AI生成测试用例,仅用prompt需要解决的问题
首先解释一下,如果你调大语言模型,用prompt约定规则的方式,专业名词叫做对话微调。
同时,我要给定一个行业通用标准,如果一个模型或者AI生成测试用例模型的精准率、召回率在80%以上时,才可以商用。
接下来,我来说说仅仅是调用大模型API,通过用prompt对话微调实现,你需要解决的几个问题:
1、AI会偷懒,给需求给AI他不会根据实际需要生成用例,也就是本应该生成10条的,结果他可能只会生成5条。很多用prompt的解决办法就是限制AI生成固定的条数,但这样实现会导致用例设计的冗余。
2、需求理解也就是常说的业务关联问题。在实际公司中,需求是很复杂的,版本与版本之间有关联,需求内容与需求内容之间有关联。这个点不解决,你的精准率、召回率之类的指标应该就是在40%左右,所以达不到一个商用的标准。这数据怎么测算来的?我2023年3月份【现在2024年12月7日,马上就2025年了】的实现方式就是用的对话微调,但这种方式在我尝试几次之后就放弃了。
3、可能有人会说,把大量的内容一次性给到AI模型呗?这很好,但这个时候你会面临第二个问题,token长度限制的问题。首先你对话微调的规则就已经消耗一部分的token长度了,你还得给对应的需求这也会消耗token长度,而一个模型的token消耗是计算上下文长度的。如果你用histroy模式,这更会消耗你的token长度。
4、假设模型token长度你都解决,这时候会有新的问题,长文本的模型会带来精准度、性能的问题,同时模型可能会偷懒产生幻觉,所以精度又是你需要解决的问题。
5、以上都是技术问题,当然,除了我说的这些问题之外,你还不止这几个技术问题要解决。再说一个不是技术方面的问题,你如何解决数据安全的问题?公司的数据安全你不能不管呀。
再说一个行业认同的问题,这是重点。如果只是调用模型用prompt对话微调的方式实现,从我的小伙伴实际面试经验来看,很多公司的AI生成测试用例技术已经问的很深了,如果仅仅只是对话微调的方式,那么肯定是得不到认同的。
我能认同在实现AI生成测试用例过程中,先从对话微调的方式开始,这一过程我能认同。但是如果仅仅是对话微调的方式实现就拿来宣传、卖课,这会让人失望。
AI生成测试用例相关技术,我持续研发两年,熬了很多通宵。封面图片,是我去年训练的游戏测试方向的模型。在AI+测试时代的背景下,需要我们沉下心去做技术。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)