这个方向我们最近也做了不少尝试。我的感觉是,你现在的流程里其实混在了一起三件事:根据需求设计测试场景、理解页面并找到操作路径、把路径变成可以重复执行的自动化用例。
PRD 比较适合解决第一件事,但单靠 PRD 很难直接解决后两件事。因为需求文档里通常不会写清楚当前账号是什么权限、页面初始状态、测试数据怎么准备、某个下拉框具体怎么操作,以及操作成功后页面上应该出现什么。这些信息缺失时,大模型只能猜,模型越弱或者上下文越少,失败率就越高。
Cursor 效果好一些,我觉得不只是模型能力的问题。它同时拥有代码检索、文件上下文、工具调用和失败后继续修改的循环。换成平台接口以后,如果只是把 PRD、部分页面代码一次性交给 LLM,实际丢失了很多上下文和反馈能力。
可以考虑把流程拆开:
是这个道理。AI 测试是为了验证 AI Coding 的准确性,那么又怎么来验证 AI 测试的准确性呢
直接用 AI 产出银行复杂业务的用例不太现实吧,我最近是尝试了一款新的 ui 自动化测试工具,感觉还不错,只要在真实系统中点击一遍就可以把用例录制下来,然后可以进行回放。虽然跟比之前产出用例比还是麻烦了一些,但感觉更方便更精准。这个工具叫 Cuecast,才刚上线没多久,是我朋友的公司做的