测试基础 AI 测试碎碎念

伍个一 · 2026年09月16日 · 57 次阅读

断断续续描述了一些想法让 AI 写的,建议 AI 先总结一遍。

当 HR 和产品经理都在写代码:测试的下一步不在项目里,在链路上

前阵子在少数派看到 LOSSES 的《Vibe Coding 时代的角色与架构》,有个判断我很认同:更快的代码输出不会让你走得更快,只会加速架构腐化的到来。原文还有个更糙的说法:你大概率不想跟在 Code Agent 屁股后面没日没夜地做 QA,它拉屎可比你捡得快。

代码不再稀缺,"确认符合需求"才稀缺

以前开发资源是瓶颈:需求排期、开发、评审、提测,一周能出多少东西有数,测试在有限的产出里找问题。

AI 把这个结构打破了。产品经理半天就能让 Agent 吐出一个能跑的内部工具,数据分析师能自己攒一套 ETL 加报表服务。产出量上去了,一个古老的问题被放大了无数倍:这些东西符合需求吗?

这里说的不是有没有 bug。Vibe Coding 出来的东西经常能跑,语法没问题,接口也通。真正的问题是:它解决的是不是当初想解决的问题?边界情况处理了没有?被悄悄砍掉的那个"不重要的校验",是不是恰好是业务红线?更要命的是需求方自己都说不清——很多非工程师写的脚本,需求停留在一次对话里,连一句能验收的书面描述都没有。

以前这个问题靠流程兜底:需求评审、设计评审、代码评审、用例评审,一层层拦。现在写代码的人绕过所有流程直达终点,测试还守在"等项目提测"的位置上,根本接不住。

测试没必要把自己局限在"一个项目的一个点"里。生产代码的门槛消失了,测试的目标可以扩展成整条软件工程链路的质量保障——把链路拆开,每个环节放上检查点。

业界在做的事:拆链路,加检查点

上半年看了不少这个方向的工具和方法论,思路基本一致,挑两个代表性的说。

OpenSpec 走 spec 驱动:任何变更先落四件套——proposal(为什么做)、specs(需求条项和 WHEN/THEN 场景)、design(技术方案)、tasks(实施清单)。人和 AI 在 spec 上对齐了才写代码,归档后 spec 持续更新,作为下一次变更的事实基础。解决的是"需求只存在于聊天记录里"的问题。

AI-DLC(AWS 实验室)走得更远:14 个 agent(11 个领域专家、2 个纯审查、一个工作流编排)、33 个阶段的流水线,阶段之间设 gate,人批准了才能往下走。本质是把整个 SDLC 切成带检查点的传送带,AI 只在格子里跑。

OpenSpec 轻,能落地,但假设你有个愿意维护 spec 的流程 owner,很多团队没有。AI-DLC 的 33 个阶段对小团队太重,每个 gate 都要人批,人很快变瓶颈,然后开始无脑点通过——检查点流于形式,比没有更糟,它给你虚假的安心。更根本的是,它们保障的是"每一步都有产物",产物对不对还是靠人判断。spec 写得再整齐,需求理解偏了照样白搭。

方向很认可,不能让 AI 从一句话需求直接跳到代码,中间每一跳都要有可验证、可审计的东西。

目前探索方案:唯一真源,消费真源

链路长,一口气做不完。目前相对稳定跑下来的,是后半段两件事。

第一件,给项目事实建唯一真源。从代码反向推图:接口、数据模型、模块依赖、业务流全部解析进图;再在图上蒸馏,把生成测试需要的事实(接口契约、字段约束、状态流转)整理成结构化产物。这里有条踩过坑才立下的原则:真源只有一份,消费方用时实时去图里取,禁止拷贝落别处再消费。拷贝必然漂移,漂移后用例就是错的,错了你还不知道——用例振振有词地断言一个三天前就被改掉的字段名,执行全红,你还得查到底是用例错了还是代码错了。

第二件,测试生成全部走真源消费。API 用例从图里的接口契约和依赖关系生成,UI 用例(Playwright 脚本)从页面结构和业务流生成——同一个真源,不同渲染器。生成出来不是结束,两个动作必须跟上:一是执行归因,失败到底是用例错了、环境挂了、还是被测系统真有 bug,归错类,通过率就是自欺欺人的假阳性;二是覆盖率缺口回流,哪些接口没覆盖、哪些分支没触达,算出来回补生成。环转起来,用例才谈得上可信。

跑下来最大的体会是:这套东西解决的不是"用例写得快",是"用例的依据可追"。每条用例为什么存在、断言从哪来,都能查回真源。这正好接上 VibeTesting 那篇的信任闭环——信任不是感觉,是每条结论都能回溯到事实。

还没解决的部分

也得说实话。这套管的是链路后半段:代码已经存在,验证它符不符合代码里体现的事实。前半段——需求对不对、设计合不合理、AI 的理解偏没偏——还没有同等可靠的真源机制,后面 AI 替代不了的部分。

AI 工具

当下的方案都不太能复用,skill,agen loop 这些都紧紧贴合业务,需要进行项目改造,不同的模型出来的效果不一样,别人用好未必适合自己的团队。

所以先动起来,豆包,workbuddy 都可以用,有想法就先让 AI 实现。当发现实现的效果不满意的时候,再去找其他 AI 工具/方案。

充钱就能变强。

暂无回复。
需要 登录 后方可回复, 如果你还没有账号请点击这里 注册