大四 | 滴滴测开实习 · 前码上飞AI 测试

        从零搭过一套 AI 自愈测试体系,1.2 万条用例自动跑,人力省 85%。也把智慧农业 SaaS 的回归测试从 10 小时压到 3.2 小时。算法竞赛打过 ACM 拿过铜。

        这个博客写 AI+ 测试的实践,踩坑记为主,偶尔复盘。

  • 2025,我们这样评测 AI at August 22, 2026

            关于对于这个问题,我接触到的工业实践是这样的。
            首先,在 Agent 层面,一些环节的 temperature 调低,甚至可以是 0;
            其次,可以引入重试机制,强制重试 3 次,对 3 次结果进行校验如果高度一致就输出,否则就意味着有问题,提前拦截;
            再者,可以有一些传统工程代码层面的强制校验,譬如 AST 抽象代码树校验、亦或者是静态编译校验;
            最后呢,我认为站在评测集角度,我们不仅仅可以自定义一些死的,还可以通过灰度策略去线上捞一些活的评测集。具体的,我们就是会灰度 5%,这 5% 的线上流量,我们回捞的时候,对于失败的我们是 “求贤若渴” 的,这些将会作为我们下一轮的评测数据集进行驱动开发。

  • 2025,我们这样评测 AI at August 22, 2026

    这篇文章在 Agent 评测的工业化落地有真实的实践,我认为这在 Agent 收敛下,不失为未来 Agent 测试框架的工业养料。感谢分享!

  • 对于测试的点点点工作,我认为无论 AI 再怎么发展都是必须的,毕竟做出来的产品都是面向人类的,还是需要从人类的视角去点点点的。但是从回归测试以及全面兜底的视角来看,VibeTesting 绝对是有价值的,虽然目前看来是 “理想” 的,但我依旧觉得 VibeTesting 是继 VibeCoding 后最有价值的趋势。

  • 既然是测试之家来的,个人建议直接上测试智能体的项目,推荐从我的这篇文章开始敲起来:

    AI 赋能测试实践 05:告别手工脚本,性能测试 Agent 带你玩转测试之家!

  • UI 自动化本质上也算是代码化的一种,selenium、playwright、agentbrowser 这些驱使的 UI 自动化,完全可以由 AI 驱动。但是关于 UI 自动化也确实存在由 AI 视觉大模型驱动的,这种极其有潜力。

  •         测试的每轮提效其实和整个行业的招聘动向是吻合的,功能测试->自动化测试->测试开发->AI 测试开发,这些变迁本质上就是围绕着测试的可自动化的不断进阶。因为自动化本质上代替了人工,所以能够提效,且这段变迁是不断把测试坐移的。
            因此,AI 提效的核心,持平于开发效率暴涨的核心其实就在于如何更好的让 AI 左移,以及如何让AI 更好的进行回归测试
            而开发提效效率如此之高,关键就在于大部分的效率拔高因于代码。由此抛砖引玉,我们测试应该思考哪些测试环节可以代码化,这样代码化的测试环节才能够享受到 VibeCoding 的红利,也就是我们测试的 VibeTesting。

  • 其实在我开发了一个智能体项目后,个人体感 token 的测试可以围绕:

    1.各轮次 usage(prompt、completion、total)的 toekn 叠加是否等于可观测性,或者接近,因为大多数 agent 是支持可观测性展示 token 数的;

    2.每次任务的调用是否符合预算;

    3.如果是想测试可观测性在模型测的 token 计数(单一 LLM api 调用),可以采用一些具有代表性的测试样例,结合各个大模型官方的 tokenizer,并在输入测控制 max_tokens=1,直接进行 assert 断言测试。

    除此之外,还有哪些角度呢?你可以提供一些思路,如果没有的话,那我认为 token 消耗值得测试的就这么多。

  •         不愧是啄木鸟啊!感谢指出~

            这段代码主要用来演示如何捕获 diff,触发自动化反馈,确实是只会触发在本地终端,无可争议。

            针对此,通常建议使用 Notification Hook,监听 agent_completed 事件,对接到 IM 上,文中有补充道。

  • 落地的话,结合你们的项目与公司的方向吧。因为专门的 agent 或者是 skill 的形式,对于知识库的依赖以及架构都是不同的,前者属于专门的智能体工程范畴,后者更加灵活重点可以放在知识库的质量上。且如果现有体系属于旧工程师搭建的 GUI 的情况下,其实可以直接考虑轻量 AI 重构,那么知识库也可以作为输入的形式,符合轻量高效。

  • 具体人力时间只能说个大概,从 4 月份开始,人力分为专项 + 专人 all in

        大四 | 滴滴测开实习 · 前码上飞AI 测试

        从零搭过一套 AI 自愈测试体系,1.2 万条用例自动跑,人力省 85%。也把智慧农业 SaaS 的回归测试从 10 小时压到 3.2 小时。算法竞赛打过 ACM 拿过铜。

        这个博客写 AI+ 测试的实践,踩坑记为主,偶尔复盘。