同问
问 ai
同意,既然那个需求是人来提出来的,那么还是需要从人类的角度去点点点的,也是算比较有价值之一。同时 vibe testing 可以大幅度减少重复的手工测试。也算是提效的其中一点。
就是不断的 update skill 嘛,沉淀业务流程,比如给出你认为你理想的 few-shot。
蹲,追更。
楼主有没有 agent 自动化评测相关,mark 一下,追更。
可以分享一下思路嘛,有相关开源项目不?

认真的嘛?连官网都有问题。
那需求设计与实际开发和最终结果怎么都会有点差别,后端仓库搭建知识库相对准确一点。而且有些团队的产品需求设计文档是不全的。那大佬有没有什么好方案想根据产品需求设计来生成测试用例。
如果有后端仓库可以连接的话,其实拿后端仓库搭建知识库,用来生成测试用例也不错。
多谢大佬明白了
大佬有没有测过 token usage,token 消耗的相关功能,这玩意怎么测他计算消耗的 token 的数量是对的。
大佬,给老项目做知识库搭建做测试用例生成,有没有好方案不。
学到了
蹲到最新的文章。现在这环境,测试 qa 还有得玩不。
不是测开凉了,而是测开的标准高了,但凡公司引入过 ai 上项目的人就知道有多少坑的了。没有那么简单的。测试也没有凉,大厂测试合并到开发,只不过是降本增效手段而已,又不是凉了,其他公司也有专门的测试在做,比如 agent 测试,算法测试等。
评估、测试 skill 的方法和 llm as a judge 方法很相似,都是拿另外一个更好的去评估现有的。
蹲到 skill 了。
有直播回放?
那评测工程化的方法论还有相关项目有不,有具体的案例不?
牛啊,谢谢佬,我先试一试。
谢谢佬
有没有通用的解决方案,针对各种自研的 agent 平台。
对了那个轨迹判断,每一次发送 prompt 给 llm,llm 决定调用哪些 tool,而且每次他的轨迹都不一样,那么怎么做质量评估,甚至有时候直接用大模型里面的内容进行返回, 没有使用 tool,这样的话怎么做评估。
抱紧大佬的大腿