开了个 Agent 评测的系列。想法很朴素:把"这个模型行不行、这个版本能不能上线"这种事,从拍脑袋、看感觉,变成能下结论的工程。
我们踩过坑。榜单上分数刷得挺高,上线没两周就被真实用户问翻车;评测集半年没动过,跑出来的结论早就不代表现在的模型。这些坑不是某一个人才会踩,是做 Agent 产品几乎都会撞上的。所以这个系列想把它聊明白,不端着,也不故弄玄虚。
系列大概一百篇出头,分五幕,我先把每一幕讲什么、能带走什么钩子给你说清楚。
第一幕,重新定义标尺。先把地基打正:评什么、怎么算"对"、为什么光看公开榜单会骗人。这幕你会看清一件事,榜单分高的产品,上线照样可能翻车,因为榜单和你用户的真实场景根本不是一回事。
第二幕,产品外测,锚定豆包。拿豆包真去测,推理、多模态、智能体、安全,二十多篇一点点拆。这幕有个彩蛋,豆包和头部友商的对比会实名写出来,不藏着。
第三幕,工程锚。前面两幕在讲"该评什么",这幕动手"怎么评"。从准确率怎么分层算,到发布闸门怎么接进 CI,三十多篇,给你一套能直接粘进自己流水线的评测代码和判法。
第四幕,双锚交汇。Agent 怎么编排、怎么自进化,工具调用、规划、记忆这些零件分别怎么评,还有我们做豆包 Agent 时真实翻过的车,复盘给你看。
第五幕,治理与趋势。前面讲的是怎么评,这幕讲评了之后怎么管。六大坑逐个拆,线上监控失灵了怎么救,最后落到一句话,评测的终点不是打高分,是把一个系统管住。
说清楚谁适合读,也省大家时间。
适合你,如果:你在做 Agent 产品、评测、或者要为团队选型;你受够了"感觉还行"但说不出哪里行、上线又心里没底;你想搭一套自己的评测体系。
不太适合,如果:你只想看一篇爽文速成;你只关心论文 SOTA 数字、不在乎工程和产品落地。这套东西是工程加产品双视角,不是算法 survey。
最划算的读法:你正在搭评测体系、或者上线前被"到底稳不稳"卡住的时候,直接翻对应那幕,比从头通读有用。
读完你能带走什么,我列四条,都是能自己验证的。
一,能说清"评 Agent"和"评模型"差在哪,随手画得出三层标尺(产品表面、能力拆解、评测维度)。
二,拿到一个待上线的版本,你能自己列出该卡哪四把卡尺,不靠别人给清单。
三,能设计一套最小评测集,并且报得出 95% 置信区间,而不是只丢一个平均分。
四,能给团队讲明白"这个版本为什么能上、为什么不能上"的判据,而不是"我觉得差不多"。
怎么读,给你几个实在建议。
理论幕可以跳读,工程幕最好跟着敲。每篇独立成篇,不用从头按顺序啃。急着上线,先看第一幕加第三幕的发布闸门那几篇;纯关心产品表现,第二幕就够了。节奏上,别囤,每周跟几篇比一口气吞完吸收得好。系列不追求一次写全,追求你读着能直接用上。
欢迎拍砖。哪篇讲得不对、哪块你踩过我没提到的坑,评论区或者星球里说,我接着改。这个系列是边写边长出来的,你的反馈比我的提纲重要。