上一篇把 JD 里的术语拆成了速查表,核心是「术语变了,你的评测方案改什么」。术语这关过了,紧接着就撞上一个几乎每天都要面对的问题:满屏的基准分数,MMLU、GSM8K、SuperCLUE、SuperGPQA,到底哪个能信、信到什么程度、能不能拿它拍板发不发版。这篇专门讲这件事。
先摆一个容易被忽略的立场问题:一份基准报告,最终是给谁看的。
答案不是算法,也不是老板,是用户。用户不会自己去跑 MMLU,也看不懂 55 个学科的多选正确率意味着什么。他只关心一件事:这个版本装到我手机上、接进我业务里,到底比上个版本强还是弱。评测岗的活儿,说白了就是替用户把这件事先验一遍。用户没空把每个能力戳一遍,你替他戳;用户说不清「这次好像变笨了」是错觉还是真的,你替他把话讲清楚;用户懒得对着一堆榜单换算,你替他把「这分能不能信、能不能用」翻译成人话。基准分就是你手里的一件工具,不是终点。
所以看基准报告,第一反应不该是「豆包又拿了第一」,而该是「这个第一,能不能兑现成用户手里的体验」。这两件事经常不是一回事,中间隔着一段不小的距离。这篇要做的,就是把这段距离量出来,让你既不至于看到高分就盲信,也不至于因为「基准不可靠」就一概不看。基准有它确切的用处,只是得用在对的地方。
举个真实会遇到的场景。某个版本在 GSM8K(小学数学应用题)上拿了 94 分,报告里写着「数学能力优秀」。你据此放行,结果上线后用户反馈:让它算个「三个人 AA 制、其中一个人只吃了一半」的账单,它算错了。
这不矛盾。GSM8K 测的是「规规矩矩出成题面的应用题」,用户的真实问题是「口语化、带缺省条件、还夹杂无关信息」的活场景。前者答对,不保证后者答对。分数没骗你,是你把分数的适用范围理解错了。
这种「分数高、体验差」的缝隙,来源大致有三类,后面几节会逐个拆:
第一类,测的东西和用的东西不是一回事。多选题测的是「四个选项里挑对的」,真实场景是「从零开始生成一段话」,两种能力不等价。第二类,题目本身已经被模型见过了(数据污染 / 泄露),高分是背出来的,不是推出来的。第三类,一个综合分把强弱维度平均掉了,短板被高分维度盖住,而用户偏偏踩在短板上。
一句话概括这一节:基准分是「考试成绩」,用户体验是「上岗表现」。成绩单能筛掉明显不行的,但不能替你保证一定能干活。评测岗的价值,就在于把这份成绩单读到位,读出它没写在分数里的那部分信息。
先把常见基准摊开,按「测什么能力」归类,方便你拿到一份报告时快速定位它在测哪一块。下表的「豆包表现」一栏均为定性描述,具体分数随版本变动,以火山引擎官方口径为准(本篇数据截至 2026 年 7 月)。
| 基准 | 测什么 | 大致定位 | 读分时要留神 |
|---|---|---|---|
| MMLU | 57 个学科的多选知识题 | 已饱和,头部模型普遍破 90% | 破 90% 后几乎失去区分度,只能当「及不及格」看 |
| MMLU-Pro | MMLU 加强版,10 选项 + 更重推理 | 也在快速饱和,头部约 91% | 比 MMLU 耐用,但同样在逼近天花板 |
| GSM8K | 小学数学应用题 | 前沿模型接近满分 | 只 8K 条且题型单一,区分度已很低 |
| C-Eval / CMMLU | 中文学科知识 | 国产模型普遍强项 | 偏学术,不覆盖日常对话 / 客服 / 创作 |
| HumanEval | 164 道 Python 函数题 | 常用但偏基础 | 题量小、有泄露风险,别单独下结论 |
| GPQA Diamond | 博士级科学推理,198 题 | 尚有区分度,头部逼近 85%+ | 题量小,单次波动要看多轮 |
| SuperCLUE | 中文综合(推理 / 代码 / 智能体等) | 国内权威第三方月报 | 维度较粗,替代不了内部细粒度评测 |
| SuperGPQA | 285 个研究生学科、26529 题 | 长尾知识区分度高,未饱和 | 由字节 Seed 联合 M-A-P 开源,评自家模型时注意「自建基准」的立场 |
| KOR-Bench | 知识正交推理(新规则下推理) | 专测「非背诵」的推理 | 考的是脱离预训练知识的临场推理 |
| BeyondAIME | 竞赛级数学,无标准答案题干 | 极高难度,解决 AIME 饱和 | 同为字节 Seed 自建,横向比要配第三方 |
| LiveBench | 月度更新的综合评测 | 防污染,动态刷新 | 适合追踪版本趋势,不适合跨月硬比绝对值 |
| HLE(人类最后考试) | 3000 道专家原创题 | 当前最难之一,顶尖模型仍低于 35% | 防污染设计,专门用来「让还没饱和的能力有分可测」 |
这张表不用背,用的时候查。真正要记的是它背后的一条线索:基准是有寿命的。MMLU 从 2020 年好用到 2024 年被刷穿,MMLU-Pro 顶了一年又在饱和,GPQA Diamond 也在被逼近。所以 2024 到 2025 年,一批「抗饱和 / 防污染」的新基准接棒上来,MMLU-Pro、GPQA Diamond、SimpleQA(事实性精确问答)、LiveBench(月度更新)、HLE(专家原创超难题),构成了新一代参照系。你手里如果还只盯着 MMLU、GSM8K 的分数做判断,用的是一把已经量不出差别的尺子。
对豆包本体,可以定性记住几个坐标(截至 2026 年 7 月,以火山引擎与第三方月报口径为准):中文综合能力在国产模型里处于第一梯队;SuperGPQA 这类长尾知识推理上,其 chat 版本曾在同类里排名靠前;数学、代码、Agent 等方向近一年迭代很快。具体到某个版本、某个基准的精确分数,一律以火山引擎开发者社区的一手口径为准、并标截至版本号;凡找不到独立第三方印证的,一律当「单一来源,待核验」,不进发布决策的硬门槛。
前面讲了基准是什么、主要有哪些、各自测什么,这一节讲最核心的手艺:拿到一份完整的基准报告,按什么顺序读、每步看什么、看到什么该踩刹车。这是全篇最该记住的部分,我按四步拆,每步都给可操作的判法和阈值。
第一步,看绝对值:先过「行业基线」这道闸。
拿到分数,先别关心排名,先问「达没达到能用的底线」。每个能力都有一条行业公认的基线,低于它连讨论排名的资格都没有。比如中文核心对话的正确率,业界一般把 95% 当准入线(换算成 5 分制大约 4.75 分),低于这条线的版本,无论其他维度多亮眼,直接标红。绝对值这一步的动作很硬:列出本次评测每个维度的分数,逐个和预设基线比对,低于基线的维度当场标红,不进后续讨论。基线要提前定死、写进评测方案,不能看到分数再倒推,否则等于没有基线。
第二步,看趋势:和上一版比,涨了还是跌了。
单个版本的绝对分意义有限,因为你不知道它是「本来就该这么高」还是「相比上版退步了」。真正有决策价值的是趋势。动作是:同一套评测集、同样的测试条件,把本版和上一版(最好再往前一版)的每个维度分数并排列出,算出每个维度的涨跌幅。这里有个容易被忽略的坑:非确定性系统同一版本跑两次分数都可能不同,所以趋势要建立在「多轮采样的均值」之上,不能拿两个单次分数直接相减。一般关键维度至少跑 3 到 5 轮,看均值和波动区间。判定退化不能只看均值差,要看「差距是否超出波动」。给一张可直接照抄的退化判定表:
| 维度 | 上版均值 (±波动) | 本版均值 (±波动) | 均值差 | 波动是否重叠 | 结论 |
|---|---|---|---|---|---|
| 多轮对话 | 88.0 ±0.6 | 84.8 ±0.7 | −3.2 | 不重叠 | 真实退化,告警 |
| 代码 | 92.1 ±1.5 | 91.0 ±1.6 | −1.1 | 重叠 | 落在噪声内,观察 |
| 安全 | 96.5 ±0.3 | 96.6 ±0.3 | +0.1 | 重叠 | 无变化 |
判定规则就一条:均值差的绝对值要大于两版波动区间之和,退化才算数;差距落在波动内的,是采样噪声,不是能力变化,别误报。这张表每次版本对比都填一遍,退化告警就有了客观依据,不靠「感觉这版差了点」。
第三步,看维度分解:别让综合分骗了你。
这是四步里最能体现评测岗水平的一步。一个「综合 85 分」的报告,如果你只看这个总分就放行,很可能栽跟头。因为综合分是加权平均,它会把一个塌方式的短板,用其他高分维度平均回一个好看的数字。正确的读法是:永远把综合分拆回各个子维度,逐维度看,重点盯最低的那几个,而不是盯总分。举个能直接对照的例子,两个版本综合分一样都是 85,拆开却是完全不同的两回事:
| 维度 | 权重 | 版本 A | 版本 B |
|---|---|---|---|
| 知识问答 | 0.30 | 95 | 84 |
| 代码 | 0.25 | 92 | 86 |
| 多轮对话 | 0.25 | 88 | 87 |
| 安全 | 0.20 | 62 | 83 |
| 加权综合 | — | 85.0 | 85.0 |
同样是 85 分,版本 A 藏着一个 62 分的安全塌方,版本 B 各维度都均衡在及格线以上。如果只看综合分,这两版没区别;拆开看,版本 A 根本不能发,那个 62 分的安全维度一旦被用户踩到,知识问答的 95 分救不了它。所以维度分解这一步的纪律是:综合分只用来快速排序,真正的放行判断落在最弱维度是否触线,最弱维度没过线,综合分再高也阻断。
第四步,看外部验证:基准分要和线上表现对得上。
前三步都在报告内部打转,第四步要跳出报告,拿基准分去和真实世界对账。基准分再高,也只是离线成绩,用户满意度、线上 A/B 的核心指标才是终局。动作是:把离线基准的关键结论,和线上灰度 / A/B 的对应指标做交叉验证,看两者方向是否一致。如果离线基准说「这版对话能力涨了 3 分」,但线上灰度里用户的对话轮次、满意度反而跌了,那要么是评测集没覆盖真实场景,要么是有离线测不到的问题(比如延迟、格式错乱)。两者背离时,以线上为准,回头修评测集,因为线上是用户真金白银的反馈,基准只是它的近似。
这四步是有顺序的,不能跳。先用绝对值筛掉不及格的,再用趋势看有没有退化,再用维度分解揪出被平均掉的短板,最后用外部验证确认离线结论在线上站得住。四步都过了,这份报告才算读明白了。反过来,任何一步跳过,都可能让一个有硬伤的版本溜过去。
会读报告还不够,还得知道基准本身会在哪些地方失灵。三个最常见的坑,每个都给识别信号和应对动作。
坑一,饱和:分数逼近满分,尺子失去刻度。
识别信号:一个基准上,头部几个模型的分数都挤在 90% 以上,彼此差距只剩零点几个百分点。这时候这个基准已经量不出模型间的真实差距了,分数涨跌更多是噪声和过拟合,不是能力变化。MMLU 就是活生生的例子,2020 年它能拉开差距,2024 年头部普遍破 90%,再看它的分已经没意义。应对动作:给每个常用基准设一条「退役线」(比如头部模型普遍超过 90% 就标记为饱和),触线后换更难的替代集。MMLU 换 MMLU-Pro 或 GPQA Diamond,GSM8K 换竞赛级数学题(AIME / BeyondAIME 这类),把评测的刻度重新拉开。
坑二,泄露:题目被模型见过了,高分是背的。
识别信号:模型在某个公开静态基准上分数异常高,但换一批「同类型、没公开过」的新题就明显掉下来。这说明它可能在训练时见过原题,考的是记忆不是能力。这不是假想,业界研究发现过某些主流模型对在线题库答案的重复率高得可疑。公开、静态、长期不更新的基准,泄露风险最大。应对动作:优先用防污染基准(LiveBench 月度刷新、HLE 专家原创),并且给静态基准配一批自建的「私有保留题」。私有保留题的做法可以照抄:从每个公开基准里抽出题型、难度分布一致的一批新题,自己出、绝不公开、只在内部评测用;每次版本评测时,公开题和私有题各跑一遍,对比两者的分差。正常情况下同类型题分数应当接近,一旦出现「公开题分数明显高于私有题」,基本可以判定公开分被泄露污染了,这时公开基准的分数要降权处理,以私有题的分数为准。这批私有题还有个额外好处:它是你手里唯一不会被任何模型「背过」的干净尺子。
坑三,覆盖盲区:基准测的场景,压根不是你的业务场景。
识别信号:基准分很漂亮,但你的核心业务场景在这个基准里根本没被覆盖。比如你做的是儿童教育对话产品,而你参考的基准全是成人学术知识题,那分数再高也说明不了你最该关心的「跟小孩说话安不安全、合不合适」。这是最隐蔽的坑,因为它不表现为「分数不准」,而表现为「分数不相关」。应对动作:先画一张「业务场景 × 基准覆盖」的对照表,把你真正在意的场景逐个对到基准上,找出没有任何公开基准覆盖的空白格,这些空白格必须靠自建评测集补上。公开基准负责通用能力的下限,自建评测集负责你业务的真实场景,两者缺一不可。
这三个坑有个共同的解法思路:别把命压在单一公开基准上。公开基准做通用能力的粗筛和趋势追踪,自建 + 防污染基准做真实场景的细评,多把尺子交叉着用,单把尺子的失灵才不会直接坑到你的判断。
前面都在讲怎么把基准读准,这一节讲最后一公里:读准之后,这个分在「发不发版」的决策里,到底占什么位置。一句话立在这:基准分是准入证,不是通行证。
准入证的意思是,它能一票否决,不能一票放行。低于行业基线的维度,直接卡住发布,这是它的否决权,很硬。但反过来,基准分全部达标甚至领先,也只是拿到了「可以进入下一轮评估」的资格,不等于可以直接全量发给用户。这中间还差着线上验证、安全红线、性能门槛好几道关。把「基准分高」直接等同于「可以发」,是最常见、也最致命的误判。
落到具体的决策结构,基准分在里面扮演的是「入口筛子」的角色,大致是这样一条链路:
基准评测(离线)
│ 低于行业基线的维度 → 直接标红,阻断,不进后续
▼
安全 / 合规红线(硬阻断)
│ 安全漏过率、核心正确率等触线 → 红灯,禁止发布
▼
多维加权 + 趋势判定
│ 任一关键维度显著退化 → 黄灯,需评审
▼
线上灰度验证(5% → 20% → 50% → 100%)
│ 线上核心指标与离线结论背离 → 回滚,修评测集
▼
全量发布 + 持续监控
看这条链路能看清基准分的位置:它在最上游做粗筛,把明显不合格的挡在门外;但它下游还站着安全红线、退化评审、线上灰度三道关,每一道都能把「基准分很好看」的版本拦下来。基准分从来不是决策的终点,它只是决策的入口。
再补几条把基准分接进决策时最容易踩的反模式,都是能直接对照自查的:
避开这五条,基准分在你的决策里就摆对了位置:一个严格的准入筛子,而不是一张免检通行证。
把前面几节收拢成一套能复用、能交给新人、能挂进流程的动作,这一节给一个可直接落地的骨架。
第一件事,建一本「基准台账」。把你所在业务用到的所有基准登记成一张表,每个基准记五个字段:测什么能力、对应哪个业务场景、当前是否饱和、数据是否公开(泄露风险)、一手出处链接 + 截至版本。给一个可直接套用的台账样例:
| 基准 | 测什么能力 | 对应业务场景 | 是否饱和 | 泄露风险 | 一手出处 + 截至 |
|---|---|---|---|---|---|
| MMLU | 通用知识 | 通用问答下限 | 已饱和 | 高(公开静态) | arXiv:2009.03300,仅当及格线 |
| SuperGPQA | 长尾学科推理 | 专业领域问答 | 未饱和 | 中 | Seed 博客 +arXiv:2502.14739 |
| LiveBench | 综合(月更) | 版本趋势追踪 | 未饱和 | 低(月度刷新) | livebench 官方,截至当月 |
| 自建私有题 | 本业务真实场景 | 核心场景细评 | — | 无(不公开) | 内部,版本号随评测集 |
这张台账解决的是「我到底在用哪些尺子、每把尺子还准不准」的问题。新人来了,先读这张台账,就知道本业务的评测家底,也知道哪些分只能当参考、哪些分才能当依据。
第二件事,定「轮换机制」。给每个基准设退役线(比如头部普遍破 90% 判饱和),到线就换更难的替代集;静态公开基准每隔一个周期,用自建私有题做一次泄露体检,分差过大就降权或替换。这一步解决的是「尺子会过期」的问题,让评测参照系保持新鲜。
第三件事,列「准入证清单」。把每个能力的行业基线写死成一张清单,每次评测机械地逐条核对:这个维度过没过基线,过了打勾,没过标红阻断。清单化的意义是把「凭感觉判断能不能发」变成「照单核对」,谁来做结论都一样,可复现、可追溯。
第四件事,接进 CI。把上面这套变成自动化:每个版本一出,自动跑基准评测套件,自动和上一版比趋势、自动拆维度、自动核对准入证清单,低于基线或显著退化的自动亮红灯拦住,不靠人肉盯。基准评测一旦进了 CI,它就从「发版前临时跑一次」变成「每次提交都在跑」的常态防线。
这四件事做全,你就有了一套不依赖个人经验、可以交接、可以审计的基准解读体系。它的价值不在某一次评测,而在于让每一次评测的结论都稳定、可信、能追溯。这正是评测岗区别于「随手跑个分」的地方。
最后从原理上补一句,前面那些坑不是偶然的 bug,是有底层原因的,理解了原因,你对基准的信任边界会更清楚。
一是多选题和开放生成本就是两种能力。MMLU 这类多选题,模型只需在给定选项里排除错误、选出对的,这和「从零生成一段准确、通顺、无幻觉的回答」是两回事。多选考的是判别,生成考的是产出,判别强不代表产出强。所以多选基准的高分,天然不能外推到开放问答的质量。
二是数据污染是结构性的。互联网上的公开题库,很可能就在模型的训练语料里。模型见过原题,答对就成了背诵而非推理。只要基准是公开静态的,这个风险就永远存在,这也是为什么防污染基准要靠「持续更新」或「专家原创未公开」来对抗。
三是Goodhart 定律:当一个指标变成了目标,它就不再是个好指标。当整个行业都在冲某个榜单,各家自然会针对性优化,甚至提交多个变体只公布最高分。于是榜单分数的上涨,一部分来自真实能力提升,一部分来自「应试」。这就是为什么再权威的单一榜单也不能全信,必须靠人类盲测(LMSYS Arena 这类难以针对性优化的评测)和真实业务验证来纠偏。
理解这三条,你就明白基准为什么既有用又不能全信:它是对能力的一种低成本近似,近似就一定有偏差。评测岗的手艺,就是清楚这偏差在哪、有多大,然后在偏差之内用好它。
本篇涉及的基准 / 榜单(引用时优先回溯一手出处)
基准数据的可信来源(评豆包本体优先,截至 2026.07)
基准饱和与替代的机构出处(按需查证,非必查)
前文衔接
这篇讲了怎么读基准分、怎么验数据可信度、怎么把它摆进发布决策的正确位置,核心一句:基准分是准入证不是通行证。但你可能已经注意到一个更底层的问题,前面反复提到「同一版本跑两次分数都可能不同」「关键维度要跑 3 到 5 轮取均值」。这背后是 AI 系统和传统软件最本质的区别:它不是确定性的。下篇讲非确定性系统的测试思维,传统测试那套「输入 A 必得输出 B」的假设在豆包面前会怎么崩塌,以及评测该怎么从「验证对错」转向「评估好坏与分布」。
作者注:本系列是一边工作、一边实操、一边琢磨着写出来的,规划约 100 篇,内容和篇幅会随实际调整;为保证文章质量,不追求固定的更新频率。以上内容基于脱敏内部信息、公开权威资料和自己踩坑后的理解,不一定对,欢迎拍砖。