AI测试 豆包评测 04 篇:豆包在标准评测基准上的表现怎么看

哞小妞 · 2026年07月19日 · 306 次阅读

上一篇把 JD 里的术语拆成了速查表,核心是「术语变了,你的评测方案改什么」。术语这关过了,紧接着就撞上一个几乎每天都要面对的问题:满屏的基准分数,MMLU、GSM8K、SuperCLUE、SuperGPQA,到底哪个能信、信到什么程度、能不能拿它拍板发不发版。这篇专门讲这件事。

一、基准分到底是拿给谁看的

先摆一个容易被忽略的立场问题:一份基准报告,最终是给谁看的。

答案不是算法,也不是老板,是用户。用户不会自己去跑 MMLU,也看不懂 55 个学科的多选正确率意味着什么。他只关心一件事:这个版本装到我手机上、接进我业务里,到底比上个版本强还是弱。评测岗的活儿,说白了就是替用户把这件事先验一遍。用户没空把每个能力戳一遍,你替他戳;用户说不清「这次好像变笨了」是错觉还是真的,你替他把话讲清楚;用户懒得对着一堆榜单换算,你替他把「这分能不能信、能不能用」翻译成人话。基准分就是你手里的一件工具,不是终点。

所以看基准报告,第一反应不该是「豆包又拿了第一」,而该是「这个第一,能不能兑现成用户手里的体验」。这两件事经常不是一回事,中间隔着一段不小的距离。这篇要做的,就是把这段距离量出来,让你既不至于看到高分就盲信,也不至于因为「基准不可靠」就一概不看。基准有它确切的用处,只是得用在对的地方。

二、基准分和「能不能用」隔多远

举个真实会遇到的场景。某个版本在 GSM8K(小学数学应用题)上拿了 94 分,报告里写着「数学能力优秀」。你据此放行,结果上线后用户反馈:让它算个「三个人 AA 制、其中一个人只吃了一半」的账单,它算错了。

这不矛盾。GSM8K 测的是「规规矩矩出成题面的应用题」,用户的真实问题是「口语化、带缺省条件、还夹杂无关信息」的活场景。前者答对,不保证后者答对。分数没骗你,是你把分数的适用范围理解错了。

这种「分数高、体验差」的缝隙,来源大致有三类,后面几节会逐个拆:

第一类,测的东西和用的东西不是一回事。多选题测的是「四个选项里挑对的」,真实场景是「从零开始生成一段话」,两种能力不等价。第二类,题目本身已经被模型见过了(数据污染 / 泄露),高分是背出来的,不是推出来的。第三类,一个综合分把强弱维度平均掉了,短板被高分维度盖住,而用户偏偏踩在短板上。

一句话概括这一节:基准分是「考试成绩」,用户体验是「上岗表现」。成绩单能筛掉明显不行的,但不能替你保证一定能干活。评测岗的价值,就在于把这份成绩单读到位,读出它没写在分数里的那部分信息。

三、主流基准速查:各测什么、豆包大致在哪

先把常见基准摊开,按「测什么能力」归类,方便你拿到一份报告时快速定位它在测哪一块。下表的「豆包表现」一栏均为定性描述,具体分数随版本变动,以火山引擎官方口径为准(本篇数据截至 2026 年 7 月)。

基准 测什么 大致定位 读分时要留神
MMLU 57 个学科的多选知识题 已饱和,头部模型普遍破 90% 破 90% 后几乎失去区分度,只能当「及不及格」看
MMLU-Pro MMLU 加强版,10 选项 + 更重推理 也在快速饱和,头部约 91% 比 MMLU 耐用,但同样在逼近天花板
GSM8K 小学数学应用题 前沿模型接近满分 只 8K 条且题型单一,区分度已很低
C-Eval / CMMLU 中文学科知识 国产模型普遍强项 偏学术,不覆盖日常对话 / 客服 / 创作
HumanEval 164 道 Python 函数题 常用但偏基础 题量小、有泄露风险,别单独下结论
GPQA Diamond 博士级科学推理,198 题 尚有区分度,头部逼近 85%+ 题量小,单次波动要看多轮
SuperCLUE 中文综合(推理 / 代码 / 智能体等) 国内权威第三方月报 维度较粗,替代不了内部细粒度评测
SuperGPQA 285 个研究生学科、26529 题 长尾知识区分度高,未饱和 由字节 Seed 联合 M-A-P 开源,评自家模型时注意「自建基准」的立场
KOR-Bench 知识正交推理(新规则下推理) 专测「非背诵」的推理 考的是脱离预训练知识的临场推理
BeyondAIME 竞赛级数学,无标准答案题干 极高难度,解决 AIME 饱和 同为字节 Seed 自建,横向比要配第三方
LiveBench 月度更新的综合评测 防污染,动态刷新 适合追踪版本趋势,不适合跨月硬比绝对值
HLE(人类最后考试) 3000 道专家原创题 当前最难之一,顶尖模型仍低于 35% 防污染设计,专门用来「让还没饱和的能力有分可测」

这张表不用背,用的时候查。真正要记的是它背后的一条线索:基准是有寿命的。MMLU 从 2020 年好用到 2024 年被刷穿,MMLU-Pro 顶了一年又在饱和,GPQA Diamond 也在被逼近。所以 2024 到 2025 年,一批「抗饱和 / 防污染」的新基准接棒上来,MMLU-Pro、GPQA Diamond、SimpleQA(事实性精确问答)、LiveBench(月度更新)、HLE(专家原创超难题),构成了新一代参照系。你手里如果还只盯着 MMLU、GSM8K 的分数做判断,用的是一把已经量不出差别的尺子。

对豆包本体,可以定性记住几个坐标(截至 2026 年 7 月,以火山引擎与第三方月报口径为准):中文综合能力在国产模型里处于第一梯队;SuperGPQA 这类长尾知识推理上,其 chat 版本曾在同类里排名靠前;数学、代码、Agent 等方向近一年迭代很快。具体到某个版本、某个基准的精确分数,一律以火山引擎开发者社区的一手口径为准、并标截至版本号;凡找不到独立第三方印证的,一律当「单一来源,待核验」,不进发布决策的硬门槛。

四、读懂一份基准报告的四步法

前面讲了基准是什么、主要有哪些、各自测什么,这一节讲最核心的手艺:拿到一份完整的基准报告,按什么顺序读、每步看什么、看到什么该踩刹车。这是全篇最该记住的部分,我按四步拆,每步都给可操作的判法和阈值。

第一步,看绝对值:先过「行业基线」这道闸。

拿到分数,先别关心排名,先问「达没达到能用的底线」。每个能力都有一条行业公认的基线,低于它连讨论排名的资格都没有。比如中文核心对话的正确率,业界一般把 95% 当准入线(换算成 5 分制大约 4.75 分),低于这条线的版本,无论其他维度多亮眼,直接标红。绝对值这一步的动作很硬:列出本次评测每个维度的分数,逐个和预设基线比对,低于基线的维度当场标红,不进后续讨论。基线要提前定死、写进评测方案,不能看到分数再倒推,否则等于没有基线。

第二步,看趋势:和上一版比,涨了还是跌了。

单个版本的绝对分意义有限,因为你不知道它是「本来就该这么高」还是「相比上版退步了」。真正有决策价值的是趋势。动作是:同一套评测集、同样的测试条件,把本版和上一版(最好再往前一版)的每个维度分数并排列出,算出每个维度的涨跌幅。这里有个容易被忽略的坑:非确定性系统同一版本跑两次分数都可能不同,所以趋势要建立在「多轮采样的均值」之上,不能拿两个单次分数直接相减。一般关键维度至少跑 3 到 5 轮,看均值和波动区间。判定退化不能只看均值差,要看「差距是否超出波动」。给一张可直接照抄的退化判定表:

维度 上版均值 (±波动) 本版均值 (±波动) 均值差 波动是否重叠 结论
多轮对话 88.0 ±0.6 84.8 ±0.7 −3.2 不重叠 真实退化,告警
代码 92.1 ±1.5 91.0 ±1.6 −1.1 重叠 落在噪声内,观察
安全 96.5 ±0.3 96.6 ±0.3 +0.1 重叠 无变化

判定规则就一条:均值差的绝对值要大于两版波动区间之和,退化才算数;差距落在波动内的,是采样噪声,不是能力变化,别误报。这张表每次版本对比都填一遍,退化告警就有了客观依据,不靠「感觉这版差了点」。

第三步,看维度分解:别让综合分骗了你。

这是四步里最能体现评测岗水平的一步。一个「综合 85 分」的报告,如果你只看这个总分就放行,很可能栽跟头。因为综合分是加权平均,它会把一个塌方式的短板,用其他高分维度平均回一个好看的数字。正确的读法是:永远把综合分拆回各个子维度,逐维度看,重点盯最低的那几个,而不是盯总分。举个能直接对照的例子,两个版本综合分一样都是 85,拆开却是完全不同的两回事:

维度 权重 版本 A 版本 B
知识问答 0.30 95 84
代码 0.25 92 86
多轮对话 0.25 88 87
安全 0.20 62 83
加权综合 85.0 85.0

同样是 85 分,版本 A 藏着一个 62 分的安全塌方,版本 B 各维度都均衡在及格线以上。如果只看综合分,这两版没区别;拆开看,版本 A 根本不能发,那个 62 分的安全维度一旦被用户踩到,知识问答的 95 分救不了它。所以维度分解这一步的纪律是:综合分只用来快速排序,真正的放行判断落在最弱维度是否触线,最弱维度没过线,综合分再高也阻断。

第四步,看外部验证:基准分要和线上表现对得上。

前三步都在报告内部打转,第四步要跳出报告,拿基准分去和真实世界对账。基准分再高,也只是离线成绩,用户满意度、线上 A/B 的核心指标才是终局。动作是:把离线基准的关键结论,和线上灰度 / A/B 的对应指标做交叉验证,看两者方向是否一致。如果离线基准说「这版对话能力涨了 3 分」,但线上灰度里用户的对话轮次、满意度反而跌了,那要么是评测集没覆盖真实场景,要么是有离线测不到的问题(比如延迟、格式错乱)。两者背离时,以线上为准,回头修评测集,因为线上是用户真金白银的反馈,基准只是它的近似。

这四步是有顺序的,不能跳。先用绝对值筛掉不及格的,再用趋势看有没有退化,再用维度分解揪出被平均掉的短板,最后用外部验证确认离线结论在线上站得住。四步都过了,这份报告才算读明白了。反过来,任何一步跳过,都可能让一个有硬伤的版本溜过去。

五、基准的三个坑:饱和、泄露、覆盖盲区

会读报告还不够,还得知道基准本身会在哪些地方失灵。三个最常见的坑,每个都给识别信号和应对动作。

坑一,饱和:分数逼近满分,尺子失去刻度。

识别信号:一个基准上,头部几个模型的分数都挤在 90% 以上,彼此差距只剩零点几个百分点。这时候这个基准已经量不出模型间的真实差距了,分数涨跌更多是噪声和过拟合,不是能力变化。MMLU 就是活生生的例子,2020 年它能拉开差距,2024 年头部普遍破 90%,再看它的分已经没意义。应对动作:给每个常用基准设一条「退役线」(比如头部模型普遍超过 90% 就标记为饱和),触线后换更难的替代集。MMLU 换 MMLU-Pro 或 GPQA Diamond,GSM8K 换竞赛级数学题(AIME / BeyondAIME 这类),把评测的刻度重新拉开。

坑二,泄露:题目被模型见过了,高分是背的。

识别信号:模型在某个公开静态基准上分数异常高,但换一批「同类型、没公开过」的新题就明显掉下来。这说明它可能在训练时见过原题,考的是记忆不是能力。这不是假想,业界研究发现过某些主流模型对在线题库答案的重复率高得可疑。公开、静态、长期不更新的基准,泄露风险最大。应对动作:优先用防污染基准(LiveBench 月度刷新、HLE 专家原创),并且给静态基准配一批自建的「私有保留题」。私有保留题的做法可以照抄:从每个公开基准里抽出题型、难度分布一致的一批新题,自己出、绝不公开、只在内部评测用;每次版本评测时,公开题和私有题各跑一遍,对比两者的分差。正常情况下同类型题分数应当接近,一旦出现「公开题分数明显高于私有题」,基本可以判定公开分被泄露污染了,这时公开基准的分数要降权处理,以私有题的分数为准。这批私有题还有个额外好处:它是你手里唯一不会被任何模型「背过」的干净尺子。

坑三,覆盖盲区:基准测的场景,压根不是你的业务场景。

识别信号:基准分很漂亮,但你的核心业务场景在这个基准里根本没被覆盖。比如你做的是儿童教育对话产品,而你参考的基准全是成人学术知识题,那分数再高也说明不了你最该关心的「跟小孩说话安不安全、合不合适」。这是最隐蔽的坑,因为它不表现为「分数不准」,而表现为「分数不相关」。应对动作:先画一张「业务场景 × 基准覆盖」的对照表,把你真正在意的场景逐个对到基准上,找出没有任何公开基准覆盖的空白格,这些空白格必须靠自建评测集补上。公开基准负责通用能力的下限,自建评测集负责你业务的真实场景,两者缺一不可。

这三个坑有个共同的解法思路:别把命压在单一公开基准上。公开基准做通用能力的粗筛和趋势追踪,自建 + 防污染基准做真实场景的细评,多把尺子交叉着用,单把尺子的失灵才不会直接坑到你的判断。

六、把基准分接进发布决策:准入证不是通行证

前面都在讲怎么把基准读准,这一节讲最后一公里:读准之后,这个分在「发不发版」的决策里,到底占什么位置。一句话立在这:基准分是准入证,不是通行证。

准入证的意思是,它能一票否决,不能一票放行。低于行业基线的维度,直接卡住发布,这是它的否决权,很硬。但反过来,基准分全部达标甚至领先,也只是拿到了「可以进入下一轮评估」的资格,不等于可以直接全量发给用户。这中间还差着线上验证、安全红线、性能门槛好几道关。把「基准分高」直接等同于「可以发」,是最常见、也最致命的误判。

落到具体的决策结构,基准分在里面扮演的是「入口筛子」的角色,大致是这样一条链路:

基准评测(离线)
   │  低于行业基线的维度 → 直接标红,阻断,不进后续
   ▼
安全 / 合规红线(硬阻断)
   │  安全漏过率、核心正确率等触线 → 红灯,禁止发布
   ▼
多维加权 + 趋势判定
   │  任一关键维度显著退化 → 黄灯,需评审
   ▼
线上灰度验证(5% → 20% → 50% → 100%)
   │  线上核心指标与离线结论背离 → 回滚,修评测集
   ▼
全量发布 + 持续监控

看这条链路能看清基准分的位置:它在最上游做粗筛,把明显不合格的挡在门外;但它下游还站着安全红线、退化评审、线上灰度三道关,每一道都能把「基准分很好看」的版本拦下来。基准分从来不是决策的终点,它只是决策的入口。

再补几条把基准分接进决策时最容易踩的反模式,都是能直接对照自查的:

  • 唯综合分论:只看一个综合总分就拍板,不拆维度。前面说过,综合分会藏短板,这是头号反模式。
  • 拿饱和基准当依据:还在用 MMLU、GSM8K 这类已饱和的分数论高低,尺子早就没刻度了。
  • 自建基准自证:只拿自家做的基准证明自家模型强,不配第三方,逻辑上不成立。
  • 离线分替代线上:基准分好就跳过灰度直接全量,把「考试成绩」当成了「上岗表现」。
  • 无视版本漂移:拿不同测试条件(用没用工具、few-shot 轮数不同)下的分数直接横比,比了个寂寞。

避开这五条,基准分在你的决策里就摆对了位置:一个严格的准入筛子,而不是一张免检通行证。

七、建一套自己的「基准解读 SOP」

把前面几节收拢成一套能复用、能交给新人、能挂进流程的动作,这一节给一个可直接落地的骨架。

第一件事,建一本「基准台账」。把你所在业务用到的所有基准登记成一张表,每个基准记五个字段:测什么能力、对应哪个业务场景、当前是否饱和、数据是否公开(泄露风险)、一手出处链接 + 截至版本。给一个可直接套用的台账样例:

基准 测什么能力 对应业务场景 是否饱和 泄露风险 一手出处 + 截至
MMLU 通用知识 通用问答下限 已饱和 高(公开静态) arXiv:2009.03300,仅当及格线
SuperGPQA 长尾学科推理 专业领域问答 未饱和 Seed 博客 +arXiv:2502.14739
LiveBench 综合(月更) 版本趋势追踪 未饱和 低(月度刷新) livebench 官方,截至当月
自建私有题 本业务真实场景 核心场景细评 无(不公开) 内部,版本号随评测集

这张台账解决的是「我到底在用哪些尺子、每把尺子还准不准」的问题。新人来了,先读这张台账,就知道本业务的评测家底,也知道哪些分只能当参考、哪些分才能当依据。

第二件事,定「轮换机制」。给每个基准设退役线(比如头部普遍破 90% 判饱和),到线就换更难的替代集;静态公开基准每隔一个周期,用自建私有题做一次泄露体检,分差过大就降权或替换。这一步解决的是「尺子会过期」的问题,让评测参照系保持新鲜。

第三件事,列「准入证清单」。把每个能力的行业基线写死成一张清单,每次评测机械地逐条核对:这个维度过没过基线,过了打勾,没过标红阻断。清单化的意义是把「凭感觉判断能不能发」变成「照单核对」,谁来做结论都一样,可复现、可追溯。

第四件事,接进 CI。把上面这套变成自动化:每个版本一出,自动跑基准评测套件,自动和上一版比趋势、自动拆维度、自动核对准入证清单,低于基线或显著退化的自动亮红灯拦住,不靠人肉盯。基准评测一旦进了 CI,它就从「发版前临时跑一次」变成「每次提交都在跑」的常态防线。

这四件事做全,你就有了一套不依赖个人经验、可以交接、可以审计的基准解读体系。它的价值不在某一次评测,而在于让每一次评测的结论都稳定、可信、能追溯。这正是评测岗区别于「随手跑个分」的地方。

八、原理补一刀:基准为什么会失真

最后从原理上补一句,前面那些坑不是偶然的 bug,是有底层原因的,理解了原因,你对基准的信任边界会更清楚。

一是多选题和开放生成本就是两种能力。MMLU 这类多选题,模型只需在给定选项里排除错误、选出对的,这和「从零生成一段准确、通顺、无幻觉的回答」是两回事。多选考的是判别,生成考的是产出,判别强不代表产出强。所以多选基准的高分,天然不能外推到开放问答的质量。

二是数据污染是结构性的。互联网上的公开题库,很可能就在模型的训练语料里。模型见过原题,答对就成了背诵而非推理。只要基准是公开静态的,这个风险就永远存在,这也是为什么防污染基准要靠「持续更新」或「专家原创未公开」来对抗。

三是Goodhart 定律:当一个指标变成了目标,它就不再是个好指标。当整个行业都在冲某个榜单,各家自然会针对性优化,甚至提交多个变体只公布最高分。于是榜单分数的上涨,一部分来自真实能力提升,一部分来自「应试」。这就是为什么再权威的单一榜单也不能全信,必须靠人类盲测(LMSYS Arena 这类难以针对性优化的评测)和真实业务验证来纠偏。

理解这三条,你就明白基准为什么既有用又不能全信:它是对能力的一种低成本近似,近似就一定有偏差。评测岗的手艺,就是清楚这偏差在哪、有多大,然后在偏差之内用好它。

参考与延伸

本篇涉及的基准 / 榜单(引用时优先回溯一手出处)

  • 通用知识:MMLU(arXiv:2009.03300)、MMLU-Pro、C-Eval、CMMLU
  • 数学与推理:GSM8K、AIME、GPQA Diamond、BeyondAIME(ByteDance Seed,arXiv:2504.13914 提出)、KOR-Bench
  • 长尾知识:SuperGPQA(ByteDance Seed 联合 M-A-P,arXiv:2502.14739,285 学科 26529 题)
  • 代码:HumanEval、SWE-bench、SciCode、LiveCodeBench
  • 综合 / 防污染:SuperCLUE(中文综合月报)、LiveBench(月度更新)、HLE 人类最后考试(CAIS + Scale AI,2025)
  • 人类盲测与横评:LMSYS Chatbot Arena(ELO)、Artificial Analysis(性能 / 价格 / 质量)、智源 FlagEval

基准数据的可信来源(评豆包本体优先,截至 2026.07)

  • 火山引擎开发者社区(豆包各版本评测数据与 Model Card 的官方出口,须标截至版本号)
  • 字节 Seed 团队技术博客与 arXiv 论文(自建基准 SuperGPQA / BeyondAIME 等的一手方法与榜单)
  • 第三方交叉印证:SuperCLUE 月报、LMSYS Arena、Artificial Analysis、智源 FlagEval

基准饱和与替代的机构出处(按需查证,非必查)

  • MMLU:UT Austin(Dan Hendrycks 组),大模型知识体检最广用的基准之一,已饱和。
  • GPQA / GPQA Diamond:博士级科学推理,题量小但区分度尚存。
  • HLE(Humanity's Last Exam):Center for AI Safety 与 Scale AI 联合,专家原创、防污染,设计目标是「多年内不被刷穿」。
  • LiveBench:月度更新防数据污染的综合评测,适合追踪版本趋势。
  • SuperGPQA / BeyondAIME:字节 Seed 主导的自建基准,评自家模型时须配第三方交叉印证。

前文衔接

  • 03 篇把 JD 术语拆成评测 / 产品视角速查表(RAG 分检索步与生成步、温度锁定、上下文窗口的评测含义等)
  • 01 篇的五大能力 taxonomy 与产品质量红线(红线一票否决、能力分治不用综合分盖短板),本篇「准入证不是通行证」正是那条纪律在基准解读上的落地

下篇预告

这篇讲了怎么读基准分、怎么验数据可信度、怎么把它摆进发布决策的正确位置,核心一句:基准分是准入证不是通行证。但你可能已经注意到一个更底层的问题,前面反复提到「同一版本跑两次分数都可能不同」「关键维度要跑 3 到 5 轮取均值」。这背后是 AI 系统和传统软件最本质的区别:它不是确定性的。下篇讲非确定性系统的测试思维,传统测试那套「输入 A 必得输出 B」的假设在豆包面前会怎么崩塌,以及评测该怎么从「验证对错」转向「评估好坏与分布」。

作者注:本系列是一边工作、一边实操、一边琢磨着写出来的,规划约 100 篇,内容和篇幅会随实际调整;为保证文章质量,不追求固定的更新频率。以上内容基于脱敏内部信息、公开权威资料和自己踩坑后的理解,不一定对,欢迎拍砖。

暂无回复。
需要 登录 后方可回复, 如果你还没有账号请点击这里 注册