← 返回闯关手册
AI产品白皮书 · 2026-07-22 · ★★★★☆ 选读(选模型时查阅)

看懂大模型榜单:MMLU、HLE、SWE-bench 到底都在测什么?

为什么值得读

读榜防忽悠指南。MMLU、HLE、SWE-bench 这些榜单到底在测什么、一个分数背后藏着多少限定条件,讲得清楚又好读。和产品级 eval 是互补关系:这篇帮你选模型时不被「第一」误导。

核心内容速览

适合谁 · 怎么用

选模型、看发布会、读评测报告时随手查阅(知识地图 M6 模块)。不需要精读,收藏备查即可。

闯关自测

先合上原文在心里作答,再点开对照。全对 = 本篇真正通关。

Q1 一个榜单分数背后有哪四层结构?

Benchmark(考什么)、Metric(怎么计分)、Harness(怎么运行)、Leaderboard(怎么排名)。分数 = 模型 × 环境 × 工具 × 预算 × 评分规则,不只是裸模型能力。

Q2 看榜单防忽悠的「三问」是什么?

pass@1 还是 pass@k?带不带工具/脚手架?推理强度(thinking budget)开多大?答案通常藏在脚注里。

Q3 「公共 Benchmark 是坐标,不是使用说明书」怎么理解?

榜单告诉你模型在标准赛场的位置,但你的业务场景有自己的分布——它在你的产品里好不好用,只有你自己的评测集说了算。

以下为原文全文

上方为本站原创导读,下方为原文完整收录,便于对照阅读。

每次新模型发布,最先看到的往往是一长串缩写:MMLU-Pro、GPQA、HLE、SWE-bench、BrowseComp、OSWorld……几乎每家都能找到一个「第一」。原因并不神秘:它们参加的本来就不是同一种考试。读懂榜单的第一步,不是比分数,而是先看每个分数在测什么。

同样是模型发布,六家厂商选择的评测项目并不相同
同样是模型发布,六家厂商选择的评测项目并不相同

一、看分数前,先分清四层

一张榜单里常有四个东西被混在一起:

一个分数 = 模型 × 运行环境 × 工具 × 时间与 Token 预算 × 评分规则。榜单测到的往往是「这套系统在这组条件下的表现」,不只是裸模型的能力。

一张榜单,四个层次:题目、计分、运行、排名
一张榜单,四个层次:题目、计分、运行、排名

以 SWE-bench 为例:完整系统榜单允许各家使用不同的 Coding Agent(更接近比较产品能力);Bash-only 榜单让不同模型统一运行在 mini-SWE-agent 中(更适合比较模型本身)。

二、把一串缩写,放回三个赛场

1. 像闭卷考试:测知识与可验证推理

MMLU-Pro 覆盖多学科;GPQA Diamond 偏高难度科学问题;HLE 推向专家级;AIME 观察数学推理。答案明确,适合大规模稳定比较。但考试得分高,不等于会处理模糊需求、调用工具或交付真实项目。

2. 像匿名面试:测人更喜欢哪个回答

Chatbot Arena 隐藏模型身份,让用户在 A、B 两份回答中选更好的。能反映表达、帮助感和整体体验。但「更受喜欢」不等于「更正确」——语气、长度和排版都可能影响选择。

3. 像开卷实操:测能不能把事情做成

SWE-Bench Pro 要求修改真实代码库;Terminal-Bench 测终端任务;BrowseComp 测多轮搜索;OSWorld 让 Agent 操作电脑应用;GDPval 把报告、表格等交付物交给专业人士评价。更接近「AI 能否完成真实工作」,但更依赖工具、权限和运行环境。

一串缩写,其实只有三类赛场
一串缩写,其实只有三类赛场

三、看到「第一」,先别急着下结论

一项评测是否有说服力,先看四件事:题目还能不能拉开差距;标准答案或测试程序是否可靠;运行条件是否透明;与我们关心的任务是否相关。

MMLU 曾是通用能力核心坐标,如今更像基础检查;SWE-bench Verified 随着分数饱和、污染和测试问题,OpenAI 已不再用它衡量前沿 Coding Agent。「权威」不是永久属性,评测必须持续更新。

关键信息往往藏在表格脚注里:pass@1(一次成功)/ pass@k(k 次有一次成功)/ avg@N(N 次取平均)/ with tools 与 no tools。单次作答、尝试 64 次和允许搜索,显然不是同一种测试条件。

四、拿三份真实发布报告练一遍

GLM-5.2:从评测组合反推模型定位

官方把 Terminal-Bench 2.1、SWE-Bench Pro、PostTrainBench 和 SWE-Marathon 放在重要位置。比数字更值得注意的是选题:GLM-5.2 想证明的不只是「会写代码」,而是「能否长时间推进复杂工程」。长上下文是规格,而这些评测才试图证明规格有没有转化为交付能力。

Kimi K3:同一张表,也可能有不同跑法

脚注明确写道:K3 结果使用 max 推理强度;根据评测不同,模型可能运行在 KimiCode、Claude Code 或 Codex 中。这些数字对理解真实产品表现有价值,却不是严格的「只替换裸模型」对比。最值得学习的是它对 Harness、推理强度和上下文策略的披露。

GPT-5.6:先分清模型进步,还是系统扩容

报告区分 medium、max、ultra 三种运行方式,ultra 默认四个 Agent 并行。如果 ultra 分数更高,正确读法是:增加并行 Agent 和计算预算推高了整套系统的分数,不能简化成「同一模型随手问一次就有这个能力」。前沿竞争已不只是模型之间的比较,也是计算预算、Agent 组织方式和运行时间之间的比较。

三份报告对应三个动作:先看测什么,再看和谁比,最后看怎么跑出来。

三份真实报告,三种读法:测什么、和谁比、怎么跑
三份真实报告,三种读法:测什么、和谁比、怎么跑

五、公共榜单是坐标,不是使用说明书

公共评测可以快速定位:推理是否够强、代码是否突出、能不能搜索、是否支持复杂工具任务。但它不能直接替我们做决策:AIME 领先不代表更会写行业报告;BrowseComp 很高也不代表能处理公司内部的数据、权限和流程。

公共 Benchmark 回答「模型在标准赛场上的位置」;个人 Eval 才回答「它在我的工作中是否真的好用」。最终需要的不是另一张总分榜,而是每个模型的「能力边界卡」:什么可以放心交给它,什么必须检查,什么暂时不能交给它。

公共榜单负责定位,个人评测负责决策
公共榜单负责定位,个人评测负责决策
原文出处:公众号「AI产品白皮书」· 2026-07-22。本文全文仅用于个人学习交流,版权归原作者及发布方所有;如原作者认为不妥,请联系删除。