读榜防忽悠指南。MMLU、HLE、SWE-bench 这些榜单到底在测什么、一个分数背后藏着多少限定条件,讲得清楚又好读。和产品级 eval 是互补关系:这篇帮你选模型时不被「第一」误导。
选模型、看发布会、读评测报告时随手查阅(知识地图 M6 模块)。不需要精读,收藏备查即可。
先合上原文在心里作答,再点开对照。全对 = 本篇真正通关。
Benchmark(考什么)、Metric(怎么计分)、Harness(怎么运行)、Leaderboard(怎么排名)。分数 = 模型 × 环境 × 工具 × 预算 × 评分规则,不只是裸模型能力。
pass@1 还是 pass@k?带不带工具/脚手架?推理强度(thinking budget)开多大?答案通常藏在脚注里。
榜单告诉你模型在标准赛场的位置,但你的业务场景有自己的分布——它在你的产品里好不好用,只有你自己的评测集说了算。
上方为本站原创导读,下方为原文完整收录,便于对照阅读。
每次新模型发布,最先看到的往往是一长串缩写:MMLU-Pro、GPQA、HLE、SWE-bench、BrowseComp、OSWorld……几乎每家都能找到一个「第一」。原因并不神秘:它们参加的本来就不是同一种考试。读懂榜单的第一步,不是比分数,而是先看每个分数在测什么。

一张榜单里常有四个东西被混在一起:
一个分数 = 模型 × 运行环境 × 工具 × 时间与 Token 预算 × 评分规则。榜单测到的往往是「这套系统在这组条件下的表现」,不只是裸模型的能力。
一张榜单,四个层次:题目、计分、运行、排名
以 SWE-bench 为例:完整系统榜单允许各家使用不同的 Coding Agent(更接近比较产品能力);Bash-only 榜单让不同模型统一运行在 mini-SWE-agent 中(更适合比较模型本身)。
MMLU-Pro 覆盖多学科;GPQA Diamond 偏高难度科学问题;HLE 推向专家级;AIME 观察数学推理。答案明确,适合大规模稳定比较。但考试得分高,不等于会处理模糊需求、调用工具或交付真实项目。
Chatbot Arena 隐藏模型身份,让用户在 A、B 两份回答中选更好的。能反映表达、帮助感和整体体验。但「更受喜欢」不等于「更正确」——语气、长度和排版都可能影响选择。
SWE-Bench Pro 要求修改真实代码库;Terminal-Bench 测终端任务;BrowseComp 测多轮搜索;OSWorld 让 Agent 操作电脑应用;GDPval 把报告、表格等交付物交给专业人士评价。更接近「AI 能否完成真实工作」,但更依赖工具、权限和运行环境。

一项评测是否有说服力,先看四件事:题目还能不能拉开差距;标准答案或测试程序是否可靠;运行条件是否透明;与我们关心的任务是否相关。
MMLU 曾是通用能力核心坐标,如今更像基础检查;SWE-bench Verified 随着分数饱和、污染和测试问题,OpenAI 已不再用它衡量前沿 Coding Agent。「权威」不是永久属性,评测必须持续更新。
官方把 Terminal-Bench 2.1、SWE-Bench Pro、PostTrainBench 和 SWE-Marathon 放在重要位置。比数字更值得注意的是选题:GLM-5.2 想证明的不只是「会写代码」,而是「能否长时间推进复杂工程」。长上下文是规格,而这些评测才试图证明规格有没有转化为交付能力。
脚注明确写道:K3 结果使用 max 推理强度;根据评测不同,模型可能运行在 KimiCode、Claude Code 或 Codex 中。这些数字对理解真实产品表现有价值,却不是严格的「只替换裸模型」对比。最值得学习的是它对 Harness、推理强度和上下文策略的披露。
报告区分 medium、max、ultra 三种运行方式,ultra 默认四个 Agent 并行。如果 ultra 分数更高,正确读法是:增加并行 Agent 和计算预算推高了整套系统的分数,不能简化成「同一模型随手问一次就有这个能力」。前沿竞争已不只是模型之间的比较,也是计算预算、Agent 组织方式和运行时间之间的比较。
三份报告对应三个动作:先看测什么,再看和谁比,最后看怎么跑出来。
三份真实报告,三种读法:测什么、和谁比、怎么跑
公共评测可以快速定位:推理是否够强、代码是否突出、能不能搜索、是否支持复杂工具任务。但它不能直接替我们做决策:AIME 领先不代表更会写行业报告;BrowseComp 很高也不代表能处理公司内部的数据、权限和流程。
公共 Benchmark 回答「模型在标准赛场上的位置」;个人 Eval 才回答「它在我的工作中是否真的好用」。最终需要的不是另一张总分榜,而是每个模型的「能力边界卡」:什么可以放心交给它,什么必须检查,什么暂时不能交给它。
公共榜单负责定位,个人评测负责决策