与 a10 互补:a10 教你「别被榜单分数忽悠」(选模型时用),这篇教你「解剖基准设计、偷零件建自己的评测集」(建评测时用)。「读基准四问」和三种评分设计的拆解,全是可直接复用的零件。
先修:a10(读懂榜单的四层结构)。准备自建评测集、想找设计参照的人。与 a10 连读:一个管「看分」,一个管「偷设计」。
先合上原文在心里作答,再点开对照。全对 = 本篇真正通关。
测什么能力?任务与环境怎么设计?怎么评分(最关键:查 output 还是 outcome、用代码/模型/人)?适合参考什么、有什么局限?
exact match(GAIA)适合有唯一确定答案的任务;execution-based(WebArena/OSWorld)适合「会改变环境状态」的任务——只验最终状态,允许多条合理路径。
数据污染(题进了训练集,分数是背出来的)、基准饱和(刷到天花板失去区分度)、harness 适配成本(分数 = 模型 × 你那套接榜 harness 的联合成绩)。
上方为本站原创导读,下方为原文完整收录,便于对照阅读。
认知基础篇我们解决了"评什么、怎么拆",从这一讲起,模块二解决一个更接地气的问题:评测的素材——任务和数据——从哪来。
最自然的起点,是去看别人已经做好的:公开基准(benchmark)。学读基准有两个理由:一是它们是一批经过千锤百炼的高质量参考,你能直接站在它们肩上;二是更重要的——读懂一个好基准怎么设计的,你才知道怎么给自己的业务设计评测集。
但先打个预防针:读基准不是为了刷榜。榜单分高,不代表它在你的业务上好用;基准还会饱和、会被数据污染。所以我们读基准,重点是"偷设计",而不是"追排名"。
这一讲(上)拆三个经典的通用型基准:GAIA、AgentBench、WebArena。下一讲(下)拆更偏专项的 τ-bench、SWE-bench、BFCL、OSWorld 等。
拆基准之前,先给你一个可复用的框架。以后看到任何一个新基准,都用这四个问题去解剖它,你会读得又快又透:
① 测什么。GAIA(General AI Assistants)测的是一个通用助手的综合本事:推理、多模态理解、网页浏览、工具使用——而且要把这些串起来解决一个真实问题。
② 任务与环境。它由 466 道真实世界问题组成(公开的开发/验证集 + 300 道答案保密的私有测试集,用来撑官方榜单)。最值得学的是它的三级难度设计:
按"步数 + 用到的工具数"来分难度——这是个特别朴素又好用的分级思路,你建自己的评测集时可以直接借用。
③ 怎么评分。极其干脆:精确匹配(Exact Match)。每道题要求答案是规定格式(字符串、数字、或逗号分隔的列表),经过标准化(小写、去标点、去冠词、规整空格)后,和标准答案一字不差才算对。
④ 适合与局限。GAIA 是典型的"端到端 × 任务完成"评测——它只看最终答案对不对,不管你过程怎么走。exact match 的好处是客观、可复现、零歧义;代价是它只适用于有唯一确定答案的任务。你的业务里那些开放式的、答案不唯一的任务(写一段总结、给个建议),GAIA 这套评分法就不灵了。
补一个数字,让你感受它的难度:人类答对率约 92%,而当年带插件的 GPT-4 只有约 15%——这条巨大的鸿沟,正是 GAIA 设计的初衷:用"对人简单、对 AI 很难"的真实问题,把通用助手的真实水平照出来。
它的题长这样(示意)。一道典型的 Level 2/3 题,往往是这种多跳形式:"打开某篇论文,找到它某张图引用的那个数据集;再去另一个网站查这个数据集的发布年份;最后算出它比论文的发表年份早几年。"它逼着 Agent 把"网页浏览 + 读文件 + 推理 + 计算"拧成一条长链——这正是它难的地方,也是它跟"一问一答"式题目的本质区别。
也别忽略它的局限:exact match 虽然客观,却脆——答案格式差一点(多带个单位、换种写法、多个空格)就可能被判错,所以它只适合"答案能被唯一、规整地表达"的任务;另外,公开的验证集有被训练数据污染的风险(这也正是它把 300 道测试题答案保密的原因)。
从 GAIA 偷一个设计:难度分级(按步数/工具数)+ exact match(用于唯一答案任务)。
① 测什么。AgentBench(ICLR 2024)测的是 LLM 作为 Agent 在多种环境里的推理与决策能力。它的关注点不是"答一道题",而是"在一个环境里多轮地行动"。
② 任务与环境。它的核心特色是 8 个差异极大的交互式环境,约 1360 个测试样本:
为什么要这么杂?因为它想看的是泛化——同一个模型,在写 SQL、操作系统命令、玩游戏这些天差地别的环境里,表现是不是都稳。AgentBench 把"环境"做成了评测的主角。
③ 怎么评分。因环境而异——每个环境有自己的成功判定(比如 OS 环境看命令最终达成的状态,数据库看查询结果对不对),本质上多是任务是否达成(outcome)的检查,再跨环境汇总成一个总分。
它的环境长这样(示意)。以数据库环境为例:给 Agent 一个数据库的表结构 + 一个自然语言问题("上个月哪个品类销售额最高?"),它得自己写 SQL、执行、看返回、必要时改写再查,最后给出答案——成功判定看最终答案对不对。换到操作系统环境,则是给一个目标("找出占空间最大的日志文件并清空它"),让它在真实 shell 里一条条敲命令去达成。八个环境,八种几乎完全不同的"行动语言"——这就是它考"泛化"的方式。
④ 适合与局限。它适合用来横向比较不同模型的"通用 Agent 底子",尤其是看一个模型会不会"偏科"。AgentBench 的一个著名结论是:顶级商业模型和开源模型在 Agent 能力上差距明显,而长程推理、决策、指令遵循是普遍瓶颈。局限在于,它的 8 个环境再杂,也未必覆盖你的具体业务——它是体检报告,不是你那道专业考题。
从 AgentBench 偷一个设计:用多个差异大的环境测"泛化",专门照出"偏科"。
① 测什么。WebArena 测的是 Agent 在真实网页环境里完成任务的能力——也就是当下很热的"浏览器/网页 Agent"。
② 任务与环境。它搭了一组自托管的真实网站:电商、论坛、协作开发平台(类 GitLab)、内容管理系统、地图、百科类参考站。在这些站点上,它用 241 个模板实例化出 812 个任务,覆盖三类:找信息、站内导航、配置内容。注意——这些是真能点、真能操作的站点,不是截图或文字描述。
③ 怎么评分。这是 WebArena 最该学的地方:功能正确性(functional correctness),execution-based,0/1 二值。它不去比对 Agent"点了哪些按钮、动作序列对不对",而是用程序化的校验器去检查任务最终有没有真的达成——比如"有没有真的下单成功""那条 issue 有没有真的被创建"。
这恰恰是 outcome ≠ output 和"多条路径都可能对"的完美落地:只要最终环境状态对了,你走哪条路我都认。这种评分法比"对动作序列"既更可靠、又更宽容(容得下多种合理解法)。
它的任务长这样(示意)。比如在那个类电商站点上:"把我购物车里所有评分低于 4 星的商品都删掉。" Agent 要真的去浏览购物车、逐个查评分、执行删除。它的程序化校验器根本不看 Agent 点了哪些按钮,只在结束后去查后台状态:购物车里是不是只剩评分 ≥4 的商品了?是就 1 分,不是就 0 分。这就是 execution-based 的精髓——只认最终结果状态,不认你走的那条路,于是同一个任务的多种合理解法都能被认可。
④ 适合与局限。它是所有"会改变环境状态"的 Agent(网页、操作类)评测的黄金范本——教你怎么写"验最终状态"的校验器。局限是搭建和维护这套自托管环境成本不低(这也正是"Agent 评测从准备数据升级成搭建环境"的含义)。顺带一提,WebArena 上的成绩这几年涨得很快,从最初 GPT-4 的个位数/十几个百分点,到 2025 年已有方案冲到六成以上——这也提醒我们:基准会饱和。
从 WebArena 偷一个设计:execution-based 校验最终状态,允许多路径——这是评"会动手"的 Agent 的正道。
| GAIA | AgentBench | WebArena | |
|---|---|---|---|
| 测什么 | 通用助手综合能力 | LLM 作为 Agent 的多环境泛化 | 网页/浏览器 Agent |
| 任务规模 | 466 题(300 私有) | 8 环境、约 1360 样本 | 812 任务(241 模板) |
| 有无交互环境 | 弱(问答为主,可联网) | 强(8 个交互环境) | 强(自托管真实网站) |
| 评分方式 | 精确匹配(exact match) | 各环境的任务达成判定 | 功能正确性(execution-based,0/1) |
| 看 output 还是 outcome | output(唯一答案) | 偏 outcome | 纯 outcome |
| 最适合参考 | 唯一答案的端到端任务 | 比模型的通用 Agent 底子 | 会改变环境状态的操作类 Agent |
| 主要局限 | 只适合唯一答案任务 | 未必覆盖你的具体业务 | 环境搭建/维护成本高 |
把它们放进全景图:三者主战场都在"端到端 × 任务完成"那个格子——都重点看"最终成没成"。它们对轨迹级、组件级的覆盖较弱,对"安全与成本"维度基本不碰。这不是缺点,而是提醒你:通用基准给你的是"任务完成"这一维的参照,其余维度(工具调用细节、安全、成本)得靠你自己补。
如果只记三件事:
这一讲我们用"读基准四问"(测什么 / 任务环境 / 评分方式 / 适合与局限)拆了三个经典通用基准:GAIA(三级难度 + exact match,适合唯一答案任务)、AgentBench(8 个交互环境测泛化,专照偏科)、WebArena(自托管真实网站 + execution-based 功能正确性,评"会动手" Agent 的范本)。它们主战场都在"端到端 × 任务完成",给你的是这一维的高质量参照。