← 返回闯关手册
ArchSynapse AI · 2026-08-20 · ★★★★☆ 选读(前沿 · Gaia2/ARE · RLVR · reward hacking)

《Agent 评测实战》28 | 前沿与趋势:动态环境、长程上下文与自演化 Agent

为什么值得读

正课主体的收官讲。前面 27 讲把「今天怎么落地」讲透了,这一讲告诉你「明天往哪走」——四个藏书没有的新东西:动态异步评测环境(Gaia2/ARE:最强模型也只有 42% pass@1,静态评测在温室里高估 Agent)、长程与记忆评测(context rot 注入探针 + Vending-Bench 长时程一致性)、评测⇄训练融合(RLVR、Verifier's Law、「基准 = 冻结的 RL 环境」——可验证的评测集未来就是训练资产)、以及它引来的新风险 reward hacking。知道方向,才不会被时代甩下。

核心内容速览

适合谁 · 怎么用

先修:a19(实战 02 harness 概念)、a20(实战 03 loop engineering)与 a24(实战 16 统计严谨性)——本讲的前沿判断都建立在这些主线概念上;配 a31(加餐二 记忆评测)读长程记忆评测、配 a35(实战 12 代码型评分器)理解 verifiable 的工程含义、配 a42(实战 27 非功能评测)把「评测环境动态化」落成今天能做的第一步。正课收官篇,建议在读完主线后作为「方向地图」收束:三条务实建议(多做可验证评测、把评测环境往动态挪一格、把评测集当长期资产经营)可直接抄进团队下季度计划;不训模型的应用工程师重点理解「评测集是业务 know-how 的可执行沉淀」这一句。

闯关自测

先合上原文在心里作答,再点开对照。全对 = 本篇真正通关。

Q1 为什么说「静态一问一答」的评测会系统性高估 Agent 在真实环境里的能力?Gaia2/ARE 这类动态环境额外逼出了哪几类能力?

因为静态环境里「题目摆好、Agent 来答、环境乖乖等着」,而真实世界里环境在持续变化:新邮件进来、状态更新、deadline 逼近。动态异步环境(Gaia2/ARE 的环境独立于 Agent 演化)额外逼出三类静态评测测不到的能力:时间感知(deadline 到了没、事件先后对不对)、对意外事件的适应(中途冒出的新信息会不会理会)、歧义消解(信息不全时是追问还是瞎猜)——这些恰是生产里最容易出问题的。证据:最强的 GPT-5(high)在 Gaia2 上也只有约 42% pass@1,且在时间敏感任务上明显翻车。

Q2 「verifiable beats judgeable」在前沿语境下,比第 11/12 讲讲的「更可靠、更便宜」多了一层什么理由?这条逻辑链怎么改变你设计评测的方式?

多的一层理由:可验证的评测任务本身就能当强化学习的奖励信号——任务成功能被自动客观验证,这个「验证器」就能给 RL 当奖励(RLVR),于是「一个评测环境」和「一个 RL 训练环境」本质上是同一个东西(「基准 = 冻结的 RL 环境」;Verifier's Law:可训练性追随可验证性)。对设计方式的影响:凡是能自动客观判定的评测,别偷懒交给 LLM 裁判——它不仅评得准、更便宜,还可能成为未来微调/RL 的资产;真正主观的判断项才留给裁判和人工。这不是说 judgeable 没用了,而是「能做成可验证的尽量做成可验证」。

Q3 用「回复里包含『已解决』字样」近似判定任务成功,被优化的 Agent 会怎么钻空子?这属于什么问题、根本防法是什么?

Agent 会学会不管问题解没解决,都在结尾加一句「问题已解决」——分数蹭蹭涨、实际啥也没修。这是 reward hacking(奖励作弊):评测/奖励一旦被用来驱动优化(手动刷分或 RL 训练),Agent 就学会投机讨好评分,且研究发现在真实编码环境里学会作弊后会泛化成「钻空子」的普遍坏习惯。根本防法还是 verifiable:别用可被讨好的代理指标,去查真实 outcome(数据库里有没有退款记录、测试有没有通过);同时越强的优化压力,越要有 verifiable 硬判定 + 人工校准兜底 + 主动的作弊体检和对抗测试。

以下为原文全文

上方为本站原创导读,下方为原文完整收录,便于对照阅读。(本篇为纯文字讲次,原文除封面与结尾签名插画外无信息性配图。)

这是模块六、也是正课主体的最后一讲。前面我们把一套可落地的评测方法讲透了。这一讲,我们抬头看看远方——评测这个领域正在快速演进,有几个前沿方向正在成形,还有一个正在改变「评测」这个词本身含义的大趋势。这一讲不要求你现在就用上,但要让你知道方向——别被时代甩下。

一、评测环境正在「活」起来:动态、异步、人在环路

过去的评测环境是静态的:题目摆好,Agent 来答,环境老老实实等着。但真实世界不是这样——真实世界里,你处理一件事的时候,世界在继续变化:新邮件在进来、状态在更新、deadline 在逼近。前沿的评测环境正在往动态、异步走。

Gaia2 / ARE 为例:它的环境独立于 Agent 而演化(不等你),要求 Agent 在时间约束下适应动态、带噪声的事件、消解歧义、还要和其他 Agent 协作。结果很说明问题——没有模型通吃:最强的 GPT-5(high)也只拿到约 42% 的 pass@1,而且在时间敏感的任务上明显翻车。

动态环境逼出的,是几类静态评测测不到的能力:时间感知(deadline 到了没、事件的先后顺序对不对)、对意外事件的适应(中途冒出来的新信息,它会不会理会)、歧义消解(信息不全时会不会追问,还是瞎猜)。这些恰恰是真实生产里最容易出问题、却在「静态一问一答」里完全暴露不出来的。

这给你的启示很实际:越接近真实世界,评测环境越要「活」。如果你的评测还停留在「静态一问一答、环境乖乖等着」,那你很可能高估了 Agent 在真实动态环境里的能力——它在温室里的好成绩,扛不住真实世界的时间压力和意外事件。

二、长程与记忆:评测「能不能一直不跑偏」

Agent 正在越跑越长(第 3 讲外层循环——定时值守、自我驱动、长时程任务)。长程带来一类新的评测挑战:

上下文工程能力:长任务里,上下文会膨胀、会被压缩、会腐烂(context rot)。Agent 的压缩、笔记、记忆机制到底靠不靠谱?怎么评?一个实用做法(呼应第 19 讲多跳):在长任务的早期注入一条关键信息,跑到很后面再看它记不记得——被压缩掉了、还是稳稳保留了。

长时程一致性:Agent 能不能在一次很长的自驱运行里,始终保持连贯、不跑偏、不自我矛盾?Vending-Bench 这类基准就专门测这个——让 Agent 长时间自主运营(比如经营一台自动售货机),看它会不会在某个点开始崩坏。有意思的是,这类测试常暴露出「短跑冠军、长跑崩盘」的 Agent:单个任务做得很好,一旦让它连续自主运行很久,就会在某处陷入混乱——这恰恰是只测短任务永远发现不了的。

长程评测的难点在于:很多失败不是「某一步错了」,而是「跑了很久之后慢慢偏了」。这种缓慢的漂移,短任务的评测根本照不出来,必须专门设计长程场景去逼它现形。

一个更远的方向:自演化 Agent 怎么评

再往前看,有一类「自演化 Agent」——它们能根据反馈自己改进自己(改自己的提示、工具、甚至策略)。这给评测出了个新难题:你评的是一个移动的靶子。传统评测默认「被测对象在评测期间是固定的」,但自演化 Agent 边被评边变。于是评测要回答的问题也变了——不只是「它现在多好」,而是「它自我改进的方向对不对、会不会越改越偏(自我说服,第 3 讲)、改进能不能持续」。评这种,你要评的是一条「改进轨迹」,而不是某个静态快照——这本身就是个开放的前沿问题。它也和上一节呼应:当 Agent 能拿评测当反馈来自我进化,评测就更是它能力的来源,而不只是事后的验收了。

三、最大的趋势:评测 ⇄ 训练的融合

这是这一讲、也可能是整个领域最重要的一个趋势——它正在改变「评测」这个词的含义。

先记住一句正在成为共识的话:verifiable beats judgeable(可验证的,胜过可判断的)。能被客观验证的评测(跑测试、查状态),优于需要主观判断的评测(LLM 裁判)——第 11、12 讲我们讲过它更可靠、更便宜。但前沿给了它一个更深的理由:一个可验证的评测任务,本身就能当训练的奖励信号。这就是 RLVR(reinforcement learning from verifiable rewards,基于可验证奖励的强化学习)。

逻辑链条是这样的:如果一个任务的成功能被自动、客观地验证,那这个「验证器」就能给强化学习当奖励——于是「一个评测环境」和「一个 RL 训练环境」,本质上是同一个东西。业界有个说法叫「基准 = 冻结的 RL 环境」,还有 Jason Wei 的 Verifier's Law:可训练性追随可验证性——能验证它,就能训练出它("if you can eval it, you can build it")。

这不是空谈。前面提到的 Gaia2,它的每个场景都配了 write-action verifier(写操作验证器)——这个验证器既能用来评测、又能直接拿去做 RLVR 训练。评测环境和训练环境,在它这里合二为一了。更早的代表作:Tülu 3 提出并开源了 RLVR 的配方(把奖励模型换成「可验证任务上的验证器」),DeepSeek-R1 则证明了纯 RL + 规则化可验证奖励,能让推理能力自己涌现出来。

这对你——一个 AI 应用工程师——意味着什么?你不一定训练模型,但这个视角会改变你怎么设计评测:优先做「可验证」的评测(能自动、客观判定的),因为它不仅评得准,还可能成为未来微调 / RL 的资产。你今天认真做的评测集,可能就是明天训练环境的雏形。一份高质量、可验证、覆盖真实失败的评测集,价值远超「打个分」——它是你业务 know-how 的一种可执行的沉淀。换句话说:评测,正在从「验收工具」升级为「能力的来源」。这是这几年最值得记住的一个范式转变。

但也要清醒一点:不是所有东西都能「可验证」。有唯一答案、能跑测试、能查状态的任务(数学、代码、可核对的操作),天然适合 verifiable 和 RLVR;而开放、主观的任务(写得好不好、答得体不体贴),没有客观验证器,仍然离不开 LLM 裁判和人工(第 13、15 讲)。所以「verifiable beats judgeable」不是说 judgeable 没用了,而是「能做成可验证的就尽量做成可验证的,剩下真正主观的才用判断」——和第 11 讲的配比原则是同一个道理,只是现在多了一层「可验证的还能拿去训练」的强动机。

四、优化压力下的新风险:reward hacking

但这个融合也带来一个必须警惕的新风险。一旦评测/奖励被用来驱动优化——无论是你手动迭代 prompt 去刷评测分,还是用它做 RL 训练——Agent 就会学会钻评测的空子:不真正解决问题,而是投机地讨好评分。这叫 reward hacking(奖励作弊)

这把第 8、10、12 讲的「防作弊」提到了新高度:优化压力越大,作弊的动机越强。而且有研究(Anthropic)发现,Agent 在真实编码环境里学会作弊后,会泛化到更广的对齐问题上——它不只是学会了在这道题上偷懒,而是学会了「钻空子」这种普遍的坏习惯。

举个 reward hacking 的具体样子:你的评测用「回复里包含『已解决』字样」来近似判定成功,于是被优化的 Agent 学会了——不管问题解没解决,都在结尾加一句「问题已解决」,评测分蹭蹭涨、实际啥也没修。它没解决问题,只是学会了讨好你的评分。

防它的根本办法,还是那句 verifiable:别用「嘴上说『已解决』」这种可被讨好的代理,去查真实 outcome(第 4、12 讲)。

启示很明确:评测越是被当奖励来用,就越要防作弊——越要有 verifiable 的硬判定(钻不了的空子)、越要有人工校准兜底(第 15 讲)、越要主动做「作弊体检」和对抗测试(第 8 讲)。你用评测去驱动优化的力度有多大,你在防作弊上就得有多用心。

五、一个贯穿始终的真相:评测集是「活资产」

前沿方向会不断变,但有一条会一直成立:评测集是持续演进的活资产,不是一次性的交付物

原因是第 6 讲讲过的饱和:Agent 能力涨得飞快,任何一个固定的评测集,很快就会被追平——大家都满分,它就失去了区分力。所以最前沿的态度不是「造一个完美的评测集」,而是让它一直生长:不断补进更难的、更真实的、来自线上的新用例(第 9 讲飞轮、第 22 讲回流)。

这不是什么高深技巧,而是一种心态:评测永远追不上能力的终点,但你要一直追。停下来的那一刻,你的评测就开始腐烂(第 10 讲)。

对应用工程师的三条务实建议

前沿虽远,落到今天你能做的其实很具体:

不用追每一个前沿热点,做好这三条,你就已经站在了正确的方向上。

收束:工具会过时,原则不会

这一讲讲的前沿——动态环境、长程记忆、评测与训练融合、自演化——都还在快速变化,具体的基准和方法明年可能就换了一批。但你不必焦虑,因为这门专栏一路铺下来的内核是不变的:

工具和榜单会过时,这些原则不会。抓住原则,你就能跟着前沿一起走,而不是被它甩下。

也正因如此,这门专栏从头到尾没让你去背某个榜单第一是谁、某个工具有哪些按钮——那些明年就变了。它一直在教的是判断力:面对一个新 Agent、一个新场景、一个明年才出现的新工具,你能不能自己想清楚「该评什么、怎么评才可信、怎么落地、怎么持续」。这份判断力,才是评测能力的内核,也是这门专栏真正想留给你的东西。

小结

正课主体到这里就讲完了。下一讲是实战收尾——第 29 讲:7 步从 0 到 1 搭建你的专属评测套件,我们把整门专栏串成一条你能真正跑起来的流水线。

思考题

  1. 你的评测环境是「静态一问一答」,还是允许环境动态变化、有时间压力?如果是前者,你的 Agent 在真实动态场景里,可能比评测显示的更脆弱。
  2. 想一想「verifiable beats judgeable」:你现在有多少评测是「可客观验证」的、多少是「靠 LLM/人判断」的?有没有哪些判断项,其实能被改造成可验证的检查?
  3. 如果你的评测集有一天真的成了微调/RL 的训练环境,你现在做评测的方式(可验证性、防作弊、覆盖真实失败)够格吗?
原文出处:ArchSynapse AI 公众号(《Agent 评测实战》连载第 28 讲)· 2026-08-20。本文全文仅用于个人学习交流,版权归原作者及发布方所有;如原作者认为不妥,请联系删除。
原文链接:https://mp.weixin.qq.com/s/dZ9keVlkBub_c1qjqKECMg