← 返回闯关手册
ArchSynapse AI · 2026-07-30 · ★★★★☆ 精读(Deep Research 评测)

《Agent 评测实战》加餐一 | 深度研究型 Agent 怎么评:报告质量、引用忠实度与"找得全不全"

为什么值得读

Deep Research 是部署最广的 Agent 形态,而它的评测有三大独特难点:长报告无唯一答案、检索全面性本身是能力、引用可能事后硬凑。BrowseComp 与 DeepResearch Bench(RACE+FACT 双尺)两条路线的拆解,直接给出一套四维评测清单。

核心内容速览

适合谁 · 怎么用

先修:a29(工具调用评测)、a38(检索与事实性)。正在做或评测调研类、尽调类、研报类 Agent 的团队。手动做一次 FACT 式核查(抽 5 条结论验引用)是立竿见影的第一步。

闯关自测

先合上原文在心里作答,再点开对照。全对 = 本篇真正通关。

Q1 Deep Research Agent 相比单轮 RAG 多了哪三个评测难点?

输出是长报告无唯一答案;过程是长时程多源检索,「找得全不全」本身是能力维度;引用可能事后硬凑——有引用不等于结论被支撑。

Q2 RACE 和 FACT 分别评什么?为什么要分开?

RACE 评报告质量(相对参考报告、动态标准、四维打分);FACT 评引用可信度(有效引用数 + 引用准确率)。一份报告可以写得好但引用全是硬凑——合成总分会盖住病灶。

Q3 BrowseComp-Plus 解决了什么对照难题?

各 Agent 用不同搜索引擎时,比的是搜索基建而非研究能力。它给所有 Agent 统一的、人工验证过的语料库(含干扰负例),锁死变量后结论才可比。

以下为原文全文

上方为本站原创导读,下方为原文完整收录,便于对照阅读。

这是一篇加餐,起因是一类 Agent 在 2025–2026 迅速变成了部署最广的形态——深度研究型 Agent(Deep Research)。ChatGPT、Gemini、Perplexity 都上线了各自的 Deep Research:你给一个开放问题,它自己上网搜几十上百个来源、读、比对、推理,最后产出一份带引用的长报告。问题来了:这东西怎么评?

检索与事实性评测(faithfulness、groundedness、幻觉检测)的地基在这里依然成立,但远远不够。因为那面对的多是"单轮 RAG":检索几段、生成一段答案。而深度研究 Agent 是长时程、多源、产出一整份报告——它带来了三个新难点。

为什么深度研究 Agent 特别难评:三个新难点

难点一:输出是一份长报告,没有唯一正确答案。"钱退没退"是个可验证的 outcome,但"一份竞品调研报告写得好不好"没有标准答案——同一个问题,两份都优秀的报告可以写得很不一样。exact match 那套在这里直接失效。

难点二:过程是长时程、多源检索,"找得全不全"本身就是一种能力。一份好报告的前提,是它真的把该找的信息找到了。如果 Agent 只搜了前两条结果就开始写,报告再流畅也是空中楼阁。所以你不只要评"写得好不好",还要评"检索得够不够全、够不够准"——这是一个独立的能力维度。

难点三:引用可能是"事后硬凑"的。这是最隐蔽、也最危险的一点。深度研究 Agent 的报告里往往挂满了引用链接,看起来很可信。但有引用 ≠ 结论真的被引用支撑——它完全可能先写好了一句话,再随便挂个看起来相关的链接上去。这正是 faithfulness 的问题,只不过在报告级被放大了几十倍:一份报告里几十条结论、上百个引用,逐条核对忠实度是个体力活,却不能不做。

路线一:有唯一答案的"大海捞针"——BrowseComp

第一条路线很聪明:绕开"报告质量"这个主观泥潭,专门出那些"答案唯一、但极难找到"的题。

代表作是 OpenAI 2025 年 4 月放出的 BrowseComp(browsing comprehension):1266 道刁钻问题,每道都有一个唯一、简短、可验证的答案,但要答对,Agent 必须多跳浏览、持续推理——在一堆网页间反复跳转、交叉比对,才能把那个藏得很深的事实挖出来。评分方式简单粗暴:exact match,答案对就是对。

这条路线的好处,正是"verifiable beats judgeable":它把评测变成了可客观验证的。数据也很能说明问题——OpenAI 自己的 Deep Research 在 BrowseComp 上约 51.5%,而普通模型接个搜索工具往往只有个位数。它精准地测出了"深挖信息"这个硬能力。

它的局限也同样明确:它只测"找到那个事实没有",完全不管报告写得好不好、引用真不真。

这里还有一个你做业务评测时会撞上的坑,衍生版 BrowseComp-Plus 专门解决它:如果每个 Agent 用的搜索引擎、能访问的网页都不一样,那你比的到底是"Agent 的研究能力"还是"它背后搜索引擎的好坏"?没法比。BrowseComp-Plus 的办法是——给所有 Agent 一个固定、人工验证过的语料库(每道题都配好人工核实的支撑文档,还掺入精心挖来的"干扰负例")。这样一来变量被锁死,你测的才是 Agent 本身。这个思路你要记住:评检索型 Agent 时,先想清楚"检索源统一了吗",否则结论不可比。

路线二:开放式报告质量——DeepResearch Bench 的两把尺子

第二条路线迎难而上,直接评那份长报告。代表作是 DeepResearch Bench(arXiv 2506.11763):100 道博士级研究任务,覆盖 22 个领域、中英各 50 道,每道都由领域专家精心设计。它最值得你偷师的,是它用两把独立的尺子去量报告——正好对上"报告质量"和"引用忠实度"两件事。

第一把尺子 RACE——评报告质量。它先请专家写一份参考报告作标杆,然后针对每道题动态生成一套评判标准,再让 LLM 裁判从四个维度打分——全面性、洞察力、遵循指令、可读性——而且是相对参考报告来打,不是凭空打。这正是 reference-guided(参考引导)打分的高级形态:给裁判一个参考答案,它打分会稳得多。效果如何?RACE 与人类专家的成对判断一致率达 92.7%——说明"精心设计的 rubric + 参考报告"确实能让 LLM 裁判评长文也评得准。

第二把尺子 FACT——评引用可信度。它评两件事:有效引用数量(这份报告到底引了多少条真正有用的来源)和引用准确率(挂上去的引用,是否真的支撑了对应的结论)。它和人类判断的 Pearson 相关达 0.8。数据也很有意思:Perplexity 的 Deep Research 在引用准确率上最高(约 90.24%);而 Gemini-2.5-Pro Deep Research 的有效引用数最多(平均约 111 条)——"引得多"和"引得准"是两回事,得分开量。

两把尺子分开量,是这一讲最该学习的方法论。一份报告可能写得花团锦簇(RACE 高)但引用全是硬凑的(FACT 低),也可能引用扎实但读起来枯燥。合成一个总分会把这两种病都盖住——多维度分开评、别过早合成。

落到你自己的研究型 Agent:一张四维评测清单

假设你在做一个"竞品尽调 Agent"或"行业调研 Agent"。把上面两条路线揉进你的评测,落地成四个维度,缺一不可:

一、检索能力(找得全、找得准)。借 BrowseComp 的思路,自己造一批"答案唯一但难找"的题,用 exact match 客观判分——这是你能拿到的最可信的一类信号。记得先统一检索源,否则你只是在比搜索引擎。

二、报告质量(写得好不好)。借 RACE 的思路:为你的高频调研题各写一份参考报告当标杆,让裁判相对参考报告、按你定义的维度(全面性、结论有没有洞察、有没有答到点子上)打分。别让裁判裸评——裸评长文飘得厉害。

三、引用忠实度(引得真不真)。借 FACT 的思路——逐条把报告里的关键结论抽出来,找到它对应的引用,判断这条引用是否真的支撑这个结论。这一步适合级联:先用代码检查"引用链接是否有效、是否真被访问过"(便宜的一层),再用 LLM 裁判核"内容是否支撑"(贵的一层)。

四、成本与时延。深度研究烧 token 是出了名的——一次调研可能跑几十分钟、调几百次工具。同样质量下,一个便宜三倍的 Agent 就是更好的 Agent。别评完质量就收工,把成本和时延一起纳入决策。

延伸:会"追问"的交互式深度研究

上面两条路线,评的都是"你给一个问题、Agent 闷头做完给你报告"的一次性模式。但真实的深度研究往往是交互式的——Agent 做到一半会回头问你:"你说的'竞品'是只算头部三家,还是含所有玩家?"这类追问用对了能大幅提升报告质量,用滥了则烦人又费钱。

针对这种模式,2026 出现了 IDRBench(交互式深度研究基准)这类工作。它多了一个专门的用户模拟器来陪测(思路和 τ-bench 让 LLM 扮用户一脉相承),并引入交互感知的指标——不只看最终报告质量,还看:追问得对不对(问的是不是真正关键、会改变研究方向的信息)、对齐用户意图没有、以及交互成本(别为了"显得严谨"没完没了地问)。如果你的研究型 Agent 会主动追问,评测就得多带一个维度:它问的问题,值不值它打断用户一次的成本?

一个必须警惕的放大陷阱

最后敲一个警钟。深度研究 Agent 的评测里,LLM 裁判偏差会被显著放大。

为什么?因为输出是长报告。裁判有"长度偏差"(偏爱更长的回答)和"权威偏差"(被自信措辞、漂亮排版迷惑)——而一份洋洋洒洒、排版精美、挂满引用的深度研究报告,简直是把这两个偏差的按钮全按到底。一个啥都没查清、但写得花哨的报告,很容易骗过一个裸评的裁判拿高分。

对策还是那三招,只是在这里尤其不能省:用 reference-guided(相对参考报告打,RACE 的做法)压住裁判的自由发挥、用 rubric 把"实质内容"和"文采排版"拆成不同维度分开打、并定期用人工校准盯住裁判有没有被带偏。一句话:报告越漂亮,你越要冷静地问一句——它查得对吗、引得实吗?

小结

思考题

  1. 你的研究型 / 调研型 Agent,现在是只评了"报告读起来好不好",还是把"检索全不全""引用真不真"也分开评了?哪一维现在是空的?
  2. 试着对你的 Agent 产出的一份报告,手动做一次 FACT 式核查:抽 5 条关键结论,逐条看它挂的引用是否真的支撑。命中率是多少?这个数字有没有吓到你?
  3. 如果两份报告,一份写得漂亮但引用松散、一份朴素但引用扎实,你现在的评测会给谁更高分?这暴露了你的裁判有没有被"长度/权威偏差"带偏?
原文出处:公众号「ArchSynapse AI」· 2026-07-30。本文全文仅用于个人学习交流,版权归原作者及发布方所有;如原作者认为不妥,请联系删除。