← 返回闯关手册
中文导读 · 原文:Eugene Yan《Evaluating the Effectiveness of LLM-Evaluators (aka LLM-as-Judge)》· 2024-08 · 英文原文

LLM 评估器的有效性评估(中文导读)

一篇综述 20 余篇论文的长文,系统回答「LLM 当裁判到底靠不靠谱」。是你收藏中《Grader》和《LLM-as-a-judge 综述》两篇之间的最佳桥梁。

一、采用 LLM 评估器前的三大考量

1. 基线是什么?

2. 三种评分方式(不可互换)

3. 评估指标的选择

作者推崇分类指标(recall、precision)——直观、可对应生产表现。相关性指标中 Cohen's κ 最保守可信(会校正随机一致);百分比一致率会高估对齐程度(某模型一致率 80% 但 κ 仅 0.62)。建议尽量让评估器输出二元结果。

二、关键实证发现

三、值得知道的提示技术

四、偏差清单(务必主动防范)

偏差证据
位置偏差成对比较偏好特定位置,gpt-3.5 偏差率 50%,claude-v1 达 70%
冗长偏差>90% 情况下偏好更长回复,即便质量不更好
自我增强偏差偏好自己生成的答案,gpt-4 自偏好胜率 +10%,claude-v1 +25%
给分偏高gpt-4 给 alpaca-7b 打 4.7 分,人类仅 2.9 分
过度推理强模型注入过多背景知识而非简单比对参考答案
表面质量过拟合微调评估器被表面漂亮但实质错误的答案欺骗,LLMBar 上差于随机猜测

五、对 LLM-as-Judge 的批评(保持清醒)

  1. 20 任务 × 11 模型的大规模研究显示:每个模型都有表现糟糕的数据集——不足以系统性替代人类判断;且 LLM 评估器与非专家标注者的相关性高于与专家的——已发表的高相关性可能被高估;
  2. 最强模型在长文连贯性、事实性、指令遵循上,>50% 的情况未能给扰动后的差答案降分;
  3. 微调裁判模型本质是任务特定分类器,换评估范式性能灾难性下降;
  4. 支持的一面:MT-Bench/Chatbot Arena 中 gpt-4 与人类专家一致率 85%,超过人类间的 81%(但未校正随机一致)。

六、实用决策树(直接可用)

Q1: 任务客观(事实性、毒性、指令遵循)还是主观(语气、说服力)?
├─ 客观 → 直接评分
└─ 主观 → 成对比较(更可靠)

Q2: 直接评分能否简化为二元任务?
├─ 能 → 分类指标(recall/precision)或 Cohen's κ
└─ 不能(Likert)→ Spearman's ρ / Kendall's τ

Q3: 成对比较 → Cohen's κ

Q4: 开发期评估还是生产期护栏?
├─ 开发期 → 样本数百条,可用 LLM API + CoT + n-shot
└─ 生产护栏(低延迟高吞吐)→ 投资微调分类器/奖励模型