← 返回闯关手册
LLM 评估器的有效性评估(中文导读)
一篇综述 20 余篇论文的长文,系统回答「LLM 当裁判到底靠不靠谱」。是你收藏中《Grader》和《LLM-as-a-judge 综述》两篇之间的最佳桥梁。
一、采用 LLM 评估器前的三大考量
1. 基线是什么?
- 对标人工标注员:目标是 LLM-人类相关性 ≈ 人类-人类相关性,较容易达成;
- 对标微调分类器/奖励模型:更难——LLM 评估器难以匹配毫秒级延迟和低成本。
2. 三种评分方式(不可互换)
- 直接评分:单独评估单个回复,适合客观评估(忠实度、毒性检测);
- 成对比较:两回复选优,适合主观评估(说服力、语气),结果更稳定;
- 基于参考答案:与黄金答案对比,本质是高级模糊匹配,需标注好的参考答案。
3. 评估指标的选择
作者推崇分类指标(recall、precision)——直观、可对应生产表现。相关性指标中 Cohen's κ 最保守可信(会校正随机一致);百分比一致率会高估对齐程度(某模型一致率 80% 但 κ 仅 0.62)。建议尽量让评估器输出二元结果。
二、关键实证发现
- 摘要评估中,人类专家间相关性 0.8—0.9,而 gpt-3.5-turbo 与人类仅 0.3—0.6——但仍优于 ROUGE/BERTScore 等传统指标;
- 事实一致性评估:高精度、低召回——能识别 >95% 的一致摘要,却只识别 30—60% 的不一致摘要(缺陷召回率低);
- HaluEval:LLM 难以识别隐含幻觉——超过一半失败案例是「现实世界中正确但与给定上下文冲突」的幻觉,LLM 难以忠实于上下文;
- 成对比较在主观任务上更稳,但在客观任务(事实一致性)上相比直接评分几乎没有优势。
三、值得知道的提示技术
- G-Eval:gpt-4 + CoT + 表单填写,SummEval 上超过此前 SOTA;
- PoLL(评审团):三个较小模型集成投票替代单个强模型——与人类判断的相关性高于单独用 gpt-4,成本仅 1/7。有趣发现:gpt-4 起初甚至输给精确字符串匹配,原因是「过度推理」,加入 "don't overthink" 指令后改善;
- Fairer Preferences:LLM 评估器对语义等价的不同表述会产生显著不同的偏好,优化 prompt 可把与人类判断的相关性提升 10—17%。
四、偏差清单(务必主动防范)
| 偏差 | 证据 |
| 位置偏差 | 成对比较偏好特定位置,gpt-3.5 偏差率 50%,claude-v1 达 70% |
| 冗长偏差 | >90% 情况下偏好更长回复,即便质量不更好 |
| 自我增强偏差 | 偏好自己生成的答案,gpt-4 自偏好胜率 +10%,claude-v1 +25% |
| 给分偏高 | gpt-4 给 alpaca-7b 打 4.7 分,人类仅 2.9 分 |
| 过度推理 | 强模型注入过多背景知识而非简单比对参考答案 |
| 表面质量过拟合 | 微调评估器被表面漂亮但实质错误的答案欺骗,LLMBar 上差于随机猜测 |
五、对 LLM-as-Judge 的批评(保持清醒)
- 20 任务 × 11 模型的大规模研究显示:每个模型都有表现糟糕的数据集——不足以系统性替代人类判断;且 LLM 评估器与非专家标注者的相关性高于与专家的——已发表的高相关性可能被高估;
- 最强模型在长文连贯性、事实性、指令遵循上,>50% 的情况未能给扰动后的差答案降分;
- 微调裁判模型本质是任务特定分类器,换评估范式性能灾难性下降;
- 支持的一面:MT-Bench/Chatbot Arena 中 gpt-4 与人类专家一致率 85%,超过人类间的 81%(但未校正随机一致)。
六、实用决策树(直接可用)
Q1: 任务客观(事实性、毒性、指令遵循)还是主观(语气、说服力)?
├─ 客观 → 直接评分
└─ 主观 → 成对比较(更可靠)
Q2: 直接评分能否简化为二元任务?
├─ 能 → 分类指标(recall/precision)或 Cohen's κ
└─ 不能(Likert)→ Spearman's ρ / Kendall's τ
Q3: 成对比较 → Cohen's κ
Q4: 开发期评估还是生产期护栏?
├─ 开发期 → 样本数百条,可用 LLM API + CoT + n-shot
└─ 生产护栏(低延迟高吞吐)→ 投资微调分类器/奖励模型