← 返回闯关手册
中文导读 · 原文:Hamel & Shreya《LLM Evals: Everything You Need to Know》· 2025-05 · 英文原文

LLM Evals 常见问题全书(中文导读)

42 个问答、6 大板块,是目前最完整的 Evals 实操 FAQ。本导读提取最高密度的结论,重点标注错误分析、Judge 校准与数据集规模三大主题。

一、最小可行方案(MVP)

二、错误分析:评估中最重要的活动

四步流程(借鉴质性研究方法):

  1. 创建数据集:收集代表性 trace,无数据时可先生成合成数据;
  2. 开放编码(Open Coding):人工对 trace 写开放式笔记,聚焦每条 trace 中观察到的第一个失败(上游错误会级联到下游);
  3. 主轴编码(Axial Coding):把笔记归类为「失败分类法」——这是最重要的一步,最后统计各类别失败数量;
  4. 迭代精炼:直到理论饱和——新 trace 不再揭示新失败模式。
场景推荐规模
每次变更后的最小审查20—50 条输出,约 30 分钟
错误分析(达到理论饱和)至少 100 条 trace;约 20 条无新类别可停
每周期常规复审100+ 条新 trace,周期 2—4 周
LLM-as-Judge 训练/验证标注100+ 条人工标注样本
CI 测试集100+ 条精选样例
三条铁律:绝不跳过、绝不外包、绝不让 LLM 做初始开放编码。为实际发现的失败写评估,而非想象的失败。

三、LLM Judge 校准

四、高频实践问答精选

五、人机分工边界

可以借助 LLM(需人工监督):首轮主轴编码的分组建议、将新 trace 映射到已有失败模式、建议提示改进、分析标注数据找模式。

绝不能外包给 LLM:初始开放编码、验证失败分类法、ground truth 标注、根因分析。

总结:先手动看数据理解问题,再用 LLM 放大你学到的东西——而不是用 LLM 逃避看数据。