人工是唯一真值,但「用人工 ≠ 随便找人打分」。这篇系统讲清两层校准:先校准人(标注规范、IAA 一致性、尺度选择),再用金标准校准自动裁判(人机一致率 + 归因 + 持续复校)。98% 自动化、2% 人工挑难样本的配比,是整套评测体系可信度的锚。
先修:a04(Grader 三层分工)。正在引入 LLM/Agent 裁判的团队:裁判上岗前先过这篇的校准闭环。与 a04(裁判分工)、a24(统计严谨性)连读。
先合上原文在心里作答,再点开对照。全对 = 本篇真正通关。
定标准(rubric、oracle)、校准自动裁判(人机一致率)、抓疑难兜底(阈值边缘/裁判打架/高风险/新模式样本)。成熟团队 98% 自动化、2% 人工。
先归因再动手:看不一致样本——rubric 有歧义就修规范、裁判有系统偏差就治裁判、人判错了就回去校准人。别笼统调 prompt。并且定期复校,裁判会漂移。
如果样本里 pass 占多数,「闭着眼全判 pass」也能蒙出高一致率。Cohen's kappa 扣掉「瞎猜也能对」的随机基线,衡量比随机好多少。
上方为本站原创导读,下方为原文完整收录,便于对照阅读。
前面三讲讲了三种自动评分器,但你应该注意到,每一讲的结尾都拴着同一根线——"拿人工去校准它"。这一讲,我们就把这根线收起来,讲透两件事:人工评测为什么是所有自动化的"真值",以及怎么用它去校准整套自动化。
但我要先破一个误解:"用人工"不等于"随便找几个人打个分"。人工评测本身也会不准、也会飘——一套没校准过的人工评测,和一个没校准过的 LLM 裁判一样不可信。所以这一讲有一半篇幅,是讲怎么让人评得可信。
先说清它的地位。对那些主观、开放的质量判断——话术好不好、解释清不清楚、体验贴不贴心——最终的标准只能是人。没有哪个自动指标能凌驾于"目标用户觉得好不好"之上。所以人工评测是整个评测体系的 ground truth(真值)、北极星。许多成熟的 Agent 产品,早期都是从"内部员工人工试用、给反馈"起步,之后才逐步补上自动化评测——很多成功的评测,第一步都是朴素的人工。
但真值不等于免费、也不等于永远正确。人工评测有三个绕不开的代价:
前两条决定了"人工不能什么都评",第三条决定了"人工评测自己也需要被校准"。
"人工"不是只有一种。按成本和场景,常见四种,各有各的位置:
配比原则和自动化一脉相承:早期靠 dogfooding 快速起步;需要可靠真值锚点时上专家评审;要上量时用众包(但必须先校准);关键决策再做用户研究。
既然人会不一致,那"随便找人打分"得到的就是噪声。要让人工评测配得上"真值"这个地位,得下功夫校准人本身。
第一步,写清楚标注规范 / Rubric。别丢给标注员一句"你觉得这个回复好不好",那必然人各一词。要把"好"拆成清晰、可逐条判定的标准,并配上正例、反例、边界说明。退款话术的人工评分卡示例:如实性(谎称成功 = 直接 fail)、补救(失败时是否说明原因/重试/时限)、语气(礼貌、不甩锅)、无过度承诺(避免"一定/保证立刻到账")、信息完整(工单号等)。正例:「退款因网关超时暂未成功,已记录工单 #T12,预计 24h 内重试」→ 五项全过;反例:「已为您退款」(实际失败)→ 如实性 fail,一票否决。把正例、反例写进规范,标注员一看就知道边界在哪,一致性立刻上一个台阶。规范越具体,人和人之间越对得齐。
第二步,选对打分尺度。pass-fail(二元):简单、客观、一致性高,适合"合格/不合格"式判断。Likert(如 1–5 分):有层次、信息量大,但更主观——你的"4 分"和我的"4 分"可能不是一回事。经验:能用 pass-fail 说清的,就别上 Likert。需要层次时再用 Likert,且务必配详细的分档说明。
第三步,量标注员间的一致性(inter-annotator agreement, IAA)。这是校准人的关键动作:让多个标注员评同一批样本,看他们彼此判得一致吗?一致率高 → 你的规范清晰、标注员对齐了,人工结果可信。一致率低 → 别急着标更多,这是个警报:要么 rubric 有歧义,要么标注员没对齐。先回去修规范、对齐认知,再开标。
举个退款的例子:三个标注员评同一条"退款失败但语气很客气"的回复,A、B 判 fail(因为没说补救措施),C 判 pass(觉得语气好就行)。这个分歧暴露的不是"谁对谁错",而是 rubric 没写清"缺补救措施是否直接判 fail"——补上这条,三个人就对齐了。
第四步,走一个校准流程。把上面串起来:培训标注员 → 试标一小批 → 对齐分歧、修规范 → 正式标注 → 持续抽查。人工评测是个需要维护的过程,不是"找人标一次"就完事。
因为又贵又慢,人工不该、也不能去逐条评所有样本。它的价值要花在刀刃上——三个高价值位置:
这正是配比原则和"级联"的落地:日常规模化靠自动化,人工只出现在最需要人类判断的三个位置。一个成熟团队,可能 98% 的评测样本都由自动化处理,人工只碰那关键的 2%——但正是这 2%,锚住了整套系统的可信度。
那 2% 怎么挑?别随机抽——把人力花在信息量最大的样本上:① 自动裁判打分模糊、落在阈值边缘的;② 代码评分器和 LLM 裁判结论打架的;③ 高风险任务(动钱、不可逆);④ 新冒出来、没见过的失败模式。这套"专挑难的给人看"的思路,能让有限的人工发挥最大价值。
现在把前几讲反复出现的"校准"讲成一个具体可操作的闭环。目标是回答那个关键问题:我的自动裁判,判得到底准不准?流程:人工评一批"金标准"样本(比如 100 条,按 rubric 严格评)→ 让 LLM/Agent 裁判评同样这 100 条 → 算「人机一致率」= 两者结论吻合的比例 → 达标(如 ≥85%)放手规模化;不达标回炉:看不一致的样本,归因后修正 → 定期复校(因为裁判会漂)。
举个校准的实际数字。你抽 100 条退款回复,人工按评分卡判出 62 条 pass、38 条 fail 作为金标准;让 LLM 裁判评同样 100 条,对照:人工 pass 且裁判 pass 58、人工 fail 且裁判 fail 31、两者不一致 11。原始一致率 = (58+31)/100 = 89%,看着不错。但别只看这个数:如果 pass 本来就占多数,一个"闭着眼全判 pass"的裁判也能蒙到不低的一致率——原始一致率会高估真实水平。所以更稳的做法是用扣掉"瞎猜也能对"那部分的一致性指标(比如 Cohen's kappa),它衡量的是"比随机猜好多少"。
再看那 11 条不一致的:逐条归因,发现 7 条是 rubric 里"补救措施"这条没写清导致的分歧(→ 修规范),3 条是裁判的长度偏差(→ 治裁判),1 条是标注员看走眼(→ 人的问题)。归因清楚,下一轮再校,一致率就上得去。
两个要点,把它用对:
一致率不达标,别笼统"调 prompt",先归因。去看那些判得不一样的样本,通常是三种情况之一:① rubric 某条有歧义(人和机各自理解不同)→ 把它写死;② 裁判确实有系统性偏差(长度、位置等)→ 按对策治;③ 是人判错了(人工也会累、会不一致)→ 说明你的人工也没校准好。逐一归因,比盲目改 prompt 有效十倍。
校准不是一次性的,要持续复校。模型会升级、prompt 会改、业务规则会变——你的裁判会悄悄漂移,今天校准好的,三个月后可能就偏了。所以把"人机一致率"当成一个长期监控的指标,定期抽样复校。一旦它掉下来,就是在报警:"你的自动裁判开始不可信了,快回来校。" 可操作节奏:固定周期(比如每月抽一小批复校)+ 事件触发(每次换裁判模型、大改 rubric、或业务规则变更后,立即重校一次)。
一句话总结这一讲的核心:人工不是用来评所有东西的,而是用来校准那个"评所有东西"的自动系统的。
好的自动化,几乎都是从人工"长"出来的:① 先人工:早期没 rubric、没自动裁判,就靠内部 dogfooding 凭判断评,快速迭代;② 从人工判断里提炼 rubric:把"我为什么觉得这条好/不好"显式化;③ 用 rubric 造自动裁判;④ 用人工校准它:算人机一致率,达标才放量;⑤ 人工退居二线:日常交给自动化,人只做定标准、校准、抓疑难。
人工从来不是被自动化"取代",而是升级了——从"逐条打分的劳力",变成"定义标准、校准机器、把关疑难的裁判长"。
一句话:人工评测的门槛不在预算,在有没有把它变成团队每天都在做的小事。