一线 PM 的真实项目复盘:从「手搓工作流」到「体系化评测」的认知升级全过程,包含评测一致率从 67% 提升到 84% 的具体操作。理论读多了之后,这种带泥土味的实战记录尤其珍贵。
适合读完方法论(a01–a05)之后作为「实战印证」来读,看看理论在真实团队里落地时会遇到哪些坑。
先合上原文在心里作答,再点开对照。全对 = 本篇真正通关。
人肉看输出 → 抽样式评测 → 例行化评测流水线。每次跃迁的触发点都是前一阶段的成本失控。
绝对分数依赖评分标准的宽松度,容易自欺欺人;机器评分与人工评分的一致率(如 67%→84%)直接衡量评测系统本身可不可信。
上方为本站原创导读,下方为原文完整收录,便于对照阅读。
2024 年作者接到任务:评测客服会话的 AI 回复质量。一开始手搓了一个简单工作流,用不同模型对会话逐条打分。第一轮小样本人工标注后,发现工作流打分与人工判断偏差很大,于是调 prompt、换模型、调整节点顺序……折腾几轮才跑出勉强能看的分数。
公司评测体系经历三个阶段:① 各自为战期——各业务线依赖第三方标注,标准不一;② 体系觉醒期——搭建自研评测系统,形成数据集管理→标注→策略维护→分析报告→版本管理的完整链路;③ 自动化升级期——启动 Rubric 自动化评测,驱动力是两个痛点:人工标注速度跟不上迭代;人工评测天然存在波动性。Rubric 的本质是把「评分的尺子」显式化。

评测不是一个执行动作,而是一套策略体系。
不要上来就把所有能力拉一张大表全测一遍。正确做法是「三层过滤」:



常用维度框架:正确性、安全性、流畅度、一致性、讨好度/品牌调性、效率(响应速度、Token 消耗)、业务转化。关键洞察:不同维度的评测方式、成本、所需人员都不同——「正确性」可以自动化批量跑 2000 条,「流畅度」必须人工逐条感受。


| 评测角色 | 适合维度 | 成本 | 建议样本量 |
|---|---|---|---|
| 普通用户 | 流畅度、体验感受、有用性 | 低 | 200—500 条 |
| 专业标注员 | 正确性、一致性、讨好度 | 中 | 500—2000 条 |
| 领域专家 | 专业正确性、业务合理性 | 高 | 50—200 条 |
| 自动化工具 | 安全性、效率、基础正确性 | 极低 | 全量 |

常见误区:让领域专家评「流畅度」是资源错配;所有维度用同一批人测会产生光环效应(觉得对的也感觉流畅)。

结论解读三步法:① 区分达标与不达标;② 定位根因(正确率低是数据问题还是模型能力?流畅度差是生成策略还是 prompt?一致性差是温度参数还是记忆管理?);③ 给出具体优化方向。
真实案例:第一版工作流用单一模型做「满意/不满意」二分类,与人工标注一致率只有 67%。正确结论不是「换模型」,而是把综合分拆成准确性、友好度、效率三个子维度单独评估再加权合成——调整后一致率提升到 84%。教训:不是评分工具的问题,是评测维度设计的问题。
最大的认知升级:AI 评测不是「找几个工具、标一批数据、跑一个分数」,而是从方案设计到例行化运营的策略体系。下次接到评测任务,先别急着打开工作流编辑器——先问自己这五个问题。
