← 返回闯关手册
人人都是产品经理(Miss卓卓)· 2026-07-20 · ★★★★ 精读

当我们说AI评测时,到底在评什么?

为什么值得读

一线 PM 的真实项目复盘:从「手搓工作流」到「体系化评测」的认知升级全过程,包含评测一致率从 67% 提升到 84% 的具体操作。理论读多了之后,这种带泥土味的实战记录尤其珍贵。

核心内容速览

适合谁 · 怎么用

适合读完方法论(a01–a05)之后作为「实战印证」来读,看看理论在真实团队里落地时会遇到哪些坑。

闯关自测

先合上原文在心里作答,再点开对照。全对 = 本篇真正通关。

Q1 从「手搓」到「体系」的评测建设分哪三个阶段?

人肉看输出 → 抽样式评测 → 例行化评测流水线。每次跃迁的触发点都是前一阶段的成本失控。

Q2 为什么「一致率」比绝对分数更值得监控?

绝对分数依赖评分标准的宽松度,容易自欺欺人;机器评分与人工评分的一致率(如 67%→84%)直接衡量评测系统本身可不可信。

以下为原文全文

上方为本站原创导读,下方为原文完整收录,便于对照阅读。

一位 AI 产品经理从「手搓评测工作流」到「搭建完整体系」的认知升级实录。

一、一切从一个评测项目开始

2024 年作者接到任务:评测客服会话的 AI 回复质量。一开始手搓了一个简单工作流,用不同模型对会话逐条打分。第一轮小样本人工标注后,发现工作流打分与人工判断偏差很大,于是调 prompt、换模型、调整节点顺序……折腾几轮才跑出勉强能看的分数。

公司评测体系经历三个阶段:① 各自为战期——各业务线依赖第三方标注,标准不一;② 体系觉醒期——搭建自研评测系统,形成数据集管理→标注→策略维护→分析报告→版本管理的完整链路;③ 自动化升级期——启动 Rubric 自动化评测,驱动力是两个痛点:人工标注速度跟不上迭代;人工评测天然存在波动性。Rubric 的本质是把「评分的尺子」显式化。

同一批会话,不同标注的打分存在天然波动
同一批会话,不同标注的打分存在天然波动

评测不是一个执行动作,而是一套策略体系。

二、五个灵魂拷问

第一问:测什么?——评测方案设计

不要上来就把所有能力拉一张大表全测一遍。正确做法是「三层过滤」:

  1. 产品当前处于什么阶段?技术验证期测「做对」(正确性、安全性);体验打磨期测「做好」(流畅度、一致性);上线运营期测「做值」(转化率、留存)。递进关系,前一阶段没达标,后一阶段的评测没意义;
  2. 不同产品阶段的评测侧重:做对 → 做好 → 做值
    不同产品阶段的评测侧重:做对 → 做好 → 做值
  3. 核心使用场景是什么?同一个「正确性」,对话机器人看意图识别,代码助手看语法正确,内容生成看事实准确;
  4. 不同场景下的评测维度侧重
    不同场景下的评测维度侧重
  5. 用户最不能接受什么?找出每个场景的「一票否决」致命维度,放在最高优先级。P0 不达标 → 产品不上线;P1 不达标 → 核心体验残缺;P2 不达标 → 有瑕疵但可迭代。
  6. 致命维度不达标 = 一票否决
    致命维度不达标 = 一票否决

第二问:用什么维度测?——评测维度拆解

常用维度框架:正确性、安全性、流畅度、一致性、讨好度/品牌调性、效率(响应速度、Token 消耗)、业务转化。关键洞察:不同维度的评测方式、成本、所需人员都不同——「正确性」可以自动化批量跑 2000 条,「流畅度」必须人工逐条感受。

AI 产品评测的七大核心维度
AI 产品评测的七大核心维度
AI 产品评测的七大核心维度
AI 产品评测的七大核心维度

第三问:谁来测?——评测角色分工矩阵

评测角色适合维度成本建议样本量
普通用户流畅度、体验感受、有用性200—500 条
专业标注员正确性、一致性、讨好度500—2000 条
领域专家专业正确性、业务合理性50—200 条
自动化工具安全性、效率、基础正确性极低全量
四类评测主体对比
四类评测主体对比

常见误区:让领域专家评「流畅度」是资源错配;所有维度用同一批人测会产生光环效应(觉得对的也感觉流畅)。

评测角色分工矩阵
评测角色分工矩阵

第四问:测出什么结论?——阶段性结果的解读

结论解读三步法:① 区分达标与不达标;② 定位根因(正确率低是数据问题还是模型能力?流畅度差是生成策略还是 prompt?一致性差是温度参数还是记忆管理?);③ 给出具体优化方向。

真实案例:第一版工作流用单一模型做「满意/不满意」二分类,与人工标注一致率只有 67%。正确结论不是「换模型」,而是把综合分拆成准确性、友好度、效率三个子维度单独评估再加权合成——调整后一致率提升到 84%。教训:不是评分工具的问题,是评测维度设计的问题。

第五问:还要怎么测?——调优方向与例行化

三、三个常见误区

  1. 只关注自动化跑分,忽略人工体验:「MMLU 85 分,上线后用户骂翻」。对策:自动化做筛选,人工做终审;
  2. 所有维度用同一批人测:成本高且结果不可靠。对策:按角色分工矩阵分配;
  3. 评测做一次就完事:模型迭代后质量退化无感知。对策:建立例行化机制,让评测成为研发流程的一环。

最大的认知升级:AI 评测不是「找几个工具、标一批数据、跑一个分数」,而是从方案设计到例行化运营的策略体系。下次接到评测任务,先别急着打开工作流编辑器——先问自己这五个问题。

AI 评测策略全景图
AI 评测策略全景图
原文出处:公众号「人人都是产品经理」· 2026。本文全文仅用于个人学习交流,版权归原作者及发布方所有;如原作者认为不妥,请联系删除。