这是「AI产品白皮书」Evals 系列的开篇,也是整套方法论的地基。它回答了一个最容易被跳过的问题:在写任何评测代码之前,先搞清楚「什么叫好」。开篇的市场研究报告案例(「信息挺全,但没法拿它做决定」)几乎在每个 AI 团队都真实发生过。
适合所有正准备给 AI 产品做评测的人作为第一篇文章读。读完后建议立刻动手:选一个你的高频任务,按文中的六要素写出第一版 Rubric 草稿(哪怕只有 3 个维度),后续所有评测工作都建立在这张表上。
先合上原文在心里作答,再点开对照。全对 = 本篇真正通关。
维度、行为锚点、权重、门槛、红线、Unknown。其中红线用于标记「不可补偿」的错误(如伪造来源),一旦出现直接不通过,不进入平均分。
形容词无法执行——「准确」不告诉你看什么证据。从决策倒推(决策最怕什么→需要什么证据→怎样算达标)才能让每条标准对应可观察的事实。
能确定性验证的:链接能否打开、数字是否正确、订单状态是否更新。这些用程序或状态检查,LLM 只负责推理质量等开放问题。
上方为本站原创导读,下方为原文完整收录,便于对照阅读。
团队让 AI 做了一份市场研究报告。三十多页,结构完整,图表不少,结论也很明确。业务负责人看完只说了一句:「信息挺全,但没法拿它做决定。」
团队继续改 Prompt:要求更专业、更深入、更有洞察。AI 写得更像咨询报告,页数也更长,问题却没有消失。
因为「专业」「深入」「有洞察」只是期待,不是标准。没人说清楚:一份能支持决策的报告,究竟要有什么证据;哪些缺陷只是扣分,哪些错误会让整份报告直接失效。这正是 Rubric 要解决的问题。
Prompt 定义 AI 要做什么,Rubric 定义结果满足什么条件才值得采用。
Prompt 定义做什么,Rubric 定义怎样才算做好
Rubric 常被译为「评分量规」。卡内基梅隆大学将 Rubric 概括为三个部分:评价维度、具体描述和表现等级。放进 AI 产品里,它更像一份「质量协议」:把业务人员脑中的专业判断,写成团队和机器都能执行的验收规则。
例如评价一份研究报告,「洞察力」这个词本身没有多少用。写成「洞察力强 5 分;一般 3 分;较差 1 分」,也只是给模糊形容词配了数字。更可执行的写法是:
高档:结论能追溯到证据和假设,同时说明适用条件、主要代价与可能反例。
中档:结论与部分证据一致,但主要停留在信息归纳。
低档:结论无法从证据推出,或只是重复材料。
评分者不再判断「我觉得有没有洞察」,而是检查「我看到了什么证据」。
一份最小可用的 Rubric,通常包含六个元素:

Rubric 不能消灭主观判断。它的价值,是把主观判断显性化,让团队能够讨论、校准和修订。
因为 AI 承接的任务正在从「有标准答案的问题」,走向「没有唯一解的交付物」。报告、对话、研究和 Agent 工作流,往往同时包含三类要求:

例如,一份报告语言流畅、结构漂亮,却伪造了两个数据来源。它可能在表达上得到高分,但这些高分不能抵消事实造假。正确的设计不是多扣几分,而是设置红线:一旦出现,整份报告直接不通过。
前沿评测已经在用 Rubric 拆解复杂任务:OpenAI 的 PaperBench 把论文复现拆成 8,316 个可评分部分;HealthBench 为 5,000 段医疗对话配置医生编写的任务专属 Rubric;LifeSciBench 检查科学主张、计算、理由、限制和研究价值。它们共同说明:AI 评测正在从「核对答案」,转向「描述一个好结果应具备什么」。
最容易写坏 Rubric 的方式,是打开一张空表,然后填入「准确性、完整性、专业度、可读性」。这些词看起来全面,却没有回答:这份结果要被谁用来做什么?
倒推链路:业务决策 → 决策最怕什么 → 需要什么证据 → 怎样算达标 → 不达标怎么办
好标准不是从形容词出发,而是从业务决策及其风险倒推
以「是否进入某个细分市场」为例:
| 业务问题 | 关键风险 | 必须观察的证据 | 验收规则 |
|---|---|---|---|
| 市场是否值得进入 | 市场规模被夸大 | 来源、日期、统计口径 | 核心数字可追溯 |
| 我们凭什么进入 | 把行业增长等同于自身机会 | 数据、假设、推理链 | 结论能从证据推出 |
| 应该怎样进入 | 只讲趋势,不提供选择 | 方案、条件、代价 | 至少形成可比较选项 |
| 哪些情况会失败 | 语气确定但证据不足 | 限制、反例、待验证项 | 明确不确定性和验证动作 |
还有一条边界:能确定性验证的,不要交给 LLM 猜。链接能否打开、数字是否正确、订单状态是否更新,应优先使用程序或状态检查;推理和决策价值等开放质量,才需要 Rubric。
按照上面的推导,可以得到第一版市场研究 Rubric:
| 维度 | 权重 | 达标证据 | 典型失败 |
|---|---|---|---|
| 事实与来源 | 30 | 数字标明来源、日期和口径 | 无来源数字,把预测当事实 |
| 推理完整性 | 25 | 结论可追溯到数据和假设 | 数据与结论脱节 |
| 决策价值 | 25 | 给出选项、条件和主要代价 | 只有趋势总结 |
| 受众适配 | 10 | 信息层级适合决策者 | 术语堆积、重点错位 |
| 风险意识 | 10 | 说明限制、反例和验证项 | 用确定语气掩盖证据不足 |
观察证据 → 匹配行为锚点 → 得到等级 → 按权重折算。维度得分 = 权重 ×(等级 ÷ 4)
证据先匹配锚点,再得到等级并乘以权重;红线不进入平均分
例如使用 0—4 级。「事实与来源」权重 30,报告有来源但部分数字缺日期和口径,对照锚点属于 3 级,得分 30 × 3/4 = 22.5。其余维度同规则折算后合计 58.75,显示为 59 分。这个 59 分不是凭感觉打的,它把「没法用」具体定位为:推理链不完整,而且没有形成可比较的选择。
任务样本 → AI 输出 / Trace → 程序、人工或模型收集证据 → Rubric 判级与门禁 → 发布、返修、人工复核或阻断
Rubric 位于证据与系统动作之间,是评测流程中的标准层
Rubric 在系统里完成三件事:让不同版本使用同一标准;让红线、低分和证据不足触发不同动作;让失败指向需要修改的组件(来源缺失查检索和知识库;推理跳跃查任务拆解、Prompt 或模型;越权泄露查工具权限与执行门禁)。修改组件后,再用同一批任务回归,才构成一次完整迭代。

第一版模板:任务/使用者/要支持的决策;维度与权重;0/2/4 级行为锚点;单项门槛与总分门槛;不可补偿的红线;Unknown 与人工复核条件;通过/不通过分别触发什么动作;Rubric 版本与本次修改依据。
Rubric 表面上是一种评分方法,底层是在回答一个产品问题:我们究竟愿意把什么样的结果交给用户?模型供应商可以提供能力,却无法替一家公司定义:什么样的报告足以支持决策,什么样的客服回复符合品牌承诺,什么风险绝不能接受。
AI 时代真正稀缺的,不只是写 Prompt 的能力,还包括把「我觉得不够好」翻译成证据、门槛和行动的能力。先别急着给 AI 打分。先回答:对我们来说,到底什么才叫好?