← 返回闯关手册
AI产品白皮书 · 2026-07-11 · ★★★★★ 精读

Rubric:AI时代,定义「什么叫好」正在成为一种核心能力

为什么值得读

这是「AI产品白皮书」Evals 系列的开篇,也是整套方法论的地基。它回答了一个最容易被跳过的问题:在写任何评测代码之前,先搞清楚「什么叫好」。开篇的市场研究报告案例(「信息挺全,但没法拿它做决定」)几乎在每个 AI 团队都真实发生过。

核心内容速览

适合谁 · 怎么用

适合所有正准备给 AI 产品做评测的人作为第一篇文章读。读完后建议立刻动手:选一个你的高频任务,按文中的六要素写出第一版 Rubric 草稿(哪怕只有 3 个维度),后续所有评测工作都建立在这张表上。

闯关自测

先合上原文在心里作答,再点开对照。全对 = 本篇真正通关。

Q1 一份最小可用 Rubric 包含哪六个要素?

维度、行为锚点、权重、门槛、红线、Unknown。其中红线用于标记「不可补偿」的错误(如伪造来源),一旦出现直接不通过,不进入平均分。

Q2 为什么写 Rubric 要从「业务决策」倒推,而不是从「准确性、完整性」这类形容词开始?

形容词无法执行——「准确」不告诉你看什么证据。从决策倒推(决策最怕什么→需要什么证据→怎样算达标)才能让每条标准对应可观察的事实。

Q3 哪些检查不应该交给 Rubric / LLM 来判断?

能确定性验证的:链接能否打开、数字是否正确、订单状态是否更新。这些用程序或状态检查,LLM 只负责推理质量等开放问题。

以下为原文全文

上方为本站原创导读,下方为原文完整收录,便于对照阅读。

团队让 AI 做了一份市场研究报告。三十多页,结构完整,图表不少,结论也很明确。业务负责人看完只说了一句:「信息挺全,但没法拿它做决定。」

团队继续改 Prompt:要求更专业、更深入、更有洞察。AI 写得更像咨询报告,页数也更长,问题却没有消失。

因为「专业」「深入」「有洞察」只是期待,不是标准。没人说清楚:一份能支持决策的报告,究竟要有什么证据;哪些缺陷只是扣分,哪些错误会让整份报告直接失效。这正是 Rubric 要解决的问题。

Prompt 定义 AI 要做什么,Rubric 定义结果满足什么条件才值得采用。

Prompt 定义做什么,Rubric 定义怎样才算做好
Prompt 定义做什么,Rubric 定义怎样才算做好

一、Rubric 不是一张打分表

Rubric 常被译为「评分量规」。卡内基梅隆大学将 Rubric 概括为三个部分:评价维度、具体描述和表现等级。放进 AI 产品里,它更像一份「质量协议」:把业务人员脑中的专业判断,写成团队和机器都能执行的验收规则。

例如评价一份研究报告,「洞察力」这个词本身没有多少用。写成「洞察力强 5 分;一般 3 分;较差 1 分」,也只是给模糊形容词配了数字。更可执行的写法是:

高档:结论能追溯到证据和假设,同时说明适用条件、主要代价与可能反例。

中档:结论与部分证据一致,但主要停留在信息归纳。

低档:结论无法从证据推出,或只是重复材料。

评分者不再判断「我觉得有没有洞察」,而是检查「我看到了什么证据」。

一份最小可用的 Rubric,通常包含六个元素:

Rubric 不能消灭主观判断。它的价值,是把主观判断显性化,让团队能够讨论、校准和修订。

二、为什么 AI 越强,Rubric 越重要?

因为 AI 承接的任务正在从「有标准答案的问题」,走向「没有唯一解的交付物」。报告、对话、研究和 Agent 工作流,往往同时包含三类要求:

  1. 必须正确的事实:数字、引用、计算和业务状态;
  2. 需要专业判断的质量:推理、完整性和决策价值;
  3. 绝不能发生的错误:伪造、泄露、越权和危险建议。
  4. 事实、开放质量和不可补偿风险,需要三种不同的验收方式
    事实、开放质量和不可补偿风险,需要三种不同的验收方式

例如,一份报告语言流畅、结构漂亮,却伪造了两个数据来源。它可能在表达上得到高分,但这些高分不能抵消事实造假。正确的设计不是多扣几分,而是设置红线:一旦出现,整份报告直接不通过。

前沿评测已经在用 Rubric 拆解复杂任务:OpenAI 的 PaperBench 把论文复现拆成 8,316 个可评分部分;HealthBench 为 5,000 段医疗对话配置医生编写的任务专属 Rubric;LifeSciBench 检查科学主张、计算、理由、限制和研究价值。它们共同说明:AI 评测正在从「核对答案」,转向「描述一个好结果应具备什么」。

三、先别列指标,从业务决策倒推

最容易写坏 Rubric 的方式,是打开一张空表,然后填入「准确性、完整性、专业度、可读性」。这些词看起来全面,却没有回答:这份结果要被谁用来做什么?

倒推链路:业务决策 → 决策最怕什么 → 需要什么证据 → 怎样算达标 → 不达标怎么办

好标准不是从形容词出发,而是从业务决策及其风险倒推
好标准不是从形容词出发,而是从业务决策及其风险倒推

以「是否进入某个细分市场」为例:

业务问题关键风险必须观察的证据验收规则
市场是否值得进入市场规模被夸大来源、日期、统计口径核心数字可追溯
我们凭什么进入把行业增长等同于自身机会数据、假设、推理链结论能从证据推出
应该怎样进入只讲趋势,不提供选择方案、条件、代价至少形成可比较选项
哪些情况会失败语气确定但证据不足限制、反例、待验证项明确不确定性和验证动作

还有一条边界:能确定性验证的,不要交给 LLM 猜。链接能否打开、数字是否正确、订单状态是否更新,应优先使用程序或状态检查;推理和决策价值等开放质量,才需要 Rubric。

四、把「没法用」变成一套可执行标准

按照上面的推导,可以得到第一版市场研究 Rubric:

维度权重达标证据典型失败
事实与来源30数字标明来源、日期和口径无来源数字,把预测当事实
推理完整性25结论可追溯到数据和假设数据与结论脱节
决策价值25给出选项、条件和主要代价只有趋势总结
受众适配10信息层级适合决策者术语堆积、重点错位
风险意识10说明限制、反例和验证项用确定语气掩盖证据不足

分数怎样算出来?

观察证据 → 匹配行为锚点 → 得到等级 → 按权重折算。维度得分 = 权重 ×(等级 ÷ 4)

证据先匹配锚点,再得到等级并乘以权重;红线不进入平均分
证据先匹配锚点,再得到等级并乘以权重;红线不进入平均分

例如使用 0—4 级。「事实与来源」权重 30,报告有来源但部分数字缺日期和口径,对照锚点属于 3 级,得分 30 × 3/4 = 22.5。其余维度同规则折算后合计 58.75,显示为 59 分。这个 59 分不是凭感觉打的,它把「没法用」具体定位为:推理链不完整,而且没有形成可比较的选择。

如果使用 1—5 级,公式应改为「权重 ×(等级-1)÷4」。红线不进入平均分;关键维度为 Unknown 时,应补证据或转人工,而不是填成中间分。

得分之后,Rubric 怎样进入系统?

任务样本 → AI 输出 / Trace → 程序、人工或模型收集证据 → Rubric 判级与门禁 → 发布、返修、人工复核或阻断

Rubric 位于证据与系统动作之间,是评测流程中的标准层
Rubric 位于证据与系统动作之间,是评测流程中的标准层

Rubric 在系统里完成三件事:让不同版本使用同一标准;让红线、低分和证据不足触发不同动作;让失败指向需要修改的组件(来源缺失查检索和知识库;推理跳跃查任务拆解、Prompt 或模型;越权泄露查工具权限与执行门禁)。修改组件后,再用同一批任务回归,才构成一次完整迭代。

五、用 20 个样本做出第一版

  1. 选定具体任务:写清结果给谁使用、要支持什么决策,不做「通用内容 Rubric」;
  2. 找出好、差和边界样本:让业务人员分别挑出可以直接用、明显不能用和容易分歧的输出;
  3. 把感觉改写成证据:把「感觉不专业」改成「关键数字没有日期」「建议没有适用条件」等可观察事实;
  4. 合并为 4—6 个维度:优先保留高频失败和高后果风险,并为每个维度写出行为锚点;
  5. 设置权重、门槛、红线和 Unknown
  6. 先对齐人,再接模型:让两名业务人员独立评分同一批样本,先解决人的分歧,再考虑 LLM Judge 自动化。
  7. 先用 20 个样本稳定人的判断,再接入自动评分
    先用 20 个样本稳定人的判断,再接入自动评分

第一版模板:任务/使用者/要支持的决策;维度与权重;0/2/4 级行为锚点;单项门槛与总分门槛;不可补偿的红线;Unknown 与人工复核条件;通过/不通过分别触发什么动作;Rubric 版本与本次修改依据。

写在最后

Rubric 表面上是一种评分方法,底层是在回答一个产品问题:我们究竟愿意把什么样的结果交给用户?模型供应商可以提供能力,却无法替一家公司定义:什么样的报告足以支持决策,什么样的客服回复符合品牌承诺,什么风险绝不能接受。

AI 时代真正稀缺的,不只是写 Prompt 的能力,还包括把「我觉得不够好」翻译成证据、门槛和行动的能力。先别急着给 AI 打分。先回答:对我们来说,到底什么才叫好?

原文出处:公众号「AI产品白皮书」· 2026-07-11。本文全文仅用于个人学习交流,版权归原作者及发布方所有;如原作者认为不妥,请联系删除。