EV_
AI EVALS GUIDE / 闯关手册

AI Evals 闯关手册

「从新手村到 Eval 大师」

写给要给 AI 产品搭评测体系的产品经理和工程师:39 篇精选文章逐篇评级,15 篇精读划出主线,七个知识模块 + 一条推荐路径——帮你从「读懂别人的评测」走到「做出自己的评测」。

我是工程师 / 从业者 → 按推荐路径读 我想转型 AI PM → 走转型路线
39篇已评估文章
15篇精读推荐
20+个补充资源链接
5步学习路径
LV.0 · 新手村读第 1 篇即升级 → LV.1 启程
学习进度:0 / 39 篇已读
00 / KNOWLEDGE MAP

Evals 知识地图

Evals 的七个知识模块,每个模块从一个关键问题出发。点击卡片直达对应文章;每日新收录的内容会持续归位到各模块。

MODULE 01

定义标准 · Rubric

对我们而言,到底什么才叫「好」?
MODULE 06

读懂公共榜单

模型在标准赛场上的位置,如何不被「第一」忽悠?
INBOX

新鲜内容收录箱

每日抓取的最新论文 / 博客 / 中文视频,经筛选后收录进上面各模块。
01 / PATH

推荐阅读顺序

同一批精选藏书,两条读法——选适合你的那条,读完再打勾。

1

先建立动机(两篇短读热身)

目标:搞清楚为什么 Evals 是 AI PM 的核心交付物,建立整体图景
2

核心方法论五连读(白皮书系列)

RubricEvalEval Set 实战GraderAgent Eval,按系列原顺序读,概念环环相扣
目标:掌握「定义标准 → 设计评测 → 建评测集 → 选裁判 → 评 Agent」完整链条
3

权威印证 · 把 eval 前置到设计

目标:一手最佳实践 + 工业级全案 + 在产品设计阶段就为可验证性埋点
4

工程落地六篇(把评测变成日常流程)

目标:工具决策 → 自动化边界 → 数字可信度 → 评测集生长 → 校准 → 接入 CI
5

按需查阅(不必通读)

《看懂大模型榜单》(选模型看榜时) / 藏书区的《Agent 评测实战》连载专题(深入 Agent 评测时按讲次顺序读,注意每篇开头的「先修」)
目标:工具书式查阅,不作为主线
02 / LIBRARY

精选藏书 · 39 篇质量评级

每篇都完整通读并评级:★ 精读(15 篇)是推荐路径的主线,选读按需查阅;同一来源的连载折叠为「连载专题」卡片。每篇文章页包含:独家导读 → 闯关自测 → 原文全文(仅作学习交流,版权归原作者)。点开文章即自动记为已读,也可用卡片上的按钮手动标记/撤销;进度只保存在你自己的浏览器中。

04 / FEED

最新动态 · AI Evals 前沿追踪

由自动任务每日抓取 arXiv 新论文、优质博客与中文视频更新,按时间倒序呈现。点击标题直达原文。

05 / PRACTICE

实战任务:从"读过"到"做过"

方法论已经足够,下一步最值得做的不是再收藏文章,而是搭出你的第一套种子评测集。

  1. 选定一个真实场景(如你的 AI 助手的一个高频任务),用一句话写出评测目标:判断______系统能否帮助______用户在______场景完成______任务,同时避免______失败。
  2. 收集 10 条真实任务 + 5 条真实失败,画一张"任务 × 难点"矩阵,删重复、补盲区。
  3. 选出 8 条种子 Case,按六问模板完整写好其中 3 条(见下方模板)。
  4. 找一位业务同事独立试判,先修掉歧义,再考虑接 LLM Judge。
  5. 选一个工具跑起来:promptfoo(轻量 YAML)或 Phoenix(tracing + eval),完成 Quickstart。
一条 Case 的六问模板(来自《Eval Set 实战》): 1. 输入与环境:系统收到什么,可以看到什么? 2. 必须做到:合格结果必须出现哪些事实或行为? 3. 不能出现:什么错误一发生就应该失败?(红线) 4. 如何判断:哪些由程序核对,哪些依据 Rubric 判断? 5. 保存证据:需要留下回答、引用、检索文档还是工具记录? 6. 来源与版本:它从哪来,为什么入选,当前是哪一版?