大模型评估纪律 — 榜单分数是参照物不是成绩单
R — 原文 (Reading)
(转述)GPT-3 论文在报告少样本结果的同时明确警示:训练语料与基准测试间存在意外的重叠风险,作者以 n-gram 重叠检查并声称其对结果影响轻微——但这一检查方法本身被后续工作证明是宽松的。
— Tom Brown 等《Language Models are Few-Shot Learners》(NeurIPS 2020)
(转述)Liang 等对主流模型开展大规模整体评估(HELM),主张评估应覆盖准确性之外的多维度(稳健性、公平性、偏见、效率),并以标准化协议统一测量条件,因为单榜单一维度的排名无法代表真实能力结构。
— Percy Liang 等《Holistic Evaluation of Language Models》(2022)
(转述)Zheng 等系统检验 LLM-as-judge:大模型裁判与人类偏好有较高一致率,但存在位置偏差(倾向特定答案位置)、自增强偏差(偏爱自己家族模型的输出)、长度偏差(偏爱更长的回答);可通过交换位置、多裁判等手段缓解。
— Lianmin Zheng 等《Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena》(NeurIPS 2023)
I — 方法论骨架 (Interpretation)
西瓜书的评估三件套(留出/交叉验证 × 度量 × 比较检验)建立在一个前提上:测试集与训练过程严格隔离。LLM 时代这个前提系统性崩塌——网络规模的预训练语料几乎必然吞下公开 benchmark 的题目及其变体。于是 NFL 定理的教训以新形态重演:脱离你的具体任务分布谈"哪个模型更强",与脱离问题谈算法优劣同样无意义。
四条纪律:
- 榜单 = 参照物不是成绩单。榜单衡量的是"在该基准分布上的表现",与你的任务分布之间的鸿沟必须用自有抽测填补;跨榜单外推排名("A 比 B 高 2 分所以选 A")是无效推理。
- 先查污染再信分数。任何"模型 X 在我领域数据上考了高分"都要过一遍污染检查:n-gram 重叠、成员推断迹象、"改写题目后分数跳水"的行为学探针。
- 人工评估先定协议再收分。没有评分细则(rubric)、没有评分者一致性指标(如 Kappa)、没有盲评,人工分数只是意见不是测量。
- 机器裁判须校正已知偏差。位置偏差→交换候选顺序双向评;自偏爱→避免让模型评自己家族的输出;长度偏差→报告时按长度分层核对。
总纲一句话:评估的对象永远是"模型×任务分布"这对组合,不是模型本身。
A1 — 文献中的经典应用 (Past Application)
(本批主题超出西瓜书覆盖范围,A1 改引奠基文献的经典案例,均为学界公认的原始实验叙述)
案例 1: GPT-3 论文主动披露污染隐患
- 问题: 网络级语料训练出的模型可能在 benchmark 题目上"见过答案",少样本成绩的可信度存疑。
- 方法论的使用: 作者主动统计训练集与测试基准间的 n-gram 重叠率,并在剔除疑似重叠样本后复算成绩对比。
- 结论: 报告称重叠对总体结果影响有限(转述),但承认检测手段粗糙、逐样本影响无法排除。
- 结果: 这是头部实验室首次把污染检查写入旗舰论文的先例;其方法的宽松性后来成为独立研究课题,反向推动了更严格的污染审计标准——本 skill 步骤 2 的多探针要求即源于此教训。
案例 2: HELM 用多维协议替代单榜叙事
- 问题: 各家模型各自挑对自己有利的基准与设置汇报,跨模型比较基本失效。
- 方法论的使用: Liang 等固定场景×度量×鲁棒性扰动的矩阵式协议,在同一条件下评测所有主流模型,同时暴露准确率之外的稳健性与偏见维度。
- 结论: 排名随维度剧烈变化——某模型准确率领先但稳健性垫底的情况普遍存在;"第一"失去唯一含义。
- 结果: 确立了 holistic 评估范式:任何"谁更强"的结论必须绑定评估维度与条件声明,本 skill 的"评估对象是组合"总纲由此而来。
案例 3: MT-Bench 对机器裁判的系统标定
- 问题: 人工评估太贵太慢,能不能放心地让 GPT-4 给其他模型的回答打分?
- 方法论的使用: Zheng 等用数千条人类投票作金标准,计算 LLM 裁判与人类偏好的一致率;并逐一构造对照实验分离位置/自偏爱/长度三类偏差。
- 结论: 一致率超过八成(转述)可用,但三类偏差均显著存在且可被对抗样本利用;交换位置等简单措施能大幅压低位置偏差。
- 结果: LLM-as-judge 获得"带使用说明书的合法地位"——可用但须按偏差清单校正,本 skill 步骤 4 的操作规则直接取自此标定。
A2 — 触发场景 (Future Trigger) ★
用户会在什么情境下需要这个 skill?
- 用户拿着榜单分数做技术选型:"A 比 B 高 3 分所以我们用 A",需要有人指出榜单分布与其任务分布的鸿沟及验证办法。
- 用户怀疑某个 benchmark 成绩虚高(题目泄进训练集),想做污染检查但不知道有哪些手段。
- 用户要组织人工评估(标注指南怎么写、几个人评、分歧怎么办),或打算用 GPT-4 当裁判批量打分。
- 用户发现"自家微调模型在自建测试集上赢了 GPT-4",兴奋之余没人提醒他检查测试集构造与裁判独立性。
语言信号 (用户的话里出现这些就应激活)
- "benchmark 分数 / 榜单排名 / leaderboard 说明什么 / 为什么实测不一样"
- "数据污染 / contamination / 测试集泄露 / 是不是背过答案"
- "LLM-as-judge / 用 GPT-4 打分 / 自动评估靠谱吗 / 机器裁判"
- "人工评估怎么做 / 标注一致性 / Kappa / 盲评"
- "帮我选个最强的模型(依据是榜单)/ 自建测试集上我们赢了大模型"
与相邻 skill 的区分
- 与
ml-evaluation-design的区别(双向 contrasts): 那是通用三层评估设计(切数据/定尺子/比较检验),假设测试集干净可得;本 skill 处理该假设失效后的 LLM 特有陷阱——污染、judge 偏差、分布鸿沟。通用骨架在那边,特化补丁在这边;小规模自有评测的设计仍应回到那边。 - 与
ml-prompting-methodology的区别: 那管单个应用的 prompt 回归迭代(开发态),本管模型能力的科学度量(选型态/验收态)。prompt 回归集太小、太局部,不能当能力结论的证据。 - 与
ml-pitfall-audit的区别: 那是交付前的横向前提审查(六问),本 skill 的污染检查可视为其"信息泄露"一问在 LLM 场景的深度展开;全面审计走那边,专项深挖走这边。
E — 可执行步骤 (Execution)
当 skill 被激活后, agent 应按以下步骤执行:
锚定真实任务分布
- 明确评估服务的对象:哪个具体应用/哪类真实输入?从该分布抽样构建自有评测集(哪怕只有几十条),禁止直接拿公开榜单当验收标准。
- 完成标准: 自有评测集建立(来源、规模、标注口径记录在案)。
- 判停条件: 用户只想讨论"模型 A 和 B 谁更强"的抽象问题 → 改为输出"分维度分场景的文献结论综述 + 强制声明不可外推到其任务",不做伪精确排名。
数据污染检查
- 三探针依次执行:①n-gram 重 overlap 扫描(自有集 vs 已知常见预训练源);②行为学探针——将测试题同义改写/换数字换实体后重测,若原题远高于改写题则污染嫌疑成立;③记忆性检查——模型能否续写出测试集的原文片段乃至标准答案。
- 完成标准: 出具三探针结果表,给出"污染风险 低/中/高"分级。
- 判停条件: 风险高 → 该 benchmark 分数降权为参考值,评估重心全部移至自有集。
评估协议定型
- 定四件事:指标定义(自动指标+判分标准)、评分者配置(人数/资格)、盲评机制(隐藏模型身份与顺序随机化)、一致性校验方案(双人独立评分 + 一致性系数,低一致性则修 rubric 再评)。
- 完成标准: 协议文档落盘;含"评分者分歧如何仲裁"条款。
- 判停条件: 无人力做双评 → 至少同一评分者隔日重评自测稳定性,并在报告中如实声明单评者局限。
LLM-as-judge 校正(若采用机器裁判)
- 按偏差清单配置缓解项:交换候选位置各评一次取综合;禁用同家族模型互评(或至少标注利益冲突);报告按回答长度分层核对是否长文占优;rubric 以可核对的具体标准写成而非笼统"哪个更好"。
- 完成标准: judge 配置卡齐全;抽样 ≥50 条与人工评分对齐校验,一致率达标才放量。
- 判停条件: 校准一致率过低 → 该 judge 结果仅作初筛,终审回人工。
合成与解读
- 汇总自有集主结果 + 污染分级 + 协议声明 + judge 局限,产出结论;所有"优于 X"的表述必须附带评估条件限定句。
- 完成标准: 结论模板为"在 Y 分布、Z 协议下,A 相对 B ……";无裸排名句。
- 判停条件: 结论间的差距小于评估噪声(seed/评分波动)→ 如实报告"无法区分",不得强行排序。
B — 边界 (Boundary) ★
不要在以下情况使用此 skill
- 传统 ML 实验(分类器/回归器的交叉验证与比较检验)→
ml-evaluation-design的领地,本 skill 的 LLM 补丁在那里无处安放。 - 单个 prompt 应用的日常回归 →
ml-prompting-methodology;把能力评估流程套在每次措辞改动上是杀鸡用牛刀。 - 安全/对齐专项评估(越狱、偏见红队)→ 有专门协议体系,本 skill 只在其评估纪律层面通用,专项内容不覆盖。
文献反复警告的失败模式
- 榜单外推: 把 MMLU/HumanEval 等基准排名直接当作业务选型依据——基准分布≠你的分布,NFL 教训在 LLM 时代原样重演;正确动作是自有抽测补鸿沟。
- 自建集上"击败 GPT-4"的自嗨: 测试集由自己生成、裁判由自己家族模型担任、样本全是自己擅长的题型——三重利益冲突叠加,结论基本无效。
- 污染分数当真: 未查污染就引用 benchmark 绝对值;改写探针跳水是红旗中的红旗。
- 无协议人工评估: 不定 rubric 不算一致性就让几个同事凭感觉打分再求平均——那是收集意见不是测量;Kappa 过低时平均分毫无意义。
- 机器裁判裸奔: 不做位置交换、不查长度偏好、让模型夸自己家的输出,然后把分数写进报告。
作者盲点 / 时代局限(本批为外推补全)
- 必须声明: 本 skill 主题超出西瓜书(2016)覆盖范围——BOOK_OVERVIEW 批判节指出书中"调参门槛高、需精心设计评估流程"的世界观在大模型时代已被部分改写,评估重心移向 benchmark 设计与对齐;本 skill 是对该时代变迁的外推补全,素材为 2020-2023 文献共识转述,方法论仍在快速演化(动态评测/私有评测集/竞技场范式持续更新),执行时应核对当前格局。
- 西瓜书"测试误差近似泛化误差"的前提依赖测试集纯净,这在 LLM 时代只能逼近不能保证——本 skill 的污染检查是该前提的修复尝试而非修复完成;残余不确定性应始终写进结论限定句。
- 评估饱和与基准寿命问题未被本 skill 完全处理:公开基准从发布到饱和的周期越来越短,任何静态基准的区分度都在衰减,长期项目需规划基准轮换。
- i.i.d. 盲区的延续形态:真实用户的输入分布会随产品上线而漂移(用户学会绕开限制、话题迁移),一次性评估的保质期有限,应配套线上持续监测。
容易混淆的邻近方法论
- "跑个 MMLU 就行": 公开 benchmark 只能提供跨模型粗参照,永远替代不了自有分布抽测;混淆二者是本 skill 存在的理由。
- A/B 测试: 线上流量实验是评估的黄金终点但回答的是"业务指标好不好",与"模型能力几何"不同层;二者互补不可互替。
- 胜率/ Elo 竞技场分: 反映人类偏好的相对序,受偏好群体构成影响,且偏好≠正确;引用时应注明其统计性质而非当成绝对能力值。
相关 skills
- depends-on: ml-evaluation-design(三层评估骨架的母方法)
- contrasts-with: ml-evaluation-design(通用设计 vs LLM 特有陷阱补丁)
- composes-with: ml-prompting-methodology(prompt 回归的尺子校准), ml-pitfall-audit(污染检查是其泄露审查的深化), ml-methodology-router
审计信息
- 来源性质: 扩充批B·深度学习与大模型时代——主题超出西瓜书(2016)覆盖范围,R 段为经典文献共识的转述表述(均已标注"(转述)")
- 验证通过: 待流水线三重验证复核
- 测试通过率: 待阶段 4 测试 (详见 test-prompts.json)
- skill_version: 0.0.1
- 蒸馏时间: 2026-08-24