# Ml LLM Evaluation

> 大模型评估纪律：榜单分数是参照物不是成绩单——benchmark 与真实任务存在分布鸿沟，NFL 教训在 LLM 时代重演，外推无效。当用户问"榜单排名和实测为什么不一致"、"测试集是不是被污染"、 "用 GPT 打分靠谱吗"，或要组织人工评估时激活。动作：自有分布抽测补鸿沟；三探针查污染； 人工评估先定 rubric 与一致性校验；LLM-as-judge 校正位置/自偏爱/长度偏差。不适用于：通用三层 评估设计（ml-evaluation-design）。触发词: benchmark, leaderboard, 数据污染 contamination, LLM-as-judge, 人工评估

- Skill: `fieldlu/ml-llm-evaluation` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add fieldlu/ml-llm-evaluation`
- Raw SKILL.md: https://api.skillmd.com/api/skills/fieldlu/ml-llm-evaluation/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: fieldlu (https://skillmd.com/u/fieldlu)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/fieldlu/ml-llm-evaluation

---


# 大模型评估纪律 — 榜单分数是参照物不是成绩单

## R — 原文 (Reading)

> （转述）GPT-3 论文在报告少样本结果的同时明确警示：训练语料与基准测试间存在意外的重叠风险，作者以 n-gram 重叠检查并声称其对结果影响轻微——但这一检查方法本身被后续工作证明是宽松的。
>
> — Tom Brown 等《Language Models are Few-Shot Learners》(NeurIPS 2020)

> （转述）Liang 等对主流模型开展大规模整体评估（HELM），主张评估应覆盖准确性之外的多维度（稳健性、公平性、偏见、效率），并以标准化协议统一测量条件，因为单榜单一维度的排名无法代表真实能力结构。
>
> — Percy Liang 等《Holistic Evaluation of Language Models》(2022)

> （转述）Zheng 等系统检验 LLM-as-judge：大模型裁判与人类偏好有较高一致率，但存在位置偏差（倾向特定答案位置）、自增强偏差（偏爱自己家族模型的输出）、长度偏差（偏爱更长的回答）；可通过交换位置、多裁判等手段缓解。
>
> — Lianmin Zheng 等《Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena》(NeurIPS 2023)

---

## I — 方法论骨架 (Interpretation)

西瓜书的评估三件套（留出/交叉验证 × 度量 × 比较检验）建立在一个前提上：**测试集与训练过程严格隔离**。LLM 时代这个前提系统性崩塌——网络规模的预训练语料几乎必然吞下公开 benchmark 的题目及其变体。于是 NFL 定理的教训以新形态重演：脱离你的具体任务分布谈"哪个模型更强"，与脱离问题谈算法优劣同样无意义。

四条纪律：

1. **榜单 = 参照物不是成绩单**。榜单衡量的是"在该基准分布上的表现"，与你的任务分布之间的鸿沟必须用自有抽测填补；跨榜单外推排名（"A 比 B 高 2 分所以选 A"）是无效推理。
2. **先查污染再信分数**。任何"模型 X 在我领域数据上考了高分"都要过一遍污染检查：n-gram 重叠、成员推断迹象、"改写题目后分数跳水"的行为学探针。
3. **人工评估先定协议再收分**。没有评分细则（rubric）、没有评分者一致性指标（如 Kappa）、没有盲评，人工分数只是意见不是测量。
4. **机器裁判须校正已知偏差**。位置偏差→交换候选顺序双向评；自偏爱→避免让模型评自己家族的输出；长度偏差→报告时按长度分层核对。

总纲一句话：**评估的对象永远是"模型×任务分布"这对组合，不是模型本身。**

---

## A1 — 文献中的经典应用 (Past Application)

*（本批主题超出西瓜书覆盖范围，A1 改引奠基文献的经典案例，均为学界公认的原始实验叙述）*

### 案例 1: GPT-3 论文主动披露污染隐患
- **问题**: 网络级语料训练出的模型可能在 benchmark 题目上"见过答案"，少样本成绩的可信度存疑。
- **方法论的使用**: 作者主动统计训练集与测试基准间的 n-gram 重叠率，并在剔除疑似重叠样本后复算成绩对比。
- **结论**: 报告称重叠对总体结果影响有限（转述），但承认检测手段粗糙、逐样本影响无法排除。
- **结果**: 这是头部实验室首次把污染检查写入旗舰论文的先例；其方法的宽松性后来成为独立研究课题，反向推动了更严格的污染审计标准——本 skill 步骤 2 的多探针要求即源于此教训。

### 案例 2: HELM 用多维协议替代单榜叙事
- **问题**: 各家模型各自挑对自己有利的基准与设置汇报，跨模型比较基本失效。
- **方法论的使用**: Liang 等固定场景×度量×鲁棒性扰动的矩阵式协议，在同一条件下评测所有主流模型，同时暴露准确率之外的稳健性与偏见维度。
- **结论**: 排名随维度剧烈变化——某模型准确率领先但稳健性垫底的情况普遍存在；"第一"失去唯一含义。
- **结果**: 确立了 holistic 评估范式：任何"谁更强"的结论必须绑定评估维度与条件声明，本 skill 的"评估对象是组合"总纲由此而来。

### 案例 3: MT-Bench 对机器裁判的系统标定
- **问题**: 人工评估太贵太慢，能不能放心地让 GPT-4 给其他模型的回答打分？
- **方法论的使用**: Zheng 等用数千条人类投票作金标准，计算 LLM 裁判与人类偏好的一致率；并逐一构造对照实验分离位置/自偏爱/长度三类偏差。
- **结论**: 一致率超过八成（转述）可用，但三类偏差均显著存在且可被对抗样本利用；交换位置等简单措施能大幅压低位置偏差。
- **结果**: LLM-as-judge 获得"带使用说明书的合法地位"——可用但须按偏差清单校正，本 skill 步骤 4 的操作规则直接取自此标定。

---

## A2 — 触发场景 (Future Trigger) ★

### 用户会在什么情境下需要这个 skill?

1. 用户拿着榜单分数做技术选型："A 比 B 高 3 分所以我们用 A"，需要有人指出榜单分布与其任务分布的鸿沟及验证办法。
2. 用户怀疑某个 benchmark 成绩虚高（题目泄进训练集），想做污染检查但不知道有哪些手段。
3. 用户要组织人工评估（标注指南怎么写、几个人评、分歧怎么办），或打算用 GPT-4 当裁判批量打分。
4. 用户发现"自家微调模型在自建测试集上赢了 GPT-4"，兴奋之余没人提醒他检查测试集构造与裁判独立性。

### 语言信号 (用户的话里出现这些就应激活)

- "**benchmark** 分数 / **榜单**排名 / leaderboard 说明什么 / 为什么实测不一样"
- "**数据污染** / contamination / 测试集泄露 / 是不是背过答案"
- "**LLM-as-judge** / 用 **GPT-4 打分** / 自动评估靠谱吗 / 机器裁判"
- "**人工评估**怎么做 / 标注一致性 / Kappa / 盲评"
- "帮我**选个最强的模型**（依据是榜单）/ 自建测试集上我们赢了大模型"

### 与相邻 skill 的区分

- 与 `ml-evaluation-design` 的区别（双向 contrasts）: 那是通用三层评估设计（切数据/定尺子/比较检验），假设测试集干净可得；本 skill 处理该假设失效后的 LLM 特有陷阱——污染、judge 偏差、分布鸿沟。通用骨架在那边，特化补丁在这边；小规模自有评测的设计仍应回到那边。
- 与 `ml-prompting-methodology` 的区别: 那管单个应用的 prompt 回归迭代（开发态），本管模型能力的科学度量（选型态/验收态）。prompt 回归集太小、太局部，不能当能力结论的证据。
- 与 `ml-pitfall-audit` 的区别: 那是交付前的横向前提审查（六问），本 skill 的污染检查可视为其"信息泄露"一问在 LLM 场景的深度展开；全面审计走那边，专项深挖走这边。

---

## E — 可执行步骤 (Execution)

当 skill 被激活后, agent 应按以下步骤执行:

1. **锚定真实任务分布**
   - 明确评估服务的对象：哪个具体应用/哪类真实输入？从该分布抽样构建自有评测集（哪怕只有几十条），禁止直接拿公开榜单当验收标准。
   - 完成标准: 自有评测集建立（来源、规模、标注口径记录在案）。
   - 判停条件: 用户只想讨论"模型 A 和 B 谁更强"的抽象问题 → 改为输出"分维度分场景的文献结论综述 + 强制声明不可外推到其任务"，不做伪精确排名。

2. **数据污染检查**
   - 三探针依次执行：①n-gram 重 overlap 扫描（自有集 vs 已知常见预训练源）；②行为学探针——将测试题同义改写/换数字换实体后重测，若原题远高于改写题则污染嫌疑成立；③记忆性检查——模型能否续写出测试集的原文片段乃至标准答案。
   - 完成标准: 出具三探针结果表，给出"污染风险 低/中/高"分级。
   - 判停条件: 风险高 → 该 benchmark 分数降权为参考值，评估重心全部移至自有集。

3. **评估协议定型**
   - 定四件事：指标定义（自动指标+判分标准）、评分者配置（人数/资格）、盲评机制（隐藏模型身份与顺序随机化）、一致性校验方案（双人独立评分 + 一致性系数，低一致性则修 rubric 再评）。
   - 完成标准: 协议文档落盘；含"评分者分歧如何仲裁"条款。
   - 判停条件: 无人力做双评 → 至少同一评分者隔日重评自测稳定性，并在报告中如实声明单评者局限。

4. **LLM-as-judge 校正（若采用机器裁判）**
   - 按偏差清单配置缓解项：交换候选位置各评一次取综合；禁用同家族模型互评（或至少标注利益冲突）；报告按回答长度分层核对是否长文占优；rubric 以可核对的具体标准写成而非笼统"哪个更好"。
   - 完成标准: judge 配置卡齐全；抽样 ≥50 条与人工评分对齐校验，一致率达标才放量。
   - 判停条件: 校准一致率过低 → 该 judge 结果仅作初筛，终审回人工。

5. **合成与解读**
   - 汇总自有集主结果 + 污染分级 + 协议声明 + judge 局限，产出结论；所有"优于 X"的表述必须附带评估条件限定句。
   - 完成标准: 结论模板为"在 Y 分布、Z 协议下，A 相对 B ……"；无裸排名句。
   - 判停条件: 结论间的差距小于评估噪声（seed/评分波动）→ 如实报告"无法区分"，不得强行排序。

---

## B — 边界 (Boundary) ★

### 不要在以下情况使用此 skill

- 传统 ML 实验（分类器/回归器的交叉验证与比较检验）→ `ml-evaluation-design` 的领地，本 skill 的 LLM 补丁在那里无处安放。
- 单个 prompt 应用的日常回归 → `ml-prompting-methodology`；把能力评估流程套在每次措辞改动上是杀鸡用牛刀。
- 安全/对齐专项评估（越狱、偏见红队）→ 有专门协议体系，本 skill 只在其评估纪律层面通用，专项内容不覆盖。

### 文献反复警告的失败模式

- **榜单外推**: 把 MMLU/HumanEval 等基准排名直接当作业务选型依据——基准分布≠你的分布，NFL 教训在 LLM 时代原样重演；正确动作是自有抽测补鸿沟。
- **自建集上"击败 GPT-4"的自嗨**: 测试集由自己生成、裁判由自己家族模型担任、样本全是自己擅长的题型——三重利益冲突叠加，结论基本无效。
- **污染分数当真**: 未查污染就引用 benchmark 绝对值；改写探针跳水是红旗中的红旗。
- **无协议人工评估**: 不定 rubric 不算一致性就让几个同事凭感觉打分再求平均——那是收集意见不是测量；Kappa 过低时平均分毫无意义。
- **机器裁判裸奔**: 不做位置交换、不查长度偏好、让模型夸自己家的输出，然后把分数写进报告。

### 作者盲点 / 时代局限（本批为外推补全）

- **必须声明**: 本 skill 主题超出西瓜书(2016)覆盖范围——BOOK_OVERVIEW 批判节指出书中"调参门槛高、需精心设计评估流程"的世界观在大模型时代已被部分改写，评估重心移向 benchmark 设计与对齐；本 skill 是对该时代变迁的外推补全，素材为 2020-2023 文献共识转述，**方法论仍在快速演化**（动态评测/私有评测集/竞技场范式持续更新），执行时应核对当前格局。
- 西瓜书"测试误差近似泛化误差"的前提依赖测试集纯净，这在 LLM 时代只能逼近不能保证——本 skill 的污染检查是该前提的修复尝试而非修复完成；残余不确定性应始终写进结论限定句。
- **评估饱和与基准寿命问题**未被本 skill 完全处理：公开基准从发布到饱和的周期越来越短，任何静态基准的区分度都在衰减，长期项目需规划基准轮换。
- i.i.d. 盲区的延续形态：真实用户的输入分布会随产品上线而漂移（用户学会绕开限制、话题迁移），一次性评估的保质期有限，应配套线上持续监测。

### 容易混淆的邻近方法论

- **"跑个 MMLU 就行"**: 公开 benchmark 只能提供跨模型粗参照，永远替代不了自有分布抽测；混淆二者是本 skill 存在的理由。
- **A/B 测试**: 线上流量实验是评估的黄金终点但回答的是"业务指标好不好"，与"模型能力几何"不同层；二者互补不可互替。
- **胜率/ Elo 竞技场分**: 反映人类偏好的相对序，受偏好群体构成影响，且偏好≠正确；引用时应注明其统计性质而非当成绝对能力值。

---

## 相关 skills

- depends-on: ml-evaluation-design（三层评估骨架的母方法）
- contrasts-with: ml-evaluation-design（通用设计 vs LLM 特有陷阱补丁）
- composes-with: ml-prompting-methodology（prompt 回归的尺子校准）, ml-pitfall-audit（污染检查是其泄露审查的深化）, ml-methodology-router

---

## 审计信息

- **来源性质**: 扩充批B·深度学习与大模型时代——主题超出西瓜书(2016)覆盖范围，R 段为经典文献共识的转述表述（均已标注"（转述）"）
- **验证通过**: 待流水线三重验证复核
- **测试通过率**: 待阶段 4 测试 (详见 test-prompts.json)
- **skill_version**: 0.0.1
- **蒸馏时间**: 2026-08-24

