# Ml Transformer Era

> 深度时代的架构选型决策。当用户问"该用 CNN/RNN 还是 Transformer"、注意力机制/QKV 是什么、 位置编码有什么用、"数据够不够训"，或想"全都上 Transformer"时激活。按数据形态×数据规模× 算力三轴匹配架构：小表格数据 GBDT 常胜神经网络、小数据 CNN/RNN 仍是正解、大规模序列才轮到 Transformer；含 QKV 直觉与位置编码必要性。不适用于：训练不动（ml-deep-training-playbook）、 自训还是微调未定（ml-pretraining-paradigm）。触发词: transformer vs cnn, QKV, positional encoding, 架构选型

- Skill: `fieldlu/ml-transformer-era` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add fieldlu/ml-transformer-era`
- Raw SKILL.md: https://api.skillmd.com/api/skills/fieldlu/ml-transformer-era/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: fieldlu (https://skillmd.com/u/fieldlu)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/fieldlu/ml-transformer-era

---


# Transformer 时代架构选型 — 规模与形态决定骨架，而非流行度

## R — 原文 (Reading)

> （转述）Vaswani 等提出 Transformer：完全基于注意力机制，摒弃递归与卷积；自注意力把每个位置表示为查询(Q)、键(K)、值(V)三元组参与全局交互，配合位置编码注入顺序信息；在机器翻译上以更短的训练时间达到当时最优质量。
>
> — Vaswani 等《Attention Is All You Need》(NeurIPS 2017)

> （转述）Kaplan 等系统报告规模定律：模型性能随参数量、数据量、算力的幂律平滑提升，且跨多个数量级成立——这为"投入多大模型配多少数据"提供了外推依据。
>
> — Jared Kaplan 等《Scaling Laws for Neural Language Models》(2020)

---

## I — 方法论骨架 (Interpretation)

西瓜书第 5 章的神经网络叙事止于 BP 与浅层网络，对"该搭什么骨架"没有给出现代答案。本 skill 补全这个决策：**架构选择是归纳偏好的选择，而归纳偏好必须同时匹配任务的数据形态和数据规模。**

三条决策轴：

- **数据形态轴**: 图像的局部平移不变性 → 卷积先验仍高效；有序序列 + 长程依赖 → 自注意力的全局交互占优；纯数值表格小样本 → 树集成先验常胜一切深度骨架。
- **数据规模轴**: Transformer 是低归纳偏好（弱先验）架构，靠数据喂养出结构知识——数据不足时它的"万能"恰是劣势；CNN/RNN 内置强先验，小数据下反而稳。
- **算力轴**: 自注意力对序列长度平方复杂度；长文档/高分辨率场景要么接受成本、要么换高效变体。

两个必须内化的概念直觉：①QKV 把"信息检索"显式化——查询去和所有键匹配相关度，按相关度加权取值，多层堆叠后实现动态路由；②自注意力本身是置换等变的，不知道词序，位置编码是把顺序信息注入模型的唯一通道。

反流行纪律：**"Transformer 万能"是这个时代最流行的误区**。架构流行度反映的是大规模基准上的边际收益，不是你那个小任务的正确答案。

---

## A1 — 文献中的经典应用 (Past Application)

*（本批主题超出西瓜书覆盖范围，A1 改引奠基文献的经典案例，均为学界公认的原始实验叙述）*

### 案例 1: Transformer 取代 RNN 的原始论证
- **问题**: 序列建模长期由 RNN/LSTM 统治，但其顺序计算本性阻碍并行、长距离依赖路径过长。
- **方法论的使用**: 作者不是简单宣布注意力更强，而是逐项对比归纳偏好：循环层串行处理、路径长 O(n)；自注意力全并行、任意两位置路径长 O(1)。再以翻译质量和训练成本双指标实测验证。
- **结论**: 在大规模 WMT 数据上，放弃"逐步递归"先验换取并行性与短路径是净收益。
- **结果**: Transformer 成为 NLP 主导架构并外溢到语音/图像；但论证本身也划定了边界——收益前提是大数据，这正是 ViT 后续实证的方向。

### 案例 2: ViT 的"数据量决定胜负"实验
- **问题**: 没有卷积先验的纯 Transformer 能不能做图像？
- **方法论的使用**: Dosovitskiy 等把图像切块当词元直接喂标准 Transformer，在 ImageNet 量级(1.28M)与 JFT-300M 量级数据上对照同规模的残差网络。
- **结论**: 中等规模数据下卷积先验仍占优；预训练数据上到亿级后，弱先验架构反超——"架构优劣"的答案被数据规模改写。
- **结果**: ViT 确立了"规模-架构匹配"的经典证据，也说明小数据团队照搬大厂架构选择的常见错误。

### 案例 3: 表格数据的反向证据
- **问题**: 深度学习是否已全面取代传统方法？
- **方法论的使用**: Grinsztajn 等构建覆盖 45 个数据集的表格基准，将调参后的神经网络（含针对表格改造的变体）与梯度提升树在同协议下对比。
- **结论**: 中小规模不规则表格数据上，树集成（GBDT/XGBoost 类）仍然系统性更优；神经网络的不平滑归纳偏好与表格数据的典型失效模式不匹配。
- **结果**: 为"表格任务默认 GBDT、深度模型需举证例外"的工程共识提供了基准支撑，是对"深度万能论"的直接反驳证据。

---

## A2 — 触发场景 (Future Trigger) ★

### 用户会在什么情境下需要这个 skill?

1. 用户开新项目选骨架："我这几万条文本/图像/表格数据，上 Transformer 行不行"，需要有人按数据量和形态给决策边界。
2. 用户在学习材料里读到注意力机制，卡在 QKV 直觉或"为什么需要位置编码"这类概念关口。
3. 用户拿着论文/博客的"SOTA 架构"想搬到自己的小任务上，没人提醒他规模前提不成立。
4. 用户在技术选型评审中被质询"为什么不用 Transformer"，需要一个有据的反流行论证或支持论证。

### 语言信号 (用户的话里出现这些就应激活)

- "**Transformer** 还是 **CNN/RNN**" / "**该用什么网络结构** / 架构选型" / "transformer vs cnn/rnn"
- "**注意力机制**是什么 / 为什么有效" / "**self-attention**" / "**QKV** / query key value 直觉"
- "**位置编码**有什么用 / 为什么需要 positional encoding"
- "**我的数据量**够不够训 Transformer" / "小数据能用大模型架构吗" / "都 2024 年了还用 X 吗"

### 与相邻 skill 的区分

- 与 `ml-task-matching` 的区别: 那是 NFL 层面的通用选型哲学（刻画任务→匹配归纳偏好），覆盖全部模型族含传统 ML；本 skill 是它在深度架构内部的展开，给出 CNN/RNN/Transformer 的具体决策边界。抽象原则在那边，落地边界在这边。
- 与 `ml-deep-training-playbook` 的区别: 那是架构定下来之后"怎么训得动"；本 skill 决定"用哪个骨架"。先后两站。
- 与 `ml-pretraining-paradigm` 的区别: 本 skill 选的是"自己训什么架构"；若答案其实是"不用自己训、拿预训练模型微调或提示"，则移交那边。本 skill 的结论常常触发那次移交。

---

## E — 可执行步骤 (Execution)

当 skill 被激活后, agent 应按以下步骤执行:

1. **刻画数据三轴**
   - 采集：数据形态（图像/序列/表格/图/多模态）、可用标注量级（精确到数量级：<1k / 1k-100k / >1M 或有无大规模无标注语料）、算力预算（能否承担 O(n²) 注意力）。
   - 完成标准: 三轴画像表填写完整；任一轴缺失则向用户索取，不得凭空假设。

2. **过决策表定候选**
   - 表格小样本 → 树集成优先，深度模型需举证例外（移交 `ml-task-matching` 的传统路线）；图像小中数据 → CNN 先行；长程依赖序列 + 充足数据 → Transformer；图像 + 亿级预训练条件 → ViT 类可入场。
   - 完成标准: 给出首选+备选各一，附决策表中命中的行。
   - 判停条件: 若用户场景本质是"利用现成通用能力"而非"训练专用模型" → 判停，移交 `ml-pretraining-paradigm` 走预训练路线，本流程终止。

3. **校验流行度偏差**
   - 若用户候选与决策表结论冲突（如小表格数据坚持上 Transformer），要求其提供规模前提成立的证据；无法提供则明确告知风险并建议基线对比。
   - 完成标准: 冲突场景下产出"基线先行"方案——先用决策表推荐架构跑 baseline，再允许挑战者入场比较。
   - 判停条件: 用户能出示同分布数据上两架构的实测对照且挑战者胜出 → 接受其选择，跳到步骤 5。

4. **概念补课（如用户卡在原理）**
   - 用 QKV 检索直觉 + 位置编码必要性两段式讲清注意力；对照 RNN 的串行路径说明并行收益的来源。
   - 完成标准: 用户能复述"注意力在做什么计算"与"位置编码解决什么问题"。

5. **交接训练配方**
   - 选定架构后输出训练注意事项清单（优化器/调度/归一化的架构惯例），移交给 `ml-deep-training-playbook` 执行。
   - 完成标准: 交接单含架构结论 + 三轴画像 + 默认训练配方要点。
   - 判停条件: 若最终结论是"不自训、走预训练路线"（步骤 2 已判停的情形）→ 本步改为输出移交单给 `ml-pretraining-paradigm`，不含训练配方。

---

## B — 边界 (Boundary) ★

### 不要在以下情况使用此 skill

- 问题根本不在架构而在"要不要自己训练"→ 先走 `ml-pretraining-paradigm` 的决策树，多数应用场景的答案是微调或提示，本 skill 只服务于确需自训骨架的场景。
- 传统模型之间的选择（GBDT vs SVM vs 线性）→ `ml-task-matching` 的领地。
- 架构已定、训练过程出问题 → `ml-deep-training-playbook`。

### 文献反复警告的失败模式

- **Transformer 万能论**: 忽视其弱先验需要大数据喂养的前提，在小样本任务上强行套用，输给内置强先验的朴素架构——ViT 的中等数据劣势实验就是这一误区的官方注脚。
- **榜单外推**: 论文架构在学术基准（百万级数据）上的优势，不能外推到数量级不同的私有数据；引用任何"X 优于 Y"前先核对双方的数据量级。
- **忽视平方复杂度**: 长序列场景直接套标准自注意力导致算力爆掉，才想起高效变体；成本轴应在选型时入表而非事后补救。
- **把位置编码当可有可无的实现细节**: 抽掉它，自注意力对输入排列完全等变，"词序"信息凭空消失——这不是超参而是架构功能组件。

### 作者盲点 / 时代局限（本批为外推补全）

- **必须声明**: 本 skill 主题超出西瓜书(2016)覆盖范围——BOOK_OVERVIEW 批判节指出西瓜书成书时 Transformer 尚未发表，第 5 章止于 BP 网络；本 skill 是对该时代局限的外推补全，素材为 2017-2021 文献共识转述，**方法论仍在快速演化**（状态空间模型/新架构持续挑战 Transformer 地位），执行时应核对当前格局。
- 西瓜书的 NFL 框架在本领域依然是最锐利的武器——"脱离数据规模谈架构优劣毫无意义"正是 NFL 在深度时代的重演；但书中"归纳偏好"讨论不含弱先验+大数据这条现代路线的理论刻画。
- i.i.d. 盲区延续：架构选择隐含了"训练分布≈部署分布"假设，分布漂移场景下的架构鲁棒性比较缺乏共识结论。
- 教材体例局限同样适用：真实项目常混合多种骨架（CNN 提特征+Transformer 融合），单一架构叙事只是教学简化。

### 容易混淆的邻近方法论

- **"更大的模型总是更好"**: scaling law 说的是"数据同步跟上"的前提下规模带来平滑收益，不是无条件命题；数据不动的纯扩参很快撞墙。
- **注意力 = 全部**: Transformer 的成功是"自注意力+残差+前馈+归一化+位置编码"整套系统的成功，单独神化注意力组件会误导读到的消融证据。
- **AutoML/NAS 自动搜架构**: 搜索自动化替代不了本 skill 的三轴判断——搜索空间的上下界本身就是人定的选型决策。

---

## 相关 skills

- depends-on: ml-pretraining-paradigm（若答案是"不自训"则整体移交）
- contrasts-with: ml-task-matching（NFL 抽象原则 vs 深度架构内部决策边界）
- composes-with: ml-deep-training-playbook（选定骨架后的训练配方接力）, ml-methodology-router

---

## 审计信息

- **来源性质**: 扩充批B·深度学习与大模型时代——主题超出西瓜书(2016)覆盖范围，R 段为经典文献共识的转述表述（均已标注"（转述）"）
- **验证通过**: 待流水线三重验证复核
- **测试通过率**: 待阶段 4 测试 (详见 test-prompts.json)
- **skill_version**: 0.0.1
- **蒸馏时间**: 2026-08-24

