Transformer 时代架构选型 — 规模与形态决定骨架,而非流行度
R — 原文 (Reading)
(转述)Vaswani 等提出 Transformer:完全基于注意力机制,摒弃递归与卷积;自注意力把每个位置表示为查询(Q)、键(K)、值(V)三元组参与全局交互,配合位置编码注入顺序信息;在机器翻译上以更短的训练时间达到当时最优质量。
— Vaswani 等《Attention Is All You Need》(NeurIPS 2017)
(转述)Kaplan 等系统报告规模定律:模型性能随参数量、数据量、算力的幂律平滑提升,且跨多个数量级成立——这为"投入多大模型配多少数据"提供了外推依据。
— Jared Kaplan 等《Scaling Laws for Neural Language Models》(2020)
I — 方法论骨架 (Interpretation)
西瓜书第 5 章的神经网络叙事止于 BP 与浅层网络,对"该搭什么骨架"没有给出现代答案。本 skill 补全这个决策:架构选择是归纳偏好的选择,而归纳偏好必须同时匹配任务的数据形态和数据规模。
三条决策轴:
- 数据形态轴: 图像的局部平移不变性 → 卷积先验仍高效;有序序列 + 长程依赖 → 自注意力的全局交互占优;纯数值表格小样本 → 树集成先验常胜一切深度骨架。
- 数据规模轴: Transformer 是低归纳偏好(弱先验)架构,靠数据喂养出结构知识——数据不足时它的"万能"恰是劣势;CNN/RNN 内置强先验,小数据下反而稳。
- 算力轴: 自注意力对序列长度平方复杂度;长文档/高分辨率场景要么接受成本、要么换高效变体。
两个必须内化的概念直觉:①QKV 把"信息检索"显式化——查询去和所有键匹配相关度,按相关度加权取值,多层堆叠后实现动态路由;②自注意力本身是置换等变的,不知道词序,位置编码是把顺序信息注入模型的唯一通道。
反流行纪律:"Transformer 万能"是这个时代最流行的误区。架构流行度反映的是大规模基准上的边际收益,不是你那个小任务的正确答案。
A1 — 文献中的经典应用 (Past Application)
(本批主题超出西瓜书覆盖范围,A1 改引奠基文献的经典案例,均为学界公认的原始实验叙述)
案例 1: Transformer 取代 RNN 的原始论证
- 问题: 序列建模长期由 RNN/LSTM 统治,但其顺序计算本性阻碍并行、长距离依赖路径过长。
- 方法论的使用: 作者不是简单宣布注意力更强,而是逐项对比归纳偏好:循环层串行处理、路径长 O(n);自注意力全并行、任意两位置路径长 O(1)。再以翻译质量和训练成本双指标实测验证。
- 结论: 在大规模 WMT 数据上,放弃"逐步递归"先验换取并行性与短路径是净收益。
- 结果: Transformer 成为 NLP 主导架构并外溢到语音/图像;但论证本身也划定了边界——收益前提是大数据,这正是 ViT 后续实证的方向。
案例 2: ViT 的"数据量决定胜负"实验
- 问题: 没有卷积先验的纯 Transformer 能不能做图像?
- 方法论的使用: Dosovitskiy 等把图像切块当词元直接喂标准 Transformer,在 ImageNet 量级(1.28M)与 JFT-300M 量级数据上对照同规模的残差网络。
- 结论: 中等规模数据下卷积先验仍占优;预训练数据上到亿级后,弱先验架构反超——"架构优劣"的答案被数据规模改写。
- 结果: ViT 确立了"规模-架构匹配"的经典证据,也说明小数据团队照搬大厂架构选择的常见错误。
案例 3: 表格数据的反向证据
- 问题: 深度学习是否已全面取代传统方法?
- 方法论的使用: Grinsztajn 等构建覆盖 45 个数据集的表格基准,将调参后的神经网络(含针对表格改造的变体)与梯度提升树在同协议下对比。
- 结论: 中小规模不规则表格数据上,树集成(GBDT/XGBoost 类)仍然系统性更优;神经网络的不平滑归纳偏好与表格数据的典型失效模式不匹配。
- 结果: 为"表格任务默认 GBDT、深度模型需举证例外"的工程共识提供了基准支撑,是对"深度万能论"的直接反驳证据。
A2 — 触发场景 (Future Trigger) ★
用户会在什么情境下需要这个 skill?
- 用户开新项目选骨架:"我这几万条文本/图像/表格数据,上 Transformer 行不行",需要有人按数据量和形态给决策边界。
- 用户在学习材料里读到注意力机制,卡在 QKV 直觉或"为什么需要位置编码"这类概念关口。
- 用户拿着论文/博客的"SOTA 架构"想搬到自己的小任务上,没人提醒他规模前提不成立。
- 用户在技术选型评审中被质询"为什么不用 Transformer",需要一个有据的反流行论证或支持论证。
语言信号 (用户的话里出现这些就应激活)
- "Transformer 还是 CNN/RNN" / "该用什么网络结构 / 架构选型" / "transformer vs cnn/rnn"
- "注意力机制是什么 / 为什么有效" / "self-attention" / "QKV / query key value 直觉"
- "位置编码有什么用 / 为什么需要 positional encoding"
- "我的数据量够不够训 Transformer" / "小数据能用大模型架构吗" / "都 2024 年了还用 X 吗"
与相邻 skill 的区分
- 与
ml-task-matching的区别: 那是 NFL 层面的通用选型哲学(刻画任务→匹配归纳偏好),覆盖全部模型族含传统 ML;本 skill 是它在深度架构内部的展开,给出 CNN/RNN/Transformer 的具体决策边界。抽象原则在那边,落地边界在这边。 - 与
ml-deep-training-playbook的区别: 那是架构定下来之后"怎么训得动";本 skill 决定"用哪个骨架"。先后两站。 - 与
ml-pretraining-paradigm的区别: 本 skill 选的是"自己训什么架构";若答案其实是"不用自己训、拿预训练模型微调或提示",则移交那边。本 skill 的结论常常触发那次移交。
E — 可执行步骤 (Execution)
当 skill 被激活后, agent 应按以下步骤执行:
刻画数据三轴
- 采集:数据形态(图像/序列/表格/图/多模态)、可用标注量级(精确到数量级:<1k / 1k-100k / >1M 或有无大规模无标注语料)、算力预算(能否承担 O(n²) 注意力)。
- 完成标准: 三轴画像表填写完整;任一轴缺失则向用户索取,不得凭空假设。
过决策表定候选
- 表格小样本 → 树集成优先,深度模型需举证例外(移交
ml-task-matching的传统路线);图像小中数据 → CNN 先行;长程依赖序列 + 充足数据 → Transformer;图像 + 亿级预训练条件 → ViT 类可入场。 - 完成标准: 给出首选+备选各一,附决策表中命中的行。
- 判停条件: 若用户场景本质是"利用现成通用能力"而非"训练专用模型" → 判停,移交
ml-pretraining-paradigm走预训练路线,本流程终止。
- 表格小样本 → 树集成优先,深度模型需举证例外(移交
校验流行度偏差
- 若用户候选与决策表结论冲突(如小表格数据坚持上 Transformer),要求其提供规模前提成立的证据;无法提供则明确告知风险并建议基线对比。
- 完成标准: 冲突场景下产出"基线先行"方案——先用决策表推荐架构跑 baseline,再允许挑战者入场比较。
- 判停条件: 用户能出示同分布数据上两架构的实测对照且挑战者胜出 → 接受其选择,跳到步骤 5。
概念补课(如用户卡在原理)
- 用 QKV 检索直觉 + 位置编码必要性两段式讲清注意力;对照 RNN 的串行路径说明并行收益的来源。
- 完成标准: 用户能复述"注意力在做什么计算"与"位置编码解决什么问题"。
交接训练配方
- 选定架构后输出训练注意事项清单(优化器/调度/归一化的架构惯例),移交给
ml-deep-training-playbook执行。 - 完成标准: 交接单含架构结论 + 三轴画像 + 默认训练配方要点。
- 判停条件: 若最终结论是"不自训、走预训练路线"(步骤 2 已判停的情形)→ 本步改为输出移交单给
ml-pretraining-paradigm,不含训练配方。
- 选定架构后输出训练注意事项清单(优化器/调度/归一化的架构惯例),移交给
B — 边界 (Boundary) ★
不要在以下情况使用此 skill
- 问题根本不在架构而在"要不要自己训练"→ 先走
ml-pretraining-paradigm的决策树,多数应用场景的答案是微调或提示,本 skill 只服务于确需自训骨架的场景。 - 传统模型之间的选择(GBDT vs SVM vs 线性)→
ml-task-matching的领地。 - 架构已定、训练过程出问题 →
ml-deep-training-playbook。
文献反复警告的失败模式
- Transformer 万能论: 忽视其弱先验需要大数据喂养的前提,在小样本任务上强行套用,输给内置强先验的朴素架构——ViT 的中等数据劣势实验就是这一误区的官方注脚。
- 榜单外推: 论文架构在学术基准(百万级数据)上的优势,不能外推到数量级不同的私有数据;引用任何"X 优于 Y"前先核对双方的数据量级。
- 忽视平方复杂度: 长序列场景直接套标准自注意力导致算力爆掉,才想起高效变体;成本轴应在选型时入表而非事后补救。
- 把位置编码当可有可无的实现细节: 抽掉它,自注意力对输入排列完全等变,"词序"信息凭空消失——这不是超参而是架构功能组件。
作者盲点 / 时代局限(本批为外推补全)
- 必须声明: 本 skill 主题超出西瓜书(2016)覆盖范围——BOOK_OVERVIEW 批判节指出西瓜书成书时 Transformer 尚未发表,第 5 章止于 BP 网络;本 skill 是对该时代局限的外推补全,素材为 2017-2021 文献共识转述,方法论仍在快速演化(状态空间模型/新架构持续挑战 Transformer 地位),执行时应核对当前格局。
- 西瓜书的 NFL 框架在本领域依然是最锐利的武器——"脱离数据规模谈架构优劣毫无意义"正是 NFL 在深度时代的重演;但书中"归纳偏好"讨论不含弱先验+大数据这条现代路线的理论刻画。
- i.i.d. 盲区延续:架构选择隐含了"训练分布≈部署分布"假设,分布漂移场景下的架构鲁棒性比较缺乏共识结论。
- 教材体例局限同样适用:真实项目常混合多种骨架(CNN 提特征+Transformer 融合),单一架构叙事只是教学简化。
容易混淆的邻近方法论
- "更大的模型总是更好": scaling law 说的是"数据同步跟上"的前提下规模带来平滑收益,不是无条件命题;数据不动的纯扩参很快撞墙。
- 注意力 = 全部: Transformer 的成功是"自注意力+残差+前馈+归一化+位置编码"整套系统的成功,单独神化注意力组件会误导读到的消融证据。
- AutoML/NAS 自动搜架构: 搜索自动化替代不了本 skill 的三轴判断——搜索空间的上下界本身就是人定的选型决策。
相关 skills
- depends-on: ml-pretraining-paradigm(若答案是"不自训"则整体移交)
- contrasts-with: ml-task-matching(NFL 抽象原则 vs 深度架构内部决策边界)
- composes-with: ml-deep-training-playbook(选定骨架后的训练配方接力), ml-methodology-router
审计信息
- 来源性质: 扩充批B·深度学习与大模型时代——主题超出西瓜书(2016)覆盖范围,R 段为经典文献共识的转述表述(均已标注"(转述)")
- 验证通过: 待流水线三重验证复核
- 测试通过率: 待阶段 4 测试 (详见 test-prompts.json)
- skill_version: 0.0.1
- 蒸馏时间: 2026-08-24