# Video Learn

> 从 AI 科普视频（3Blue1Brown / Deepia / Karpathy / 李沐 等）中蒸馏思想，不是复述字幕。把视频按章节 → 核心洞察 → sujianlin archetype 分类 → 与苏神语料对照 → 找补足 / 分歧 / **可升格 L7 锚点** 的候选（非苏神断言不进 L3）。触发条件：(1) 用户贴了一个视频 URL / transcript / 字幕文件；(2) 用户说'把这个视频的思想蒸馏出来'、'做成 video.ideas.md'；(3) 用户问'Deepia 这集跟苏神 XX 怎么对上'；(4) 用户已经按 daily-learn 的 connect 学到一个主题想看视频版。不触发：用户只要视频摘要（叫它看 transcript 就好）、或纯翻译字幕。

- Skill: `tianming23/video-learn` (Agent Skill)
- Install (CLI): `npx skillmds@latest add tianming23/video-learn`
- Raw SKILL.md: https://api.skillmd.com/api/skills/tianming23/video-learn/raw
- Safety review: pending (external: skill-scanner PASS, skillspector CAUTION)
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- License: MIT
- Author: tianming23 (https://skillmd.com/u/tianming23)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/tianming23/video-learn

---


# video-learn · AI 科普视频蒸馏引擎

> 目标：把**好视频的思想**以跟苏神语料同构的方式入库，使 sugpt / sujianlin / daily-learn 三个 skill 在回答问题时能**跨文字与视频两种语料**引用。

---

## 为什么需要这个 skill

视频跟苏神文章不同：
- 视频讲**直觉**很强，讲**严格证明**很弱
- 视频有**时间成本**（20 分钟）vs 文章（3 分钟能扫完）
- 视频的**分歧对照**是金矿：同一个概念，可视化讲法 + 数学讲法常常补位

如果直接粘 transcript 进 corpus，就变成了"更长版文章"——失去视频的独特价值。这个 skill 就是**把视频独有的表达 + 跟苏神原文的对照结构化下来**。

---

## 蒸馏产物结构（两份文件）

每个视频产出两份文件：

### 文件 1：`corpus/videos/<channel>/<slug>.md` — 原料
由 `scripts/video_fetch.py` 生成，包含：
- YAML front-matter（标题、频道、时长、观看量、发布日期、章节、URL、代码仓）
- 完整字幕（transcript）
- 章节时间轴

**这份是原料，不做"蒸馏"**。用户自己读也行，也可以喂给 AI 继续处理。

### 文件 2：`corpus/videos/<channel>/<slug>.ideas.md` — 蒸馏产物

这是本 skill 的核心产物。**必须包含**以下 5 个段落：

```markdown
---
source_video: "<channel>/<slug>.md"
video_url: "<youtube url>"
related_corpus:
  - "articles/XXXX.md"   # 相关苏神文章
distill_version: "v1"
---

# <channel> 《<title>》思想蒸馏

## 一、章节到洞察的映射
（表格：时间 · 章节 · 核心洞察 · 对苏神 L3 / archetype 的贡献）

## 二、N 条必记洞察（按 sujianlin archetype 分类）
（每条带 [Archetype X] 标签 + 推导链 + 与苏神对应 L3 条目的关系）

## 三、视频 × 苏神对照表
（表格：观点 · 视频怎么讲 · 苏神怎么讲 · 分歧/补足）

## 四、给 daily-learn skill 的钩子问题候选
（3 条钩子，覆盖 easy/medium/hard）

## 五、结论：该视频的价值定位
（相对苏神原文的定位，推荐的学习顺序）
```

看 `corpus/videos/deepia/vae.ideas.md` 作为示范。

---

## 蒸馏方法论（对 AI 的规则）

### 规则 1：不是摘要，不是复述

❌ "这个视频讲了 VAE 的定义，ELBO 推导，和重参数化……"
✅ "ELBO = KL 正则下的 f-散度特例（Archetype D），这个视角在苏神 [6016] 也有——但 Deepia 没打通 GAN 家族"

蒸馏的价值在**连接**，不在**罗列**。

### 规则 2：每条洞察必须贴 archetype 标签

强制映射到 `sujianlin v2.3` 的 5 种 archetype 之一（**L7 视频锚点与 L3 苏神观点分层，见该 skill**）：
- **A** 约束方程型（从"希望的性质"反推最简形式，如重参数化）
- **B** 现象分析型（解释"为什么 X 现象"，如 VAE 为什么糊）
- **C** 综述脉络型（梳理发展路径）
- **D** 统一框架型（看似不同的方法其实是同一框架的特例）
- **E** 物理类比型（能量 / 动量 / 摩擦 / 平衡态映射）

**如果一条洞察归不到任何 archetype**——大概率它不是洞察，而是细节。丢掉。

### 规则 3：对照表必须两列都写，且要有明确分歧

对照表**不是"视频和苏神都讲过 X"**，而是：
- 视频怎么讲（视角 1）
- 苏神怎么讲（视角 2）
- **分歧在哪 / 谁更深 / 哪个更适合入门**

如果找不到分歧，说明你没读懂苏神。去 sugpt 搜相关文章再回来。

### 规则 4：标出"可升格为 sujianlin **L7** 的候选锚点"

如果视频讲了苏神**没写过**的观点，且该观点有价值：
- 明确标注 "**新 L7 候选**（非苏神）"：XXX
- 给出"隐含前提"（与 L3 表同构，但**不得**混入 L3）
- 正式入库 `sujianlin` 时：在 `SKILL.md` 的 **L7 表**增行（**V#**）并 bump 版本；**仅苏神原文证据**才可进 L3

这就是视频语料的**独立价值**：它能补苏神的盲点，同时**不污染 L3 归因**。

### 规则 5：给 daily-learn 3 条钩子

每篇蒸馏末尾必须附 3 条钩子问题（easy / medium / hard），让话题能被 `daily.py` 当作新题目使用。

**每条钩子**：
- 触发一个**需要思考的判断**（不是事实回忆）
- 能顺着链回到苏神的 L3 或 archetype
- 最好涉及视频 ↔ 苏神的分歧点（这种题最有教学价值）

### 规则 6：不夸大视频价值

❌ "Deepia 的 VAE 讲得比苏神还好！"
✅ "Deepia 在建立直觉上比苏神强；苏神在证明严谨性和方法论上更深。两者是前置课/深化课关系。"

给每个视频一个**定位**（入门/进阶/互补），而不是简单打分。

---

## 蒸馏执行流程（AI 侧）

当用户触发本 skill 时：

```
Step 1. 定位视频
        - 用户贴 URL → 引导跑 scripts/video_fetch.py --url <X>
        - 用户贴 transcript 文件 → 引导跑 --from-file
        - 用户只说"蒸馏 Deepia 那集 VAE" → 先检查 corpus/videos/ 有没有

Step 2. 读原料
        - 读 corpus/videos/<channel>/<slug>.md 的完整 transcript
        - 如果 transcript < 2000 字，告诉用户"内容太短，可能是字幕被截断；建议重抓"

Step 3. 找相关苏神语料
        - 按视频标题的关键词跑 python3 scripts/search.py
        - 至少找到 2-3 篇相关苏神文章
        - 如果完全找不到 → 这个视频是"全新领域"，蒸馏时标注"苏神未覆盖"

Step 4. 写 5 个段落
        - 严格按上面的模板结构
        - 对照表至少 5 行
        - 洞察至少 3 条（≤7 条）

Step 5. 保存到 corpus/videos/<channel>/<slug>.ideas.md
        - 文件名规范：同频道下和原料同 slug，带 .ideas 后缀
        - 保存后建议跑 build_index.py 更新主索引

Step 6. 向用户汇报
        - 列出产出的文件路径
        - 列出新增的 **L7** 候选（若有）；勿称"新 L3"除非有苏神 archive 证据
        - 列出 3 条钩子问题
        - 建议下一步："现在可以 daily.py --id <视频 slug> 考考自己"
```

---

## 常见错误与纠正

### 错误 1：把 transcript 抄一遍
- 症状：蒸馏文件 > 5000 字，每段都长
- 纠正：蒸馏文件应该 < 2500 字。比视频自己短 5-10 倍

### 错误 2：没跟苏神对照
- 症状：只有"视频说了什么"，没有"苏神怎么看这件事"
- 纠正：没对照就不算蒸馏，只算翻译。至少 5 行对照表

### 错误 3：过度解读
- 症状：一条洞察套 3 个 archetype 标签
- 纠正：一条洞察最多贴 2 个 archetype，通常 1 个

### 错误 4：钩子太软
- 症状：钩子是"这个视频讲了啥？"
- 纠正：钩子必须是**需要判断、有争议、能引发思考**的。参考苏神式反直觉："L2 正则和 L 约束真的等价吗？"

### 错误 5：忽略分歧
- 症状：对照表里每行都写"一致 / 互补"
- 纠正：至少 1-2 行必须标记"分歧"或"谁更深"。没分歧的主题不值得蒸馏

---

## 与其他 skill 的分工

| Skill | 职责 | 联用场景 |
|---|---|---|
| `video-learn`（本） | 把视频 → 蒸馏文件 | 新视频入库时 |
| `sugpt` | 检索苏神语料 | 蒸馏 Step 3 找对照文章 |
| `sujianlin` v2.3 | archetype + **L7 锚点表** | 蒸馏 Step 4 贴标签；成熟洞察进 **L7 V#** |
| `daily-learn` | 用蒸馏产物出题 | 蒸馏完成后用户学习 |

---

## 示例：用本 skill 做蒸馏的一次对话

**用户**："把 https://www.youtube.com/watch?v=qJeaCHQ1k2w 这个视频的思想蒸馏出来"

**AI**（按本 skill 执行）：

1. 识别：Deepia 频道，VAE 主题
2. 检查 `corpus/videos/deepia/vae.md` 存在 → 直接读 transcript
3. 跑 `search.py --topic VAE/流模型` → 找到 5253、5239、9119 三篇对照
4. 按 5 段模板写 `vae.ideas.md`
5. 汇报：

> ✓ 已产出 `corpus/videos/deepia/vae.ideas.md`
>
> **5 条洞察**：
> - [A] 从"采样要可微"反推重参数化
> - [E] VAE = 有限温度的 AE
> - [D] ELBO = f-散度家族的 KL 特例
> - [B] VAE 生成糊的物理机制
> - [A+E] 重参数化 = 随机性外生化（和 SGD 的朗之万 SDE 同源）
>
> **新 L7 候选**：VAE 生成糊的根因是 MSE + 像素级比较（与 L3 #2 对照，非新增苏神断言）
>
> **daily-learn 钩子**（3 条，难度递增）：
> 1. 普通 AE 不能生成新图，苏神和 Deepia 解释侧重不同，你猜哪两个？
> 2. VAE 里的"变分"真的必要吗？苏神说不需要，Deepia 讲变分贝叶斯——两个都对，差在哪？
> 3. VAE 重参数化、Muon 动量、SGD 朗之万 SDE 三者"外生化随机性"能串成一条原理吗？
>
> **推荐下一步**：`python3 scripts/daily.py --id vae-ideas`（需要在 daily_hooks.json 里注册）

---

## 持续迭代建议

- 每蒸馏一批视频，将稳定共识写入 `sujianlin/SKILL.md` 的 **L7** 表（V#）；**仅**有 kexue.fm 原文依据者才进 **L3**
- 蒸馏质量应该逐渐提升（你会越来越擅长找"真·分歧"）
- 如果一个频道的视频质量低（找不到分歧、洞察都太浅），就**别继续蒸馏**

---

*video-learn 不是"帮你看视频"。它是把视频的价值编织进苏神知识图谱的工具。没被编织进去的视频，就算看完了也是漂移的碎片。*

