# Distillation Director

> 把一本书蒸馏成一组可执行的 Agent 技能——三闸判态制（防线3忠实度/盲测路由/达尔文体检），只判态不打分，门禁零🔴。触发：用户说「拆书」「蒸馏这本书」「蒸馏 XX」「把 XX 书做成 skill」「按手册/按流水线蒸这本书」。流程：输入决策树→阶段0整书理解→阶段1提取→阶段1.5验证→阶段2构造→阶段3链接→阶段4测试→阶段5交付；红线词分级+LLM终裁，机器层¥0先行，L2.5 单本约 ¥20。NOT for 简单总结、书评、读后感、作者人设角色扮演（后者用 huashu-nuwa）。

- Skill: `winsonpong98-cloud/distillation-director` (Agent Skill, multi-file: 7 files)
- Install (CLI): `npx skillmds@latest add winsonpong98-cloud/distillation-director`
- Raw SKILL.md: https://api.skillmd.com/api/skills/winsonpong98-cloud/distillation-director/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: winsonpong98-cloud (https://skillmd.com/u/winsonpong98-cloud)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/winsonpong98-cloud/distillation-director

---


# 蒸馏操作手册 V4.1 · 升级版（三闸·门禁制）

> 本 SKILL.md = 《蒸馏操作手册V4.1-升级版.md》（权威执行标准，2026-09-12 用户拍板）的技能化封装；触发后按下方 §0–§16 执行。

> 底本：《蒸馏操作手册V4.0-升级版.md》（2026-09-07）；本版 = 基于《周期、估值与人性》L2.5 实测复盘（`投资蒸馏/三闸机器化/手册-v4.1-修订建议（周期估值与人性实测）.md`）的 R1–R8 修订定稿（2026-09-12）。**状态：权威执行标准（2026-09-12 用户拍板切换，替换 V4.0；V4.0 转为历史档）。**
> 一句话改动（相对 V4.0 增量）：红线词分级 + LLM 语义终裁、desc 补词与让位分离、提取器提示词模板固化（§3 附件）、提取代理分段落盘 + 超时判据改为「最后落盘时间戳」、d6 校验口径文档化、辅助脚本机器校验自检单、成本基准校准（L2.5 epub ≈¥20 级）+ 成本即时回填。
> 继承 V4.0 已验证件：机械层¥0先行、judge 输入瘦身、gate-blocked 挂起、防线3 机器扫描、L1/L2.5/L3 档位。**砍掉**：9维加权100分、三套分数并行、默认全量JSON落盘、d8 每技能全测。
> 执行强制性：未过门禁不得进下一阶段；gate-blocked/降级/豁免/轻量处理未经用户确认不得启用；独立 judge/复验默认独立子代理执行。

## 0. 总纲

### 0.1 触发
- 「蒸馏 XX / 拆书 / 把 XX 做成 skill」→ 走本手册
- 「对已有技能体检/完善/优化」→ 走达尔文体检（判态+修复，见 §5.3）

### 0.2 模型分工（判态制）
| 任务 | 谁做 | 说明 |
|---|---|---|
| 主流程调度/OCR/拆分/构造/写文档 | 主会话 | 同 v3.0 |
| 机械层判态（¥0） | 本地脚本 | machine_precheck_v2 / defense3_impersonation_scan / blindtest_lexicon_mock_v1 / machine_layer_readycheck；只出 PASS/🔴/▲ 清单+证据行号，**不打分** |
| 语义层判态（最小域） | 子代理 judge | 只收机器证据包（KB 级），对 🔴 候选与语义残差出「必修清单」；不读 40KB 全文 |
| 实测 d8（簇抽） | 子代理真实执行 | 红线类必测1 + 主功能簇抽1；抽测样本同时过越界五查 |
| 交付盲复核（整书抽1-2） | 独立 judge | 整书交付时盲审：只给 SKILL 全文+机器证据包，**不给主会话结论**；出「同意/异议+理由」与 A/B/C 档位 |
| B 档数字分（按需） | 独立 judge | 仅对外汇报要具体分数时启用；默认不跑 |

### 0.3 费用纪律
- 机械层零成本先行；judge 预算只覆盖语义窄域 + d8 簇抽 + 交付盲复核。
- 文字版 PDF 先跑 pymupdf；扫描版 150dpi + PaddleOCR 快扫，32B 只修问题页；避开计价高峰（周末/节假日全天低谷价）。
- **成本基准（V4.1 校准）**：L2.5 epub 文字版 ≈14 万字单本实测 ≈ **¥20.5**（2026-09-12《周期、估值与人性》：35 次 flash 子代理 + 机器层 ¥0）。估算公式**不再叠加安全倍数**（旧口径按代理次数×单价高估至 ¥30-55）。

## 1. 输入决策树（同 v3.0）
PDF→pymupdf 查文本层；无文本→§2 OCR；视频/播客→先转稿；网络文章→抓取；个人经验→经验蒸馏另册。

## 2. OCR 标准流程（扫描版，同 v3.0 §2）
渲染150dpi → PaddleOCR-VL 快扫(并发6) → 清洗 <|LOC_数字|> → 乱码检测 → 32B 精修问题页 → 复查 → 抽查。参数同 v3.0。

## 3. 阶段流程（门禁=零🔴）

### 阶段0 骨架
- 产出 BOOK_OVERVIEW.md；门禁=用户确认骨架（主旨+章节结构+技能划分）。
### 阶段1 提取
- 小书主会话直接读；大书 5 类提取器子代理分批（≤4/批）。产出 candidates/。门禁=候选池数量达标。
- **提取器提示词模板（V4.1 附件）**：一律复制 `三闸机器化/提取器提示词模板-v4.1.md`（统一格式行 + 引文硬纪律 5 条 + 宁少勿滥），禁止自造格式——消除「引文级联污染 / 候选错锚 / 输出格式不一」三类返工。
- **分段落盘（V4.1）**：提取代理**按小节分段落盘**到 notes_{band}.md，不得整文件一次性 write——主会话可轮询文件 mtime 观测进度、超时接管有依据、中途失败留部分产出。*引擎侧 write 增量（append）能力落地前，以「每写完一小节即重写该文件当前完整内容」近似；能力落地后改 append。*
### 阶段1.5 验证
- 去重合并→verified.md；盲测机器词表初判→needs_llm 子集交 judge 结构化复核（判态：误路由/无锚/邻族抢单=🔴）。
### 阶段2 构造
- 主会话写 R/I/A1/A2/E/B + 🔴CHECKPOINT + 输出结构 + 让位规则 + 医疗/危机边界。门禁=frontmatter 判态（d1 硬闸零🔴）。
- **desc 补词与让位分离（V4.1 纪律）**：判别词（触发场景/何时用）进 description 触发区；让位词（本技能转出哪些邻族技能）**只放 B1/A2/related**，禁止把邻族技能名写进 desc 触发词——否则喂词表造成邻族抢单（实测 T12 割肉曾 top=S1）。
### 阶段3 链接 → INDEX.md / GLOSSARY.md。
### 阶段4 测试
- test-prompts 每技能3条（应调用/诱饵/跨技能路由+医疗/危机）。判态见 §5.2。
### 阶段5 交付
- DIGEST.md + 安装两工作区 + 四件套 + BOUNDARIES 协议 + SUPPLEMENT。门禁=三闸零🔴 + d8 口径达标 + 交付盲复核 A/B 档。

## 4. 子代理调度与失败协议（同 v3.0 核心）
1. 机械层先行（确定性项一律本地脚本，零LLM）。
2. LLM judge 只跑语义窄域，单发小批，prompt 自包含+绝对路径+只读。
3. 提取/OCR 并发 ≤4-5；小任务主会话直接做。
4. 超时（V4.1）：判据改为「**最后落盘时间戳距今 >25 分钟**」（替代「无产出 20-30 分钟」，配合 §3 阶段1 分段落盘，主会话轮询 notes 文件 mtime 判定）→询问一次→interrupt 重派1次或换通道→连续2次无产出=该闸 gate-blocked 挂起（不是主会话降级接盘），批量跳过继续，状态机交用户。
5. 补闸只补语义窄域；机器层已放行项不返工。

## 5. 验证三闸（判态制）

每闸输出三态：**PASS / 🔴（必修）/ ▲（建议）**。门禁 = 三闸全部零🔴。▲ 由构造者登记、不强制回改；跨版本比较看「🔴数+▲数」单调下降，不做总分微调。

### 5.1 防线3 忠实度核验（硬闸）
- 机器层（¥0）：R 逐字 quote_precheck / 页锚 tv_rcheck / 池id pool_scan / 操作层冒充 defense3_impersonation_scan。命中=🔴 候选。
- 语义层（最小域）：I 层主张↔池条目语义等价 / O 层立场光谱 / 冒充候选行终裁。judge 出必修清单。
- 复验分级：judge 报 🔴/▲；仅 🔴 需「修复→同 judge 复验」闭环，▲ 登记即可。

### 5.2 盲测路由（硬闸）
- 机器词表初判 blindtest_lexicon_mock_v1 → needs_llm 子集交 judge 结构化复核。
- 判态：误路由（top1≠目标）=🔴；邻族抢单/无锚=🔴（除非证明免 LLM 机械 clear 且 top1=目标）；判停红线（时点/买卖/医疗/危机）未判停=🔴。
- **红线词分级（V4.1）**：红线词分两表——「硬指令词」（点位/何时见底/买入价/帮我决定/现在该买该卖…单独出现即判红线）与「主题词」（买/卖/抄底/崩盘…单独出现**不**判红线）。**红线命中一律 needs_llm=True 交语义 judge 终裁，机器不直接 decline**——防框架提问（值不值得下注/够不够便宜）被主题词误拦。
- **危机词表（V4.1）**：判停危机红线词补「崩盘/要崩/股灾/撤出/全撤/躲一躲/恐慌性清仓/逃」家族（区别于中性「卖」），确保危机类红线可机械命中；decline 答复须含判停速查行 + 替代动作。

### 5.3 达尔文体检（判态，替换 9 维打分）
- 机器层 machine_precheck_v2 出「逐维 PASS/🔴/▲ + 证据行号」，不打分不求和。
- 硬闸🔴（命中必修）：见 §14 硬闸表。软闸▲（命中登记）：见 §14 软闸表。
- 语义层只对 🔴 候选与语义残差出必修清单；机器已放行项不返工。
- 结论=A/B/C 档位（§13），不是 0-100 分。

## 6. 打包插件（同 v3.0 §6）
plugin-build/<pkg>/ → tar 打包 → dsh.cmd plugin add → 补 bundles → 重启生效。

## 7. 踩坑对照表（同 v3.0 §7，节选）
子代理大并发卡死→≤4/批+超时；PaddleOCR 乱码→清洗+检测+32B；JS 模板反引号→数组 join 或写 py；judge 长任务卡死→机器层先行+gate-blocked；机器误把引文当 AI 腔→d7 豁免 R 段/引句。
- **合并/矩阵脚本机器校验自检单（V4.1）**：写合并/解析脚本自带三项——锚归一化（sNNN vs NNN）、格式多容错（[技能=S1] / [待定] / 技能=待定…归一化）、引文命中三态（命中/错锚/无锚）。防候选格式不一、错锚漏检这类小 bug 重演。

## 8. 检查清单（判态版）
- 开跑前：查文本层 / 建 books/<slug>/+PIPELINE_STATE / 定档位 L1/L2.5/L3。
- 每阶段后：更新 PIPELINE_STATE（阶段/门禁/结论三行）/ 门禁零🔴 / 快照。
- 交付前：四件套齐全 / 三闸 gates 记录零🔴 / d8 口径达标 / 交付盲复核 A/B 档 / 账本登记（agent数/波次/估算token/实际，无 meter 标「估算」）。
- **成本即时回填（V4.1）**：每次交付把 cost-meter 实测回填蒸馏报告/讨论记录，不让「估算作废」滞后（本册已按 ¥20.51 回填三处）。

## 9. 版本管理（同 v3.0）
无 git 时用 .work/snapshot.py 快照（保留5版）；有 git 则 books/ 下 init+commit+revert。

## 10. 档位与 d8 口径
| 档位 | 适用 | d8 口径 | 单本粗估 |
|---|---|---|---|
| L1 速读卡 | 背景书/历史书群 | **允许未测**（涉红线类仍测） | ¥2-5 |
| L2.5 体系卡（默认） | 承重墙书 | **必须簇抽**=红线类必测1（时点/买卖/医疗/危机/投资路由）+ 主功能簇抽1；抽测样本同时过越界五查 | ¥15-25（实测 epub ~14万字 ≈¥20.5） |
| L3 旗舰 | 反复读的书 | **全测** test-prompts | ¥10-20（估算） |

d8 结论三态：PASS（簇抽/全测通过且越界0）/ 未测（仅 L1）/ 未过（=🔴 硬闸）。抽题覆盖不足在报告如实披露，不虚标。

## 11. 内容忠实度四防线（判态版）
| 防线 | 内容 | 判态 |
|---|---|---|
| 1 原文锚 | 无原文引用不进候选池 | 提取器 PASS/🔴 |
| 2 转述派生链 | R↔I 配对+操作层◈不冒充 | 构造自查 PASS/🔴 |
| 3 忠实度核验关 | 机器扫描+语义复核 | 见 §5.1 |
| 4 目录覆盖 | 每章零贡献须有理由 | PASS/▲ |

## 12. 会话纪律与两态落盘
### 12.1 人在场（默认）
- 一书一会话批次；会话重先开新会话；子代理只回摘要（≤3行）全文落文件。
- **落盘轻量**：每技能只落一条 gates-<slug>.json（结论+关键命中项内嵌+证据指针）；machine-report 详细 JSON 就地保留在技能目录，不往 三闸机器化/ 归档、不同步。
### 12.2 无人值守（用户不在场）
- 主会话主管按 L2.5 推进；门禁照常自动；judge 卡死→gate-blocked 挂起。
- **落盘全量**：才把 readycheck/machine-report/defense3 全量落盘到 三闸机器化/（同 v3.0 §13），作为自动续跑与事后仲裁依据。

## 13. 三闸 gates 记录（单文件判态版）

每技能一条 gates-<slug>.json，schema 如下（人在场默认形态）：

    {
      "skill": "traversal-risk",
      "档位": "L2.5",
      "fidelity3": {"结论": "PASS", "🔴": 0, "▲": 0, "关键命中": [], "证据": "<技能目录>/quote-precheck.txt"},
      "blindtest": {"结论": "PASS", "🔴": 0, "needs_llm": "3/12", "判停红线": "2/2", "证据": "blindtest-mock-v1.json"},
      "darwin": {"结论": "PASS", "🔴": 0, "▲": 2, "关键命中": ["d4 分段检查点", "d7 回声"], "证据": "machine-report-traversal-risk.json"},
      "d8": {"结论": "PASS", "口径": "簇抽 2/12", "越界": 0},
      "交付盲复核": {"结论": "A 档·可交付", "理由": "零🔴，▲2 已登记"},
      "总体": "过（零🔴）"
    }

- 关键命中项**内嵌**进本条记录（不靠指针指向可能被清掉的中间文件）；证据文件指针只指向「技能目录内就地保留」的原始产物。
- 仲裁唯一权威副本 = 本条记录 + 指针指向的证据文件。

## 14. 判态规则（硬闸/软闸，替换 9 维权重表）

判态按**后果**分硬软，不按权重数字（权重表已废除）：

**硬闸🔴（命中必修）——直接影响可用性/忠实度/安全性：**
| 项 | 判🔴 条件 |
|---|---|
| 防线3 | R 引文逐字不符 / 页锚错 / 池id 悬空 / 操作层冒充（机器命中→judge 终裁） |
| 盲测 | 误路由 top1≠目标 / 判停失败（时点/买卖/医疗/危机未判停） |
| d1 结构 | name 非法 / description 缺 何时用+触发词（→不可路由） |
| d2 工作流 | R/I/E/B 缺段 / 步骤断链（→不可执行） |
| d5 可执行 | 无 🔴CHECKPOINT / 无输出结构 / 判停速查无正文实现 |
| d7 架构 | 判停/路由多副本口径漂移 / related_skills 指向不存在 slug |
| d8 实测 | 越界输出（时点/买卖/站队）/ 显著劣于基线 |

**软闸▲（命中登记，不强制回改）——影响打磨度，不影响可用：**
| 项 | 判▲ 条件 |
|---|---|
| d1 行文 | 空话尾巴 / 超长行 >260 字符 |
| d3 失败模式 | 失败闭环不完整 / 反例不足 |
| d4 检查点 | 复杂卡缺分段检查点（简单卡单一确认点可过） |
| d6 资源 | 章节锚缺省（不影响执行） |
| d9 反例 | 反例黑名单未列（不影响本技能执行） |

门禁=零🔴；▲ 登记进 gates 记录与遗留节；跨版本比较看 🔴/▲ 数单调下降。

> **d6/d7 related_skills 校验口径（V4.1 附注）**：machine_precheck_v2 扫描范围 = 投资蒸馏树内 slug ∪ 宿主 skills 目录（v4.1 补丁已并入宿主目录扫描，彻底消除「引宿主 slug 被判实缺」占位噪音）；跨家族/宿主引用在注释带「投资家族」字样仅作可读性约定，**不再是校验依赖**。

## 15. 与 v3.0 的替换对照
| v3.0 | V4.0 | 作用保留 |
|---|---|---|
| §14 9维100分加权评分 | §14 硬闸/软闸判态 | triage/定位/比较/门禁全保留；砍掉求和排序与易错权重 |
| §15.2 三套分数并行 | §0.2 一条链+交付盲复核（A/B/C档） | 零成本初检+语义兜底+独立复核都在；砍掉三分数并存与口径差解释 |
| §13 默认全量JSON落盘 | §12 两态开关（人在场单文件/无人值守全量） | 审计靠「结论+内嵌命中+指针」；无人值守仍全量 |
| d8 每技能全测(权重23) | §10 簇抽默认（红线1+主功能1）+L3全测 | 真实调用验证+红线抓取保留（越界五查跟抽题走，不并入盲测） |
| 对外 0-100 数字分 | A/B/C 档位（B 档数字分按需） | 可交付裁决保留；具体数字为按需项 |

## 16. V4.1 修订记录（相对 V4.0，R1–R8 全采纳）
| # | 修订项 | 正文落点 |
|---|---|---|
| R1 | 提取器提示词模板作为阶段1 附件（格式统一+引文硬纪律） | §3 阶段1 + 附件 `三闸机器化/提取器提示词模板-v4.1.md` |
| R2 | d6/d7 校验口径文档化（脚本扫宿主目录为主、注释约定为辅） | §14 附注 |
| R3 | 红线词分级 + 红线命中 needs_llm 语义终裁（防框架提问误拒）+ 危机词表扩充 | §5.2 |
| R4 | desc 补词与让位分离纪律 | §3 阶段2 |
| R5 | 提取代理分段落盘 + 超时判据改「最后落盘时间戳距今>25 分钟」 | §3 阶段1 + §4 |
| R6 | 合并/矩阵脚本「机器校验自检单」成文 | §7 |
| R7 | 成本基准校准：L2.5 epub ~14万字 ≈¥20.5（估算法不再加安全倍数） | §0.3 + §10 |
| R8 | 成本即时回填制度 | §8 |

> 详细依据见 `投资蒸馏/三闸机器化/手册-v4.1-修订建议（周期估值与人性实测）.md`。**R5 的「分段落盘」引擎侧 write 增量（append）能力未落地前，以「每小节重写当前完整文件」近似，能力落地后升级。**

---

*蒸馏 V4.1（升级版）· 2026-09-12 · 权威执行标准（用户拍板切换），基于 V4.0 +《周期、估值与人性》实测复盘 R1–R8；V4.0 转为历史档。*

