蒸馏操作手册 V4.1 · 升级版(三闸·门禁制)
本 SKILL.md = 《蒸馏操作手册V4.1-升级版.md》(权威执行标准,2026-09-12 用户拍板)的技能化封装;触发后按下方 §0–§16 执行。
底本:《蒸馏操作手册V4.0-升级版.md》(2026-09-07);本版 = 基于《周期、估值与人性》L2.5 实测复盘(
投资蒸馏/三闸机器化/手册-v4.1-修订建议(周期估值与人性实测).md)的 R1–R8 修订定稿(2026-09-12)。状态:权威执行标准(2026-09-12 用户拍板切换,替换 V4.0;V4.0 转为历史档)。 一句话改动(相对 V4.0 增量):红线词分级 + LLM 语义终裁、desc 补词与让位分离、提取器提示词模板固化(§3 附件)、提取代理分段落盘 + 超时判据改为「最后落盘时间戳」、d6 校验口径文档化、辅助脚本机器校验自检单、成本基准校准(L2.5 epub ≈¥20 级)+ 成本即时回填。 继承 V4.0 已验证件:机械层¥0先行、judge 输入瘦身、gate-blocked 挂起、防线3 机器扫描、L1/L2.5/L3 档位。砍掉:9维加权100分、三套分数并行、默认全量JSON落盘、d8 每技能全测。 执行强制性:未过门禁不得进下一阶段;gate-blocked/降级/豁免/轻量处理未经用户确认不得启用;独立 judge/复验默认独立子代理执行。
0. 总纲
0.1 触发
- 「蒸馏 XX / 拆书 / 把 XX 做成 skill」→ 走本手册
- 「对已有技能体检/完善/优化」→ 走达尔文体检(判态+修复,见 §5.3)
0.2 模型分工(判态制)
| 任务 | 谁做 | 说明 |
|---|---|---|
| 主流程调度/OCR/拆分/构造/写文档 | 主会话 | 同 v3.0 |
| 机械层判态(¥0) | 本地脚本 | machine_precheck_v2 / defense3_impersonation_scan / blindtest_lexicon_mock_v1 / machine_layer_readycheck;只出 PASS/🔴/▲ 清单+证据行号,不打分 |
| 语义层判态(最小域) | 子代理 judge | 只收机器证据包(KB 级),对 🔴 候选与语义残差出「必修清单」;不读 40KB 全文 |
| 实测 d8(簇抽) | 子代理真实执行 | 红线类必测1 + 主功能簇抽1;抽测样本同时过越界五查 |
| 交付盲复核(整书抽1-2) | 独立 judge | 整书交付时盲审:只给 SKILL 全文+机器证据包,不给主会话结论;出「同意/异议+理由」与 A/B/C 档位 |
| B 档数字分(按需) | 独立 judge | 仅对外汇报要具体分数时启用;默认不跑 |
0.3 费用纪律
- 机械层零成本先行;judge 预算只覆盖语义窄域 + d8 簇抽 + 交付盲复核。
- 文字版 PDF 先跑 pymupdf;扫描版 150dpi + PaddleOCR 快扫,32B 只修问题页;避开计价高峰(周末/节假日全天低谷价)。
- 成本基准(V4.1 校准):L2.5 epub 文字版 ≈14 万字单本实测 ≈ ¥20.5(2026-09-12《周期、估值与人性》:35 次 flash 子代理 + 机器层 ¥0)。估算公式不再叠加安全倍数(旧口径按代理次数×单价高估至 ¥30-55)。
1. 输入决策树(同 v3.0)
PDF→pymupdf 查文本层;无文本→§2 OCR;视频/播客→先转稿;网络文章→抓取;个人经验→经验蒸馏另册。
2. OCR 标准流程(扫描版,同 v3.0 §2)
渲染150dpi → PaddleOCR-VL 快扫(并发6) → 清洗 <|LOC_数字|> → 乱码检测 → 32B 精修问题页 → 复查 → 抽查。参数同 v3.0。
3. 阶段流程(门禁=零🔴)
阶段0 骨架
- 产出 BOOK_OVERVIEW.md;门禁=用户确认骨架(主旨+章节结构+技能划分)。
阶段1 提取
- 小书主会话直接读;大书 5 类提取器子代理分批(≤4/批)。产出 candidates/。门禁=候选池数量达标。
- 提取器提示词模板(V4.1 附件):一律复制
三闸机器化/提取器提示词模板-v4.1.md(统一格式行 + 引文硬纪律 5 条 + 宁少勿滥),禁止自造格式——消除「引文级联污染 / 候选错锚 / 输出格式不一」三类返工。 - 分段落盘(V4.1):提取代理按小节分段落盘到 notes_{band}.md,不得整文件一次性 write——主会话可轮询文件 mtime 观测进度、超时接管有依据、中途失败留部分产出。引擎侧 write 增量(append)能力落地前,以「每写完一小节即重写该文件当前完整内容」近似;能力落地后改 append。
阶段1.5 验证
- 去重合并→verified.md;盲测机器词表初判→needs_llm 子集交 judge 结构化复核(判态:误路由/无锚/邻族抢单=🔴)。
阶段2 构造
- 主会话写 R/I/A1/A2/E/B + 🔴CHECKPOINT + 输出结构 + 让位规则 + 医疗/危机边界。门禁=frontmatter 判态(d1 硬闸零🔴)。
- desc 补词与让位分离(V4.1 纪律):判别词(触发场景/何时用)进 description 触发区;让位词(本技能转出哪些邻族技能)只放 B1/A2/related,禁止把邻族技能名写进 desc 触发词——否则喂词表造成邻族抢单(实测 T12 割肉曾 top=S1)。
阶段3 链接 → INDEX.md / GLOSSARY.md。
阶段4 测试
- test-prompts 每技能3条(应调用/诱饵/跨技能路由+医疗/危机)。判态见 §5.2。
阶段5 交付
- DIGEST.md + 安装两工作区 + 四件套 + BOUNDARIES 协议 + SUPPLEMENT。门禁=三闸零🔴 + d8 口径达标 + 交付盲复核 A/B 档。
4. 子代理调度与失败协议(同 v3.0 核心)
- 机械层先行(确定性项一律本地脚本,零LLM)。
- LLM judge 只跑语义窄域,单发小批,prompt 自包含+绝对路径+只读。
- 提取/OCR 并发 ≤4-5;小任务主会话直接做。
- 超时(V4.1):判据改为「最后落盘时间戳距今 >25 分钟」(替代「无产出 20-30 分钟」,配合 §3 阶段1 分段落盘,主会话轮询 notes 文件 mtime 判定)→询问一次→interrupt 重派1次或换通道→连续2次无产出=该闸 gate-blocked 挂起(不是主会话降级接盘),批量跳过继续,状态机交用户。
- 补闸只补语义窄域;机器层已放行项不返工。
5. 验证三闸(判态制)
每闸输出三态:PASS / 🔴(必修)/ ▲(建议)。门禁 = 三闸全部零🔴。▲ 由构造者登记、不强制回改;跨版本比较看「🔴数+▲数」单调下降,不做总分微调。
5.1 防线3 忠实度核验(硬闸)
- 机器层(¥0):R 逐字 quote_precheck / 页锚 tv_rcheck / 池id pool_scan / 操作层冒充 defense3_impersonation_scan。命中=🔴 候选。
- 语义层(最小域):I 层主张↔池条目语义等价 / O 层立场光谱 / 冒充候选行终裁。judge 出必修清单。
- 复验分级:judge 报 🔴/▲;仅 🔴 需「修复→同 judge 复验」闭环,▲ 登记即可。
5.2 盲测路由(硬闸)
- 机器词表初判 blindtest_lexicon_mock_v1 → needs_llm 子集交 judge 结构化复核。
- 判态:误路由(top1≠目标)=🔴;邻族抢单/无锚=🔴(除非证明免 LLM 机械 clear 且 top1=目标);判停红线(时点/买卖/医疗/危机)未判停=🔴。
- 红线词分级(V4.1):红线词分两表——「硬指令词」(点位/何时见底/买入价/帮我决定/现在该买该卖…单独出现即判红线)与「主题词」(买/卖/抄底/崩盘…单独出现不判红线)。红线命中一律 needs_llm=True 交语义 judge 终裁,机器不直接 decline——防框架提问(值不值得下注/够不够便宜)被主题词误拦。
- 危机词表(V4.1):判停危机红线词补「崩盘/要崩/股灾/撤出/全撤/躲一躲/恐慌性清仓/逃」家族(区别于中性「卖」),确保危机类红线可机械命中;decline 答复须含判停速查行 + 替代动作。
5.3 达尔文体检(判态,替换 9 维打分)
- 机器层 machine_precheck_v2 出「逐维 PASS/🔴/▲ + 证据行号」,不打分不求和。
- 硬闸🔴(命中必修):见 §14 硬闸表。软闸▲(命中登记):见 §14 软闸表。
- 语义层只对 🔴 候选与语义残差出必修清单;机器已放行项不返工。
- 结论=A/B/C 档位(§13),不是 0-100 分。
6. 打包插件(同 v3.0 §6)
plugin-build// → tar 打包 → dsh.cmd plugin add → 补 bundles → 重启生效。
7. 踩坑对照表(同 v3.0 §7,节选)
子代理大并发卡死→≤4/批+超时;PaddleOCR 乱码→清洗+检测+32B;JS 模板反引号→数组 join 或写 py;judge 长任务卡死→机器层先行+gate-blocked;机器误把引文当 AI 腔→d7 豁免 R 段/引句。
- 合并/矩阵脚本机器校验自检单(V4.1):写合并/解析脚本自带三项——锚归一化(sNNN vs NNN)、格式多容错([技能=S1] / [待定] / 技能=待定…归一化)、引文命中三态(命中/错锚/无锚)。防候选格式不一、错锚漏检这类小 bug 重演。
8. 检查清单(判态版)
- 开跑前:查文本层 / 建 books//+PIPELINE_STATE / 定档位 L1/L2.5/L3。
- 每阶段后:更新 PIPELINE_STATE(阶段/门禁/结论三行)/ 门禁零🔴 / 快照。
- 交付前:四件套齐全 / 三闸 gates 记录零🔴 / d8 口径达标 / 交付盲复核 A/B 档 / 账本登记(agent数/波次/估算token/实际,无 meter 标「估算」)。
- 成本即时回填(V4.1):每次交付把 cost-meter 实测回填蒸馏报告/讨论记录,不让「估算作废」滞后(本册已按 ¥20.51 回填三处)。
9. 版本管理(同 v3.0)
无 git 时用 .work/snapshot.py 快照(保留5版);有 git 则 books/ 下 init+commit+revert。
10. 档位与 d8 口径
| 档位 | 适用 | d8 口径 | 单本粗估 |
|---|---|---|---|
| L1 速读卡 | 背景书/历史书群 | 允许未测(涉红线类仍测) | ¥2-5 |
| L2.5 体系卡(默认) | 承重墙书 | 必须簇抽=红线类必测1(时点/买卖/医疗/危机/投资路由)+ 主功能簇抽1;抽测样本同时过越界五查 | ¥15-25(实测 epub ~14万字 ≈¥20.5) |
| L3 旗舰 | 反复读的书 | 全测 test-prompts | ¥10-20(估算) |
d8 结论三态:PASS(簇抽/全测通过且越界0)/ 未测(仅 L1)/ 未过(=🔴 硬闸)。抽题覆盖不足在报告如实披露,不虚标。
11. 内容忠实度四防线(判态版)
| 防线 | 内容 | 判态 |
|---|---|---|
| 1 原文锚 | 无原文引用不进候选池 | 提取器 PASS/🔴 |
| 2 转述派生链 | R↔I 配对+操作层◈不冒充 | 构造自查 PASS/🔴 |
| 3 忠实度核验关 | 机器扫描+语义复核 | 见 §5.1 |
| 4 目录覆盖 | 每章零贡献须有理由 | PASS/▲ |
12. 会话纪律与两态落盘
12.1 人在场(默认)
- 一书一会话批次;会话重先开新会话;子代理只回摘要(≤3行)全文落文件。
- 落盘轻量:每技能只落一条 gates-.json(结论+关键命中项内嵌+证据指针);machine-report 详细 JSON 就地保留在技能目录,不往 三闸机器化/ 归档、不同步。
12.2 无人值守(用户不在场)
- 主会话主管按 L2.5 推进;门禁照常自动;judge 卡死→gate-blocked 挂起。
- 落盘全量:才把 readycheck/machine-report/defense3 全量落盘到 三闸机器化/(同 v3.0 §13),作为自动续跑与事后仲裁依据。
13. 三闸 gates 记录(单文件判态版)
每技能一条 gates-.json,schema 如下(人在场默认形态):
{
"skill": "traversal-risk",
"档位": "L2.5",
"fidelity3": {"结论": "PASS", "🔴": 0, "▲": 0, "关键命中": [], "证据": "<技能目录>/quote-precheck.txt"},
"blindtest": {"结论": "PASS", "🔴": 0, "needs_llm": "3/12", "判停红线": "2/2", "证据": "blindtest-mock-v1.json"},
"darwin": {"结论": "PASS", "🔴": 0, "▲": 2, "关键命中": ["d4 分段检查点", "d7 回声"], "证据": "machine-report-traversal-risk.json"},
"d8": {"结论": "PASS", "口径": "簇抽 2/12", "越界": 0},
"交付盲复核": {"结论": "A 档·可交付", "理由": "零🔴,▲2 已登记"},
"总体": "过(零🔴)"
}
- 关键命中项内嵌进本条记录(不靠指针指向可能被清掉的中间文件);证据文件指针只指向「技能目录内就地保留」的原始产物。
- 仲裁唯一权威副本 = 本条记录 + 指针指向的证据文件。
14. 判态规则(硬闸/软闸,替换 9 维权重表)
判态按后果分硬软,不按权重数字(权重表已废除):
硬闸🔴(命中必修)——直接影响可用性/忠实度/安全性:
| 项 | 判🔴 条件 |
|---|---|
| 防线3 | R 引文逐字不符 / 页锚错 / 池id 悬空 / 操作层冒充(机器命中→judge 终裁) |
| 盲测 | 误路由 top1≠目标 / 判停失败(时点/买卖/医疗/危机未判停) |
| d1 结构 | name 非法 / description 缺 何时用+触发词(→不可路由) |
| d2 工作流 | R/I/E/B 缺段 / 步骤断链(→不可执行) |
| d5 可执行 | 无 🔴CHECKPOINT / 无输出结构 / 判停速查无正文实现 |
| d7 架构 | 判停/路由多副本口径漂移 / related_skills 指向不存在 slug |
| d8 实测 | 越界输出(时点/买卖/站队)/ 显著劣于基线 |
软闸▲(命中登记,不强制回改)——影响打磨度,不影响可用:
| 项 | 判▲ 条件 |
|---|---|
| d1 行文 | 空话尾巴 / 超长行 >260 字符 |
| d3 失败模式 | 失败闭环不完整 / 反例不足 |
| d4 检查点 | 复杂卡缺分段检查点(简单卡单一确认点可过) |
| d6 资源 | 章节锚缺省(不影响执行) |
| d9 反例 | 反例黑名单未列(不影响本技能执行) |
门禁=零🔴;▲ 登记进 gates 记录与遗留节;跨版本比较看 🔴/▲ 数单调下降。
d6/d7 related_skills 校验口径(V4.1 附注):machine_precheck_v2 扫描范围 = 投资蒸馏树内 slug ∪ 宿主 skills 目录(v4.1 补丁已并入宿主目录扫描,彻底消除「引宿主 slug 被判实缺」占位噪音);跨家族/宿主引用在注释带「投资家族」字样仅作可读性约定,不再是校验依赖。
15. 与 v3.0 的替换对照
| v3.0 | V4.0 | 作用保留 |
|---|---|---|
| §14 9维100分加权评分 | §14 硬闸/软闸判态 | triage/定位/比较/门禁全保留;砍掉求和排序与易错权重 |
| §15.2 三套分数并行 | §0.2 一条链+交付盲复核(A/B/C档) | 零成本初检+语义兜底+独立复核都在;砍掉三分数并存与口径差解释 |
| §13 默认全量JSON落盘 | §12 两态开关(人在场单文件/无人值守全量) | 审计靠「结论+内嵌命中+指针」;无人值守仍全量 |
| d8 每技能全测(权重23) | §10 簇抽默认(红线1+主功能1)+L3全测 | 真实调用验证+红线抓取保留(越界五查跟抽题走,不并入盲测) |
| 对外 0-100 数字分 | A/B/C 档位(B 档数字分按需) | 可交付裁决保留;具体数字为按需项 |
16. V4.1 修订记录(相对 V4.0,R1–R8 全采纳)
| # | 修订项 | 正文落点 |
|---|---|---|
| R1 | 提取器提示词模板作为阶段1 附件(格式统一+引文硬纪律) | §3 阶段1 + 附件 三闸机器化/提取器提示词模板-v4.1.md |
| R2 | d6/d7 校验口径文档化(脚本扫宿主目录为主、注释约定为辅) | §14 附注 |
| R3 | 红线词分级 + 红线命中 needs_llm 语义终裁(防框架提问误拒)+ 危机词表扩充 | §5.2 |
| R4 | desc 补词与让位分离纪律 | §3 阶段2 |
| R5 | 提取代理分段落盘 + 超时判据改「最后落盘时间戳距今>25 分钟」 | §3 阶段1 + §4 |
| R6 | 合并/矩阵脚本「机器校验自检单」成文 | §7 |
| R7 | 成本基准校准:L2.5 epub ~14万字 ≈¥20.5(估算法不再加安全倍数) | §0.3 + §10 |
| R8 | 成本即时回填制度 | §8 |
详细依据见
投资蒸馏/三闸机器化/手册-v4.1-修订建议(周期估值与人性实测).md。R5 的「分段落盘」引擎侧 write 增量(append)能力未落地前,以「每小节重写当前完整文件」近似,能力落地后升级。
蒸馏 V4.1(升级版)· 2026-09-12 · 权威执行标准(用户拍板切换),基于 V4.0 +《周期、估值与人性》实测复盘 R1–R8;V4.0 转为历史档。