# Dr Reconstruct

> Deep Research 报告重构与独立验证助手。支持两种模式：**轻量模式**针对纯学术 DR（<30 claim，PubMed 可查），通过 Entrez API 三重匹配独立验证；**战略模式**针对多域 DR（学术+FDA+财报+市场+临床+监管），通过 Phase 0/1/2/3 多层交叉 pipeline（Phase 1 并行 subagent 按域分工 + Phase 2 B/C 可选纠错/扩展 + Phase 3 主报告+URL 表+claim-diff+MANIFEST 多产物输出）。触发条件：用户提到"DR重构""deep research验证""核查DR报告""DR文献核查""验证deep research""重构报告""DR线索提取""侦察→验证""deep research可靠性""DR置信度""DR战略核查""战略地图核查""DR数字核查""多域DR核查"等关键词。也适用于"我有一份deep research报告，帮我验证里面的文献/数字/产品码/对标""这个DR报告靠谱吗""把DR的结果重新查一遍""用entrez重新搜一下这些文献"等场景。即使用户只说"这个DR报告靠谱吗"，也应触发本技能。

- Skill: `skydooooog0221/dr-reconstruct` (Agent Skill, multi-file: 6 files)
- Install (CLI): `npx skillmds@latest add skydooooog0221/dr-reconstruct`
- Raw SKILL.md: https://api.skillmd.com/api/skills/skydooooog0221/dr-reconstruct/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: DevOps & Infra
- Author: Skydooooog0221 (https://skillmd.com/u/skydooooog0221)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/skydooooog0221/dr-reconstruct

---


# Deep Research 报告重构与独立验证

> **核心原则：** Deep Research 是侦察兵，不是测绘兵。DR 报告的价值在于发现方向，不在于提供可直接使用的引用。任何来自 DR 的具体文献、数值、归因，必须经过独立验证后才能进入正式写作或战略决策。

> **防杜撰原则（CLI 多分支必读）：** 主 agent 在视图里看不到 subagent tool call 历史时，**必须先 ls 文件系统验证产物**，再判断工作是否完成。视图缺失 ≠ 工作未做。未经文件系统验证的自我怀疑会导致主 agent 编造"坦白未执行"的错误输出——这是本 skill 在 CLI 端多 btw/resume 分支场景下最严重的已知失败模式。

> **依赖技能：**
> - `literature-search-omfs` — Entrez API 规范（检索前读取 `references/entrez-api.md`）
> - `literature-manager` — 验证通过的文献存入管理库
> - `humanizer-zh` — 重构文本去 AI 痕迹（如适用中文写作）

---

## 为什么需要这个技能

Deep Research（`launch_extended_search_task` / Claude web DR / 其他）是独立搜索代理，**不使用** project-level skills，**不调用** Entrez API，**不遵循** literature-search-omfs 的反幻觉规则。基于本地核查 100+ 学术 claim 和 175+ 战略 claim 的经验，DR 错误分布：

### 学术域错误率

| 问题类型 | 发生率 |
|---------|--------|
| 完全捏造文献 | ~5% |
| 作者归因错误（通讯作者代替第一作者） | ~11% |
| 标题/内容描述偏差 | ~15% |
| 具体数值无法从摘要验证 | ~20% |

### 战略 DR 额外错误（非学术部分，实战观察）

| 问题类型 | 实战案例形态 |
|---------|---------|
| 数量级/汇率错（$B → $0.1B 级） | 上市公司年收入 10× 高估、RMB 估值未换汇率直接乘 1 写错 |
| 股票代码错 | DR 把相近上市公司代码互相张冠李戴 |
| 产品码/监管分类错 | 某骨科产品码被 DR 误作相近领域产品码的衍生；产品码 device description 定义错 |
| IPO/融资完成状态错 | Brainlab €1.67B IPO 被推迟误作完成 |
| 流行病学/手术率错 | 某国手术量 10× 高估；"某国率最高"类 folklore |
| 整段论据崩塌 | 某章节核心论点三条证据全挂（捏造 + 论文不存在 + 方向相反 三类错误并发） |

这些错误对论文写作 + 战略决策 + FDA 申报均不可接受。

---

## 模式判定

**原则：完全由用户人工判定，不做自动判定**。主 agent 的任务是：读 DR → 汇报 DR 特征 → 提供推荐参考 → 请用户决策。

### 第一步：读 DR + 汇报特征

主 agent 读完 DR 后，向用户汇报以下要素（作为决策依据）：

- **claim 原子化数量**（估算，"约 N 条"即可）
- **涵盖域**（学术 / FDA / 财报 / 市场 / CPT / 流行病学 哪些出现）
- **数字密集度**（是否含 $B / 亿元 / 万例 / K 号 / 股票代码 等大数字或敏感数字）
- **引用密集度**（多少条具体文献引用，是否以学术引用为主）
- **DR 的产出目标**（用户希望用来做什么：综述 / PhD proposal / 战略决策 / 监管申报 / 投资分析）

### 第二步：提供推荐参考

**推荐参考（仅供参考，不代替用户决策）**：

| DR 特征 | 参考倾向 |
|---|---|
| 纯学术引用 + claim 少（<30） | 倾向模式 A 轻量 |
| 多域（含 FDA / 财报 / 市场 / CPT / 监管 / 流行病学 任一） | 倾向模式 B 战略 |
| claim 很多但单域 | 介于两者之间，列出 token/时长/产物差异让用户权衡 |
| 面向战略决策 / 监管申报 / PhD proposal | 倾向模式 B（产物直接可用） |
| 面向综述写作 / 文献整理 | 倾向模式 A（快速定位文献） |

### 第三步：请用户决策

**绝不自动启动**——把判定权交给用户。询问示例：

> "DR 特征汇报完毕：约 X 条 claim，覆盖 [学术 + FDA + 商业]，产出目标 [<用户指定>]。
> 参考倾向：模式 B 战略（预估 1-2 h、1-2M token、多产物）。
> 或可走模式 A 轻量（15-20 min、2 产物，但非学术 claim 需手动处理）。
> 你选哪种？"

### 向下兼容说明

战略模式 Phase 1 学术组**直接复用**轻量模式的 Entrez 三重匹配子流程（不重复实现，避免代码分叉）。

---

## 模式 A：轻量流程

### 适用场景

- 纯 PubMed/arXiv 可查文献 DR
- claim 数量可控（< 30）
- 无 FDA / 财报 / 监管 / 市场研报等非学术内容

### 流程（7 步）

1. **确认输入**：DR 报告 md / artifact / 对话文本
2. **线索提取**：按类型分组（作者/方法/概念/期刊/年份），**不提取具体数值**
3. **独立搜索**：严格遵循 `literature-search-omfs/references/entrez-api.md`；先查 DR 引用存在性，再用纯主题关键词扩展
4. **三重匹配**：作者 / 年份+期刊 / 标题+内容 三维检查
5. **Claim-摘要匹配**：DR claim 是否能从摘要支持（摘要不足标 📖 需全文验证）
6. **扩展发现**：用纯主题关键词搜遗漏（团队早期奠基 + 最新进展 + 综述）
7. **输出**：核查清单（.md）+ 重构报告（替代原 DR）

### 输出模板

见 `references/light-output-templates.md`

### 质量基准

| 指标 | DR 单独 | + 轻量重构 |
|------|---------|------------|
| 文献可验证率 | ~70% | 100% |
| 作者归因准确率 | ~80% | 100% |
| 捏造文献 | ~5% | 0% |
| 耗时 | 几分钟 | 15-20 min |

---

## 模式 B：战略流程

### 适用场景

- 多域 DR（学术 + FDA + 财报 + 市场 + 临床 + 监管）
- ≥ 30 claim
- 产出目标：PhD proposal / 商业战略底稿 / FDA 申报 / 投资决策

### Phase 架构

```
Phase 0：读 DR + 原子化 claim + 按域分组 + 估算 subagent 数量和主题
Phase 1：并行 subagent 核查（通常 5 组，按内容类型分工）
Phase 2：可选分叉（用户决定 or agent 推荐）
  - B 路径：Tier 1 战略锚点独立二次验证（纠错深挖）
  - C 路径：DR 盲区扩展补充（新主题）
Phase 3：多产物输出（主报告 + URL 表 + claim-diff + MANIFEST）
```

详细执行指南 → `references/strategic-pipeline.md`

### Phase 1 分组规范

按**内容类型**而非 DR 章节分组（5 种典型域）：

| 组 | 负责主题 | 主要工具 |
|---|---|---|
| **A 学术论文** | AI / ML / Foundation Model / Agent 论文 | arXiv + Semantic Scholar + PubMed + 会议 proceedings (NeurIPS/ICML/ICLR/ICCV/CVPR/ACL) |
| **B 临床医学** | 临床证据 / 流行病学 / 方法学 | PubMed Entrez + 期刊官网 + 国家级 registry (NIS/NASS/DRG/NHIS/NHIRD) |
| **C 监管** | FDA 510(k)/De Novo/PMA / NMPA / CE / PCCP | FDA Innolitics + fda.report + 21 CFR 原文 + 公司 PR |
| **D 商业** | 公司估值 / IPO / 融资 / 装机量 / 并购 | SEC EDGAR + 公司 IR + Bloomberg + BusinessWire + 中文财经 |
| **E 市场** | TAM 规模 / CPT 支付 / NTAP / 手术量 / 市场研报 | Grand View Research + MarketsandMarkets + Mordor + CMS PFS + AMA |

每个 subagent 的 prompt 规范 → `references/subagent-prompt-template.md`

### Tier 1 / 2 / 3 分层

Phase 1 核查时对每条 claim 标注 Tier：

| Tier | 判定标准 | 处理强度 |
|---|---|---|
| **Tier 1** | 战略锚点级（影响用户项目决策的关键数字/引用） | 必须原文句子级溯源 + 战略影响分析 |
| **Tier 2** | 重要但非战略（数字错可能误导下游引用） | 二次验证 + URL 溯源 |
| **Tier 3** | 细节偏差（年份/venue/作者归属微差） | 快速扫描 + 简表标注 |

Tier 1 典型特征：用户项目的核心商业对标数字 / 核心监管 predicate / 核心学术 baseline / 核心导师/合作者归属。

### Phase 2 可选分叉（B / C 路径）

**B 路径（纠错深挖）**：针对 Phase 1 Tier 1 做独立二次验证
- **关键认知**：Phase 1 本身可能有 FP（过度判断）和 FN（漏判）
- **跨层仲裁**：B 路径**预期反向修正 Phase 1 部分判断**
- **实战观察**：B 预期反向修正 Phase 1 若干处（典型类型：装机量 milestone 误判、同一公司多日期/多估值被误判为矛盾、监管文件表格解析错位、产品作者归属错、全球手术量区间判错等）

**C 路径（盲区扩展）**：对 DR 未覆盖但应覆盖的主题做独立核查
- 由用户 or agent 根据 B 结果确定候选主题
- **C 路径可能进一步修正 B 路径**（实战观察：γ 对 β 的跨层仲裁修正包括作者归属、产品归属等典型类型）

**可选性**：轻量 DR 不需要 B/C；战略 DR 建议至少跑 B；盲区多时加 C。

### Phase 3 多产物输出

| 产物 | 用途 |
|---|---|
| **主报告重构版** | 保留 DR 原结构 + 每章可信度评分 + 战略叙事 ready-to-copy 替换段落 |
| **URL 溯源总表** | 所有 claim × 源头 URL/DOI/PMID（引用时 Ctrl+F 查） |
| **claim-diff 对照表** | DR 原版 → Phase 1 → B → C → 最终 多层修正轨迹（**方法论价值**，向导师展示时的差异化资产） |
| **SESSION-MANIFEST** | 分支 session-id + 产物清单 + 决策节点 + 最终结论（CLI 多分支回溯必备） |

**文件命名规则 + 格式模板**统一放在 → `references/strategic-output-templates.md`

### 跨 subagent 一致性仲裁

当 subagent A 和 B 判断冲突时：
- **后验证优先**（C 路径修正 B 路径 > B 路径修正 Phase 1）
- **原文证据优先**（直接 PDF quote > 二手源引用）
- **合并层必须显式记录"R1-RN 仲裁表"**，不能隐藏冲突
- **实战惯例**：仲裁表 R1-RN 全部在最终合并的"Phase 1 vs Phase 2 内部冲突仲裁表"中公开，不隐藏冲突

### 分步防御性输出（4+1 策略）

N 个 subagent 各写独立 md 落盘 + 最后主 agent 合并
- 理由：**中间态持久化 = 任何单点失败不致前功尽弃**
- 落盘路径：优先 `<项目根目录>\<项目名>\` 下子目录
- 合并阶段：主 agent 只做"综合判断层"，不复制子报告内容（交叉影响分析 + 战略映射总表）

### 质量基准

| 指标 | DR 单独 | + 战略重构 |
|------|---------|------------|
| 数字可靠率 | ~70% | 95%+ |
| 数量级/汇率错识别 | 0% | 100% |
| 完全捏造识别 | 0% | 100% |
| 产物直接可用于 proposal/申报 | 否 | 是 |
| 耗时 | 几分钟 | 1-2 h（含 subagent 调度 + 合并） |
| Token 消耗 | 小 | 1-2 M（学术任务强制 opus，不降级） |

---

## 共享工具（两种模式通用）

### 非学术内容验证方法

FDA / SEC / 公司 IR / CMS / 中文财经 / 股票代码 / 市场研报 的 primary sources 索引与具体方法 → `references/non-academic-verification.md`

**触发条件**：DR 出现
- 数字带 "$"、"亿"、"K"、"M"、"B" 单位
- K 号 / De Novo 编号 / 产品码 / CPT / HCPCS
- 股票代码 / IPO 日期 / 融资轮次
- 手术量 / 人口学数字 / 国家级统计

### 数量级 / 汇率错专项检测

**触发**：DR 出现 $XX B、X 亿元、X 万例、X 万/年 等大数字

**流程**：
1. 独立找 primary source（SEC 10-K / 官方 IR / 国家级 registry）
2. 三源交叉验证
3. 若数字差异 ≥ 10 倍 → 确认数量级错
4. 推断错误机制（单位转换错 / 汇率未换算 / 小数点位数吞掉）

**实战案例形态**：
- 上市公司年收入 $X0B 被写成 $X.0B 的 10× 错（SEC 10-K + 公司 IR + 财经媒体三源交叉纠错）
- 港股/A 股公司估值 RMB→USD 未换汇率的 10× 汇率错（中文财经 + 官方公告 + 数学反推交叉）
- 某国手术量统计被 DR 10× 高估（国家级 registry peer-reviewed 论文对照纠错）

### 完全捏造引用识别

**信号**（满足 ≥3 条即判定）：
- PubMed 严格检索 0 命中（不是近似结果）
- 期刊官方发表列表（e.g. NEJM AI 年度 issues）无匹配
- Google Scholar + Semantic Scholar 均无匹配
- arXiv 检索无匹配
- 作者 + 期刊 + 年份组合在任何数据库均无返回

**结论**：标记 ❌ 建议删除；寻找真实等价文献作替代引用。

**实战案例形态**：
- DR 给出"新期刊 + 新年份 + 第一作者"看似合理的引用，PubMed/Google Scholar/Semantic Scholar 三源均无匹配 → 完全捏造
- DR 真实作者存在，但期刊/年份/主题被写错（如把 2018 写成近年、把 Nat Rev Cancer 写成 Radiology）→ 论文不存在
- DR 作者名错 + 方向相反（真实论文结论与 DR 描述方向相反，但数字被错引）→ 作者 + 方向双错

**机制提示**：DR 更可能在 **近 2-3 年内新文献**上捏造（LLM 训练数据对最新文献覆盖不足）。

### 整段论据崩塌处理

当某论点的核心证据全部失效（≥2 条核心引用捏造 / 错归属 / 方向相反）：

**流程**：
1. 识别论点（DR 想说什么）
2. 评估论点本身是否成立（可能引用捏造但论点方向对）
3. 寻找真实等价证据重建
4. 输出 **ready-to-copy 段落**（可直接进入用户正式产物）

**实战套路**：某章节核心论点若干条证据全挂后，先判断底层论断方向是否仍成立（DR 可能引用错但论断方向对），再用多篇真实文献（含最强定量锚 + 正反双向证据）重建完整证据链，产出 ready-to-copy 段落供用户直接替换进正式产物。

---

## 输出归档规范

工作完成后，所有产物整理到项目目录（避免散落根目录）：

```
<项目根目录>\<项目名>\<DR核查主题>_<YYYY-MM-DD>\
├── 00_README.md                     ← SESSION-MANIFEST 副本作导航
├── 01_输入_DR原报告_<主题>.md        ← DR 原文（重命名避免 artifact 长哈希名）
├── 02_Phase1_并行核查/              ← 5 组 subagent 输出
├── 03_Phase2B_纠错深挖/             ← 战略模式 B 路径（如启用）
├── 04_Phase2C_盲区扩展/             ← 战略模式 C 路径（如启用）
├── 05_Phase2_最终合并.md            ← 综合战略判断
├── 06_Phase3_最终产物/              ← 主报告 + URL 表 + claim-diff + MANIFEST
└── 99_辅助数据/                     ← subagent 拉取的原始 PDF/TXT（如 arXiv PDF）
```

**轻量模式**产物少，可平铺不分子目录。

**文件夹命名**：主题 + 日期（支持未来二次核查版本区分）；中文可用，× 号（U+00D7）在 Windows 路径合法。

---

## 注意事项

1. **绝不从 DR 复制 PMID / DOI / 股票代码 / K 号 / 产品码 / 具体数字**——必须从 primary source 独立获取
2. **绝不假设 DR 中的作者名是第一作者**——DR 倾向用通讯 / 资深作者命名
3. **对数量级 / 汇率 / 股票代码多一层警觉**——LLM 在这三类上错率最高
4. **学术任务强制 opus**——subagent 不能降级到 sonnet/haiku（会降低原文引用和独立验证质量）
5. **遵循 literature-search-omfs 的全部反幻觉规则**——信息可及度标签 📄📑📌 和置信度标签 🟢🟡🔴 必须标注
6. **文件系统硬证据 > 视图自我怀疑**——分支 workflow 中遇到 "Agent tool call 消失" 时必先 `ls <产物路径>` 验证
7. **每份重构报告开头声明**："本清单中所有 PMID / DOI / K 号 / 标题 / 作者均直接来自 primary source 独立验证，未从 DR 原文复制"
8. **战略模式 Phase 2 B/C 路径是可选项**——简单 DR 不需要；用户未明确要求时先 Phase 1 汇报，由用户决定是否进 B/C

---

## 扩展阅读（references/）

| 文件 | 内容 | 何时读取 |
|---|---|---|
| `references/light-output-templates.md` | 轻量模式核查清单 + 重构报告格式模板 | 触发轻量模式第 7 步输出前 |
| `references/strategic-pipeline.md` | 战略模式 Phase 0/1/2/3 完整执行指南 + Phase 2 B/C 决策细节 | 触发战略模式 Phase 0 读 DR 后 |
| `references/subagent-prompt-template.md` | 5 类 subagent prompt 模板（Phase 1 A/B/C/D/E）+ β/γ 深挖 prompt 模板 | 启动 subagent 前 |
| `references/strategic-output-templates.md` | 主报告 / URL 表 / claim-diff / MANIFEST 四种产物格式模板 | Phase 3 输出前 |
| `references/non-academic-verification.md` | FDA / SEC / IR / CMS / 市场研报 / 股票 / 中文财经 验证方法清单 | 战略模式 Phase 1 C/D/E 组启动前 |

---

*本 skill 基于多域 DR 核查项目的实战经验迭代*

