Deep Research 报告重构与独立验证
核心原则: Deep Research 是侦察兵,不是测绘兵。DR 报告的价值在于发现方向,不在于提供可直接使用的引用。任何来自 DR 的具体文献、数值、归因,必须经过独立验证后才能进入正式写作或战略决策。
防杜撰原则(CLI 多分支必读): 主 agent 在视图里看不到 subagent tool call 历史时,必须先 ls 文件系统验证产物,再判断工作是否完成。视图缺失 ≠ 工作未做。未经文件系统验证的自我怀疑会导致主 agent 编造"坦白未执行"的错误输出——这是本 skill 在 CLI 端多 btw/resume 分支场景下最严重的已知失败模式。
依赖技能:
literature-search-omfs— Entrez API 规范(检索前读取references/entrez-api.md)literature-manager— 验证通过的文献存入管理库humanizer-zh— 重构文本去 AI 痕迹(如适用中文写作)
为什么需要这个技能
Deep Research(launch_extended_search_task / Claude web DR / 其他)是独立搜索代理,不使用 project-level skills,不调用 Entrez API,不遵循 literature-search-omfs 的反幻觉规则。基于本地核查 100+ 学术 claim 和 175+ 战略 claim 的经验,DR 错误分布:
学术域错误率
| 问题类型 | 发生率 |
|---|---|
| 完全捏造文献 | ~5% |
| 作者归因错误(通讯作者代替第一作者) | ~11% |
| 标题/内容描述偏差 | ~15% |
| 具体数值无法从摘要验证 | ~20% |
战略 DR 额外错误(非学术部分,实战观察)
| 问题类型 | 实战案例形态 |
|---|---|
| 数量级/汇率错($B → $0.1B 级) | 上市公司年收入 10× 高估、RMB 估值未换汇率直接乘 1 写错 |
| 股票代码错 | DR 把相近上市公司代码互相张冠李戴 |
| 产品码/监管分类错 | 某骨科产品码被 DR 误作相近领域产品码的衍生;产品码 device description 定义错 |
| IPO/融资完成状态错 | Brainlab €1.67B IPO 被推迟误作完成 |
| 流行病学/手术率错 | 某国手术量 10× 高估;"某国率最高"类 folklore |
| 整段论据崩塌 | 某章节核心论点三条证据全挂(捏造 + 论文不存在 + 方向相反 三类错误并发) |
这些错误对论文写作 + 战略决策 + FDA 申报均不可接受。
模式判定
原则:完全由用户人工判定,不做自动判定。主 agent 的任务是:读 DR → 汇报 DR 特征 → 提供推荐参考 → 请用户决策。
第一步:读 DR + 汇报特征
主 agent 读完 DR 后,向用户汇报以下要素(作为决策依据):
- claim 原子化数量(估算,"约 N 条"即可)
- 涵盖域(学术 / FDA / 财报 / 市场 / CPT / 流行病学 哪些出现)
- 数字密集度(是否含 $B / 亿元 / 万例 / K 号 / 股票代码 等大数字或敏感数字)
- 引用密集度(多少条具体文献引用,是否以学术引用为主)
- DR 的产出目标(用户希望用来做什么:综述 / PhD proposal / 战略决策 / 监管申报 / 投资分析)
第二步:提供推荐参考
推荐参考(仅供参考,不代替用户决策):
| DR 特征 | 参考倾向 |
|---|---|
| 纯学术引用 + claim 少(<30) | 倾向模式 A 轻量 |
| 多域(含 FDA / 财报 / 市场 / CPT / 监管 / 流行病学 任一) | 倾向模式 B 战略 |
| claim 很多但单域 | 介于两者之间,列出 token/时长/产物差异让用户权衡 |
| 面向战略决策 / 监管申报 / PhD proposal | 倾向模式 B(产物直接可用) |
| 面向综述写作 / 文献整理 | 倾向模式 A(快速定位文献) |
第三步:请用户决策
绝不自动启动——把判定权交给用户。询问示例:
"DR 特征汇报完毕:约 X 条 claim,覆盖 [学术 + FDA + 商业],产出目标 [<用户指定>]。 参考倾向:模式 B 战略(预估 1-2 h、1-2M token、多产物)。 或可走模式 A 轻量(15-20 min、2 产物,但非学术 claim 需手动处理)。 你选哪种?"
向下兼容说明
战略模式 Phase 1 学术组直接复用轻量模式的 Entrez 三重匹配子流程(不重复实现,避免代码分叉)。
模式 A:轻量流程
适用场景
- 纯 PubMed/arXiv 可查文献 DR
- claim 数量可控(< 30)
- 无 FDA / 财报 / 监管 / 市场研报等非学术内容
流程(7 步)
- 确认输入:DR 报告 md / artifact / 对话文本
- 线索提取:按类型分组(作者/方法/概念/期刊/年份),不提取具体数值
- 独立搜索:严格遵循
literature-search-omfs/references/entrez-api.md;先查 DR 引用存在性,再用纯主题关键词扩展 - 三重匹配:作者 / 年份+期刊 / 标题+内容 三维检查
- Claim-摘要匹配:DR claim 是否能从摘要支持(摘要不足标 📖 需全文验证)
- 扩展发现:用纯主题关键词搜遗漏(团队早期奠基 + 最新进展 + 综述)
- 输出:核查清单(.md)+ 重构报告(替代原 DR)
输出模板
见 references/light-output-templates.md
质量基准
| 指标 | DR 单独 | + 轻量重构 |
|---|---|---|
| 文献可验证率 | ~70% | 100% |
| 作者归因准确率 | ~80% | 100% |
| 捏造文献 | ~5% | 0% |
| 耗时 | 几分钟 | 15-20 min |
模式 B:战略流程
适用场景
- 多域 DR(学术 + FDA + 财报 + 市场 + 临床 + 监管)
- ≥ 30 claim
- 产出目标:PhD proposal / 商业战略底稿 / FDA 申报 / 投资决策
Phase 架构
Phase 0:读 DR + 原子化 claim + 按域分组 + 估算 subagent 数量和主题
Phase 1:并行 subagent 核查(通常 5 组,按内容类型分工)
Phase 2:可选分叉(用户决定 or agent 推荐)
- B 路径:Tier 1 战略锚点独立二次验证(纠错深挖)
- C 路径:DR 盲区扩展补充(新主题)
Phase 3:多产物输出(主报告 + URL 表 + claim-diff + MANIFEST)
详细执行指南 → references/strategic-pipeline.md
Phase 1 分组规范
按内容类型而非 DR 章节分组(5 种典型域):
| 组 | 负责主题 | 主要工具 |
|---|---|---|
| A 学术论文 | AI / ML / Foundation Model / Agent 论文 | arXiv + Semantic Scholar + PubMed + 会议 proceedings (NeurIPS/ICML/ICLR/ICCV/CVPR/ACL) |
| B 临床医学 | 临床证据 / 流行病学 / 方法学 | PubMed Entrez + 期刊官网 + 国家级 registry (NIS/NASS/DRG/NHIS/NHIRD) |
| C 监管 | FDA 510(k)/De Novo/PMA / NMPA / CE / PCCP | FDA Innolitics + fda.report + 21 CFR 原文 + 公司 PR |
| D 商业 | 公司估值 / IPO / 融资 / 装机量 / 并购 | SEC EDGAR + 公司 IR + Bloomberg + BusinessWire + 中文财经 |
| E 市场 | TAM 规模 / CPT 支付 / NTAP / 手术量 / 市场研报 | Grand View Research + MarketsandMarkets + Mordor + CMS PFS + AMA |
每个 subagent 的 prompt 规范 → references/subagent-prompt-template.md
Tier 1 / 2 / 3 分层
Phase 1 核查时对每条 claim 标注 Tier:
| Tier | 判定标准 | 处理强度 |
|---|---|---|
| Tier 1 | 战略锚点级(影响用户项目决策的关键数字/引用) | 必须原文句子级溯源 + 战略影响分析 |
| Tier 2 | 重要但非战略(数字错可能误导下游引用) | 二次验证 + URL 溯源 |
| Tier 3 | 细节偏差(年份/venue/作者归属微差) | 快速扫描 + 简表标注 |
Tier 1 典型特征:用户项目的核心商业对标数字 / 核心监管 predicate / 核心学术 baseline / 核心导师/合作者归属。
Phase 2 可选分叉(B / C 路径)
B 路径(纠错深挖):针对 Phase 1 Tier 1 做独立二次验证
- 关键认知:Phase 1 本身可能有 FP(过度判断)和 FN(漏判)
- 跨层仲裁:B 路径预期反向修正 Phase 1 部分判断
- 实战观察:B 预期反向修正 Phase 1 若干处(典型类型:装机量 milestone 误判、同一公司多日期/多估值被误判为矛盾、监管文件表格解析错位、产品作者归属错、全球手术量区间判错等)
C 路径(盲区扩展):对 DR 未覆盖但应覆盖的主题做独立核查
- 由用户 or agent 根据 B 结果确定候选主题
- C 路径可能进一步修正 B 路径(实战观察:γ 对 β 的跨层仲裁修正包括作者归属、产品归属等典型类型)
可选性:轻量 DR 不需要 B/C;战略 DR 建议至少跑 B;盲区多时加 C。
Phase 3 多产物输出
| 产物 | 用途 |
|---|---|
| 主报告重构版 | 保留 DR 原结构 + 每章可信度评分 + 战略叙事 ready-to-copy 替换段落 |
| URL 溯源总表 | 所有 claim × 源头 URL/DOI/PMID(引用时 Ctrl+F 查) |
| claim-diff 对照表 | DR 原版 → Phase 1 → B → C → 最终 多层修正轨迹(方法论价值,向导师展示时的差异化资产) |
| SESSION-MANIFEST | 分支 session-id + 产物清单 + 决策节点 + 最终结论(CLI 多分支回溯必备) |
文件命名规则 + 格式模板统一放在 → references/strategic-output-templates.md
跨 subagent 一致性仲裁
当 subagent A 和 B 判断冲突时:
- 后验证优先(C 路径修正 B 路径 > B 路径修正 Phase 1)
- 原文证据优先(直接 PDF quote > 二手源引用)
- 合并层必须显式记录"R1-RN 仲裁表",不能隐藏冲突
- 实战惯例:仲裁表 R1-RN 全部在最终合并的"Phase 1 vs Phase 2 内部冲突仲裁表"中公开,不隐藏冲突
分步防御性输出(4+1 策略)
N 个 subagent 各写独立 md 落盘 + 最后主 agent 合并
- 理由:中间态持久化 = 任何单点失败不致前功尽弃
- 落盘路径:优先
<项目根目录>\<项目名>\下子目录 - 合并阶段:主 agent 只做"综合判断层",不复制子报告内容(交叉影响分析 + 战略映射总表)
质量基准
| 指标 | DR 单独 | + 战略重构 |
|---|---|---|
| 数字可靠率 | ~70% | 95%+ |
| 数量级/汇率错识别 | 0% | 100% |
| 完全捏造识别 | 0% | 100% |
| 产物直接可用于 proposal/申报 | 否 | 是 |
| 耗时 | 几分钟 | 1-2 h(含 subagent 调度 + 合并) |
| Token 消耗 | 小 | 1-2 M(学术任务强制 opus,不降级) |
共享工具(两种模式通用)
非学术内容验证方法
FDA / SEC / 公司 IR / CMS / 中文财经 / 股票代码 / 市场研报 的 primary sources 索引与具体方法 → references/non-academic-verification.md
触发条件:DR 出现
- 数字带 "$"、"亿"、"K"、"M"、"B" 单位
- K 号 / De Novo 编号 / 产品码 / CPT / HCPCS
- 股票代码 / IPO 日期 / 融资轮次
- 手术量 / 人口学数字 / 国家级统计
数量级 / 汇率错专项检测
触发:DR 出现 $XX B、X 亿元、X 万例、X 万/年 等大数字
流程:
- 独立找 primary source(SEC 10-K / 官方 IR / 国家级 registry)
- 三源交叉验证
- 若数字差异 ≥ 10 倍 → 确认数量级错
- 推断错误机制(单位转换错 / 汇率未换算 / 小数点位数吞掉)
实战案例形态:
- 上市公司年收入 $X0B 被写成 $X.0B 的 10× 错(SEC 10-K + 公司 IR + 财经媒体三源交叉纠错)
- 港股/A 股公司估值 RMB→USD 未换汇率的 10× 汇率错(中文财经 + 官方公告 + 数学反推交叉)
- 某国手术量统计被 DR 10× 高估(国家级 registry peer-reviewed 论文对照纠错)
完全捏造引用识别
信号(满足 ≥3 条即判定):
- PubMed 严格检索 0 命中(不是近似结果)
- 期刊官方发表列表(e.g. NEJM AI 年度 issues)无匹配
- Google Scholar + Semantic Scholar 均无匹配
- arXiv 检索无匹配
- 作者 + 期刊 + 年份组合在任何数据库均无返回
结论:标记 ❌ 建议删除;寻找真实等价文献作替代引用。
实战案例形态:
- DR 给出"新期刊 + 新年份 + 第一作者"看似合理的引用,PubMed/Google Scholar/Semantic Scholar 三源均无匹配 → 完全捏造
- DR 真实作者存在,但期刊/年份/主题被写错(如把 2018 写成近年、把 Nat Rev Cancer 写成 Radiology)→ 论文不存在
- DR 作者名错 + 方向相反(真实论文结论与 DR 描述方向相反,但数字被错引)→ 作者 + 方向双错
机制提示:DR 更可能在 近 2-3 年内新文献上捏造(LLM 训练数据对最新文献覆盖不足)。
整段论据崩塌处理
当某论点的核心证据全部失效(≥2 条核心引用捏造 / 错归属 / 方向相反):
流程:
- 识别论点(DR 想说什么)
- 评估论点本身是否成立(可能引用捏造但论点方向对)
- 寻找真实等价证据重建
- 输出 ready-to-copy 段落(可直接进入用户正式产物)
实战套路:某章节核心论点若干条证据全挂后,先判断底层论断方向是否仍成立(DR 可能引用错但论断方向对),再用多篇真实文献(含最强定量锚 + 正反双向证据)重建完整证据链,产出 ready-to-copy 段落供用户直接替换进正式产物。
输出归档规范
工作完成后,所有产物整理到项目目录(避免散落根目录):
<项目根目录>\<项目名>\<DR核查主题>_<YYYY-MM-DD>\
├── 00_README.md ← SESSION-MANIFEST 副本作导航
├── 01_输入_DR原报告_<主题>.md ← DR 原文(重命名避免 artifact 长哈希名)
├── 02_Phase1_并行核查/ ← 5 组 subagent 输出
├── 03_Phase2B_纠错深挖/ ← 战略模式 B 路径(如启用)
├── 04_Phase2C_盲区扩展/ ← 战略模式 C 路径(如启用)
├── 05_Phase2_最终合并.md ← 综合战略判断
├── 06_Phase3_最终产物/ ← 主报告 + URL 表 + claim-diff + MANIFEST
└── 99_辅助数据/ ← subagent 拉取的原始 PDF/TXT(如 arXiv PDF)
轻量模式产物少,可平铺不分子目录。
文件夹命名:主题 + 日期(支持未来二次核查版本区分);中文可用,× 号(U+00D7)在 Windows 路径合法。
注意事项
- 绝不从 DR 复制 PMID / DOI / 股票代码 / K 号 / 产品码 / 具体数字——必须从 primary source 独立获取
- 绝不假设 DR 中的作者名是第一作者——DR 倾向用通讯 / 资深作者命名
- 对数量级 / 汇率 / 股票代码多一层警觉——LLM 在这三类上错率最高
- 学术任务强制 opus——subagent 不能降级到 sonnet/haiku(会降低原文引用和独立验证质量)
- 遵循 literature-search-omfs 的全部反幻觉规则——信息可及度标签 📄📑📌 和置信度标签 🟢🟡🔴 必须标注
- 文件系统硬证据 > 视图自我怀疑——分支 workflow 中遇到 "Agent tool call 消失" 时必先
ls <产物路径>验证 - 每份重构报告开头声明:"本清单中所有 PMID / DOI / K 号 / 标题 / 作者均直接来自 primary source 独立验证,未从 DR 原文复制"
- 战略模式 Phase 2 B/C 路径是可选项——简单 DR 不需要;用户未明确要求时先 Phase 1 汇报,由用户决定是否进 B/C
扩展阅读(references/)
| 文件 | 内容 | 何时读取 |
|---|---|---|
references/light-output-templates.md |
轻量模式核查清单 + 重构报告格式模板 | 触发轻量模式第 7 步输出前 |
references/strategic-pipeline.md |
战略模式 Phase 0/1/2/3 完整执行指南 + Phase 2 B/C 决策细节 | 触发战略模式 Phase 0 读 DR 后 |
references/subagent-prompt-template.md |
5 类 subagent prompt 模板(Phase 1 A/B/C/D/E)+ β/γ 深挖 prompt 模板 | 启动 subagent 前 |
references/strategic-output-templates.md |
主报告 / URL 表 / claim-diff / MANIFEST 四种产物格式模板 | Phase 3 输出前 |
references/non-academic-verification.md |
FDA / SEC / IR / CMS / 市场研报 / 股票 / 中文财经 验证方法清单 | 战略模式 Phase 1 C/D/E 组启动前 |
本 skill 基于多域 DR 核查项目的实战经验迭代