# doubao-reference-audit

> 用于用户提交论文、学位论文或参考文献清单后，系统审查参考文献真实性、题录准确性、文内—文后对应关系以及正文主张是否得到被引文献支持，并生成专业、清晰、可直接指导修改的论文引用审计报告与飞书文档。用户要求“论文审计”“参考文献检查”“引用核对”“引用是否支持观点”“检查错引、过度推断或二手转引”时使用。开放主题综述、普通论文精读、论文代写或仅做语言润色时不使用。

- Skill: `ahang1598/doubao-reference-audit` (Agent Skill, multi-file: 3 files)
- Install (CLI): `npx skillmds add ahang1598/doubao-reference-audit`
- Raw SKILL.md: https://api.skillmd.com/api/skills/ahang1598/doubao-reference-audit/raw
- Safety review: pending (external: skill-scanner PASS, skillspector PASS)
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Security
- Author: ahang1598 (https://skillmd.com/u/ahang1598)
- Updated: 2026-08-19
- Page: https://skillmd.com/skills/ahang1598/doubao-reference-audit

---


# 豆包·参考文献审计

## 功能说明

豆包·论文引用审计是一套面向科研论文、学位论文和投稿稿件的专业引用审查方法。它不仅检查参考文献是否真实、格式是否正确，还会回到论文正文，判断被引文献是否真正支持作者在相应位置提出的观点。

核心能力包括：

- 全量阅读论文中的参考文献和引用语境；
- 检查文内引用与文后参考文献是否对应；
- 核验标题、作者、年份、期刊或会议、卷期页码、DOI等题录信息；
- 区分预印本、正式发表版本、勘误、更正和撤稿状态；
- 判断引用在句子中承担的真实作用；
- 识别明显错引、支持不足、过度推断、二手转引和组合引用问题；
- 对关键数字、因果、机制、优先性和强结论进行深入核查；
- 将发现转化为作者可以直接执行的修改建议；
- 生成具有科研审稿质感的 Markdown 报告，并进一步创建飞书文档。

这不是机械的格式检查，也不要求把每条引用处理成同样深度。先看见全部引用结构，再把精力集中到真正影响论文论证和投稿可信度的位置。

## 适用场景

适用于：

- 投稿前检查整篇论文的参考文献；
- 检查文献是否真实存在、题录是否准确；
- 判断正文中的引用是否真正支持对应观点；
- 排查引用错误、过度概括、过度推断和二手转引；
- 检查预印本、正式版、数据集、软件和网页来源；
- 审查学位论文、综述、研究报告中的引用质量；
- 用户要求形成正式、专业的引用审查书。

不适用于：

- 围绕开放主题重新做文献综述；
- 只精读或总结某一篇论文；
- 代写论文正文；
- 只做语言润色或格式排版；
- 没有具体论文或参考文献材料的一般学术问答。

## 审计原则

### 全量看见，风险聚焦

检查整篇论文的参考文献与引用语境，但不平均分配审计精力。普通背景引用可以快速确认，真正承载核心论证的引用需要深入判断。

### 先辨角色，再查支持

先判断引用在当前句子中是用于证明外部事实、介绍已有方法、标识基线、说明数据集或软件、表达不同观点，还是仅仅提到相关工作。只有理解引用角色，才能判断它是否被正确使用。

### 证据深度服从问题

题录和摘要可以解决的问题不必机械阅读全文；精确数字、因果关系、机制解释、优先性、适用范围和直接引语等高风险问题，应进入正文相关章节、图表或补充材料。

### 主题相关不等于支持

被引论文与研究主题相近，不代表它能够支持当前句子的具体表述。审计时比较的是作者写出的主张与来源实际提供的证据。

### 证据不足时保留判断

无法获得充分来源、正文不可访问或原文表达不清时，说明当前证据边界并提出复核建议，不把“没有查清”写成“没有问题”，也不把怀疑包装成确定错误。

### 报告服务于修改

优先报告会影响论证可靠性、研究归属、复现性、学术规范或投稿判断的问题。报告不仅指出问题，还应解释为什么重要以及作者应当怎样修改。

## 工作流程

### 第一阶段：理解论文与审计目标

先阅读论文的题目、摘要、引言、方法、实验和结论，理解：

- 论文研究什么问题；
- 核心方法、主要结果和关键结论是什么；
- 哪些陈述是作者自己的实验结果；
- 哪些论证真正依赖外部文献；
- 用户特别关心哪些章节、文献或风险。

不要一开始就逐条搜索参考文献。缺少对论文整体论证的理解，容易把作者自己的结果误认为需要由旁边的引用证明，也容易误判方法名、基线、数据集和普通背景引用。

### 第二阶段：建立全量引用地图

通读参考文献列表和正文引用，形成对整篇论文引用结构的完整认识。

关注：

- 文后有哪些参考文献；
- 每条文献在正文哪些位置被引用；
- 文内引用是否都有对应的文后条目；
- 文后是否存在从未在正文使用的条目；
- 编号制或作者—年份制是否出现错位、重复和歧义；
- 同一文献是否在不同语境中承担不同作用；
- 一句话是否同时绑定多篇文献；
- 正文、脚注、表格和图注中的引用是否被遗漏。

“全量”表示所有参考文献和引用语境都进入视野，不表示每条文献都必须接受同样深度的全文核查。工作笔记可以采用执行者最顺手的方式，不要求建立固定格式的台账。

### 第三阶段：核验文献身份和当前状态

核验参考文献是否真实存在，并检查：

- 标题、作者和发表年份；
- 期刊、会议、出版社或机构；
- 卷号、期号、页码和文章编号；
- DOI、ISBN、PMID、arXiv编号或稳定URL；
- 文献类型是否标注正确；
- 引用的是预印本、会议版、期刊版还是最终正式版；
- 是否存在勘误、更正、撤稿或表达关切；
- 数据集、软件、标准和网页是否指向官方或原始来源。

优先使用：

1. 出版商、期刊、会议或机构官方页面；
2. Crossref、PubMed、arXiv、PMC、ACL Anthology、OpenReview等权威平台；
3. 作者或研究机构公开的合法版本；
4. 其他可靠学术索引。

搜索引擎、Google Scholar和聚合网站可以帮助发现来源，但重要判断尽量回到官方记录或原始文献。DOI不存在并不等于文献虚假；同样，DOI可以解析也不代表正文引用一定正确。

题录核验优先走最短路径：已有 DOI 时直接查询该 DOI；CVF、NeurIPS、PMLR、USENIX、arXiv、PubMed 等具有明确官方入口的来源，优先使用官方记录；软件、数据集和网页优先核验官方仓库或机构页面。只有缺少稳定标识或身份不确定时，才使用 Crossref 题录搜索，并只保留少量候选。复用已经获得的查询结果；批量核验中断或重新运行时，只补查尚未完成的条目，不重复请求已确认来源。

### 第四阶段：判断引用角色与风险

对每个引用语境，先判断被引文献承担什么功能：

- 支撑背景事实或领域共识；
- 支撑具体数字、结果或比较；
- 解释因果关系或作用机制；
- 证明研究空白、优先性或“首次”主张；
- 介绍已有方法、模型或技术路线；
- 标识实验基线、评价指标、软件或数据集；
- 表示与既有研究一致、不同或相反；
- 仅仅提及相关工作；
- 与作者自己的实验设置或结果共同出现在一句话中。

随后判断风险。以下语境值得优先深入：

- 摘要、结论和核心论点中的引用；
- 精确数字、比例、性能指标和统计结论；
- “导致”“证明”“决定”等因果或机制表述；
- “首次”“唯一”“显著优于”“普遍适用”等强断言；
- 对样本、人群、设备、场景或适用范围的扩展；
- 直接引语；
- 题名与正文主张明显不一致；
- 多篇文献共同支撑一个复杂句子；
- 综述、博客、镜像网站等二手或非权威来源；
- 可能影响研究归属、复现性或投稿可信度的引用。

作者自己的实验结果不要求被引文献替作者证明。此时应检查的是引用是否正确标识了基线、方法、软件或数据集，以及作者是否借助该引用把自己的结果不恰当地推广到更大范围。

### 第五阶段：按风险获取和升级证据

根据问题选择恰当的证据深度。

一般背景、成熟定义、方法名称或明显的题录问题，可以先通过权威元数据、官方落地页和摘要判断。

遇到下列问题时，进一步进入目标正文、图表、实验设置或补充材料：

- 摘要只能说明主题相关，不能回答具体主张；
- 需要核对精确数字、样本、实验条件或适用范围；
- 涉及因果、机制、优先性或直接引语；
- 不同版本可能给出不同结果；
- 多篇文献对同一句话的支持关系不清；
- 该判断将成为报告中的重要问题。

证据获取应围绕当前问题定向进行。已经找到足以确认支持或明显冲突的直接证据后，可以停止继续扩展检索；同一来源被多处引用时，复用已经获得的材料，不重复下载和重复阅读。

如果公开或已授权来源不足，说明限制并给出复核方向。不要绕过登录、版权或付费访问限制。

### 第六阶段：进行主张—证据实质比较

把包含多个判断的长句拆成可以分别核查的主张，再将论文表述与来源证据进行比较。

重点比较：

- 研究对象是否一致；
- 应用场景是否一致；
- 方法与实验条件是否一致；
- 样本、人群或数据集是否一致；
- 结论方向是否一致；
- 数字和量级是否准确；
- 相关性是否被写成因果性；
- “可能”“提示”“相关”是否被增强为“证明”“导致”“确定”；
- 局部实验结果是否被扩大为普遍结论；
- 来源提供的是直接证据还是二手转述；
- 引用是否只支持句子的一部分。

根据实际证据，用自然、准确的语言表达判断，例如：

- 该引用能够充分支持当前表述；
- 基本支持，但需要补充条件或缩小范围；
- 只支持句子中的部分主张；
- 主题相关，但不足以支撑当前结论；
- 来源内容与论文表述存在明显冲突；
- 现有证据不足，暂时不能可靠判断。

对于一句话后的多篇组合引用，不要默认每篇文献都支持整句话。拆分其中的不同主张，判断各文献分别支持什么；如果无法安全归因，建议拆句、调整引文位置或进一步人工复核。

### 第七阶段：归并问题并形成专业报告

将零散发现整理成对作者真正有用的审计结论。相同根因导致的多个表面问题可以合并，不用通过堆积问题数量表现工作量。

每个重要问题尽量包括：

- 对重大发现，优先直接复制稿件中的相关原句或原始题录；不便完整复制时，可给出准确位置并做忠实摘录；
- 专家判断；
- 被引来源实际说明了什么；
- 稿件表述与来源之间的差异；
- 该问题为什么重要；
- 可直接执行的修改建议；
- 用于核验的权威来源链接。

修改建议可以包括：

- 收窄或重新表述当前主张；
- 补充必要的适用条件；
- 将因果措辞改为相关性或观察性措辞；
- 更换为真正支持该主张的原始来源；
- 补引原始研究，避免只引用二手综述；
- 拆分组合引用和复合句；
- 修正年份、作者、题名、版本、DOI等题录信息；
- 补充数据集、软件版本、许可证或正式来源；
- 删除无法支持当前观点的引用。

先完成一份高质量 Markdown 审查书。生成报告时读取并参考 `assets/report-template.md`，根据论文类型和实际发现调整栏目、顺序与篇幅，不要机械填充空章节。Markdown 定稿后，再使用当前环境可用的飞书文档能力创建飞书原生文档；飞书内容以最终 Markdown 为准。创建后回读主要内容，确认没有明显缺失、截断或链接错误。

如果当前环境没有飞书工具，或者飞书创建、写入、回读失败，保留完整 Markdown 报告并向用户明确说明失败原因。不得虚构飞书链接、Document ID或交付回执。

## 工具与脚本

### Crossref 题录查询器

当参考文献较多、需要批量核验题录时，使用 `scripts/lookup_metadata.py`。脚本只负责获取题录候选，不负责判断引用真实性、语义支持程度或审计结论。

先准备 UTF-8 JSON：

```json
[
  {
    "id": "25",
    "raw": "Schwartz E, et al. DeepISP: Toward Learning an End-to-End Image Processing Pipeline.",
    "title": "DeepISP: Toward Learning an End-to-End Image Processing Pipeline",
    "first_author": "Schwartz",
    "year": 2019,
    "doi": "10.1109/TIP.2018.2872858"
  }
]
```

运行：

```text
python "<SKILL_DIR>\scripts\lookup_metadata.py" references.json --output metadata-results.json --mailto your-email@example.com
```

脚本会：

- 对已有 DOI 的条目直接查询；
- 对有结构化标题的普通文献优先按标题与作者搜索；只有纯题录文本时才使用 Crossref 综合题录搜索；
- 对无 DOI 的普通文献保留少量候选；
- 对无 DOI 的软件、数据集和网页提示改查官方来源；
- 以 DOI 或标准化题录为键复用本次任务缓存；
- 中断或重新运行时只补查未完成请求；
- 区分未找到、请求失败和应优先核验官方来源。

执行者根据候选的标题、作者、年份、载体和 DOI 自行判断匹配关系。不得把脚本返回的首个候选、相似度或 `ok` 状态直接写成“文献真实”“题录正确”或“支持正文主张”。缓存和输出保存在当前任务目录，不写入 Skill 全局数据库。
## 专家审计经验

### 引用真实不等于引用正确

一篇文献可以真实存在、题录完全正确，却被放在不支持当前观点的位置。这类问题往往比轻微格式错误更影响论文可信度。

### 摘要适合筛查，不适合包办全部判断

摘要能够快速判断研究主题、对象和主要结论，但通常缺少实验条件、限定范围、具体数字和例外情况。高风险主张需要查看与问题直接相关的正文位置。

### 原始研究优先于二手转述

综述和二手来源可以帮助理解领域或发现原始文献，但关键事实、数字和结论尽量回到首次报告该结果的原始研究。特别留意论文是否把综述中的概括错误地当成原始证据。

### 版本会改变判断

预印本、会议版、期刊版和更正版可能在标题、作者、实验、结论甚至撤稿状态上不同。不要只看文献名称相近就认为它们可以互换。

### 强措辞需要强证据

“首次”“证明”“导致”“普遍”“全部”“显著优于”等词语承担较高证据责任。如果来源只提供有限场景下的观察结果，应建议作者降低断言强度或补充更直接的证据。

### 组合引用需要拆开看

一句话后列出多篇文献，可能只是每篇分别支持某一部分，也可能其中一些仅提供背景。不要把引用数量误当成证据强度。

### 不要把作者自己的结果交给被引文献证明

带有基线引用的实验句子，可能主要是在报告本文结果。此时应区分“基线来源是否正确”和“本文结果是否被过度解释”，避免错误地要求基线论文支持作者自己的数值。

### 重要的是发现的解释力

用户更需要少量但准确、解释充分、能够直接修改的问题，而不是大批意义不大的“建议复核”。正常引用可以概括说明，真正的篇幅留给影响论文论证的发现。

## 报告建议

报告应具有专业审稿意见的质感，优先呈现结论和行动，而不是展示内部检索过程。具体版式参考 `assets/report-template.md`。

推荐结构：

### 1. 审计结论

用简洁、克制的语言说明论文引用体系的整体可靠性、主要风险和投稿前是否需要修改。

### 2. 核心发现

优先展示影响核心论证、研究归属、数据来源、方法复现或学术规范的问题。避免把格式小问题和实质错引混在一起。

### 3. 重点修改建议

告诉作者哪些问题应当优先处理，以及最直接的修改路径。

### 4. 实质性引用问题

使用“稿件原文—专家判断—来源证据—影响—修改建议”的方式展开重要问题。

### 5. 题录、版本与来源问题

集中说明年份、作者、载体、DOI、预印本、正式版、勘误、撤稿、数据集和软件来源等问题。

### 6. 引用结构观察

总结组合引用、二手转引、来源质量、引用密度和未使用文献等整体性现象。

### 7. 审计范围与证据边界

简要说明本次审计覆盖了哪些内容、哪些判断因来源不可访问或证据不足而保留。流程完成不代表论文必然“通过审计”。

报告结构可以根据论文类型和实际发现灵活调整。不要为了套用模板制造空洞章节，也不要在主报告中展示大量内部编号、状态字段、检索日志或机械的正常项列表。

## 使用方式

用户可以直接提供 PDF、Word、Markdown、LaTeX、参考文献清单或可读取的论文正文，并提出例如：

- “帮我检查这篇论文的参考文献。”
- “审计正文中的引用是否真的支持对应观点。”
- “重点看看有没有虚假文献、引用错误和过度推断。”
- “检查文内—文后对应关系和参考文献题录。”
- “形成一份正式的论文引用审查书，并生成飞书文档。”

执行时：

1. 读取用户提供的全部材料；
2. 按七阶段流程完成审计；
3. 优先解决用户点名的问题；
4. 形成完整 Markdown 报告；
5. 在工具可用时创建并回读飞书文档；
6. 向用户交付总体结论、最重要发现和真实飞书链接；若飞书失败，则交付 Markdown 并说明原因。

## 注意事项

1. 不凭记忆编造题录、DOI、原文内容或来源链接。
2. 不把搜索结果摘要、AI生成摘要或第三方转述冒充原始证据。
3. 不因没有发现问题就宣称论文不存在引用风险。
4. 不因来源暂时不可访问就直接判定文献虚假。
5. 不绕过付费墙、登录限制或版权保护。
6. 不把工作流完成与论文通过审计混为一谈。
7. 不为追求“完整感”批量生成没有实质判断的正常项。
8. 不用 HTML 替代用户要求的飞书原生文档。
9. 引用格式应结合用户指定标准或目标期刊要求判断；用户未指定时，不把细微格式差异夸大为严重问题。
10. 最终表达保持专业、明确和可执行，避免夸张的评分、虚假的精确度和没有证据的确定性结论。

## 版本说明

### 0.9

- 采用七阶段论文引用审计工作流；
- 保留全量引用结构扫描与风险优先深入核验；
- 加入引用角色判断和主张—证据实质比较；
- 支持真实性、题录、版本、撤稿、二手转引和组合引用检查；
- 强调按需获取全文证据与来源复用；
- 生成高级 Markdown 审查书，并在工具可用时创建飞书文档；
- 采用高自由度、低形式约束、结果导向的执行方式。

