论文同行评审
把同行评审视为有边界的科学评价。先确认是否有权使用 AI 和处理稿件,再从稿件事实建立证据链;不以流畅措辞、通用总分或个人偏好替代方法学判断。
1. 审查伦理、授权与范围
先确认以下事项;缺失但会改变审查权限或结论时停下询问。
- 稿件状态:公开论文或预印本、作者自查稿,还是期刊保密投稿。
- 期刊要求:reviewer instructions、评价标准、审稿模式、轮次、截止时间、AI 使用与披露政策。
- 审查资格:用户是否获授权,是否存在利益冲突,哪些主题在专业范围内,是否需要统计或其他专科审稿人。
- 审查范围:正文、补充材料、报告清单、方案、注册、统计分析计划、数据、代码和既往轮次中实际提供了哪些材料。
处理保密投稿时必须遵守:
- 未确认期刊允许 AI 辅助及其披露要求时,不继续正式审稿。
- 不把稿件、标题、作者、独特短语、未发表结果或原始数据上传到新的外部服务,也不用这些内容进行公开网络检索。
- 不尝试识别双盲作者,不联系作者,不让未经期刊许可的第三方参与。
- 疑似不端只以事实和位置告知编辑,不自行调查、定罪或向作者公开指控。
公开稿或作者本人提供的自查稿可继续,但仍声明输入范围和无法核验项。
2. 确认唯一稿件和审查要求
多个候选稿件或轮次并存时,先确认本轮采用的唯一版本。记录:
稿件与轮次 / 文章类型和研究设计 / 期刊或目标读者 / 提供的附件 / 未提供的关键材料 / 允许的外部核验 / 输出语言和格式 / 是否要求推荐结论
完整同行评审应读取正文、表图、补充材料和期刊表单。PDF 或 Word 分别用 pdf 或 docx 提取内容,并核对页码、表格、脚注、公式、图例和补充材料;不能只依据摘要或纯文本抽取结果审完整稿。用户只要求一个章节、一个统计问题或一组可定位意见时按 L 局部审查:读取目标内容、其直接引用的方法/结果/表图和判断所需上下文,明确未审范围,不为给出局部意见强制通读全文或生成完整 reviewer report。
3. 整理稿件内容及证据对应关系
在形成评价前,根据稿件原文整理以下内容:
研究问题与 estimand / 设计、时间零点和场景 / 人群与样本流 / 暴露、干预、比较和结局 / 分析集与缺失 / 主要方法 / 主次与探索性结果 / 表图和补充材料 / 主要论断 / 注册、方案、伦理和数据代码声明
将每项主要论断与相应方法、数据摘要、结果和表图逐项对应,并明确区分:
- 稿件直接报告的事实;
- 根据稿件进行的可复核计算或一致性检查;
- 审稿人的方法学推断;
- 外部规范或文献支持的判断;
- 因输入缺失而无法判断的事项。
4. 分层审查
读取 references/review-criteria.md 中与当前范围适用的部分;生成完整审稿报告时再读取 references/report-template.md。按文章类型和实际审查问题读取 references/reporting-guidelines.md,识别当前适用的报告规范和方法学评价工具。
完整同行评审依次执行四轮,避免边读边给出失去上下文的零散意见;L 只执行与目标问题及其直接依赖有关的轮次,并声明其它维度未审:
- 可评审性与报告完整性:研究类型、问题、方法、样本流和主要结果是否报告到足以评价;报告清单缺项只先记为
reporting gap。 - 数据、方法与统计:核对稿内数字、分母、定义、时间顺序、设计、偏倚、模型适配、缺失、多重性、不确定性、诊断与验证。
- 结果与论断:检查主次层级、阴性结果、表图、敏感性分析、因果或推广措辞是否与证据一致。
- 透明度、伦理、语言与呈现:检查注册和方案偏离、伦理与利益声明、数据代码可用性、术语、结构、可复现性和妨碍理解的语言问题。
量化稿件同时读取 ../academic-publishing/references/statistical-reporting.md,按研究问题、estimand、分析集、方法、结果、表图和结论双向核对。不得用单个通用阈值代替对样本量、事件数、模型复杂度、估计精度和验证设计的整体判断。
5. 区分数据核验深度
| 实际输入 | 允许的结论 |
|---|---|
| 只有稿件 | 核对稿内样本流、分母、比例、估计值、区间、P 值、单位、表图和章节一致性;异常数值只作为需解释的信号 |
| 稿件加补充材料、注册或方案 | 进一步核对预设终点、分析集、时间、偏离和补充结果 |
| 用户授权的数据与代码 | 保持原始数据只读;项目级链路交给 epi-project-audit,指定复算交给对应 R/Python 执行层,实跑后把证据返回本报告 |
没有原始数据时不得写“数据真实”“已复现”或“无数据错误”。没有执行代码时不得把公式目测称为结果复算。
6. 建立问题清单
每条问题使用唯一 ID,并记录:
类型 / 严重度 / 稿件位置 / 观察到的事实 / 判断依据 / 对有效性或解释的影响 / 最小可行动请求 / 核验状态
类型使用以下集合:
reporting gap:缺少信息,暂时无法判断做法是否正确;inconsistency:数字、定义、方向、时间或表图互相冲突;method/statistics:设计、偏倚控制或分析本身存在可说明的缺陷;interpretation:结论、因果、临床意义或可推广性超过证据;language/presentation:确实妨碍理解、复现或准确解释;ethics/editor-only:需编辑保密处理的伦理、完整性或利益冲突信号。
严重度按影响定义,不按意见篇幅定义:
major:可能改变主要结论、有效性、偏倚、可解释性或复现性,或使主要主张目前无法判断;minor:不改变主要推断,但影响清晰度、完整性、精确性或呈现;query:关键信息含混,作者回答后才能判定严重度。
额外分析或实验必须标明是“支撑当前主张所必需”还是“仅能扩展或强化”。不要求超出稿件问题和目标范围的新研究,不以建议引用审稿人本人工作增加引文。
7. 生成报告
完整同行评审使用 references/report-template.md 的结构,至少包含审查依据与限制、稿件概述、优点、major comments、minor comments、覆盖矩阵和未核验项。L 局部审查只交付可定位意见、依据、影响、最小修订请求及明确的未审范围,不补写全文概述、优点、覆盖矩阵或推荐结论来伪装成完整报告。
- 只有期刊表单或用户明确要求时给 accept/revise/reject 或数字评分,并严格使用该期刊定义;有效性与期刊优先级分开说明。
- 只有存在真实敏感事项或期刊要求时写 confidential comments to the editor;科学评价原则上同时出现在作者可见部分,二者不得矛盾。
- 语言意见聚焦可理解性、术语、逻辑和论断强度,不逐句改写基本清楚的稿件,不把非母语表达当作科学质量替代指标。
- 输出 Word 或 PDF 时分别交给
docx或pdf;交付前可用academic-humanizer仅校准专业语气、结构和论断强度,不得改变事实、严重度或科学判断。
8. 反向核验后交付
完整同行评审逐项确认下列内容;L 只核对目标意见及其直接依据,并明确哪些维度、材料和结论没有审查:
- 每条 major comment 都能定位到稿件或已核验外部标准,并说明为何影响主要判断;
reporting gap没有被写成已证实的方法错误,疑似完整性问题没有被写成不端结论;- 所有数字、引文、期刊要求和指南版本均来自真实输入或已核验来源;
- 意见无重复、严重度一致,作者问题与建议一一对应;
- 必需的额外工作与可选扩展已分开,未用个人风格偏好或显著性结果决定评价;
- 数据、方法、统计、解释、报告、语言和伦理各维度均写明发现或“在已审范围内未见实质问题”;
- 明确列出未提供材料、专业范围外内容和未实际复核的公式、代码、原始数据或参考文献;
- AI 使用和披露符合期刊政策,报告没有泄露保密信息或暴露双盲身份。