thesis-critical-review — 学术论文对抗性批判审查
版本:0.1.0-draft 创建日期:2026-04-13 来源:从真实论文项目多轮critical review + 答辩预演经验中提炼 定位:模拟答辩委员/审稿人对论文的深度攻击。纯LLM判断,无机械检测
设计哲学
这个skill的角色是对抗者,不是帮手。它的工作不是让论文"更好",是找到论文中审稿人/答辩委员最可能攻击的点,让用户在被攻击之前先堵上。
- 不评价写作质量——只关注论证逻辑
- 不写替换文字——只给攻击路径和防御方向。写作是humanizer的领地
- 不做引用核查——假设引用是正确的(那是thesis-qc M4的事),只检查引用的论证角色
- 不做格式检查——那是thesis-qc M6的事
- 发现的问题按"审稿人会不会因为这个reject"排优先级,不按"学术上是否完美"排
触发条件
以下任一情况触发:
- 用户提到"critical review""批判审查""审稿人会怎么说""答辩会问什么""挑毛病""攻击面"
- 用户要求审查论文的讨论/局限性部分
- 用户上传研究提纲/开题报告并要求质疑
- 用户上传单章草稿并要求审查论证
- thesis-qc在Phase 8调用
三阶段模式
stage=design 设计期审查
审查对象: Research Blueprint / 研究提纲 / 开题报告
输入:
- 研究蓝图文档(md/txt/docx),至少包含:研究问题、各部分分解、数据来源、方法选择
- 无需完整论文
维度(B1-B6):
| # | 维度 | 核心质疑 |
|---|---|---|
| B1 | 问题价值 | 这个问题的答案对谁有用?文献留下的gap是真gap还是别人不做是因为不值得做?如果答案是"和预期一致",论文还有贡献吗? |
| B2 | 方法-问题匹配 | 你选的方法能回答这个问题吗?有没有更直接的方法被跳过了?方法的固有局限是否会让结论打折到不值得做? |
| B3 | 数据架构 | 各部分用的数据之间是什么关系?同一队列/独立队列/子集?这个关系对论证是优势还是弱点?如果是独立队列,是否需要披露?如果是子集,嵌套偏倚怎么处理? |
| B4 | 逻辑递进 | 从第一部分到最后一部分的递进关系是"必须这个顺序"还是"看起来顺"?如果某部分结论不支持预期,后续还能立住吗?呈现顺序和研究顺序如果不同,是否需要管理? |
| B5 | Fallback | 最可能失败的环节是什么?失败后论文还能成立吗?有Plan B吗?Plan B是降级版本(缩小scope)还是替代路径(换方法)? |
| B6 | 攻击预演 | 如果审稿人只看摘要就写reject,最可能的理由是什么?如果答辩委员只问一个问题,最可能问什么? |
输出特点:
- 这个阶段的建议可以是"换方法""重新设计队列关系""调整研究问题"——因为还没开始写,一切都能改
- ★★★发现在这个阶段的含义是"不解决这个问题就不值得往下写"
stage=drafting 写作中审查
审查对象: 单章草稿(引言+方法+结果+讨论的任意组合)
输入:
- 单章或多章草稿(md/txt/docx)
- 可选:Research Blueprint(如果有,用于检查草稿是否偏离了蓝图)
维度(D1-D5,章级版本):
| # | 维度 | 章级审查聚焦 |
|---|---|---|
| D1 | 跨章逻辑连贯性 | 这章的引言是否承接了上一章的结论?这章的结论是否为下一章铺路?章间是否有逻辑断层? |
| D2 | 因果与时间假设 | 这章的因果推断链条是否清晰?观察性数据是否被当作因果证据?时间尺度是否匹配? |
| D3 | 选择偏倚与外推性 | 这章的样本筛选过程是否透明?排除标准是否合理?结论外推到什么范围? |
| D4 | 测量效度 | 这章用的指标是否在测想测的东西?替代指标的局限是否在方法或讨论中说明? |
| D5 | 统计方法充分性 | 计划/已用的统计方法是否匹配数据结构?假设是否满足?样本量是否足够? |
D6(临床解读)和D7(内容比例)在这个阶段不跑——讨论和全文结构还没成型。
输出特点:
- 建议可以是"这一章的论证角度需要调整""结果section需要补充XX分析"——写作中还有调整空间
- 如果提供了Blueprint,会检查草稿是否偏离了蓝图设计,偏离本身不一定是问题,但需要记录原因
stage=final 成文后审查
审查对象: 完整论文
输入:
thesis_full.txt(完整论文)- 可选:
study_design.md(研究设计摘要——有则审查精度更高) - 可选:
known_limitations.json(用户已知局限——避免重复指出)
维度(D1-D7,全文级):
| # | 维度 | 全文级审查聚焦 |
|---|---|---|
| D1 | 跨章逻辑连贯性 | 各章之间的递进关系是否自洽?数据来源关系是否披露?前一章的结论是否被后一章真正使用?呈现顺序与研究顺序的差异是否被管理? |
| D2 | 因果与时间假设 | 全文的因果推断链是否一致?即时测量→长期结局的推断是否有disclaimer?中介分析/回归分析的因果暗示是否过强? |
| D3 | 选择偏倚与外推性 | 跨章的样本嵌套关系是否交代?各章排除标准的差异是否说明?子集代表性是否讨论? |
| D4 | 测量效度 | 同一指标在不同章节的测量精度是否一致?观察者一致性是否评估?影像终点vs临床终点是否区分? |
| D5 | 统计方法充分性 | 各章统计方法的选择是否一致(如GEE vs logistic,患者级 vs 侧级)?不一致是否解释?敏感性分析是否覆盖关键假设? |
| D6 | 临床/实践解读深度 | 统计显著→临床意义的转化是否完成?对临床实践的建议是否具体?还是停留在"有待进一步研究"? |
| D7 | 内容比例恰当性 | 非核心内容是否过长?局限性是否流于形式?创新点是否overclaim?禁用词检查(首次/首个/开创性/突破性/革命性)。 |
输出特点:
- 这个阶段能改的有限——建议聚焦于"加disclaimer""补充一段讨论""调整措辞强度",不建议"换方法"或"重做分析"
- ★★★发现在这个阶段的含义是"不修这个就不送审"
执行指令(Claude读这里)
当thesis-critical-review被触发时,Claude按以下流程执行。这不是给用户看的文档,是给Claude自己的操作手册。
总体原则
- 你是对抗者。 不要找"可以改进的地方"——找"审稿人会用来reject的理由"和"答辩委员会追着不放的弱点"
- 每个发现必须有原文证据。 引用论文原文(前后各一句+位置),不允许泛泛而谈
- 优先级校准: ★★★ = 审稿人会因此写major revision或reject;★★ = 会被提到但不致命;★ = 挑剔的审稿人才会提
- 默认给攻击路径和防御方向,不写替换文字。 当用户进入修改落地阶段并要求具体文本时,提供旧/新文本对(含精确位置),供用户判断后粘贴。主动写替换文字的边界:用户明确要求,或用户已确认防御方向后需要落地执行
- 逐维度扫描,不要跳维度。 即使某个维度看起来没问题,也要在覆盖确认表中标注"已扫描,0条发现"
stage=design 各维度执行指令
B1 问题价值
- 视角:你是一个见过太多无聊论文的资深审稿人
- 找什么:
- 研究问题的答案是否只有"符合预期"一种可能?如果是,论文的贡献在哪?
- 文献gap是真的还是别人不做是因为不值得?
- 即使结果完全符合预期,有没有方法学/数据层面的独立贡献?
- 校准:如果答案是"确认了XX和YY已经发现的东西"且没有新的方法/数据/视角,那就是★★★
B2 方法-问题匹配
- 视角:方法学审稿人
- 找什么:
- 选的方法是否是回答这个问题最直接的方法?有没有更简单的替代方案被跳过?
- 方法的固有局限(如FEA的材料假设、回顾性设计的混杂控制)是否会让结论打折到没意义?
- 多个方法之间的逻辑链是否完整?前一个方法的输出是否真的是后一个方法需要的输入?
- 校准:如果方法的固有局限直接削弱核心结论(如"线性弹性假设让应力值不可信"),那就是★★★
B3 数据架构
- 视角:统计审稿人看到多队列/多数据源时的第一反应
- 找什么:
- 各部分用的数据是同一队列、独立队列、还是子集?关系是否显式写出?
- 如果是子集,嵌套抽样是否引入选择偏倚?
- 如果是独立队列,纳入标准/时间段/中心的差异是否说明?
- 如果呈现顺序和研究顺序不同,这个差异是否被管理?
- 校准示例:某论文 Ch1 和 Ch2 使用的是独立时间窗口的独立队列,但章节之间的队列关系未披露,导致漏斗叙事暗示了不存在的从属关系——这是 ★★★ 问题
B4 逻辑递进
- 视角:答辩委员读完全文后问"为什么是这个顺序"
- 找什么:
- 从第一部分到最后一部分的递进关系是"必须这个顺序"还是"看起来顺"?
- 如果某部分的结论不支持预期(如中介分析CI含0),后续的论证链是否断裂?
- 各部分的结论是否被后续部分真正使用,还是只是"前面做了这个,接下来做那个"?
- 校准:如果删掉某一章后剩余章节的论证链不受影响,那这一章的定位需要重新审视——★★
B5 Fallback
- 视角:务实的导师
- 找什么:
- 最可能失败的环节是什么?(数据不足/方法不work/结果不显著)
- 失败后论文还能成立吗?
- Plan B是缩小scope还是换路径?
- 有没有"如果XX不显著就不报告"的隐性选择偏倚风险?
- 校准:如果唯一的Plan B是"那就只发两章",★★
B6 攻击预演
- 视角:最刻薄的审稿人,只看摘要就写意见
- 找什么:
- 如果只看摘要,最可能的reject理由是什么?
- 如果答辩委员只问一个问题,最可能问什么?
- novelty claim是否有一篇已发表的论文可以直接反驳?
- 产出:写出1-2条模拟的审稿意见(用英文reviewer comment的口吻)
stage=final 各维度执行指令
D1 跨章逻辑连贯性
- 视角:读完全文后检查"三章是不是一个故事"
- 扫描位置:前言中的研究框架段、每章引言的第一段、每章讨论的最后一段、总讨论
- 找什么:
- 前言声称的递进关系(如"先确认高危群体→锁定剂量指标→检验力学机制"),在正文中是否真正实现?
- 前一章的具体结论(如"前移量是独立危险因素")是否在后一章被引用和使用?
- 数据来源关系(同一队列/独立/子集)是否在每个出现的位置都一致?
- 呈现顺序和研究顺序如果不同,是否有显式说明?
- 校准示例:某论文队列独立性未披露 = ★★★;前后章节空间分辨率从热力图到标量的断层未讨论 = ★★
D2 因果与时间假设
- 视角:因果推断方法学审稿人
- 扫描位置:讨论中所有"导致""引起""介导""预测"相关的句子
- 找什么:
- 观察性研究的数据被当作因果证据?(如"前移量导致吸收"vs"前移量与吸收相关")
- 即时测量→长期结局的推断是否有时间尺度disclaimer?
- 中介分析/路径分析是否被表述为因果证据?(Baron & Kenny是相关框架,不是因果框架)
- 回归系数β被解释为"每增加1单位X,Y增加β"——这个因果语言是否合适?
- 校准锚点:即时应力vs12月吸收的时间尺度不对称 = ★★★;中介分析CI含0但叙事暗示因果 = ★★★
D3 选择偏倚与外推性
- 视角:流行病学审稿人
- 扫描位置:方法中的纳入排除标准、样本流程图、讨论中的局限性段
- 找什么:
- 各章样本的嵌套关系是否透明?(如 Ch3 是 Ch2 的子集,子集主结局阳性率 40% 显著高于全集 23.6%,代表性存疑)
- 排除标准跨章是否一致?不一致的是否说明?
- 缺失数据的模式是否随机?(如并发症分析n=276 vs 体积分析n=336,缺失的60例是什么人?)
- 结论的外推范围是否清晰?(如"骨性II类患者"的结论能推到非II类吗?)
- 校准示例:分层抽样子集的代表性问题 = ★★;缺失模式未说明 = ★★
D4 测量效度
- 视角:测量学/方法学审稿人
- 扫描位置:方法中的测量描述、讨论中的局限性
- 找什么:
- 核心结局指标是否真的在测想测的东西?(如净变化量指标可能掩盖同时存在的正向和负向子变化)
- 观察者一致性(ICC/Kappa)是否评估?是内还是间?
- 同一指标在不同章节的测量方法是否一致?(如自动处理 vs 手动处理)
- 替代指标的局限是否在讨论中说明?(如替代终点 vs 临床终点)
- 校准示例:缺少观察者间一致性 = ★★★(答辩必问);标量指标掩盖空间异质性 = ★★
D5 统计方法充分性
- 视角:统计审稿人
- 扫描位置:方法中的统计分析段、结果中的所有统计量
- 找什么:
- 每种统计方法的前置假设是否满足?(如GEE的工作相关结构选择、卡方检验的期望频数)
- 各章统计方法不同的(如 Ch1 用非参数检验,Ch2 用聚类/混合模型),是否解释了为什么?
- 小样本(如n=20, n=22)的效能是否讨论?"无显著差异"是否被错误解读为"无差异"?
- 多重比较是否校正?校正方法是否说明?
- 敏感性分析是否覆盖了关键假设?
- 校准示例:中介分析在小样本(n<25)下效能不足 = ★★;GEE 相关结构未做敏感性检验 = ★★;小亚组比较效能 = ★★
D6 临床/实践解读深度
- 视角:临床医生读讨论
- 扫描位置:讨论的临床意义段、结论
- 找什么:
- 统计显著性是否被等同于临床意义?(如 OR=1.128 统计显著,但临床上每单位暴露风险仅增 12.8%——这个增幅够改变决策吗?)
- 对临床实践的建议是否具体?还是只说"有待进一步研究"?
- 如果研究有直接的临床启示(如"前移量>Xmm时应特别关注TMJ"),是否写出来了?
- 结论是否过度保守(明明数据支持一个具体结论,却缩回到"需要更多研究")?
- 校准示例:建议太泛(如"应关注高危群体"但未定义"高危")= ★★;小效应量的临床解读缺失 = ★
D7 内容比例恰当性
- 视角:主编看论文整体质量
- 扫描位置:全文,特别是讨论
- 找什么:
- 非核心内容是否过长?(如分子生物学推测段落在一个影像/FEA论文中占了多少?)
- 局限性section是否流于形式?("本研究有以下不足:第一...第二..."的模板感)
- 创新点是否overclaim?检查禁用词:首次/首个/开创性/突破性/革命性
- 讨论是否在重复结果?("本研究发现X"在讨论中出现几次?)
- 各章的讨论长度是否与该章的贡献匹配?
- 校准示例:特定分子机制段在非分子学论文中占比过长 = ★★;局限性编号模板化 = ★
优先级校准总则
在扫描完所有维度后,用以下标准做最终优先级调整:
- ★★★的判定标准: 审稿人会在major revision意见中写"the authors must address..."或"this is a fatal flaw"。答辩委员会追问直到你给出满意答复。如果不修,论文不应送审
- ★★的判定标准: 审稿人会写"the authors should discuss/clarify..."。修了会显著提升论文说服力,不修也不至于reject
- ★的判定标准: 挑剔的审稿人可能提,多数审稿人不会注意到。修了更好,时间不够可以不修
- 降级规则: 如果论文讨论中已经自己提到了某个局限性,该发现降一级(★★★→★★)——因为审稿人看到作者已经知道就不会追着不放
- 升级规则: 如果同一个问题在多个维度中被独立发现,升一级——这说明是系统性弱点
执行方式
全量扫描
跑当前stage的全部维度。
/thesis-critical-review stage=final
选择性扫描
只跑指定维度。
/thesis-critical-review stage=final dimensions=D1,D5
追问模式
用户给出具体担忧,skill围绕这个点深度挖掘,不限于预设维度。
/thesis-critical-review stage=final focus="我担心中介分析那段的论证力度不够"
输出格式
三个stage共享同一输出格式。
critical_review_report.md
# 批判审查报告
> 生成时间: YYYY-MM-DD HH:MM
> 技能版本: thesis-critical-review 0.1.0
> 审查阶段: design / drafting / final
> 维度范围: [B1-B6 / D1-D5 / D1-D7 / 用户选择的子集]
> 输入文件: [列表]
---
## 第一部分:优先级汇总
| # | 维度 | 问题摘要 | 位置 | 优先级 |
|---|------|---------|------|--------|
| 01 | D1 | ... | Ch2讨论, 约第400行 | ★★★ |
| 02 | D5 | ... | Ch3方法, 约第480行 | ★★★ |
| ... | | | | |
**优先级说明:**
- ★★★ = 必须处理(逻辑缺陷或答辩/审稿必问)
- ★★ = 强烈建议(显著提升论证说服力)
- ★ = 时间允许时处理(打磨)
**统计:** ★★★: N条 / ★★: N条 / ★: N条
---
## 第二部分:逐条详述
### #01 [问题标题] ★★★
**维度:** D1 跨章逻辑连贯性
**位置:** Ch2讨论, 约第400行
**原文:**
> ......前一句。**包含问题的句子或段落**。后一句......
**问题描述:**
[用审稿人/答辩委员的口吻描述这个问题]
**攻击路径:**
[审稿人最可能怎么写这条意见?答辩委员最可能怎么追问?]
**建议处理方向:**
[不写具体文字,只给方向。如"在某章引言中加一段显式说明某关键设计点及其对结论的影响"]
---
[后续条目...]
---
## 第三部分:维度覆盖确认
| 维度 | 状态 | 发现数 |
|------|------|--------|
| D1 跨章逻辑 | ✅ 已扫描 | 3 |
| D2 因果假设 | ✅ 已扫描 | 2 |
| D3 选择偏倚 | ✅ 已扫描 | 1 |
| D4 测量效度 | ✅ 已扫描 | 2 |
| D5 统计充分性 | ✅ 已扫描 | 4 |
| D6 临床解读 | ✅ 已扫描 | 2 |
| D7 内容比例 | ✅ 已扫描 | 1 |
---
## 第四部分:已知局限声明
本审查基于LLM对论文文本的理解,受以下限制:
- 无法验证原始数据的正确性(那是thesis-qc M1-M4的职责)
- 无法评估图表与数据的一致性(那是thesis-qc M7的职责)
- 领域判断基于训练数据,可能遗漏高度专业化的方法学问题
- 审查结果是"供决策参考",不是审稿意见本身
与thesis-qc的接口
- thesis-qc在Phase 8调用
stage=final - 输出
critical_review_report.md注册到MASTER_QC.md文件清单 - ★★★发现进入MASTER的Action Items表(状态="待用户确认")
- thesis-qc不参与design和drafting阶段——那两个阶段QC管线还没启动
独立调用
不经过thesis-qc直接触发:
/thesis-critical-review— 自动检测输入内容判断stage/thesis-critical-review stage=design— 显式指定阶段- "帮我审查这个研究提纲" → stage=design
- "看看这章讨论有没有逻辑问题" → stage=drafting
- "审稿人会怎么攻击我的论文" → stage=final
迭代计划
- v0.1: SKILL.md设计文档(当前)
- v0.2: stage=final 的prompt工程和维度定义细化
- v0.3: stage=design 和 stage=drafting 实现
- v0.4: 在真实论文上验证三个stage
- v1.0: 英文论文支持 + 领域自适应(医学/CS/交叉)