# Thesis Critical Review

> thesis-critical-review — 学术论文对抗性批判审查

- Skill: `skydooooog0221/thesis-critical-review` (Agent Skill)
- Install (CLI): `npx skillmds@latest add skydooooog0221/thesis-critical-review`
- Raw SKILL.md: https://api.skillmd.com/api/skills/skydooooog0221/thesis-critical-review/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: Skydooooog0221 (https://skillmd.com/u/skydooooog0221)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/skydooooog0221/thesis-critical-review

---

# thesis-critical-review — 学术论文对抗性批判审查

> 版本：0.1.0-draft
> 创建日期：2026-04-13
> 来源：从真实论文项目多轮critical review + 答辩预演经验中提炼
> 定位：模拟答辩委员/审稿人对论文的深度攻击。纯LLM判断，无机械检测

---

## 设计哲学

这个skill的角色是**对抗者**，不是帮手。它的工作不是让论文"更好"，是找到论文中审稿人/答辩委员**最可能攻击的点**，让用户在被攻击之前先堵上。

- 不评价写作质量——只关注论证逻辑
- 不写替换文字——只给攻击路径和防御方向。写作是humanizer的领地
- 不做引用核查——假设引用是正确的（那是thesis-qc M4的事），只检查引用的论证角色
- 不做格式检查——那是thesis-qc M6的事
- 发现的问题按"审稿人会不会因为这个reject"排优先级，不按"学术上是否完美"排

---

## 触发条件

以下任一情况触发：
- 用户提到"critical review""批判审查""审稿人会怎么说""答辩会问什么""挑毛病""攻击面"
- 用户要求审查论文的讨论/局限性部分
- 用户上传研究提纲/开题报告并要求质疑
- 用户上传单章草稿并要求审查论证
- thesis-qc在Phase 8调用

---

## 三阶段模式

### `stage=design` 设计期审查

**审查对象：** Research Blueprint / 研究提纲 / 开题报告

**输入：**
- 研究蓝图文档（md/txt/docx），至少包含：研究问题、各部分分解、数据来源、方法选择
- 无需完整论文

**维度（B1-B6）：**

| # | 维度 | 核心质疑 |
|---|------|---------|
| B1 | 问题价值 | 这个问题的答案对谁有用？文献留下的gap是真gap还是别人不做是因为不值得做？如果答案是"和预期一致"，论文还有贡献吗？ |
| B2 | 方法-问题匹配 | 你选的方法能回答这个问题吗？有没有更直接的方法被跳过了？方法的固有局限是否会让结论打折到不值得做？ |
| B3 | 数据架构 | 各部分用的数据之间是什么关系？同一队列/独立队列/子集？这个关系对论证是优势还是弱点？如果是独立队列，是否需要披露？如果是子集，嵌套偏倚怎么处理？ |
| B4 | 逻辑递进 | 从第一部分到最后一部分的递进关系是"必须这个顺序"还是"看起来顺"？如果某部分结论不支持预期，后续还能立住吗？呈现顺序和研究顺序如果不同，是否需要管理？ |
| B5 | Fallback | 最可能失败的环节是什么？失败后论文还能成立吗？有Plan B吗？Plan B是降级版本（缩小scope）还是替代路径（换方法）？ |
| B6 | 攻击预演 | 如果审稿人只看摘要就写reject，最可能的理由是什么？如果答辩委员只问一个问题，最可能问什么？ |

**输出特点：**
- 这个阶段的建议可以是"换方法""重新设计队列关系""调整研究问题"——因为还没开始写，一切都能改
- ★★★发现在这个阶段的含义是"不解决这个问题就不值得往下写"

---

### `stage=drafting` 写作中审查

**审查对象：** 单章草稿（引言+方法+结果+讨论的任意组合）

**输入：**
- 单章或多章草稿（md/txt/docx）
- 可选：Research Blueprint（如果有，用于检查草稿是否偏离了蓝图）

**维度（D1-D5，章级版本）：**

| # | 维度 | 章级审查聚焦 |
|---|------|------------|
| D1 | 跨章逻辑连贯性 | 这章的引言是否承接了上一章的结论？这章的结论是否为下一章铺路？章间是否有逻辑断层？ |
| D2 | 因果与时间假设 | 这章的因果推断链条是否清晰？观察性数据是否被当作因果证据？时间尺度是否匹配？ |
| D3 | 选择偏倚与外推性 | 这章的样本筛选过程是否透明？排除标准是否合理？结论外推到什么范围？ |
| D4 | 测量效度 | 这章用的指标是否在测想测的东西？替代指标的局限是否在方法或讨论中说明？ |
| D5 | 统计方法充分性 | 计划/已用的统计方法是否匹配数据结构？假设是否满足？样本量是否足够？ |

**D6（临床解读）和D7（内容比例）在这个阶段不跑——讨论和全文结构还没成型。**

**输出特点：**
- 建议可以是"这一章的论证角度需要调整""结果section需要补充XX分析"——写作中还有调整空间
- 如果提供了Blueprint，会检查草稿是否偏离了蓝图设计，偏离本身不一定是问题，但需要记录原因

---

### `stage=final` 成文后审查

**审查对象：** 完整论文

**输入：**
- `thesis_full.txt`（完整论文）
- 可选：`study_design.md`（研究设计摘要——有则审查精度更高）
- 可选：`known_limitations.json`（用户已知局限——避免重复指出）

**维度（D1-D7，全文级）：**

| # | 维度 | 全文级审查聚焦 |
|---|------|--------------|
| D1 | 跨章逻辑连贯性 | 各章之间的递进关系是否自洽？数据来源关系是否披露？前一章的结论是否被后一章真正使用？呈现顺序与研究顺序的差异是否被管理？ |
| D2 | 因果与时间假设 | 全文的因果推断链是否一致？即时测量→长期结局的推断是否有disclaimer？中介分析/回归分析的因果暗示是否过强？ |
| D3 | 选择偏倚与外推性 | 跨章的样本嵌套关系是否交代？各章排除标准的差异是否说明？子集代表性是否讨论？ |
| D4 | 测量效度 | 同一指标在不同章节的测量精度是否一致？观察者一致性是否评估？影像终点vs临床终点是否区分？ |
| D5 | 统计方法充分性 | 各章统计方法的选择是否一致（如GEE vs logistic，患者级 vs 侧级）？不一致是否解释？敏感性分析是否覆盖关键假设？ |
| D6 | 临床/实践解读深度 | 统计显著→临床意义的转化是否完成？对临床实践的建议是否具体？还是停留在"有待进一步研究"？ |
| D7 | 内容比例恰当性 | 非核心内容是否过长？局限性是否流于形式？创新点是否overclaim？禁用词检查（首次/首个/开创性/突破性/革命性）。 |

**输出特点：**
- 这个阶段能改的有限——建议聚焦于"加disclaimer""补充一段讨论""调整措辞强度"，不建议"换方法"或"重做分析"
- ★★★发现在这个阶段的含义是"不修这个就不送审"

---

## 执行指令（Claude读这里）

当thesis-critical-review被触发时，Claude按以下流程执行。这不是给用户看的文档，是给Claude自己的操作手册。

### 总体原则

1. **你是对抗者。** 不要找"可以改进的地方"——找"审稿人会用来reject的理由"和"答辩委员会追着不放的弱点"
2. **每个发现必须有原文证据。** 引用论文原文（前后各一句+位置），不允许泛泛而谈
3. **优先级校准：** ★★★ = 审稿人会因此写major revision或reject；★★ = 会被提到但不致命；★ = 挑剔的审稿人才会提
4. **默认给攻击路径和防御方向，不写替换文字。** 当用户进入修改落地阶段并要求具体文本时，提供旧/新文本对（含精确位置），供用户判断后粘贴。主动写替换文字的边界：用户明确要求，或用户已确认防御方向后需要落地执行
5. **逐维度扫描，不要跳维度。** 即使某个维度看起来没问题，也要在覆盖确认表中标注"已扫描，0条发现"

### stage=design 各维度执行指令

**B1 问题价值**
- 视角：你是一个见过太多无聊论文的资深审稿人
- 找什么：
  - 研究问题的答案是否只有"符合预期"一种可能？如果是，论文的贡献在哪？
  - 文献gap是真的还是别人不做是因为不值得？
  - 即使结果完全符合预期，有没有方法学/数据层面的独立贡献？
- 校准：如果答案是"确认了XX和YY已经发现的东西"且没有新的方法/数据/视角，那就是★★★

**B2 方法-问题匹配**
- 视角：方法学审稿人
- 找什么：
  - 选的方法是否是回答这个问题最直接的方法？有没有更简单的替代方案被跳过？
  - 方法的固有局限（如FEA的材料假设、回顾性设计的混杂控制）是否会让结论打折到没意义？
  - 多个方法之间的逻辑链是否完整？前一个方法的输出是否真的是后一个方法需要的输入？
- 校准：如果方法的固有局限直接削弱核心结论（如"线性弹性假设让应力值不可信"），那就是★★★

**B3 数据架构**
- 视角：统计审稿人看到多队列/多数据源时的第一反应
- 找什么：
  - 各部分用的数据是同一队列、独立队列、还是子集？关系是否显式写出？
  - 如果是子集，嵌套抽样是否引入选择偏倚？
  - 如果是独立队列，纳入标准/时间段/中心的差异是否说明？
  - 如果呈现顺序和研究顺序不同，这个差异是否被管理？
- 校准示例：某论文 Ch1 和 Ch2 使用的是独立时间窗口的独立队列，但章节之间的队列关系未披露，导致漏斗叙事暗示了不存在的从属关系——这是 ★★★ 问题

**B4 逻辑递进**
- 视角：答辩委员读完全文后问"为什么是这个顺序"
- 找什么：
  - 从第一部分到最后一部分的递进关系是"必须这个顺序"还是"看起来顺"？
  - 如果某部分的结论不支持预期（如中介分析CI含0），后续的论证链是否断裂？
  - 各部分的结论是否被后续部分真正使用，还是只是"前面做了这个，接下来做那个"？
- 校准：如果删掉某一章后剩余章节的论证链不受影响，那这一章的定位需要重新审视——★★

**B5 Fallback**
- 视角：务实的导师
- 找什么：
  - 最可能失败的环节是什么？（数据不足/方法不work/结果不显著）
  - 失败后论文还能成立吗？
  - Plan B是缩小scope还是换路径？
  - 有没有"如果XX不显著就不报告"的隐性选择偏倚风险？
- 校准：如果唯一的Plan B是"那就只发两章"，★★

**B6 攻击预演**
- 视角：最刻薄的审稿人，只看摘要就写意见
- 找什么：
  - 如果只看摘要，最可能的reject理由是什么？
  - 如果答辩委员只问一个问题，最可能问什么？
  - novelty claim是否有一篇已发表的论文可以直接反驳？
- 产出：写出1-2条模拟的审稿意见（用英文reviewer comment的口吻）

### stage=final 各维度执行指令

**D1 跨章逻辑连贯性**
- 视角：读完全文后检查"三章是不是一个故事"
- 扫描位置：前言中的研究框架段、每章引言的第一段、每章讨论的最后一段、总讨论
- 找什么：
  - 前言声称的递进关系（如"先确认高危群体→锁定剂量指标→检验力学机制"），在正文中是否真正实现？
  - 前一章的具体结论（如"前移量是独立危险因素"）是否在后一章被引用和使用？
  - 数据来源关系（同一队列/独立/子集）是否在每个出现的位置都一致？
  - 呈现顺序和研究顺序如果不同，是否有显式说明？
- 校准示例：某论文队列独立性未披露 = ★★★；前后章节空间分辨率从热力图到标量的断层未讨论 = ★★

**D2 因果与时间假设**
- 视角：因果推断方法学审稿人
- 扫描位置：讨论中所有"导致""引起""介导""预测"相关的句子
- 找什么：
  - 观察性研究的数据被当作因果证据？（如"前移量导致吸收"vs"前移量与吸收相关"）
  - 即时测量→长期结局的推断是否有时间尺度disclaimer？
  - 中介分析/路径分析是否被表述为因果证据？（Baron & Kenny是相关框架，不是因果框架）
  - 回归系数β被解释为"每增加1单位X，Y增加β"——这个因果语言是否合适？
- 校准锚点：即时应力vs12月吸收的时间尺度不对称 = ★★★；中介分析CI含0但叙事暗示因果 = ★★★

**D3 选择偏倚与外推性**
- 视角：流行病学审稿人
- 扫描位置：方法中的纳入排除标准、样本流程图、讨论中的局限性段
- 找什么：
  - 各章样本的嵌套关系是否透明？（如 Ch3 是 Ch2 的子集，子集主结局阳性率 40% 显著高于全集 23.6%，代表性存疑）
  - 排除标准跨章是否一致？不一致的是否说明？
  - 缺失数据的模式是否随机？（如并发症分析n=276 vs 体积分析n=336，缺失的60例是什么人？）
  - 结论的外推范围是否清晰？（如"骨性II类患者"的结论能推到非II类吗？）
- 校准示例：分层抽样子集的代表性问题 = ★★；缺失模式未说明 = ★★

**D4 测量效度**
- 视角：测量学/方法学审稿人
- 扫描位置：方法中的测量描述、讨论中的局限性
- 找什么：
  - 核心结局指标是否真的在测想测的东西？（如净变化量指标可能掩盖同时存在的正向和负向子变化）
  - 观察者一致性（ICC/Kappa）是否评估？是内还是间？
  - 同一指标在不同章节的测量方法是否一致？（如自动处理 vs 手动处理）
  - 替代指标的局限是否在讨论中说明？（如替代终点 vs 临床终点）
- 校准示例：缺少观察者间一致性 = ★★★（答辩必问）；标量指标掩盖空间异质性 = ★★

**D5 统计方法充分性**
- 视角：统计审稿人
- 扫描位置：方法中的统计分析段、结果中的所有统计量
- 找什么：
  - 每种统计方法的前置假设是否满足？（如GEE的工作相关结构选择、卡方检验的期望频数）
  - 各章统计方法不同的（如 Ch1 用非参数检验，Ch2 用聚类/混合模型），是否解释了为什么？
  - 小样本（如n=20, n=22）的效能是否讨论？"无显著差异"是否被错误解读为"无差异"？
  - 多重比较是否校正？校正方法是否说明？
  - 敏感性分析是否覆盖了关键假设？
- 校准示例：中介分析在小样本（n<25）下效能不足 = ★★；GEE 相关结构未做敏感性检验 = ★★；小亚组比较效能 = ★★

**D6 临床/实践解读深度**
- 视角：临床医生读讨论
- 扫描位置：讨论的临床意义段、结论
- 找什么：
  - 统计显著性是否被等同于临床意义？（如 OR=1.128 统计显著，但临床上每单位暴露风险仅增 12.8%——这个增幅够改变决策吗？）
  - 对临床实践的建议是否具体？还是只说"有待进一步研究"？
  - 如果研究有直接的临床启示（如"前移量>Xmm时应特别关注TMJ"），是否写出来了？
  - 结论是否过度保守（明明数据支持一个具体结论，却缩回到"需要更多研究"）？
- 校准示例：建议太泛（如"应关注高危群体"但未定义"高危"）= ★★；小效应量的临床解读缺失 = ★

**D7 内容比例恰当性**
- 视角：主编看论文整体质量
- 扫描位置：全文，特别是讨论
- 找什么：
  - 非核心内容是否过长？（如分子生物学推测段落在一个影像/FEA论文中占了多少？）
  - 局限性section是否流于形式？（"本研究有以下不足：第一...第二..."的模板感）
  - 创新点是否overclaim？检查禁用词：首次/首个/开创性/突破性/革命性
  - 讨论是否在重复结果？（"本研究发现X"在讨论中出现几次？）
  - 各章的讨论长度是否与该章的贡献匹配？
- 校准示例：特定分子机制段在非分子学论文中占比过长 = ★★；局限性编号模板化 = ★

### 优先级校准总则

在扫描完所有维度后，用以下标准做最终优先级调整：

- **★★★的判定标准：** 审稿人会在major revision意见中写"the authors must address..."或"this is a fatal flaw"。答辩委员会追问直到你给出满意答复。如果不修，论文不应送审
- **★★的判定标准：** 审稿人会写"the authors should discuss/clarify..."。修了会显著提升论文说服力，不修也不至于reject
- **★的判定标准：** 挑剔的审稿人可能提，多数审稿人不会注意到。修了更好，时间不够可以不修
- **降级规则：** 如果论文讨论中已经自己提到了某个局限性，该发现降一级（★★★→★★）——因为审稿人看到作者已经知道就不会追着不放
- **升级规则：** 如果同一个问题在多个维度中被独立发现，升一级——这说明是系统性弱点

---

## 执行方式

### 全量扫描

跑当前stage的全部维度。

```
/thesis-critical-review stage=final
```

### 选择性扫描

只跑指定维度。

```
/thesis-critical-review stage=final dimensions=D1,D5
```

### 追问模式

用户给出具体担忧，skill围绕这个点深度挖掘，不限于预设维度。

```
/thesis-critical-review stage=final focus="我担心中介分析那段的论证力度不够"
```

---

## 输出格式

三个stage共享同一输出格式。

### critical_review_report.md

```markdown
# 批判审查报告
> 生成时间: YYYY-MM-DD HH:MM
> 技能版本: thesis-critical-review 0.1.0
> 审查阶段: design / drafting / final
> 维度范围: [B1-B6 / D1-D5 / D1-D7 / 用户选择的子集]
> 输入文件: [列表]

---

## 第一部分：优先级汇总

| # | 维度 | 问题摘要 | 位置 | 优先级 |
|---|------|---------|------|--------|
| 01 | D1 | ... | Ch2讨论, 约第400行 | ★★★ |
| 02 | D5 | ... | Ch3方法, 约第480行 | ★★★ |
| ... | | | | |

**优先级说明：**
- ★★★ = 必须处理（逻辑缺陷或答辩/审稿必问）
- ★★ = 强烈建议（显著提升论证说服力）
- ★ = 时间允许时处理（打磨）

**统计：** ★★★: N条 / ★★: N条 / ★: N条

---

## 第二部分：逐条详述

### #01 [问题标题] ★★★
**维度：** D1 跨章逻辑连贯性
**位置：** Ch2讨论, 约第400行
**原文：**
> ......前一句。**包含问题的句子或段落**。后一句......

**问题描述：**
[用审稿人/答辩委员的口吻描述这个问题]

**攻击路径：**
[审稿人最可能怎么写这条意见？答辩委员最可能怎么追问？]

**建议处理方向：**
[不写具体文字，只给方向。如"在某章引言中加一段显式说明某关键设计点及其对结论的影响"]

---
[后续条目...]

---

## 第三部分：维度覆盖确认

| 维度 | 状态 | 发现数 |
|------|------|--------|
| D1 跨章逻辑 | ✅ 已扫描 | 3 |
| D2 因果假设 | ✅ 已扫描 | 2 |
| D3 选择偏倚 | ✅ 已扫描 | 1 |
| D4 测量效度 | ✅ 已扫描 | 2 |
| D5 统计充分性 | ✅ 已扫描 | 4 |
| D6 临床解读 | ✅ 已扫描 | 2 |
| D7 内容比例 | ✅ 已扫描 | 1 |

---

## 第四部分：已知局限声明

本审查基于LLM对论文文本的理解，受以下限制：
- 无法验证原始数据的正确性（那是thesis-qc M1-M4的职责）
- 无法评估图表与数据的一致性（那是thesis-qc M7的职责）
- 领域判断基于训练数据，可能遗漏高度专业化的方法学问题
- 审查结果是"供决策参考"，不是审稿意见本身
```

---

## 与thesis-qc的接口

- thesis-qc在Phase 8调用 `stage=final`
- 输出 `critical_review_report.md` 注册到MASTER_QC.md文件清单
- ★★★发现进入MASTER的Action Items表（状态="待用户确认"）
- thesis-qc不参与design和drafting阶段——那两个阶段QC管线还没启动

## 独立调用

不经过thesis-qc直接触发：
- `/thesis-critical-review` — 自动检测输入内容判断stage
- `/thesis-critical-review stage=design` — 显式指定阶段
- "帮我审查这个研究提纲" → stage=design
- "看看这章讨论有没有逻辑问题" → stage=drafting
- "审稿人会怎么攻击我的论文" → stage=final

---

## 迭代计划

- v0.1: SKILL.md设计文档（当前）
- v0.2: stage=final 的prompt工程和维度定义细化
- v0.3: stage=design 和 stage=drafting 实现
- v0.4: 在真实论文上验证三个stage
- v1.0: 英文论文支持 + 领域自适应（医学/CS/交叉）

