# Thesis Deai Review

> 审查中文学位论文（尤其 MEM/工程管理类实证改进论文）的模板化表达、证据薄弱点和"AI 味"风险，让它回到真实材料和专业硕士论文语体。 核心是以真实通过的同类论文为体裁基准，再让确定性扫描脚本与隔离 AI 判断并行，合并证据后定向修改。 当用户问"像不像 AI 写的""哪里太模板化""证据链哪里薄""脚本和AI并行审查""润色得像学生论文"时使用。 分工（表达风险三角）：正向语体写法（句式/引号/段落形态）→ thesis-style；AIGC 检测报告 （PaperYY/PaperPass/知网 报告解析+复核闭环）→ aigc-reduce-playbook；本 skill 专做"像不像 AI"的**判定** 与定向修改边界，不承诺平台结果。

- Skill: `gxgeek-n/thesis-deai-review` (Agent Skill, multi-file: 8 files)
- Install (CLI): `npx skillmds@latest add gxgeek-n/thesis-deai-review`
- Raw SKILL.md: https://api.skillmd.com/api/skills/gxgeek-n/thesis-deai-review/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: gxgeek-n (https://skillmd.com/u/gxgeek-n)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/gxgeek-n/thesis-deai-review

---


# thesis-deai-review —— 论文模板化表达与 AI 味风险审查

把一篇中文学位论文中“过度模板化、证据链太薄、论证太顺滑”的位置找出来，回到真实材料和专业硕士论文语体上修。
**不是**做表面文字替换，也**不是**改成大白话，更不是承诺任何检测平台给出特定结果。

## 一条最重要的原则（本方法论的核心）

> **先找一篇同专业、同体裁、已通过答辩的真人论文当"基准"，用它校准"什么是 AI 痕迹"。**

很多"看起来像 AI"的特征，其实是**体裁规定动作**，真人论文一模一样——改掉反而更不规范、更可疑。
实测对照（MEM 质量改进类论文）发现，以下**全是体裁规范，不要动**：

- 三个改进章高度平行（问题→原因→方案→实施→效果→本章小结）
- "本章小结"复述式（"本章围绕……完成了……下一章将……"）
- 摘要以"随着……"开头、六段式（背景→对象→方法→问题→结果→结论）
- 程度副词"有效/显著/全面/系统"高频（真人论文往往用得**更多**）
- 结论"研究结论 + 研究展望"二段式、理论/标准映射表、方案多标准优选表

## 真正的 AI 指纹（这才是要改的）

针对**实证/数据驱动**的改进类论文，AI 味集中在"数字和论证太完美"，而非"空话连篇"：

1. **统计过度武装且全部完美** ★最强信号★：几乎每个指标都做 t 检验，且
   **全部 p<0.001、全部 |Cohen's d|>1.0、95%CI 全部不含 0**；甚至对"系统埋点的
   总体计数"（如某率、某分位延迟等）也套样本 t 检验。真人论文几乎不会这样。
2. **叙事与数据表自相矛盾**：正文写了波折（如大促性能回落、灰度超标、试点指标短暂下跌），
   但趋势表/效果表却一条平滑单调线——说明"叙事"和"数据"是两套流程分别生成、没对账。
3. **数字过于工整**：满意度全挤在某个窄区间（如 4.0–4.4）、占比恰好凑成 80%/100%、
   权重恰好是 0.05 的整数倍、效应量随基线"完美单调对应"。
4. **诊断指标教科书式整齐**：回归里 VIF 全部刚好 <5、R² 是整数、Shapiro p 刚好不拒绝、
   Cook's 远小于阈值——真实回归通常至少有一项处于临界、有变量因共线性掉出来。
5. **"直接给方案"无权衡**：方案设计直接给"方案一/二/三"，没有备选、没有取舍、没有优选过程。
6. **空泛万能句**：换个公司/行业也成立的过渡句、"为……提供借鉴"式安全表态（少量是体裁，扎堆才是问题）。

## 去 AI 味的标准动作（保持正式学术书面语！）

> ⚠️ **最大的坑**：去 AI 味 ≠ 改成口语。把"本章完成了……"改成"回头看，这章踩了几个坑"
> 这种"人话话术"会被导师一眼看穿、更不像论文。**始终用正式书面语，只去机械模板与完美感。**

- **统计收敛**：只对"真正抽样的主观指标（满意度类）"做 t 检验；系统计数/比例/分位数指标
  改用"监控趋势 + 描述性变化幅度"呈现（表里 t/p/d 留空标"监控指标"）。删掉"所有指标
  p<0.001、d>1.0、CI 均不含 0"这类自夸句。——这一步**单独就能拆掉最强 AI 信号**，且方法更严谨。
- **修矛盾**：让数据表反映正文已写的波折（用真实事件如大促/灰度解释），消除"叙事-数据"不一致。
- **保留真实的不完美**：真实数据中存在未达标指标、较小效应量、不显著变量、
  共线性或实施波折时，诚实保留并解释；如果不存在，不得为了“像真人”人为改数、
  制造临界统计量或虚构失败。
- **补"备选→多标准评价→优选"**：在真有互斥路径的方案处（如架构/技术路线选型），仿真人论文加
  备选方案 + 5 维评分表 + 优选结论（结论须与实际实施一致）。互补型措施（标准+流程+分析一起上）**不要**硬套优选。
- **保留真实素材**：用户访谈原话、踩坑/事故复盘、反直觉发现、诚实的局限——**这些是全文最不像 AI 的部分，务必留**。
- **底线**：**不替作者编造"真实数据"**。脱敏/示意数据只须做到"全文内部自洽 + 符合常识"；
  真正的数据真实性问题（如表与正文冲突）要指出来交作者定，不要粉饰。

## 推荐流程

1. **取基准**：拿到一篇同类已过答辩论文（docx/pdf），扒它的结构、小结、摘要、数据呈现方式、套话频次。
2. **冻结快照**：记录当前提交、论文版本和扫描范围；两路必须读取同一快照。
3. **隔离并行**：读取 `references/parallel-script-ai-audit.md`，同时启动确定性脚本
   与独立 AI 判断。AI 在提交结果前不得读取脚本报告，脚本也不接收 AI 先验。
4. **合并判定**：优先处理高级泄漏和两路交集；低级脚本命中若 AI/范文认为合理则保留。
5. **定向修改**：只改有定位和证据的问题，全篇联动保持数字、引用与术语自洽。
6. **重新并行**：在新快照上再跑两路，确认未引入新矛盾或口语化。
7. **可视化复核**：用 `thesis-docx` 的"渲染核对"把 docx 渲成图逐页看（表格/数据/封面）。

## 配套脚本

`scripts/ai_tell_scan.py` —— 确定性扫描器（不下结论、不自动修改）：

- 递归扫描 `.tex/.md/.txt`，给出文件、行号、规则、严重度和上下文；
- 检查本机路径、内部目录、路线编号、执行日志和生成过程泄漏；
- 统计模板句密度、段落长度均匀度、非标准缩写重复；
- 检查 p 值和效应量过度集中的线索；
- 输出 JSON 与 Markdown，可用 `--fail-on high` 把高级泄漏变成机械门禁。

```bash
python3 .claude/skills/thesis-deai-review/scripts/ai_tell_scan.py chapters/ \
  --json-out .project/07_审校记录/deai-script-report.json \
  --md-out .project/07_审校记录/deai-script-report.md
```

规则位于 `assets/deai-patterns.json`；脚本报告结构见
`assets/deai-script-report.schema.json`；独立 AI 输出结构见
`assets/deai-ai-review.schema.json`。

## 经验校准表（MEM 质量改进类，实测）

| 现象 | 是 AI 痕迹吗 | 处理 |
|---|---|---|
| 三章平行结构 / 复述式小结 / "随着"开头摘要 | 否，体裁规范 | 保留 |
| 程度副词"有效/显著"高频 | 否（真人更多） | 保留 |
| 理论映射表 / 备选优选表 | 否，体裁规范 | 保留/补齐 |
| 全部指标 p<0.001、d>1.0、CI 不含 0 | **是，最强信号** | 统计收敛 |
| 叙事有波折但数据表全平滑 | **是** | 让表反映波折 |
| 满意度全 4.0–4.4 / 占比凑 80% / 权重全 0.05 倍 | **是** | 去整、注入不完美 |
| VIF 全 <5、R² 整数、诊断全中段 | **是** | 让一项临界并讨论 |
| 方案直接给答案无备选 | **是** | 补备选-优选 |
| 改写成"回头看/踩坑/扛不住" | 这是**改错了** | 还原成正式书面语 |

## 配套：检测平台认知 + 报告复核工作流

> 本节是用真实检测报告（PaperYY/PaperPass）打出来的经验，补上"上面的方法论怎么落到平台分数"。
> **工具链与报告解析脚本在 `aigc-reduce-playbook`**（本项目级 skill）：`scripts/parse_paperyy.py`、`parse_paperpass.py`、`strip_tex.py`、`aigc_scan.py`。两者配合用：**deai-review 管"判断什么该改、怎么改不翻车"，playbook 管"解析报告、定位高疑似句、多agent改写、复测"。**

**① 平台认知（别被吓住）**：AIGC 检测器=不同刻度的尺子。同一篇文在不同平台可能差异很大。PaperPass 往往更严，可能把真人数据、事故、访谈等信息密集段落也判成高疑似；不要为了平台数字把论文改坏。检测报告只能当定位线索，最终仍以学校规范、事实证据和导师意见为准。

**② 风险定位杠杆（前几个通常不伤质量）**：破枚举/序号（首先/随后/最后、第一二三、其一~其四、(1)(2)(3)→更自然的论述句）> 打散句长 > 数据句瘦身（数字不动、删与表重复的罗列）> 数据罗列搬进表格（前提是表格更清晰）> 删空洞对冲套话。❌换冷僻词/加口语=人审挂（与上面"别改成口语"铁律一致）。

**③ 铁律补充**：① **禁 LLM 全量重写**——容易制造新的模板化表达，只做有定位、有证据的局部修订；② 多agent改写**按章分不重叠文件**(c1=摘要+Ch1, c2=Ch2…)才能并行；③ 每轮改完**编译+本地aigc_scan复扫**，再让用户自行按学校规则决定是否需要平台复测。

**④ 经验提醒**：历史项目显示，不同平台对同一篇论文的判断差异很大。不要把平台百分比当成唯一目标；更重要的是消除空泛表达、证据缺口、数据矛盾和过度整齐的论证。

