论文 AIGC 报告复核与表达风险诊断(Playbook)
把「检测报告 → 定位高疑似句 → 回查真实材料 → 定向修订表达 → 编译/复核」串成可复用闭环。理论/替换表见 references/theory/,5维语义检测见 references/detector/,本 skill 是 AIGC 报告复核和表达风险诊断入口。
配套
thesis-deai-review(项目级)管"判断什么该改不翻车"(体裁基准校准、"完美统计=强信号"、保留真实不完美、"别改成口语"铁律)。本 playbook 管平台工具+复测,deai-review 管确定性脚本与隔离 AI 并行判断,配合用。
学术诚信边界
- 本 skill 不承诺任何 AIGC 检测平台给出特定结果,也不提供伪装、篡改 PDF 或篡改字符编码的方法。
- 只允许基于真实材料做表达修订、结构调整、证据补强和风险定位。
- 不新增不存在的数据、访谈、日志、引用、案例或导师意见。
- 检测报告只能作为写作风险线索;最终质量以学校规范、事实证据和导师意见为准。
0. 一句话心智模型(先建立,否则白干)
AIGC 检测器 = 拿一个"裁判 AI 模型"算你的文字"有多好猜"(困惑度)+ "句长够不够起伏"(突发性)。
- 不同平台 = 不同刻度的尺子:同一篇文 PaperYY 判 19.6%、PaperPass 判 49%,都不算错。别拿最严平台的分吓自己。
- 真正算数的是学校的工具(多为知网);PaperYY/PaperPass 只是便宜预检。
- 统计型检测器惩罚"信息密集的流畅学术中文"本身——你写得越像正经论文,它越觉得像 AI。所以有地板,降不到 0。
1. 风险收敛杠杆排序(按质量收益)
| 杠杆 | 风险收敛 | 伤质量? | 说明 |
|---|---|---|---|
| 破枚举/序号 | 高 | 否 | "首先/随后/最后""第一/第二/第三""其一~其四""一是二是""(1)(2)(3)"→流水句。头号 AI-tell |
| 打散句长(突发性) | 高 | 否 | 长短句交错,插极短句。人类 CV≈0.52 vs AI≈0.32 |
| 数据句瘦身 | 中 | 否 | "由A提升至B""从表X看…占比…说明…"模板→数字不动、换动词/语序,删与表重复的罗列 |
| 数据罗列搬进表格 | 中 | 否 | 纯数字句→小表格,进"不予检测"区,移出分母(结构法,不反弹) |
| 特异性下沉 | 中 | 否 | 把已有真实细节(日期/角色/事故)织进泛句,拉高困惑度。绝不编造 |
| 删空洞对冲/套话 | 中 | 否 | 一定/初步/相对/系统性/多维度/聚焦/提供了参考/值得注意的是… |
| 方法定义句改写 | 中 | 否 | PDCA/LDA/帕累托等标准定义→嵌入本文具体语境(同时降查重) |
| 换冷僻词/加口语/打乱 | 高 | 是 | ❌ 机审过、人审挂(导师答辩看出别扭)。学位论文别用 |
2. 闭环流程(每轮)
- 独立基线审查:先调用
thesis-deai-review,按该 Skill 的“脚本与 AI 隔离并行审查”流程冻结同一提交;两路完成前不得互看结果。 - 拿报告:用户上传 PaperYY(AIGC) / PaperPass(查重+AIGC) 离线报告包。
- 解析高疑似句:
scripts/parse_paperyy.py <report.html>或parse_paperpass.py <dir>→ 抽出class='high'句子,按章节聚类成 JSON。 - 剥正文:
scripts/strip_tex.py chapterN.tex把 LaTeX 剥成纯中文,用于定位 .tex 段落。 - 多 subagent 改写:按章节分不重叠文件(c1=摘要+Ch1, c2=Ch2, c3=Ch3+4, c4=Ch5-7),每个 agent 拿本簇高疑似 JSON + 杠杆清单 + 铁律,用 Edit 工具精确改 .tex。文件不重叠才能并行。
- 编译验证:
xelatex→biber→xelatex×2,查Reference.*undefined=0、页数正常、grep '——|·|.|et al\.'标点干净。 - 本地复扫:重新调用
thesis-deai-review自带扫描器与隔离 AI, 再用scripts/aigc_scan.py(突发性CV/模板密度)或 5维规则做改前后对比。 - 版本管理:worktree 提交 → 合并 main → 复制 PDF/DOCX 到桌面
论文_v{N}→ CLAUDE.md 版本+1。 - 复测:用户重传平台确认实际降幅。本地工具测不出平台精确%,必须复测。
3. 铁律(违反即前功尽弃)
- 禁止 LLM 全量重写——会叠加 AI 指纹,检测率反弹到 ~100%。只做确定性局部改写(拆句/换序/换动词/删序号)。
- 零编造——不加论文里不存在的任何数字/事实/案例/引用。
- 全保留:数据、
\cite{}/\ref{}、术语首次定义、英文缩写、访谈原话与编号、PDCA 波折细节。 - 保学术书面语——严禁口语/网络词/情绪词("颇有看点""绝了""太好了地"这类一律不要)。
- 不 churn 已自然的句——只动仍标红的;反复改同一句会反弹。
- 破折号每段 ≤1;模板声明/授权书/目录不用动(官方查重排除)。
4. 该做 / 不该做
✅ 该做:破枚举、打散句长、数据句瘦身、特异性下沉、数据→表格、删套话、方法定义句本地化。 ❌ 不该做:
- 用 AI 一键重写/"处理后的Word"(容易制造新模板化表达)。
- 换冷僻词+加口语处理检测提示(人审挂)。
scramble-pdf这类篡改 PDF unicode 的工具——学术造假,PDF 会坏,会被查。- 为最严平台(PaperPass)硬刚到很低——性价比极低,它可能把真人的信息密集段落也判成高疑似。
5. 实战轨迹(本 MEM 论文,参考量级)
| 版本 | PaperYY AIGC | PaperPass AIGC | 做了什么 |
|---|---|---|---|
| v36 | 41.8% | — | 起点 |
| v38 | 29.9% | 56.47% | 60处:打散数据句/破枚举/删对冲 |
| v39 | 19.6% | 49.46% | 50处:通用方法定义句本地化(双降) |
| v40 | (待测,预计~15%) | 48.65% | 32处:数据句瘦身/特异性下沉(对PaperPass仅降0.8pp=触底证据) |
经验值:不同平台刻度差异很大,历史项目里 PaperYY 对定向修订更敏感,PaperPass 对信息密集的真人学术中文也会给高疑似。不要为了某个平台数字牺牲论文质量;报告只当定位线索。
6. 平台与工具速查
- 检测:PaperYY(AIGC,便宜,接近多数校线)、PaperPass(查重+AIGC,最严,离群偏高)、维普/PaperFree(查重便宜)、知网(学校官方,贵,问学院有无免费名额)。
- 本地:
scripts/(本skill内置: 5维规则/8维扫描/报告解析)、scripts/aigc_scan.py(8维统计)、humanize-chinese(纯Python本地,但自动改写太口语,只借鉴技巧别直用)。 - 查重 ≠ AIGC:查重=和别人撞(改写/搬表格);AIGC=像机器写(打散/特异化)。两者杠杆有重叠(方法定义句本地化同时降两者)。
- 报告解析脚本:见
scripts/(PaperYY HTML / PaperPass JS / strip_tex)。