thesis-deai-review —— 论文模板化表达与 AI 味风险审查
把一篇中文学位论文中“过度模板化、证据链太薄、论证太顺滑”的位置找出来,回到真实材料和专业硕士论文语体上修。 不是做表面文字替换,也不是改成大白话,更不是承诺任何检测平台给出特定结果。
一条最重要的原则(本方法论的核心)
先找一篇同专业、同体裁、已通过答辩的真人论文当"基准",用它校准"什么是 AI 痕迹"。
很多"看起来像 AI"的特征,其实是体裁规定动作,真人论文一模一样——改掉反而更不规范、更可疑。 实测对照(MEM 质量改进类论文)发现,以下全是体裁规范,不要动:
- 三个改进章高度平行(问题→原因→方案→实施→效果→本章小结)
- "本章小结"复述式("本章围绕……完成了……下一章将……")
- 摘要以"随着……"开头、六段式(背景→对象→方法→问题→结果→结论)
- 程度副词"有效/显著/全面/系统"高频(真人论文往往用得更多)
- 结论"研究结论 + 研究展望"二段式、理论/标准映射表、方案多标准优选表
真正的 AI 指纹(这才是要改的)
针对实证/数据驱动的改进类论文,AI 味集中在"数字和论证太完美",而非"空话连篇":
- 统计过度武装且全部完美 ★最强信号★:几乎每个指标都做 t 检验,且 全部 p<0.001、全部 |Cohen's d|>1.0、95%CI 全部不含 0;甚至对"系统埋点的 总体计数"(如某率、某分位延迟等)也套样本 t 检验。真人论文几乎不会这样。
- 叙事与数据表自相矛盾:正文写了波折(如大促性能回落、灰度超标、试点指标短暂下跌), 但趋势表/效果表却一条平滑单调线——说明"叙事"和"数据"是两套流程分别生成、没对账。
- 数字过于工整:满意度全挤在某个窄区间(如 4.0–4.4)、占比恰好凑成 80%/100%、 权重恰好是 0.05 的整数倍、效应量随基线"完美单调对应"。
- 诊断指标教科书式整齐:回归里 VIF 全部刚好 <5、R² 是整数、Shapiro p 刚好不拒绝、 Cook's 远小于阈值——真实回归通常至少有一项处于临界、有变量因共线性掉出来。
- "直接给方案"无权衡:方案设计直接给"方案一/二/三",没有备选、没有取舍、没有优选过程。
- 空泛万能句:换个公司/行业也成立的过渡句、"为……提供借鉴"式安全表态(少量是体裁,扎堆才是问题)。
去 AI 味的标准动作(保持正式学术书面语!)
⚠️ 最大的坑:去 AI 味 ≠ 改成口语。把"本章完成了……"改成"回头看,这章踩了几个坑" 这种"人话话术"会被导师一眼看穿、更不像论文。始终用正式书面语,只去机械模板与完美感。
- 统计收敛:只对"真正抽样的主观指标(满意度类)"做 t 检验;系统计数/比例/分位数指标 改用"监控趋势 + 描述性变化幅度"呈现(表里 t/p/d 留空标"监控指标")。删掉"所有指标 p<0.001、d>1.0、CI 均不含 0"这类自夸句。——这一步单独就能拆掉最强 AI 信号,且方法更严谨。
- 修矛盾:让数据表反映正文已写的波折(用真实事件如大促/灰度解释),消除"叙事-数据"不一致。
- 保留真实的不完美:真实数据中存在未达标指标、较小效应量、不显著变量、 共线性或实施波折时,诚实保留并解释;如果不存在,不得为了“像真人”人为改数、 制造临界统计量或虚构失败。
- 补"备选→多标准评价→优选":在真有互斥路径的方案处(如架构/技术路线选型),仿真人论文加 备选方案 + 5 维评分表 + 优选结论(结论须与实际实施一致)。互补型措施(标准+流程+分析一起上)不要硬套优选。
- 保留真实素材:用户访谈原话、踩坑/事故复盘、反直觉发现、诚实的局限——这些是全文最不像 AI 的部分,务必留。
- 底线:不替作者编造"真实数据"。脱敏/示意数据只须做到"全文内部自洽 + 符合常识"; 真正的数据真实性问题(如表与正文冲突)要指出来交作者定,不要粉饰。
推荐流程
- 取基准:拿到一篇同类已过答辩论文(docx/pdf),扒它的结构、小结、摘要、数据呈现方式、套话频次。
- 冻结快照:记录当前提交、论文版本和扫描范围;两路必须读取同一快照。
- 隔离并行:读取
references/parallel-script-ai-audit.md,同时启动确定性脚本 与独立 AI 判断。AI 在提交结果前不得读取脚本报告,脚本也不接收 AI 先验。 - 合并判定:优先处理高级泄漏和两路交集;低级脚本命中若 AI/范文认为合理则保留。
- 定向修改:只改有定位和证据的问题,全篇联动保持数字、引用与术语自洽。
- 重新并行:在新快照上再跑两路,确认未引入新矛盾或口语化。
- 可视化复核:用
thesis-docx的"渲染核对"把 docx 渲成图逐页看(表格/数据/封面)。
配套脚本
scripts/ai_tell_scan.py —— 确定性扫描器(不下结论、不自动修改):
- 递归扫描
.tex/.md/.txt,给出文件、行号、规则、严重度和上下文; - 检查本机路径、内部目录、路线编号、执行日志和生成过程泄漏;
- 统计模板句密度、段落长度均匀度、非标准缩写重复;
- 检查 p 值和效应量过度集中的线索;
- 输出 JSON 与 Markdown,可用
--fail-on high把高级泄漏变成机械门禁。
python3 .claude/skills/thesis-deai-review/scripts/ai_tell_scan.py chapters/ \
--json-out .project/07_审校记录/deai-script-report.json \
--md-out .project/07_审校记录/deai-script-report.md
规则位于 assets/deai-patterns.json;脚本报告结构见
assets/deai-script-report.schema.json;独立 AI 输出结构见
assets/deai-ai-review.schema.json。
经验校准表(MEM 质量改进类,实测)
| 现象 | 是 AI 痕迹吗 | 处理 |
|---|---|---|
| 三章平行结构 / 复述式小结 / "随着"开头摘要 | 否,体裁规范 | 保留 |
| 程度副词"有效/显著"高频 | 否(真人更多) | 保留 |
| 理论映射表 / 备选优选表 | 否,体裁规范 | 保留/补齐 |
| 全部指标 p<0.001、d>1.0、CI 不含 0 | 是,最强信号 | 统计收敛 |
| 叙事有波折但数据表全平滑 | 是 | 让表反映波折 |
| 满意度全 4.0–4.4 / 占比凑 80% / 权重全 0.05 倍 | 是 | 去整、注入不完美 |
| VIF 全 <5、R² 整数、诊断全中段 | 是 | 让一项临界并讨论 |
| 方案直接给答案无备选 | 是 | 补备选-优选 |
| 改写成"回头看/踩坑/扛不住" | 这是改错了 | 还原成正式书面语 |
配套:检测平台认知 + 报告复核工作流
本节是用真实检测报告(PaperYY/PaperPass)打出来的经验,补上"上面的方法论怎么落到平台分数"。 工具链与报告解析脚本在
aigc-reduce-playbook(本项目级 skill):scripts/parse_paperyy.py、parse_paperpass.py、strip_tex.py、aigc_scan.py。两者配合用:deai-review 管"判断什么该改、怎么改不翻车",playbook 管"解析报告、定位高疑似句、多agent改写、复测"。
① 平台认知(别被吓住):AIGC 检测器=不同刻度的尺子。同一篇文在不同平台可能差异很大。PaperPass 往往更严,可能把真人数据、事故、访谈等信息密集段落也判成高疑似;不要为了平台数字把论文改坏。检测报告只能当定位线索,最终仍以学校规范、事实证据和导师意见为准。
② 风险定位杠杆(前几个通常不伤质量):破枚举/序号(首先/随后/最后、第一二三、其一~其四、(1)(2)(3)→更自然的论述句)> 打散句长 > 数据句瘦身(数字不动、删与表重复的罗列)> 数据罗列搬进表格(前提是表格更清晰)> 删空洞对冲套话。❌换冷僻词/加口语=人审挂(与上面"别改成口语"铁律一致)。
③ 铁律补充:① 禁 LLM 全量重写——容易制造新的模板化表达,只做有定位、有证据的局部修订;② 多agent改写按章分不重叠文件(c1=摘要+Ch1, c2=Ch2…)才能并行;③ 每轮改完编译+本地aigc_scan复扫,再让用户自行按学校规则决定是否需要平台复测。
④ 经验提醒:历史项目显示,不同平台对同一篇论文的判断差异很大。不要把平台百分比当成唯一目标;更重要的是消除空泛表达、证据缺口、数据矛盾和过度整齐的论证。