AIGC 痕迹检测与消除(aigc-trace-cleaner)
把"AI 生成痕迹过重、一眼被看出"变成可检测、可定位、可修的问题。方法论取自五份实战文档:10 维检测体系(对齐「终极提示词 V5.0」)+ 数模竞赛 AI 破绽清单 + AI 写作 8 大痕迹 + 2026 国赛 AI 合规自查表(6 维 26 条)。
模式判断(先定模式,再动手)
- 诊断模式(默认):只出检测报告与修改建议,不改写正文。适用于"帮我看看这篇论文 AI 味重不重"。
- 改写模式:用户明确要求"顺手改掉/降到 X% 以下"时才改写;改写前必须先出诊断报告(先诊断后开药)。
- 合规自查模式(国赛 AI 红线):用户要"国赛 AI 合规自查/AI 红线检测/按自查表核查"时启用——按 6 维 26 条逐条给出「合格/存在问题/待核实」,出《AI 合规自查报告》;细则见
references/national-competition-compliance.md,报告格式见references/compliance-report-template.md。 - 质检模式:只要机械指标与自检清单(跑
scripts/scan.mjs出统计 + 按自检表核对),适用于快速抽查或改完后复检。
用户没说清楚时用诊断模式,并在报告末尾问是否进入改写模式。 合规自查模式需要四件套输入:参赛论文 + 比赛题目 + 附件(如有)+ 自查表;缺项按要求标"待核实(缺 X)",不得凭空判合格。 两种报告可同时交付(诊断报告 + 合规自查报告);用户明确要"一份完整报告"时才合并编排(见 compliance-report-template.md 末节)。
工作流程(六步,诊断模式)
- 取全文:要求用户提供完整论文(或至少 摘要+正文+结论;图表要含标题与说明)。docx 先转文本(可用
scripts/scan.mjs --docx或先解压取word/document.xml)。 - 机械统计(省 token 关键):先跑
scripts/scan.mjs,拿到客观数字:段落长度分布与变异系数、句长分布、AI 高频词频次与阈值命中、的字密度、过渡词密度、模板化动词数、空洞形容词连用、小数位异常、设问/破折号等"人味指标"计数。不要靠肉眼数。 - 逐段扫描定位:从摘要到结论逐段过,结合机械统计标出可疑位置(章节+段落+句),记原文摘录。
- 10 维深度归因:对每个问题判定维度、严重度(🔴/🟡/🟢)、成因(AI 为什么会这样写、人类通常怎么写)——细则见
references/detection-dimensions.md。 - 给可执行改法与示例:每条至少一个"原文 → 修改后"对照;禁止"建议优化表达"这类空话——手法见
references/rewrite-rules.md,词表见references/ai-word-library.md。 - 出报告:按五部分结构(总体评估 / 详细问题清单 / 维度汇总 / 优先级路线图 / 附录)输出,模板见
references/report-template.md。
数模/竞赛论文:第 3 步后加读 references/math-modeling-pitfalls.md,额外核查 6 大坑(机理缺失、硬算不简化、图表同质化、文献幻觉、逻辑断层、无迭代痕迹)。
合规自查模式:机械统计后加读 references/national-competition-compliance.md,按 6 维 26 条逐条判定(合格/存在问题/待核实),出《AI 合规自查报告》。
交付契约
- 报告必须含:论文基本信息、A–E 级 AI 生成概率 + 百分比、10 维得分、严重/中等/轻微问题计数;
- 每条问题必须含:编号(P-001…)、精确位置(章节+段+句)、原文摘录、所属维度、问题类型、严重度、深度分析、修改建议、修改示例(原文→修改后);
- 问题清单按论文顺序排列(不是按维度或严重度);
- 报告格式:默认 Markdown;用户要 HTML 时按
references/report-template.md的样式与卡片结构出(可直接浏览器打开); - 合规自查报告(新模式):五段结构——自查结果汇总表 → 逐条核查明细(26 条,每条含结论/位置/原文证据/判定理由/整改建议)→ 问题分级汇总(致命扣分/一般缺陷/轻微瑕疵)→ 优先级整改清单(按扣分权重排序)→ 官方规范适配度与风险预警;模板见
references/compliance-report-template.md;用户要 Word/PDF/HTML 时按其"输出与交付要求"执行; - 改写模式额外交付:改写后的全文 + 改动清单(改了哪些句、为什么),并复跑一次扫描做前后对比。
硬规则(红线)
- 只改表达、不改内容:数据、公式、结论、逻辑关系一律不动;为了降 AI 味改数字=学术不端。
- 人味适量:口语化/个人化表达每 1000 字 1–2 处,过量反而显假;全文风格保持一致。
- 不改坏逻辑:改写必须保持原论证链条,禁止为求变化引入错误因果。
- 文献不得编造:发现疑似幻觉引用(查不到、作者年份对不上、与论点无关)必须列为🔴并提示核验,不许"顺手美化"。
- 宁多勿少:诊断阶段宁可多标一个轻微问题,不可漏一个严重问题;但严重度判定必须给出理由。
- 禁止一次性大替换:批量替换前逐条确认,避免把正确用法一起替换(禁忌见
references/rewrite-rules.md)。 - 不承诺"过检测":只承诺降低可识别痕迹;不得声称能保证通过任何 AIGC 检测系统。
- 合规自查不得和稀泥:每条只允许"合格/存在问题/待核实";没有证据的一律"待核实",禁止把未核验项写成合格;文本层查不到的(页数、单页不跨页、三线表、配色、匿名信息在页眉页脚)必须列入"需人工核验"。
- 官方硬指标优先:合规模式下的摘要字数(800–1000)、正文页数(20–32,最优 25–30)、假设条数(4–6)、三大检验(误差/灵敏度/稳健性)、匿名合规属硬扣分项,必须在报告中逐项给"当前值 → 官方要求 → 差距"。
渐进加载指引(省 token)
- 触发后先只读本文件;按需再读:
- 判定问题维度/阈值/自检 →
references/detection-dimensions.md - 查词、找人类替代表达 →
references/ai-word-library.md - 具体改写手法与禁忌 →
references/rewrite-rules.md - 出 HTML 痕迹报告 →
references/report-template.md - 数学建模/竞赛论文加检 →
references/math-modeling-pitfalls.md - 国赛 AI 合规自查(26 条红线与硬指标) →
references/national-competition-compliance.md - 出《AI 合规自查报告》/合并版报告 →
references/compliance-report-template.md
- 判定问题维度/阈值/自检 →
- 机械统计一律交给
scripts/scan.mjs(零依赖 Node,默认输出含"10 维痕迹指标 + 国赛合规机械核查"两段),不要用模型逐字数; - 不要一次性加载全部 references。