File contents |
| 2026-06-29 | 2.1.0 | 新增:数据集版本陷阱(WDBC 699 vs 569)、消融实验可复现性检查、thebibliography与bib同步检查、fig6重复引用检测 |
| 2026-06-24 | 1.4.0 | 新增 OpenML 外部数据库实验真实性验证、多 JSON 源 Ensemble 交叉验证 |
| 2026-06-23 | 1.3.0 | 新增多脚本-多输出交叉验证 |
| 2026-06-21 | 1.2.0 | 新增 SHAP 模型源验证、声称-实验交叉验证、后台自动执行模式 |
契约层 · BOUNDARY
边界 :技能功能边界。
契约层 · IO_CONTRACT
输入 :请求描述、上下文信息。
输出 :执行结果、状态反馈。
验证清单 · VERIFICATION
核心原则 · PRINCIPLES
准确为先 : 所有输出必须经过事实核查,不编造数据
证据驱动 : 每个结论必须可追溯到具体证据或数据源
可复现性 : 每一步操作必须可重复,结果可验证
Golden 集合 · GOLDEN SET
Golden Input : 一篇含 WDBC 实验的 LaTeX 论文目录——thebibliography 与 references.bib 并存、含消融实验独立运行脚本 + 输出 JSON、正文 fig6 重复引用 3 次(覆盖正常审计路径)
Golden Output : 六条 VERIFICATION 全部打勾的审计日志——数据集版本锁定(699/569 分别记录)、消融复现差值 ≤0.5% 判"一致"、thebibliography↔bib 无 MISMATCH、fig6 冗余引用合并为单次、同一指标 ≥2 独立源交叉核对、每条结论可溯源(精确匹配审计日志模板)
Golden Error : 跨版本对比(699 vs 569)或消融复现差值 >0.5% 时,输出 MISMATCH 标记并列出差值来源与版本号,阻断后续结论(覆盖失败路径)
Golden 集合是测试的单一真理来源。所有改进必须通过 golden 测试。
违反任何原则的输出视为失败。原则优先级:准确 > 证据 > 可复现。
每项验证必须可执行、可记录、可复现。验证失败时记录原因和修复。
Paper Experiment Audit---
约束规则 · RULES
数据集版本固定 :审计实验前必须记录数据集版本(如 WDBC 699 vs 569 样本数差异),禁止跨版本对比指标。
消融实验可复现 :每个消融配置须有独立运行脚本 + 输出 JSON/CSV,复现结果与声称差值 ≤0.5% 视为一致。
引用同步 :thebibliography 内条目与 references.bib 必须一一对应,缺项/余项均标记 MISMATCH 并修复。
图表唯一引用 :同一 fig(如 fig6)在正文中被重复引用超过 2 次 → 标记冗余,合并为单次引用。
多源交叉验证 :同一指标须有 ≥2 个独立 JSON/CSV 输出(不同脚本)交叉核对,单一来源视为 UNVERIFIED。
Genes (策略基因)
紧凑策略表示。条件→策略。需要深度时参考完整文档。
[PAPE-008] 审计实验前 → 必须记录并固定数据集版本(如 WDBC 样本数差异),禁止跨版本对比指标
[PAPE-009] 验证消融实验可复现性 → 每个配置须有独立脚本及输出文件,复现结果与声称差值 ≤0.5% 方视为一致
[PAPE-010] 检查参考文献一致性 → thebibliography 与 references.bib 须一一对应,缺项或余项均标记 MISMATCH 并修复
[PAPE-011] 检测图表引用冗余 → 同一 fig 在正文中被重复引用超过 2 次时,标记冗余并合并为单次引用
[PAPE-012] 验证指标数据真实性 → 同一指标须有 ≥2 个独立脚本生成的 JSON/CSV 输出交叉核对,单一来源视为 UNVERIFIED
[PAPE-013] 形成审计结论 → 必须遵循“准确 > 证据 > 可复现”优先级,确保每个结论可追溯到具体证据或数据源
示例 · EXAMPLES
输入 : 一篇论文用 WDBC 数据集对比两个模型 F1。操作 : 按规则 1(PAPE-001)审计前先记录锁定数据集版本,发现基线用 699 样本、新方法用 569 样本 → 判定跨版本对比,标记无效。验证 : VERIFICATION 第一条(数据集版本固定)通过,审计结论引用版本号而非仅指标数字(PAPE-006)。
输入 : 论文声称去掉模块 A 后精度掉 2.1%。操作 : 按规则 2(PAPE-002)用该消融配置的独立运行脚本复现,读输出 JSON 与声称值比对。验证 : 复现差值 ≤0.5% → 判"一致";若 >0.5% 记 MISMATCH 并列出差值来源(证据驱动,结论可溯源)。
输入 : 检查某指标只有单一 metrics.json 来源,且 fig6 在正文出现 4 次。操作 : 按规则 5(PAPE-005)将该指标标 UNVERIFIED 并补第二个独立脚本输出交叉核对;按规则 4(PAPE-004)将 fig6 重复引用合并为单次。验证 : VERIFICATION 中"指标多源交叉验证"与"图表引用无冗余"两条均打勾,修复处写入审计日志。
1 --- 2 name: paper-experiment-audit 3 description: **边界**:技能功能边界。 4 license: MIT 5 --- 6 7 | 8 | 2026-06-29 | 2.1.0 | 新增:数据集版本陷阱(WDBC 699 vs 569)、消融实验可复现性检查、thebibliography与bib同步检查、fig6重复引用检测 | 9 | 2026-06-24 | 1.4.0 | 新增 OpenML 外部数据库实验真实性验证、多 JSON 源 Ensemble 交叉验证 | 10 | 2026-06-23 | 1.3.0 | 新增多脚本-多输出交叉验证 | 11 | 2026-06-21 | 1.2.0 | 新增 SHAP 模型源验证、声称-实验交叉验证、后台自动执行模式 | 12 13 ## 契约层 · BOUNDARY 14 15 **边界**:技能功能边界。 16 17 ## 契约层 · IO_CONTRACT 18 19 **输入**:请求描述、上下文信息。 20 **输出**:执行结果、状态反馈。 21 22 ## 验证清单 · VERIFICATION 23 24 - [ ] 数据集版本已固定:审计前已记录并锁定数据集版本(如 WDBC 699 vs 569 样本数差异),未跨版本对比指标 25 - [ ] 消融实验可复现:每个消融配置有独立运行脚本 + 输出 JSON/CSV,复现结果与声称差值 ≤0.5% 视为一致 26 - [ ] 引用同步无 MISMATCH:thebibliography 内条目与 references.bib 一一对应,缺项/余项均已标记并修复 27 - [ ] 图表引用无冗余:同一 fig(如 fig6)正文重复引用超过 2 次已标记冗余并合并为单次引用 28 - [ ] 指标多源交叉验证:同一指标有 ≥2 个独立脚本生成的 JSON/CSV 输出交叉核对,单一来源已标记 UNVERIFIED 29 - [ ] 结论可追溯:每个审计结论可追溯到具体证据或数据源,遵循"准确 > 证据 > 可复现"优先级 30 31 ## 核心原则 · PRINCIPLES 32 33 1. **准确为先**: 所有输出必须经过事实核查,不编造数据 34 2. **证据驱动**: 每个结论必须可追溯到具体证据或数据源 35 3. **可复现性**: 每一步操作必须可重复,结果可验证 36 37 ## Golden 集合 · GOLDEN SET 38 39 - **Golden Input**: 一篇含 WDBC 实验的 LaTeX 论文目录——`thebibliography` 与 `references.bib` 并存、含消融实验独立运行脚本 + 输出 JSON、正文 fig6 重复引用 3 次(覆盖正常审计路径) 40 - **Golden Output**: 六条 VERIFICATION 全部打勾的审计日志——数据集版本锁定(699/569 分别记录)、消融复现差值 ≤0.5% 判"一致"、thebibliography↔bib 无 MISMATCH、fig6 冗余引用合并为单次、同一指标 ≥2 独立源交叉核对、每条结论可溯源(精确匹配审计日志模板) 41 - **Golden Error**: 跨版本对比(699 vs 569)或消融复现差值 >0.5% 时,输出 MISMATCH 标记并列出差值来源与版本号,阻断后续结论(覆盖失败路径) 42 43 > Golden 集合是测试的单一真理来源。所有改进必须通过 golden 测试。 44 45 > 违反任何原则的输出视为失败。原则优先级:准确 > 证据 > 可复现。 46 47 > 每项验证必须可执行、可记录、可复现。验证失败时记录原因和修复。 48 49 # Paper Experiment Audit--- 50 51 ## 约束规则 · RULES 52 1. **数据集版本固定**:审计实验前必须记录数据集版本(如 WDBC 699 vs 569 样本数差异),禁止跨版本对比指标。 53 2. **消融实验可复现**:每个消融配置须有独立运行脚本 + 输出 JSON/CSV,复现结果与声称差值 ≤0.5% 视为一致。 54 3. **引用同步**:`thebibliography` 内条目与 `references.bib` 必须一一对应,缺项/余项均标记 MISMATCH 并修复。 55 4. **图表唯一引用**:同一 fig(如 fig6)在正文中被重复引用超过 2 次 → 标记冗余,合并为单次引用。 56 5. **多源交叉验证**:同一指标须有 ≥2 个独立 JSON/CSV 输出(不同脚本)交叉核对,单一来源视为 UNVERIFIED。 57 ## Genes (策略基因) 58 > 紧凑策略表示。条件→策略。需要深度时参考完整文档。 59 - **[PAPE-008]** 审计实验前 → 必须记录并固定数据集版本(如 WDBC 样本数差异),禁止跨版本对比指标 60 - **[PAPE-009]** 验证消融实验可复现性 → 每个配置须有独立脚本及输出文件,复现结果与声称差值 ≤0.5% 方视为一致 61 - **[PAPE-010]** 检查参考文献一致性 → `thebibliography` 与 `references.bib` 须一一对应,缺项或余项均标记 MISMATCH 并修复 62 - **[PAPE-011]** 检测图表引用冗余 → 同一 fig 在正文中被重复引用超过 2 次时,标记冗余并合并为单次引用 63 - **[PAPE-012]** 验证指标数据真实性 → 同一指标须有 ≥2 个独立脚本生成的 JSON/CSV 输出交叉核对,单一来源视为 UNVERIFIED 64 - **[PAPE-013]** 形成审计结论 → 必须遵循“准确 > 证据 > 可复现”优先级,确保每个结论可追溯到具体证据或数据源 65 66 ## 示例 · EXAMPLES 67 68 1. **输入**: 一篇论文用 WDBC 数据集对比两个模型 F1。**操作**: 按规则 1(PAPE-001)审计前先记录锁定数据集版本,发现基线用 699 样本、新方法用 569 样本 → 判定跨版本对比,标记无效。**验证**: VERIFICATION 第一条(数据集版本固定)通过,审计结论引用版本号而非仅指标数字(PAPE-006)。 69 2. **输入**: 论文声称去掉模块 A 后精度掉 2.1%。**操作**: 按规则 2(PAPE-002)用该消融配置的独立运行脚本复现,读输出 JSON 与声称值比对。**验证**: 复现差值 ≤0.5% → 判"一致";若 >0.5% 记 MISMATCH 并列出差值来源(证据驱动,结论可溯源)。 70 3. **输入**: 检查某指标只有单一 `metrics.json` 来源,且 fig6 在正文出现 4 次。**操作**: 按规则 5(PAPE-005)将该指标标 UNVERIFIED 并补第二个独立脚本输出交叉核对;按规则 4(PAPE-004)将 fig6 重复引用合并为单次。**验证**: VERIFICATION 中"指标多源交叉验证"与"图表引用无冗余"两条均打勾,修复处写入审计日志。
yakeworld/Synthos/tree/main/skills/private/paper-experiment-audit commit 43c8f9e3e5
Frequently asked questions How do I install the Paper Experiment Audit skill? Run npx skillmds@latest add yakeworld/paper-experiment-audit in your terminal (requires Node.js), paste this page's agent-chat prompt into Claude, Cursor, or any MCP-connected agent, or download the SKILL.md file and copy it into your agent's skills directory.
What does the Paper Experiment Audit skill do? **边界**:技能功能边界。 It is listed under Security on SkillMD.
Is Paper Experiment Audit safe to use? This skill has not completed SkillMD's automated safety review yet. SkillMD never runs a skill's scripts for you; review the SKILL.md before installing.
Which AI agents work with Paper Experiment Audit? This skill is tagged as working with Claude Code, Claude.ai, OpenAI Codex. SKILL.md is an open format, so most agents that read a skills directory can load it too.
Is Paper Experiment Audit free to use? Yes. Installing skills from SkillMD is free. This skill is licensed under MIT.
Who published Paper Experiment Audit? yakeworld (@yakeworld) published this skill. Their other Agent Skills are listed on their SkillMD profile.