# Prai Experiments

> 在为《模式识别与人工智能》(Pattern Recognition and Artificial Intelligence, PR&AI) 设计与呈现模式识别/机器学习实验证据时调用。覆盖研究问题(RQ)拆解、公平基线与相同划分/算力、评测指标选择(准确率/F1/mAP/IoU/AUC 等)、多次运行的均值±标准差与统计显著性检验、消融实验、复杂度与开销报告、数据泄漏与评测污染的防范，以及把每条主张绑定到证据的呈现方式。用于把 AI 细分方向的实证部分做到经得起外审对"基线是否公平、结果是否可信、消融是否充分"的质询。

- Skill: `thedixitjain/prai-experiments` (Agent Skill)
- Install (CLI): `npx skillmds add thedixitjain/prai-experiments`
- Raw SKILL.md: https://api.skillmd.com/api/skills/thedixitjain/prai-experiments/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: thedixitjain (https://skillmd.com/u/thedixitjain)
- Updated: 2026-09-09
- Page: https://skillmd.com/skills/thedixitjain/prai-experiments

---



# 《模式识别与人工智能》实验设计与呈现

本技能把《模式识别与人工智能》(Pattern Recognition and Artificial Intelligence, PR&AI) 论文的实证
部分落到可执行清单。本刊聚焦模式识别与机器学习，外审对实验严谨性要求高：公平基线、统计口径、消融、
开销缺一易被质疑。事实核验日期 2026-07-09，见 `resources/official-source-map.md`。

## 一、从主张到 RQ

先把贡献拆成可检验的研究问题(RQ)，每个 RQ 对应一组实验：

- RQ1（有效性）：本文方法是否在目标任务上优于最强基线？
- RQ2（机制）：哪个组件带来提升？（→消融）
- RQ3（鲁棒性）：在噪声/长尾/小样本/跨域等更难设定下是否仍有效？
- RQ4（开销）：精度提升的时间/显存/参数代价如何？

每个 RQ 的结论必须由对应证据支撑，不多不少。

## 二、公平基线（外审首要质询）

- 基线在**相同数据划分、相同算力、相同调参预算**下比较；不拿别人论文里不可比的数字直接对照。
- 覆盖相关工作中提到的代表性方法（见 `prai-related-work`），尤其是最接近工作。
- 复现基线时说明来源（官方代码/自实现），并诚实标注差异。
- 避免"只调自己方法、不调基线"的隐性不公。

## 三、评测指标与统计严谨

| 任务 | 常用指标 |
|---|---|
| 分类/识别 | 准确率、F1、精确率/召回率、AUC |
| 目标检测 | mAP、AP@IoU |
| 分割 | mIoU、Dice |
| 检索/排序 | mAP、NDCG、Recall@K |
| 长尾/不平衡 | 分组精度、平衡准确率 |

统计纪律：

- **多次运行**（不同随机种子）报告**均值±标准差**，不报单次最优。
- 关键比较做**显著性检验**（如配对 t 检验、Wilcoxon），报告 p 值。
- 指标选择与任务匹配，避免只挑对自己有利的指标。

## 四、消融实验

- 逐组件消融，量化每个机制的独立贡献（去掉 X 掉多少）。
- 关键超参数的敏感性分析（给曲线或表）。
- 消融要能支撑"方法新意来自 Y 机制"这一主张，与相关工作 delta 呼应。

## 五、数据泄漏与评测污染

模式识别/机器学习实验的可信性红线：

- 训练/验证/测试**严格划分**，无样本重叠、无标签泄漏。
- 预训练语料/权重与评测集不重叠；用大模型时说明是否见过评测数据。
- 调参在验证集上做，测试集只用于最终报告。
- 数据增强、采样策略对所有方法一致。

## 六、开销与复杂度

- 报告训练/推理时间、显存、参数量、FLOPs（据任务选）。
- 精度-开销权衡用图或表呈现，避免只报精度不报代价。
- 硬件环境（GPU 型号、数量）写清，便于复现（见 `prai-reproducibility`）。

## 七、结果呈现

- 主表报告均值±标准差、样本量、最优加粗；对比方法与本文并列。
- 每条主张在正文有对应表图编号；图题表题中英文对照、黑白可辨。
- 失败案例/局限随结果讨论，不回避（威胁有效性见 `prai-writing-style`）。

## 八、常见被拒理由与对策

| 外审批评 | 根因 | 对策 |
|---|---|---|
| 基线不公平 | 划分/算力/调参不一致 | 统一设置、重跑 |
| 结果不可信 | 单次运行、无统计 | 多种子+显著性检验 |
| 消融不足 | 说不清提升来源 | 补逐组件消融 |
| 疑似数据泄漏 | 划分/预训练重叠 | 澄清划分、排查重叠 |
| 只报精度 | 忽略开销 | 补时间/显存/复杂度 |

## 九、实验章节自检清单

1. 每个 RQ 是否有对应实验与明确结论？
2. 基线是否在相同划分/算力/调参下比较、覆盖最接近工作？
3. 是否多种子报告均值±标准差并做显著性检验？
4. 消融是否支撑方法新意来源？
5. 是否排查数据泄漏/评测污染？
6. 是否报告精度-开销权衡？
7. 主张与表图编号是否一一对应？

## 十、与其他技能衔接

- 上游 `prai-related-work` 定对比方法；下游 `prai-reproducibility` 固定环境与复现包。
- 呈现体例见 `prai-writing-style`；投稿前证据-主张一致性核对见 `prai-submission`。

## 十一、数据集选择与报告

《模式识别与人工智能》(Pattern Recognition and Artificial Intelligence, PR&AI) 论文的说服力很大
程度取决于数据集选择是否恰当、报告是否透明：

- **覆盖代表性基准**：用本子领域公认的公开数据集，便于与已有工作对比；只在自造小数据上验证难以
  服众。
- **规模与多样性**：数据集规模、类别数、分布特点(是否长尾/含噪)要写清，避免"挑软柿子"。
- **划分透明**：train/val/test 划分与来源固定并说明；沿用标准划分时注明出处。
- **多数据集验证**：单一数据集上的优势可能是过拟合到该集，多数据集一致提升更可信。
- **自采数据**：说明采集/标注流程、标注一致性(如 kappa)、许可与隐私合规。

## 十二、结果分析而非堆数字

外审看重的是"为什么有效"的**分析**，而不仅是"更高的数字"：

- 结合数据特性解释增益来自何处（如"在高噪声子集上提升更大，印证方法抑制噪声的机制"）。
- 报告并分析**失败案例**，指出方法边界，这比掩盖局限更能取信。
- 用可视化（特征分布、注意力、决策边界、混淆矩阵）佐证机制性主张。
- 把定量结果与定性分析绑定，让"提升 x%"有可解释的来由。

## 十三、实验与其他技能的一致性

实验部分不能孤立：相关工作(`prai-related-work`)提到的对比方法要落为基线；方法章节声称的每个机制要
在消融中被验证；可复现性(`prai-reproducibility`)要求的种子、划分、环境要在实验设置里交代；补充材料
(`prai-supplementary`)决定超参全表、额外数据集实验的归属。投稿前用 `prai-submission` 核对每条主张
是否都有对应表图编号支撑，做到主张与证据一一对应、无悬空断言。

## 输出格式

```text
[PR&AI 实验] 达标 / 待补
[RQ 覆盖] RQ1..n 是否各有证据：___
[基线公平] 相同划分/算力/调参？覆盖最接近工作？
[统计] 多种子均值±标准差？显著性检验 p 值？
[消融] 是否支撑方法新意来源：是/否
[泄漏排查] 划分/预训练/调参是否干净：___
[开销] 是否报告时间/显存/复杂度：是/否
[待补项] ___
```

---

**Source:** [`brycewang-stanford/Awesome-Journal-Skills`](https://github.com/brycewang-stanford/Awesome-Journal-Skills) → `Pattern-Recognition-and-Artificial-Intelligence-Skills/skills/prai-experiments/SKILL.md`

