# Ssi Reproducibility

> 当需要为投往《中国科学：信息科学》(Scientia Sinica Informationis, SSI) 的稿件保证实验可重复、结果可复现，并撰写数据/代码可用性叙述时调用。覆盖实验环境与来源固定（数据集版本、工具链、随机种子、硬件平台）、仿真与实测/硅后结果的区分、统计报告与随机性控制、跨子学科（计算机/控制/通信/微电子）的可复现要点，以及诚实的可用性声明。作为国家级大信息学科综合旗舰，本刊强调科学价值与可信证据，与英文姊妹刊 Science China Information Sciences 的开放科学精神一致。

- Skill: `thedixitjain/ssi-reproducibility` (Agent Skill)
- Install (CLI): `npx skillmds add thedixitjain/ssi-reproducibility`
- Raw SKILL.md: https://api.skillmd.com/api/skills/thedixitjain/ssi-reproducibility/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Research & Search
- Author: thedixitjain (https://skillmd.com/u/thedixitjain)
- Updated: 2026-09-08
- Page: https://skillmd.com/skills/thedixitjain/ssi-reproducibility

---



# 《中国科学：信息科学》可复现性与实验可重复（Reproducibility）

《中国科学：信息科学》(SCIENTIA SINICA Informationis, SSI) 以刊载信息科学领域最高水平的
中文原创成果为目标，审稿强调**科学价值与创新高度**，而这必须建立在**可信、可复现**的证据上。
本技能帮助你在实验开展与稿件撰写时，把"别人能否重复出你的结果"这件事前置处理——
很多可复现性问题在数据采集或实验设计时不做记录，投稿时便无法补救。

## 一、可复现的三个层次

1. **可重复（repeatable）**：同一团队、同一环境重跑得到一致结果。
2. **可复现（reproducible）**：他人用你提供的代码/数据/说明能重现主结果。
3. **可推广（replicable）**：他人在新数据/新平台上得到一致结论（更高标准）。

SSI 论文至少应做到前两层，并对第三层的边界（外部效度）诚实说明。

## 二、来源与环境固定（提交前记录，事后难补）

- **数据集**：名称、版本/发布日期、规模、划分方式、预处理步骤；自采数据说明采集协议与时间。
- **工具链**：语言与库版本、框架版本、编译器/EDA 工具版本、操作系统。
- **随机性**：随机种子、初始化、数据打乱方式；报告多次运行的均值与波动。
- **硬件平台**：CPU/GPU/FPGA/芯片型号、内存、必要的时钟/工艺参数（微电子/控制常需）。
- **超参数**：完整超参与搜索空间、选择依据；避免"精心挑选的一次结果"。

## 三、仿真 vs 实测/硅后（本刊多子学科的关键区分）

SSI 覆盖计算机、控制、通信、微电子等，结果来源差异大，务必明确标注：

| 结果类型 | 说明要求 |
|---|---|
| 数值仿真 | 仿真器/模型、参数、边界条件、理想化假设 |
| 硬件在环/半实物 | 平台、接口、实时性约束 |
| 硅后/实测 | 芯片/样机、测试仪器、测量条件、误差来源 |
| 理论/证明 | 假设、引理依赖、可验证的推导步骤 |

- **不得把仿真结果表述为实测**；跨工艺/跨平台外推要给敏感性分析而非直接断言。

## 四、统计与随机性报告

- 报告**均值 + 波动**（标准差/置信区间/分位数），而非单次最好结果。
- 对比多方法时用一致的评测协议与统计比较；必要时做显著性检验。
- 说明异常值处理、失败样本、未收敛情形，避免选择性报告。
- 消融实验隔离各组件贡献，支撑"创新点确实起作用"的主张。

## 五、可复现材料与可用性叙述

- 组织清晰的复现包（`code/data/scripts/README`），中文 README 给出一键复现主结果的步骤。
- 撰写**数据/代码可用性声明**：提供什么、在哪里、如何获取；"可向作者索取"是弱承诺。
- 涉密/隐私/工业合作限制时，提供脱敏子集或接口说明并解释原因。
- 材料形态与徽章现状见 [`../ssi-artifact-evaluation/SKILL.md`](../ssi-artifact-evaluation/SKILL.md)
  （本刊无独立制品徽章制度，现状**待核实**）。

## 六、跨子学科可复现要点

- **计算机/AI**：数据泄漏检查、训练/测试划分、预训练模型与数据污染、算力与时间成本。
- **控制**：被控对象模型、扰动与噪声设定、稳定性/鲁棒性验证条件。
- **通信/信号**：信道模型、信噪比范围、评测指标（BER/吞吐等）的统计口径。
- **微电子/EDA**：工艺库、约束、测试激励、PVT 角；注意 IP 与工艺保密合规。

## 七、可复现性自查表

- [ ] 主结果（主表/主图）可在干净环境按 README 复现。
- [ ] 数据版本、工具链版本、种子、硬件平台均已记录。
- [ ] 仿真/实测/硅后/理论结果分别标注，无混淆。
- [ ] 报告了均值与波动，而非单次最优。
- [ ] 消融实验支撑创新点的独立贡献。
- [ ] 可用性声明与材料实际一致；敏感信息已清理。
- [ ] 复现所需算力/时间已说明。

## 八、常见失误

| 失误 | 后果 | 纠正 |
|---|---|---|
| 只报单次最好结果 | 被质疑不可复现 | 报告多次运行的统计量 |
| 仿真当实测 | 严重可信性问题 | 明确来源与假设 |
| 种子/版本未记录 | 无法重跑 | 采集时即记录 |
| 数据泄漏未检查 | 结论失真 | 严格划分并检查 |
| "整理后公开"从未公开 | 可用性声明失信 | 提交时即提供或给明确途径 |

## 九、复现失败的常见根因与排查

当审稿人或读者反馈"跑不出你的结果"，多半是以下几类，投稿前自行排查：

- **环境漂移**：库/框架小版本升级改变了数值行为。对策：锁版本（`requirements.txt`/
  容器镜像/工具链版本号），README 写明验证过的环境。
- **随机性未控制**：种子、并行、非确定性算子导致波动。对策：固定种子、报告多次运行统计量、
  标注无法完全确定的算子。
- **数据不一致**：数据版本或预处理与论文不符。对策：固定数据版本与预处理脚本，给出校验值。
- **隐式依赖**：依赖本地文件/私有服务/特定硬件而未声明。对策：显式列出并提供替代或说明。
- **口径不同**：评测指标定义/统计口径与论文表述不一致。对策：在 README 与论文中统一定义。

一段有用的复现说明示例（README 片段）：

```text
## 复现主结果（表 2 / 图 3）
环境：Python 3.10，PyTorch 2.1，CUDA 12.1，单卡 A100（已在该环境验证）
1) 准备数据：bash scripts/prepare_data.sh   # 校验：md5 见 data/CHECKSUMS
2) 训练：python train.py --seed 0 --config configs/main.yaml
3) 评测：python eval.py --ckpt runs/main/best.pt   # 预计约 20 分钟
说明：论文表 2 为 5 个种子(0-4)的均值±标准差；单次结果会有小幅波动。
```

## 十、每次核实

- 本刊是否对数据/代码公开、可复现材料有强制要求（**待核实**）。
- 补充材料容量/格式（**待核实**）。
- 与英文姊妹刊 Science China Information Sciences 开放科学要求的差异（**待核实**）。

## 输出格式

```text
[可复现层次] 可重复/可复现/可推广——达到哪一层？
[来源固定] 数据版本/工具链/种子/硬件——是否齐备
[结果类型] 仿真/实测/硅后/理论——是否明确标注
[统计] 均值+波动？消融隔离贡献？
[可用性] 声明与材料一致？敏感信息已清理？
[待核实] 强制公开与否、附件格式、SCIS 差异
```

参见 [`../ssi-experiments/SKILL.md`](../ssi-experiments/SKILL.md) 与
[`../../resources/code/README.md`](../../resources/code/README.md)。

---

**Source:** [`brycewang-stanford/Awesome-Journal-Skills`](https://github.com/brycewang-stanford/Awesome-Journal-Skills) → `Scientia-Sinica-Informationis-Skills/skills/ssi-reproducibility/SKILL.md`

