# Forge Cumcm Solving

> 执行 forge-cumcm-solution 的阶段二：把已冻结的 CUMCM 模型实现为真实可运行、可复现的代码和求解流程，生成逐问答案、约束证书、独立验证、适用的敏感性与稳健性分析、图表数据和规定结果文件。用于实现、调试、数值审计、统计或机器学习防泄漏和结果证据链检查。

- Skill: `jiangkaiqi2005/forge-cumcm-solving` (Agent Skill)
- Install (CLI): `npx skillmds@latest add jiangkaiqi2005/forge-cumcm-solving`
- Raw SKILL.md: https://api.skillmd.com/api/skills/jiangkaiqi2005/forge-cumcm-solving/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: jiangkaiqi2005 (https://skillmd.com/u/jiangkaiqi2005)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/jiangkaiqi2005/forge-cumcm-solving

---


# 阶段二：求解与结果证据

## 1. 把指南变成本题动作

先核验阶段一模型合同、原始数据、现有代码和运行环境，读取[模型与算法证据路由](../../references/method-routing.md)，再按[规则追溯表](../../references/guide-traceability.md)读取指南第 0、3、4、8、9、10、23、24 章以及 §5.4–5.5、第 17、19、20 章中与当前求解产物相关的段落。

逐小问建立执行合同，把模型 ID、数学结构与规模、所选算法、匹配依据、简单方法不足之处、代码位置、运行命令、输出字段、约束证书、独立验证、资源证据和验收条件连在一起。任何对象、单位、约束或模型接口缺失，先回退阶段一，不在代码中私自补设定。

## 2. 先跑通可信基线

先实现最小基础模型和解析/枚举/小规模精确或简单统计基线，在已知、极限、守恒、对称、单调或手算情形上检查通过后再扩展。

代码必须做到：

- 原始输入只读，清洗和派生数据可追溯；
- 路径、参数、场景和随机种子可配置；
- 主程序、函数、配置、依赖和完整命令齐全；
- 方程、变量、约束与代码位置逐项映射；
- 在 `reproduction-record` 中记录真实环境、版本、日志、退出码、种子和异常状态，以及参数值、来源、搜索范围、停止准则、资源预算、实际终止原因和最终残差/gap/迭代数；
- 核心数字、表格、图和规定结果文件由同一运行生成。

基线失败时先查题意、数据、机制、尺度和实现，不用更复杂模型掩盖错误。改进只能由基础假设、精度、规模或数据结构的实际失效触发，并记录增益、代价和新风险。

## 3. 按题型做有效性检查

### 优化与搜索

- 优先解析、求解器、枚举或小规模精确对照；
- 逐项核验硬约束，容差必须有数值或业务依据；
- 区分最优、限时可行、不可行、无界、数值错误和中断；
- 无证书不得把“没找到”写成不可行，也不得把最好已知值写成全局最优；
- 启发式使用预先登记的多组种子，报告分布和最优性边界。

### 统计、预测与机器学习

- 先声明独立实验单位，按时间、个体、群组或场景切分；
- 插补、标准化、编码、采样、特征选择和调参只在训练折拟合；
- 使用匹配的回测/嵌套验证/层级或稳健方法；
- 报告基线、误差或效应量、区间、残差/校准与独立测试；
- 相关、预测和特征重要性不得升级为因果。

统一执行跨任务泄漏审计：是否先切分后拟合，是否使用未来信息，个体/群组是否跨集合重叠，是否反复用测试集选模，是否存在由标签或事后结果派生的变量，以及是否根据已看结果事后选择参数、场景或报告批次。发现任一泄漏即重做受影响实验。

### 仿真、随机与动态网络

- 说明分布、状态更新、事件顺序、预热、重复次数和停止条件；
- 报告 Monte Carlo 误差或随样本量的稳定性；
- 动态网络按到达时刻检查边和节点可行性，不能只解静态快照；
- 记录非确定性来源和跨运行波动。

## 4. 建立逐问证据链

每问用 `answer_kind` 标记答案类型：`NUMERIC`、`CATEGORICAL`、`TEXT`、`PROOF`、`PLAN` 或 `FILE`。只有数值答案强制填写数值、单位和合理精度；证明、分类、策略和文件型任务使用相应证据，不硬凑数字。

每问依次闭合：

1. 正式答案及适用场景；
2. 全部硬约束证书；
3. 公式—代码—输出—图表一致性；
4. 独立验证或不同错误源的复算；
5. 误差、现实参数敏感性、边界或等价的稳健性检查；
6. 结果的机制或业务解释：关键状态/参数如何导致结果，反常结果如何解释；
7. 结论适用范围与失效条件。

敏感性不适用时，明确理由并执行更贴题的反例、边界、扰动可行性或模型比较。两条验证路径共享关键代码或公式错误源时，不得称为独立。

## 5. 数字、图表与复现

数字先写入 `number-ledger`，再生成论文表图。每幅图回答一个主要问题，保存绘图数据和配置；使用白底、少色、轴名/单位/图例完整的可打印表达。保持官方结果模板的名称、工作表、字段、行列和精度，不用截图代替结构化文件。

在干净环境执行复现命令。对规范化后的核心结果数据、配置和代码版本分别记录哈希；随机算法或跨平台浮点输出按固定种子复算，或按预先登记的数值/统计容差比较，不能只要求原始产物字节完全一致。非有限值、失败退出、漏问、约束失败、伪独立验证、数据泄漏或无法重建核心结果都必须 `BLOCKED`。

## 6. 产出、执行者预审和八席评审

阶段清单登记：

- `research-record`、`code-bundle`、`run-commands`
- `result-files`、`constraint-certificate`、`independent-validation`
- `sensitivity-analysis`（可包含不适用理由及替代稳健性检查）
- `number-ledger`、`figures-manifest`
- `reproduction-record`（含环境版本）、`data-validity-audit`、`result-evidence-contract`（逐问登记 EVID-* 证据）

执行者先按阶段二八席量表，从数值、工程、实验统计、数据、性能、复现、可视化和模型—代码一致性逐席攻击并修正。随后按[评审量表](../../references/review-rubrics.md)调用八个全新独立身份；需要时增加 `ADDITIONAL-*`。

任一评委低于 100 或存在问题，候选失效，内部修订后换全新八席完整重评。全部 100/100、无否决和未关闭问题、机械检查通过后才进入阶段三。模型或口径变化必须回退阶段一。

