阶段二:求解与结果证据
1. 把指南变成本题动作
先核验阶段一模型合同、原始数据、现有代码和运行环境,读取模型与算法证据路由,再按规则追溯表读取指南第 0、3、4、8、9、10、23、24 章以及 §5.4–5.5、第 17、19、20 章中与当前求解产物相关的段落。
逐小问建立执行合同,把模型 ID、数学结构与规模、所选算法、匹配依据、简单方法不足之处、代码位置、运行命令、输出字段、约束证书、独立验证、资源证据和验收条件连在一起。任何对象、单位、约束或模型接口缺失,先回退阶段一,不在代码中私自补设定。
2. 先跑通可信基线
先实现最小基础模型和解析/枚举/小规模精确或简单统计基线,在已知、极限、守恒、对称、单调或手算情形上检查通过后再扩展。
代码必须做到:
- 原始输入只读,清洗和派生数据可追溯;
- 路径、参数、场景和随机种子可配置;
- 主程序、函数、配置、依赖和完整命令齐全;
- 方程、变量、约束与代码位置逐项映射;
- 在
reproduction-record中记录真实环境、版本、日志、退出码、种子和异常状态,以及参数值、来源、搜索范围、停止准则、资源预算、实际终止原因和最终残差/gap/迭代数; - 核心数字、表格、图和规定结果文件由同一运行生成。
基线失败时先查题意、数据、机制、尺度和实现,不用更复杂模型掩盖错误。改进只能由基础假设、精度、规模或数据结构的实际失效触发,并记录增益、代价和新风险。
3. 按题型做有效性检查
优化与搜索
- 优先解析、求解器、枚举或小规模精确对照;
- 逐项核验硬约束,容差必须有数值或业务依据;
- 区分最优、限时可行、不可行、无界、数值错误和中断;
- 无证书不得把“没找到”写成不可行,也不得把最好已知值写成全局最优;
- 启发式使用预先登记的多组种子,报告分布和最优性边界。
统计、预测与机器学习
- 先声明独立实验单位,按时间、个体、群组或场景切分;
- 插补、标准化、编码、采样、特征选择和调参只在训练折拟合;
- 使用匹配的回测/嵌套验证/层级或稳健方法;
- 报告基线、误差或效应量、区间、残差/校准与独立测试;
- 相关、预测和特征重要性不得升级为因果。
统一执行跨任务泄漏审计:是否先切分后拟合,是否使用未来信息,个体/群组是否跨集合重叠,是否反复用测试集选模,是否存在由标签或事后结果派生的变量,以及是否根据已看结果事后选择参数、场景或报告批次。发现任一泄漏即重做受影响实验。
仿真、随机与动态网络
- 说明分布、状态更新、事件顺序、预热、重复次数和停止条件;
- 报告 Monte Carlo 误差或随样本量的稳定性;
- 动态网络按到达时刻检查边和节点可行性,不能只解静态快照;
- 记录非确定性来源和跨运行波动。
4. 建立逐问证据链
每问用 answer_kind 标记答案类型:NUMERIC、CATEGORICAL、TEXT、PROOF、PLAN 或 FILE。只有数值答案强制填写数值、单位和合理精度;证明、分类、策略和文件型任务使用相应证据,不硬凑数字。
每问依次闭合:
- 正式答案及适用场景;
- 全部硬约束证书;
- 公式—代码—输出—图表一致性;
- 独立验证或不同错误源的复算;
- 误差、现实参数敏感性、边界或等价的稳健性检查;
- 结果的机制或业务解释:关键状态/参数如何导致结果,反常结果如何解释;
- 结论适用范围与失效条件。
敏感性不适用时,明确理由并执行更贴题的反例、边界、扰动可行性或模型比较。两条验证路径共享关键代码或公式错误源时,不得称为独立。
5. 数字、图表与复现
数字先写入 number-ledger,再生成论文表图。每幅图回答一个主要问题,保存绘图数据和配置;使用白底、少色、轴名/单位/图例完整的可打印表达。保持官方结果模板的名称、工作表、字段、行列和精度,不用截图代替结构化文件。
在干净环境执行复现命令。对规范化后的核心结果数据、配置和代码版本分别记录哈希;随机算法或跨平台浮点输出按固定种子复算,或按预先登记的数值/统计容差比较,不能只要求原始产物字节完全一致。非有限值、失败退出、漏问、约束失败、伪独立验证、数据泄漏或无法重建核心结果都必须 BLOCKED。
6. 产出、执行者预审和八席评审
阶段清单登记:
research-record、code-bundle、run-commandsresult-files、constraint-certificate、independent-validationsensitivity-analysis(可包含不适用理由及替代稳健性检查)number-ledger、figures-manifestreproduction-record(含环境版本)、data-validity-audit、result-evidence-contract(逐问登记 EVID-* 证据)
执行者先按阶段二八席量表,从数值、工程、实验统计、数据、性能、复现、可视化和模型—代码一致性逐席攻击并修正。随后按评审量表调用八个全新独立身份;需要时增加 ADDITIONAL-*。
任一评委低于 100 或存在问题,候选失效,内部修订后换全新八席完整重评。全部 100/100、无否决和未关闭问题、机械检查通过后才进入阶段三。模型或口径变化必须回退阶段一。