Run Real Experiments

运行方案试验、真实模型评测或多样例对比时使用;固定实验条件,调用真实入口,保留逐轮证据并检查跨样例改进。普通单元测试不触发。

Ruosong320 Updated

File contents

真实实验与迭代

实验契约

开始前确定假设、被测阶段、正式入口、成功标准、样例来源和用户给定的轮次/费用/时间预算。沿用项目实验目录,把脚本、清单、原始输出和汇总放在独立运行目录。

默认使用真实输入、依赖和正式入口;编排器不得重新实现被测逻辑。用户明确允许 mock 上游或局部逻辑验证时,标出哪些阶段被替代,结论只覆盖真实执行部分,不能称为完整端到端实验。连接失败不能擅自改用 mock 或其他模型。

用户指定样例或数量时照做。未指定且已授权自行实验时,选择能区分假设的代表性样例并说明理由;只有样本选择影响业务真值、成本或访问范围且无法推断时才询问。不因固定模板每轮重复索取授权。

每轮流程

  1. 核对当前配置和正式模型调用方式,以最小真实调用确认连接;记录模型、思考强度、入口、代码/提示词版本和评分口径,不记录密钥。
  2. 冻结该轮配置并运行样例。保留输入、实际输出、状态、耗时、提供方报告的 token、错误和产物位置。不能把预计产出作为真实结果。
  3. 单例失败不阻塞其他可运行样例。影响全批次的基础设施错误应停止无效重复;不要在同一轮混用修改前后的代码。已授权修复时可修复可确认的运行错误,并另记新尝试及其条件。
  4. 按固定口径比较质量、耗时、token 和完成率;区分缺失统计与零消耗。并发阶段耗时不能直接相加当成端到端耗时,端到端时间应从真实开始到最终完成计量。
  5. 汇总重复缺陷、单例问题和未验证项。先验证问题仍存在,再修复能解释证据的共性机制;不得通过主题关键词、固定数量、答案映射或样例专用分支凑结果。明确局部缺陷也可修复,但不宣称是共性结论。
  6. 用户授权迭代时继续,不再次询问是否继续。修复后保留原样例作回归,并用未参与调优的新样例检查泛化。换样例验证与修改方法分开记录,避免无法归因。

可比较与收敛

先固定验收和评分维度;优化后不得降低标准或改分母来宣称达标。评估既看具体产出,也看全部必需样例是否完成;提供可读结果片段或树状文件以及原始产物位置。语义评分说明主观性,不伪装成客观测量。

提示词正反例应说明原则,不能暗示唯一答案或固定数量;具体案例可用于解释和评测,不得作为程序分支。失败反馈给模型时携带具体违反的契约,避免重复整个流程或无限拒绝重试。

恢复会话时先读已有计划、结果、日志,核对运行进程、已完成单元和剩余预算,避免重复启动。用户预算跨会话延续;仅在用户明确重设时重置。把必要续跑状态记入该实验已有记录,不另建全局记忆。

达到验收则结束;到达用户预算、同类失败不再带来新证据或质量无收敛时保存结果并说明差距。仅要求实验不等于授权改正式流程;要求修复并应用时按该授权继续。

Ruosong320/my-codex-working-skills/tree/main/skills/run-real-experiments commit 260a312b3f

Frequently asked questions

npx skillmds@latest add ruosong320/run-real-experiments