# Run Real Experiments

> 运行方案试验、真实模型评测或多样例对比时使用；固定实验条件，调用真实入口，保留逐轮证据并检查跨样例改进。普通单元测试不触发。

- Skill: `ruosong320/run-real-experiments` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add ruosong320/run-real-experiments`
- Raw SKILL.md: https://api.skillmd.com/api/skills/ruosong320/run-real-experiments/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: Ruosong320 (https://skillmd.com/u/ruosong320)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/ruosong320/run-real-experiments

---


# 真实实验与迭代

## 实验契约

开始前确定假设、被测阶段、正式入口、成功标准、样例来源和用户给定的轮次/费用/时间预算。沿用项目实验目录，把脚本、清单、原始输出和汇总放在独立运行目录。

默认使用真实输入、依赖和正式入口；编排器不得重新实现被测逻辑。用户明确允许 mock 上游或局部逻辑验证时，标出哪些阶段被替代，结论只覆盖真实执行部分，不能称为完整端到端实验。连接失败不能擅自改用 mock 或其他模型。

用户指定样例或数量时照做。未指定且已授权自行实验时，选择能区分假设的代表性样例并说明理由；只有样本选择影响业务真值、成本或访问范围且无法推断时才询问。不因固定模板每轮重复索取授权。

## 每轮流程

1. 核对当前配置和正式模型调用方式，以最小真实调用确认连接；记录模型、思考强度、入口、代码/提示词版本和评分口径，不记录密钥。
2. 冻结该轮配置并运行样例。保留输入、实际输出、状态、耗时、提供方报告的 token、错误和产物位置。不能把预计产出作为真实结果。
3. 单例失败不阻塞其他可运行样例。影响全批次的基础设施错误应停止无效重复；不要在同一轮混用修改前后的代码。已授权修复时可修复可确认的运行错误，并另记新尝试及其条件。
4. 按固定口径比较质量、耗时、token 和完成率；区分缺失统计与零消耗。并发阶段耗时不能直接相加当成端到端耗时，端到端时间应从真实开始到最终完成计量。
5. 汇总重复缺陷、单例问题和未验证项。先验证问题仍存在，再修复能解释证据的共性机制；不得通过主题关键词、固定数量、答案映射或样例专用分支凑结果。明确局部缺陷也可修复，但不宣称是共性结论。
6. 用户授权迭代时继续，不再次询问是否继续。修复后保留原样例作回归，并用未参与调优的新样例检查泛化。换样例验证与修改方法分开记录，避免无法归因。

## 可比较与收敛

先固定验收和评分维度；优化后不得降低标准或改分母来宣称达标。评估既看具体产出，也看全部必需样例是否完成；提供可读结果片段或树状文件以及原始产物位置。语义评分说明主观性，不伪装成客观测量。

提示词正反例应说明原则，不能暗示唯一答案或固定数量；具体案例可用于解释和评测，不得作为程序分支。失败反馈给模型时携带具体违反的契约，避免重复整个流程或无限拒绝重试。

恢复会话时先读已有计划、结果、日志，核对运行进程、已完成单元和剩余预算，避免重复启动。用户预算跨会话延续；仅在用户明确重设时重置。把必要续跑状态记入该实验已有记录，不另建全局记忆。

达到验收则结束；到达用户预算、同类失败不再带来新证据或质量无收敛时保存结果并说明差距。仅要求实验不等于授权改正式流程；要求修复并应用时按该授权继续。

