Clean Room Eval

手动调用 /clean-room-eval <被测对象> [案例数]。用无污染子 agent 批量跑真实案例来评测一个 skill / prompt / 流程的真实能力,并归纳共性问题而非单点 bug。自己生成跨领域案例(不复用被测方给的案例)→ 开 N 个无对话历史、无其他 skill、无提示的干净子 agent 各跑一例 → 主 agent 并行联网检索人类基准做对照 → 只上报在多个案例中重复出现的共性问题,附命中率与逐例证据。不自动触发(会开大量子 agent,开销大,必须显式调用)。不做修复(修复归 prompt-forge),不做只读分析(归 analyze-only)。

Ruosong320 Updated

File contents

Ruosong320/my-claude-working-skills/tree/main/clean-room-eval commit 86461ff9d9

Frequently asked questions

npx skillmds@latest add ruosong320/clean-room-eval