Eval Guide

Guide for running statistically meaningful agent-tty evals with trials, parallelism, and A/B comparison. Covers non-determinism baseline, recommended sample sizes, and result interpretation.

coder 8987b8c 8.0 KB Updated

File contents

coder/agent-tty/tree/main/.mux/skills/eval-guide commit 8987b8c3c0

Frequently asked questions

npx skillmds@latest add coder/eval-guide