Eval Harness

Automated evaluation harness for measuring agent and LLM performance, preventing regressions, and enabling eval-driven development. Use when setting up systematic quality gates for AI-assisted workflows or when you need measurable pass/fail criteria for non-deterministic outputs. Distinguishes itself through pass@k/pass^k metrics, LLM-as-judge patterns, cost tracking per eval run, and CI/CD integration with coverage mapping.

k1lgor f88ebc1 18.5 KB Updated

File contents

k1lgor/mega-mind-skills/tree/main/.agent/skills/eval-harness commit f88ebc17cd

Frequently asked questions

npx skillmds@latest add k1lgor/eval-harness