Eval

Run evaluations against skills, agents, or rules. Use when the user wants to test that a skill triggers correctly, measure agent output quality, compare prompt variants, or detect regressions. Triggers on /eval, "run evals", "test skill", "benchmark agent".

sethdford 20ca7e0 3.6 KB Updated

File contents

sethdford/claude-code-teams/tree/main/claude/skills/eval commit 20ca7e03b5

Frequently asked questions

npx skillmds@latest add sethdford/eval