Agent Evaluation

Design reproducible evaluations for AI agents with representative task sets, explicit rubrics, appropriate graders, baselines, regression gates, and failure analysis. Use when defining agent quality, comparing prompts or models, validating a release, measuring tool-use reliability, investigating regressions, or deciding whether an agent is ready for production.

seb1n Updated 159 repo stars

File contents

seb1n/awesome-ai-agent-skills/tree/main/agent-engineering/agent-evaluation commit d3005e7a9b

Frequently asked questions

npx skillmds@latest add seb1n/agent-evaluation