Agent Eval Contract

Design trustworthy, reproducible evaluations for AI agents, skills, prompts, and tool loops by turning quality claims into scenarios, evidence, baselines, validity checks, and ship gates. Use for version comparisons, regression detection, or release decisions; do not use for ordinary deterministic unit tests.

CHENG-LIANG1 08c8c54 2 files · 5.5 KB Updated

File contents

CHENG-LIANG1/badass-skills/tree/main/skills/agent-eval-contract commit 08c8c54732

Frequently asked questions

npx skillmds@latest add cheng-liang1/agent-eval-contract