AI Agent Evaluation

Comprehensive evaluation patterns for AI agents including multi-turn conversation testing, LLM-as-judge frameworks, benchmark suites, regression detection, and systematic eval pipelines for measuring agent quality and safety.

PramodDutta Updated

File contents

PramodDutta/qaskills/tree/main/seed-skills/ai-agent-eval commit cea75304b9

Frequently asked questions

npx skillmds@latest add pramoddutta/ai-agent-evaluation