Agent Evaluation Testing

Builds evaluation harnesses for AI agents — LLM-as-judge scoring, tool-use accuracy validation, multi-turn conversation testing, and prompt injection detection in production-ready Python.

paulpas e07f823 39.4 KB Updated

File contents

paulpas/agent-skill-router/tree/main/skills/coding/agent-evaluation-testing commit e07f82389f

Frequently asked questions

npx skillmds@latest add paulpas/agent-evaluation-testing