Agent Evaluation

Evaluate LLM agents and tool-using workflows—task success, tool accuracy, latency/cost, safety, and regression suites. Use when shipping agent features, comparing prompts/models, or debugging agent failures. Triggers: "agent eval", "benchmark agent", "tool accuracy", "agent regression".

charlieviettq Updated

File contents

charlieviettq/awesome-agent-skill/tree/main/.cursor/skills/ai-agent-systems/agent-evaluation commit ec0a44477a

Frequently asked questions

npx skillmds@latest add charlieviettq/agent-evaluation-2