Agent Evals Lab

Evaluate agent quality and reliability with practical scorecards: accuracy, relevance, actionability, risk flags, tool-call failures, regression checks, and prioritized fix plans. Use when users ask to audit agent quality, compare prompt/config/model changes, investigate failures, or validate performance after updates.

dvcrn Updated 32 repo stars

File contents

dvcrn/openclaw-skills-marketplace/tree/main/plugins/vassiliylakhonin--agent-evals-lab/skills/agent-evals-lab commit af7ce0947c

Frequently asked questions

npx skillmds@latest add dvcrn/agent-evals-lab