Anthropic Evaluations

This skill should be used when the user asks to "create evals", "evaluate an agent", "build evaluation suite", or mentions agent testing, graders, or benchmarks. Also suggest when building coding agents, conversational agents, or research agents that need quality assurance.

dwmkerr 14bd42c 9 files · 23.6 KB Updated

File contents

dwmkerr/claude-toolkit/tree/main/plugins/toolkit/skills/anthropic-evaluations commit 14bd42c189

Frequently asked questions

npx skillmds@latest add dwmkerr/anthropic-evaluations