Agent Evals

Build automated evaluation suites for AI agents using golden datasets, rubrics, and regression gates.

majiayu000 3a445b8 2 files · 1.8 KB Updated 567 repo stars

File contents

Agent Evals

Create repeatable checks so agent behavior improves safely over time.

Evaluation Layers

  • Unit evals: prompt-level correctness
  • Tool evals: API/tool call decision quality
  • End-to-end evals: realistic multi-step tasks
  • Safety evals: prompt injection and data leak resistance

CI/CD Integration

# Example eval pipeline steps
make evals-smoke
make evals-regression
make evals-safety

Best Practices

  • Version datasets with expected outputs.
  • Track pass rates and score drift over time.
  • Block deploys on critical safety regressions.

Related Skills

majiayu000/claude-skill-registry-data/tree/main/testing/agent-evals-bagelhole-devops-security-agen commit 3a445b8d83

Frequently asked questions

npx skillmds add majiayu000/agent-evals