# Agent Evals

> Measure an agent instead of vibing it: fixed task sets, seeded runs, and a rubric written before the results are seen.

- Skill: `gulmezeren2-byte/agent-evals` (Agent Skill)
- Install (CLI): `npx skillmds@latest add gulmezeren2-byte/agent-evals`
- Raw SKILL.md: https://api.skillmd.com/api/skills/gulmezeren2-byte/agent-evals/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: gulmezeren2-byte (https://skillmd.com/u/gulmezeren2-byte)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/gulmezeren2-byte/agent-evals

---


# agent-evals

Measure an agent instead of vibing it: fixed task sets, seeded runs, and a
rubric written before the results are seen.

