Agent Benchmark

Self-benchmark: YOU write the code, adversarial reviews it (multi-provider), you fix, you write tests, adversarial reviews tests, you fix. Measures YOUR quality as an agent. Run in different models (Opus, Sonnet, Haiku) and compare results.

greglas75 6895021 9.9 KB Updated

File contents

greglas75/zuvo/tree/main/skills/agent-benchmark commit 68950214a6

Frequently asked questions

npx skillmds@latest add greglas75/agent-benchmark