Agent Benchmarking

Map agent capabilities to standard benchmarks (SWE-bench, WebArena, OSWorld, GAIA, TauBench) plus custom regression packs. Use when you need defensible numbers on agent quality, not just vibes — before shipping, after every model change, and for vendor comparisons.

akillness 076e1df 3.7 KB Updated 42 repo stars

File contents

akillness/oh-my-gods/tree/main/.god-skills/agent-benchmarking commit 076e1df5cc

Frequently asked questions

npx skillmds@latest add akillness/agent-benchmarking