Multi Agent Eval Harness

Role-level metrics, coordination-failure tests, and transcript grading for multi-agent systems. Use when single-agent eval misses bugs that only appear when agents collaborate — handoff drops, role drift, blame loops, deadlocks.

akillness 5de6675 3.2 KB Updated 42 repo stars

File contents

akillness/oh-my-gods/tree/main/.god-skills/multi-agent-eval-harness commit 5de667561f

Frequently asked questions

npx skillmds@latest add akillness/multi-agent-eval-harness