Agent Benchmark

Run agent tasks across multiple LLMs in parallel tmux sessions, score results with a weighted rubric, track improvements over time in JSONL, and generate harness improvement recommendations. Use when comparing model performance, evaluating harness changes, or identifying agent failure patterns at scale.

alejandro-ao ce89dc3 6 files · 26.3 KB Updated

File contents

alejandro-ao/skills/tree/main/skills/agent-benchmark commit ce89dc3431

Frequently asked questions

npx skillmds@latest add alejandro-ao/agent-benchmark