Benchmark

Multi-provider AI coding benchmark. Dispatches a task to Codex, Gemini, Claude, and Cursor-Agent in parallel, scores responses with a Claude meta-judge, and produces a ranked leaderboard with cost, time, quality, and self-eval bias metrics. Supports corpus mode (fixed OrderService + useSearchProducts tasks) for apples-to-apples comparison across runs.

greglas75 3858456 16.7 KB Updated

File contents

greglas75/zuvo/tree/main/skills/benchmark commit 3858456eb1

Frequently asked questions

npx skillmds@latest add greglas75/benchmark