Agentbench Eval

AgentBench evaluation harness for claudemem. Covers pre-indexed repos, experiment conditions, running benchmarks, analyzing results, and managing index archives. Use when working on eval infrastructure, running experiments, or interpreting benchmark results.

MadAppGang Updated

File contents

madappgang/mnemex/tree/main/.agents/skills/agentbench-eval commit 0dccf8ab5b

Frequently asked questions

npx skillmds@latest add madappgang/agentbench-eval