Run Model Eval

Use when running the Eval-v1 agent-reliability benchmark (packages/web/eval) — benchmarking a newly released Ollama Cloud model, re-running or adding scenarios, refreshing the published dataset in packages/web/eval/data/, or when a long sweep needs unattended keep-alive (watchdog), stalls, or produced suspicious/contaminated results.

heypinchy Updated

File contents

heypinchy/pinchy/tree/main/.claude/skills/run-model-eval commit 77df0b6cc4

Frequently asked questions

npx skillmds@latest add heypinchy/run-model-eval