Babysitting Evals

Use for monitoring, diagnosing, and intervening in RUNNING Inspect AI evaluations via the `inspect ctl` command-line control channel. Triggers when: watching a live eval for stalls/errors/retry failures, checking progress of an active eval process, launching an eval you'll monitor in parallel, finding problematic samples in a running eval, cancelling a stuck sample or task, pausing a running eval and resuming it in place (without killing the process), re-running an errored sample, or retuning a running eval's concurrency or timeouts.

meridianlabs-ai Updated

File contents

meridianlabs-ai/inspect-skills/tree/main/plugins/inspect-skills/skills/babysitting-evals commit 1bdaa42217

Frequently asked questions

npx skillmds@latest add meridianlabs-ai/babysitting-evals