LLM Evals

Build and run eval harnesses for features that call a model, with a keyless mock lane in CI, a budget-capped live lane behind a key gate, thresholds in a versioned file, and judge scoring. Use when adding or changing evals, testing a prompt or model swap, gating a release on output quality, or investigating a quality regression. Runs scripts/check_thresholds.py.

vignesh-nagarajan-vn Updated

File contents

vignesh-nagarajan-vn/claude-workflow-skills/tree/main/skills/llm-evals commit d330cb100e

Frequently asked questions

npx skillmds@latest add vignesh-nagarajan-vn/llm-evals