AI Evaluation

Systematic evaluation (evals) for LLM and AI products. Design test cases, measure accuracy/quality, track regressions, benchmark models, and build continuous evaluation pipelines. Distinct from traditional software testing with probabilistic outputs.

sunnypatneedi Updated

File contents

sunnypatneedi/claude-starter-kit/tree/main/skills/engineering/ai-evaluation commit a7c00b1507

Frequently asked questions

npx skillmds@latest add sunnypatneedi/ai-evaluation