Evaluation Harness

Builds an evaluation harness to measure LLM accuracy, reliability, and performance on a task. Use when benchmarking models, comparing prompts, or tracking quality regressions.

Nikoxkx Updated

File contents

Nikoxkx/Agent-Skills/tree/main/skills/ai-ml/evaluation-harness commit d53ce90ed9

Frequently asked questions

npx skillmds@latest add nikoxkx/evaluation-harness