Eval Harness Builder

Build systematic evaluation frameworks for LLM applications and AI agent systems. Use this skill when you need to measure LLM output quality, compare model performance, evaluate RAG accuracy, benchmark agent reliability, or set up continuous evaluation pipelines. Covers both automated metrics and LLM-as-a-Judge approaches with bias mitigation.

viliawang-pm 5ececf8 9.7 KB Updated

File contents

viliawang-pm/ai-engineering-toolkit/tree/main/skills/eval-harness-builder commit 5ececf8ab8

Frequently asked questions

npx skillmds add viliawang-pm/eval-harness-builder