LLM Evaluation

LLM output evaluation — automated metrics, LLM-as-judge, A/B testing, regression testing. Use when measuring LLM output quality, comparing prompt or model versions, building an automated eval pipeline, setting up regression tests for prompt changes, or evaluating RAG systems and bias/safety.

projectious-work Updated 0 repo stars

File contents

projectious-work/aibox/tree/main/context/templates/processkit/v0.25.1/context/skills/data-ai/llm-evaluation commit 69be75f9ea

Frequently asked questions

npx skillmds@latest add projectious-work/llm-evaluation-2