LLM Evaluation

LLM output evaluation — automated metrics, LLM-as-judge, A/B testing, regression testing. Use when measuring LLM output quality, comparing prompt or model versions, building an automated eval pipeline, setting up regression tests for prompt changes, or evaluating RAG systems and bias/safety.

projectious-work Updated 0 repo stars

File contents

projectious-work/aibox/tree/main/context/templates/processkit/v0.13.0/context/skills/data-ai/llm-evaluation commit c885df10dd

Frequently asked questions

npx skillmds@latest add projectious-work/llm-evaluation