AI Evaluation

Use when designing an evaluation framework for AI/LLM features. Covers golden dataset creation, automated scoring rubrics, hallucination detection, regression testing infrastructure, and production monitoring. Do not use for prompt design (use prompt-engineering) or RAG pipeline architecture (use rag-architecture).

tomevault-io Updated

File contents

tomevault-io/skills-registry/tree/main/dtsong--my-claude-setup--ai-evaluation commit 08b74e215e

Frequently asked questions

npx skillmds@latest add tomevault-io/ai-evaluation