AI Evaluation

Practical knowledge for evaluating AI/LLM systems. Covers language modeling metrics (perplexity, cross-entropy), exact evaluation methods (functional correctness, similarity), AI-as-judge patterns, comparative evaluation, evaluation criteria for production systems, model selection workflows, and designing end-to-end evaluation pipelines. Use this skill when: - Designing an evaluation strategy for an LLM application - Choosing between models or providers (build vs buy) - Selecting evaluation metrics (perplexity, BLEU, semantic similarity) - Setting up AI-as-judge evaluation - Interpreting public benchmarks (MMLU, HumanEval, etc.) - Building an evaluation pipeline with scoring rubrics

ebarti fbdecb7 31 files · 168.9 KB Updated

File contents

ebarti/skills/tree/main/ai-evaluation commit fbdecb7321

Frequently asked questions

npx skillmds@latest add ebarti/ai-evaluation