LLM Evaluation

Implement comprehensive evaluation strategies for LLM applications — automated metrics (BLEU, ROUGE, BERTScore, RAG metrics), A/B testing with statistical rigor, regression detection, and benchmarking. Use when measuring agent quality, comparing models or prompts, or building eval pipelines for LangGraph or Google ADK agents.

kumaran-is 6914a90 5 files · 60.9 KB Updated

File contents

kumaran-is/claude-code-onboarding/tree/main/.claude/skills/llm-evaluation commit 6914a90a2f

Frequently asked questions

npx skillmds@latest add kumaran-is/llm-evaluation