AI Evaluation Suite

Comprehensive AI/LLM evaluation toolkit for production AI systems. Covers LLM output quality, prompt engineering, RAG evaluation, agent performance, hallucination detection, bias assessment, cost/token optimization, latency metrics, model comparison, and fine-tuning evaluation. Includes BLEU/ROUGE metrics, perplexity, F1 scores, LLM-as-judge patterns, and benchmarks like MMLU and HumanEval.

majiayu000 a0e71ec 2 files · 13.6 KB Updated 567 repo stars

File contents

majiayu000/claude-skill-registry-data/tree/main/ai-llm/ai-evaluation-suite commit a0e71ecad2

Frequently asked questions

npx skillmds add majiayu000/ai-evaluation-suite