Eval Frameworks

Traditional software metrics (accuracy, F1) fail to capture the quality of LLM outputs. Evaluation frameworks like Ragas and DeepEval use "LLM-as-a-judge" to quantify subjective qualities like faithfu

majiayu000 Updated 567 repo stars

File contents

majiayu000/claude-skill-registry-data/tree/main/ai-ml/eval-frameworks-cuba6112-skillfactory-2 commit dd2b4da06a

Frequently asked questions

npx skillmds@latest add majiayu000/eval-frameworks-2