Evaluate

Evaluates RAG retrieval and LLM-as-judge metrics (faithfulness, relevancy, context precision). Triggers: measure RAG quality, knowledge gap, RAG eval, golden dataset.

softspark Updated

File contents

softspark/ai-toolkit/tree/main/app/skills/evaluate commit 56bbebca9d

Frequently asked questions

npx skillmds@latest add softspark/evaluate