Advanced Evaluation

This skill should be used when the user asks to "implement LLM-as-judge", "compare model outputs", "create evaluation rubrics", "mitigate evaluation bias", or mentions direct scoring, pairwise comparison, position bias, evaluation pipelines, or automated quality assessment. Use when this capability is needed.

tomevault-io Updated

File contents

tomevault-io/skills-registry/tree/main/muratcankoylan--agent-skills-for-context-engineering--advanced-evaluation commit bba72ccfd7

Frequently asked questions

npx skillmds@latest add tomevault-io/advanced-evaluation-2