Advanced Evaluation

This skill should be used when the user asks to "implement LLM-as-judge", "compare model outputs", "create evaluation rubrics", "mitigate evaluation bias", or mentions direct scoring, pairwise comparison, position bias, evaluation pipelines, or automated quality assessment.

guanyang b95b16e 15.9 KB Updated

File contents

guanyang/antigravity-skills commit b95b16e2c8

Frequently asked questions

npx skillmds@latest add guanyang/advanced-evaluation