Advanced Evaluation

Design and operate LLM-as-a-Judge evaluation systems using direct scoring, pairwise comparison, rubric calibration, evaluator bias mitigation, confidence scoring, and automated quality assessment. Use when building LLM-as-judge systems, comparing model responses, calibrating rubrics, debugging inconsistent evaluations, or designing A/B tests for prompt or model changes.

shipshitdev 223d790 9 files · 63.1 KB Updated

File contents

shipshitdev/skills/tree/main/skills/advanced-evaluation commit 223d790372

Frequently asked questions

npx skillmds add shipshitdev/advanced-evaluation