LLM As Judge Evaluation

Evaluate LLM outputs using frontier models as judges. Use for pairwise model comparison, quality scoring with custom rubrics, and automated evaluation pipelines. Covers position bias mitigation, statistical significance, and generating preference data for DPO/RLHF.

synthetic-sciences Updated

File contents

synthetic-sciences/openscience/tree/main/backend/cli/skills/llm-tools/llm-as-judge-evaluation commit 3799d0a726

Frequently asked questions

npx skillmds@latest add synthetic-sciences/llm-as-judge-evaluation