LLM Judge Evaluation

当需要用 LLM 自动评测模型输出(评分、择优、建评分量规、做 A/B)时使用;做出含偏差缓解、置信度校准、量规生成的可落地评测流程与结构化打分产物;不适用于纯人工评测或无判别标准的开放生成。触发词:LLM-as-judge、成对比较、位置偏差、评分量规、评测流水线

findscripter 40b2438 6.7 KB Updated

File contents

findscripter/everything-skills/tree/main/04-ai/llm-judge-evaluation commit 40b2438f22

Frequently asked questions

npx skillmds@latest add findscripter/llm-judge-evaluation