Ml LLM Evaluation

大模型评估纪律:榜单分数是参照物不是成绩单——benchmark 与真实任务存在分布鸿沟,NFL 教训在 LLM 时代重演,外推无效。当用户问"榜单排名和实测为什么不一致"、"测试集是不是被污染"、 "用 GPT 打分靠谱吗",或要组织人工评估时激活。动作:自有分布抽测补鸿沟;三探针查污染; 人工评估先定 rubric 与一致性校验;LLM-as-judge 校正位置/自偏爱/长度偏差。不适用于:通用三层 评估设计(ml-evaluation-design)。触发词: benchmark, leaderboard, 数据污染 contamination, LLM-as-judge, 人工评估

fieldlu 0301007 2 files · 20.4 KB Updated

File contents

fieldlu/Machine-learning-skills/tree/main/skills/ml-llm-evaluation commit 0301007190

Frequently asked questions

npx skillmds@latest add fieldlu/ml-llm-evaluation