回答准确性评测Skill

AI 回答准确性的评测方法(评测集构建、打分口径)。当需要评测大模型应用回答质量、构建评测集并量化准确率时使用。

Sky-Cube 7eedcd5 1.5 KB Updated

File contents

回答准确性评测Skill

适用场景

AI 专项测试环节,评测模型回答与标准答案/事实的一致性。

执行步骤

  1. 构建评测集:按业务场景分层抽样(常见/边界/长尾),每题含问题 + 标准答案 + 判定要点。
  2. 评测集规模:首轮 ≥50 条,覆盖所有业务类型;答案必须有可靠出处。
  3. 执行评测:真实调用被测应用,记录原始输出。
  4. 打分:准确 / 部分准确 / 错误 / 拒答,按判定要点逐项核对。
  5. 统计指标:准确率、部分准确率、错误率、拒答率,分场景拆解。
  6. 分析错例:归因(检索缺失/Prompt 问题/模型能力),输出改进建议。

规范要点

  • 评测集答案必须有出处(文档/事实依据),评测集本身要过人工抽检。
  • 打分口径先定后测:什么算「部分准确」写清判定规则,保持打分一致性。
  • 结论必须附样例证据(输入/输出/判定),禁止只给百分比。
  • 拒答也分好坏:该拒答时拒答算正确,不该拒答时拒答算错误。

输出模板

## 评测报告
| 场景 | 准确 | 部分准确 | 错误 | 拒答 | 准确率 |
## 错例分析(样例 + 归因 + 建议)

自检清单

  • 评测集有出处且规模达标
  • 打分口径明确且执行一致
  • 结论附样例证据
  • 错例有归因与改进建议

Sky-Cube/fullflow-dev-agent/tree/main/.claude/skills/answer-accuracy-eval commit 7eedcd5224

Frequently asked questions

npx skillmds@latest add sky-cube/skill-46