回答准确性评测Skill
适用场景
AI 专项测试环节,评测模型回答与标准答案/事实的一致性。
执行步骤
- 构建评测集:按业务场景分层抽样(常见/边界/长尾),每题含问题 + 标准答案 + 判定要点。
- 评测集规模:首轮 ≥50 条,覆盖所有业务类型;答案必须有可靠出处。
- 执行评测:真实调用被测应用,记录原始输出。
- 打分:准确 / 部分准确 / 错误 / 拒答,按判定要点逐项核对。
- 统计指标:准确率、部分准确率、错误率、拒答率,分场景拆解。
- 分析错例:归因(检索缺失/Prompt 问题/模型能力),输出改进建议。
规范要点
- 评测集答案必须有出处(文档/事实依据),评测集本身要过人工抽检。
- 打分口径先定后测:什么算「部分准确」写清判定规则,保持打分一致性。
- 结论必须附样例证据(输入/输出/判定),禁止只给百分比。
- 拒答也分好坏:该拒答时拒答算正确,不该拒答时拒答算错误。
输出模板
## 评测报告
| 场景 | 准确 | 部分准确 | 错误 | 拒答 | 准确率 |
## 错例分析(样例 + 归因 + 建议)
自检清单
- 评测集有出处且规模达标
- 打分口径明确且执行一致
- 结论附样例证据
- 错例有归因与改进建议