# 回答准确性评测Skill

> AI 回答准确性的评测方法(评测集构建、打分口径)。当需要评测大模型应用回答质量、构建评测集并量化准确率时使用。

- Skill: `sky-cube/skill-46` (Agent Skill)
- Install (CLI): `npx skillmds@latest add sky-cube/skill-46`
- Raw SKILL.md: https://api.skillmd.com/api/skills/sky-cube/skill-46/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: Sky-Cube (https://skillmd.com/u/sky-cube)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/sky-cube/skill-46

---

# 回答准确性评测Skill

## 适用场景
AI 专项测试环节,评测模型回答与标准答案/事实的一致性。

## 执行步骤
1. 构建评测集:按业务场景分层抽样(常见/边界/长尾),每题含问题 + 标准答案 + 判定要点。
2. 评测集规模:首轮 ≥50 条,覆盖所有业务类型;答案必须有可靠出处。
3. 执行评测:真实调用被测应用,记录原始输出。
4. 打分:准确 / 部分准确 / 错误 / 拒答,按判定要点逐项核对。
5. 统计指标:准确率、部分准确率、错误率、拒答率,分场景拆解。
6. 分析错例:归因(检索缺失/Prompt 问题/模型能力),输出改进建议。

## 规范要点
- 评测集答案必须有出处(文档/事实依据),评测集本身要过人工抽检。
- 打分口径先定后测:什么算「部分准确」写清判定规则,保持打分一致性。
- 结论必须附样例证据(输入/输出/判定),禁止只给百分比。
- 拒答也分好坏:该拒答时拒答算正确,不该拒答时拒答算错误。

## 输出模板
```
## 评测报告
| 场景 | 准确 | 部分准确 | 错误 | 拒答 | 准确率 |
## 错例分析(样例 + 归因 + 建议)
```

## 自检清单
- [ ] 评测集有出处且规模达标
- [ ] 打分口径明确且执行一致
- [ ] 结论附样例证据
- [ ] 错例有归因与改进建议

