# RAG召回效果评测Skill

> RAG 召回评测指标(召回率/准确率/MRR)与切片质量评估方法。当需要量化评测 RAG 检索效果与切片质量时使用。

- Skill: `sky-cube/rag-skill-2` (Agent Skill)
- Install (CLI): `npx skillmds@latest add sky-cube/rag-skill-2`
- Raw SKILL.md: https://api.skillmd.com/api/skills/sky-cube/rag-skill-2/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: Sky-Cube (https://skillmd.com/u/sky-cube)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/sky-cube/rag-skill-2

---

# RAG召回效果评测Skill

## 适用场景
AI 专项测试环节,构建评测集量化 RAG 检索召回效果,评估切片质量,并定位召回失败原因。

## 执行步骤
1. 构建评测集:问题 + 标准答案 + 相关文档/切片标注,≥50 条覆盖各业务主题;标注须人工或权威来源确认,不得用待测系统自标注。
2. 计算召回指标(先写清口径:K 取值、命中判定标准、分母口径):
   - 召回率 Recall@K:Top-K 检索结果中命中相关切片的比例。
   - 准确率 Precision@K:Top-K 结果中相关切片占比。
   - MRR:首个相关切片排名的倒数,取所有 query 的均值。
   - 答案准确率:基于召回生成的回答与标准答案的一致率(召回的下游效果)。
3. 评估切片质量:
   - 语义完整性:切片是否截断语义单元(段落/步骤/表格)。
   - 粒度合理性:过长/过短均影响检索,以实测指标为准调整。
   - 元数据完整:标题/章节/版本等元数据是否保留,支撑过滤与归因。
4. 执行评测:逐 query 检索 → 记录命中与排名 → 计算指标,分主题拆解。
5. 归因与优化:召回失败归因(切片过碎/向量化效果差/查询改写不足)→ 输出优化建议(切片策略调整、混合检索、重排)。

## 规范要点
- 评测集标注必须独立权威,禁止「用被测系统生成答案再反过来打分」的自我验证。
- 指标口径在报告中写明:K 取值、命中判定、分母定义,保证结果可复算。
- 结果如实呈现:指标未达目标如实报告,不得挑数据美化;未评测的主题标注未评测。
- 切片质量与召回指标联动分析:指标差时先查切片质量,再查向量化与检索策略。
- 具体向量库/检索/重排 API 与参数以官方文档为准。

## 输出模板
```
## RAG召回评测报告
| 指标 | 实测值 | 目标 | 是否达标 |
## 分主题召回明细
## 切片质量评估结论
## 失败归因与优化建议
```

## 自检清单
- [ ] 评测集有独立权威标注
- [ ] 指标口径明确可复算
- [ ] 分主题拆解,覆盖各业务主题
- [ ] 有失败归因与优化建议

