RAG召回效果评测Skill
适用场景
AI 专项测试环节,构建评测集量化 RAG 检索召回效果,评估切片质量,并定位召回失败原因。
执行步骤
- 构建评测集:问题 + 标准答案 + 相关文档/切片标注,≥50 条覆盖各业务主题;标注须人工或权威来源确认,不得用待测系统自标注。
- 计算召回指标(先写清口径:K 取值、命中判定标准、分母口径):
- 召回率 Recall@K:Top-K 检索结果中命中相关切片的比例。
- 准确率 Precision@K:Top-K 结果中相关切片占比。
- MRR:首个相关切片排名的倒数,取所有 query 的均值。
- 答案准确率:基于召回生成的回答与标准答案的一致率(召回的下游效果)。
- 评估切片质量:
- 语义完整性:切片是否截断语义单元(段落/步骤/表格)。
- 粒度合理性:过长/过短均影响检索,以实测指标为准调整。
- 元数据完整:标题/章节/版本等元数据是否保留,支撑过滤与归因。
- 执行评测:逐 query 检索 → 记录命中与排名 → 计算指标,分主题拆解。
- 归因与优化:召回失败归因(切片过碎/向量化效果差/查询改写不足)→ 输出优化建议(切片策略调整、混合检索、重排)。
规范要点
- 评测集标注必须独立权威,禁止「用被测系统生成答案再反过来打分」的自我验证。
- 指标口径在报告中写明:K 取值、命中判定、分母定义,保证结果可复算。
- 结果如实呈现:指标未达目标如实报告,不得挑数据美化;未评测的主题标注未评测。
- 切片质量与召回指标联动分析:指标差时先查切片质量,再查向量化与检索策略。
- 具体向量库/检索/重排 API 与参数以官方文档为准。
输出模板
## RAG召回评测报告
| 指标 | 实测值 | 目标 | 是否达标 |
## 分主题召回明细
## 切片质量评估结论
## 失败归因与优化建议
自检清单
- 评测集有独立权威标注
- 指标口径明确可复算
- 分主题拆解,覆盖各业务主题
- 有失败归因与优化建议