RAG召回效果评测Skill

RAG 召回评测指标(召回率/准确率/MRR)与切片质量评估方法。当需要量化评测 RAG 检索效果与切片质量时使用。

Sky-Cube 6fb650c 2.3 KB Updated

File contents

RAG召回效果评测Skill

适用场景

AI 专项测试环节,构建评测集量化 RAG 检索召回效果,评估切片质量,并定位召回失败原因。

执行步骤

  1. 构建评测集:问题 + 标准答案 + 相关文档/切片标注,≥50 条覆盖各业务主题;标注须人工或权威来源确认,不得用待测系统自标注。
  2. 计算召回指标(先写清口径:K 取值、命中判定标准、分母口径):
    • 召回率 Recall@K:Top-K 检索结果中命中相关切片的比例。
    • 准确率 Precision@K:Top-K 结果中相关切片占比。
    • MRR:首个相关切片排名的倒数,取所有 query 的均值。
    • 答案准确率:基于召回生成的回答与标准答案的一致率(召回的下游效果)。
  3. 评估切片质量:
    • 语义完整性:切片是否截断语义单元(段落/步骤/表格)。
    • 粒度合理性:过长/过短均影响检索,以实测指标为准调整。
    • 元数据完整:标题/章节/版本等元数据是否保留,支撑过滤与归因。
  4. 执行评测:逐 query 检索 → 记录命中与排名 → 计算指标,分主题拆解。
  5. 归因与优化:召回失败归因(切片过碎/向量化效果差/查询改写不足)→ 输出优化建议(切片策略调整、混合检索、重排)。

规范要点

  • 评测集标注必须独立权威,禁止「用被测系统生成答案再反过来打分」的自我验证。
  • 指标口径在报告中写明:K 取值、命中判定、分母定义,保证结果可复算。
  • 结果如实呈现:指标未达目标如实报告,不得挑数据美化;未评测的主题标注未评测。
  • 切片质量与召回指标联动分析:指标差时先查切片质量,再查向量化与检索策略。
  • 具体向量库/检索/重排 API 与参数以官方文档为准。

输出模板

## RAG召回评测报告
| 指标 | 实测值 | 目标 | 是否达标 |
## 分主题召回明细
## 切片质量评估结论
## 失败归因与优化建议

自检清单

  • 评测集有独立权威标注
  • 指标口径明确可复算
  • 分主题拆解,覆盖各业务主题
  • 有失败归因与优化建议

Sky-Cube/fullflow-dev-agent/tree/main/.claude/skills/rag-evaluation commit 6fb650c1d3

Frequently asked questions

npx skillmds@latest add sky-cube/rag-skill-2