组装结果评分评测集
将 manifest(答案类型清单) + outputs/*.md 长文交付物 + materials/ 题干材料 合并为扣子罗盘可导入文件。
何时使用
- 已用
ai-literacy-generate-deliverable生成或更新了outputs/ - 需要刷新
结果评分v2-评测集-罗盘导入.csv - 用户要求「按答案类型形成评测集」
评测集目录
默认目录名 AI素养-结果评分评测集,或通过环境变量指定:
export AI_LITERACY_EVAL_ROOT="/绝对路径/你的评测集目录"
目录结构:
{AI_LITERACY_EVAL_ROOT}/
├── materials/ # Q*-任务背景.txt Q*-材料.txt
├── outputs/ # Q1-minimal_pass.md 等(skill1 产出)
├── manifest.json # 样本清单(完整版 75 条)
└── (可选)scripts/ # 可与本仓库 eval-toolkit/scripts 同步
工作流
1. 编辑 manifest
在评测集根目录维护 manifest.json。每条 case 示例:
- case_id: Q1-M01
question_id: Q1
answer_type: minimal_pass
case_label: 基本合格
test_focus: 准确性
reference_dim1: 52
reference_dim2: 50
reference_dim3: 48
reference_total: 50
reference_notes: "≥2处数据回指;未比选全部方案"
output_file: Q1-minimal_pass.md # 可选
copy_from: null # 一致性:填 Q1-M01 则正文复制该 case
answer_type 须在 answer-types.md 中存在。
2. 生成交付物(若尚未生成)
对每个 manifest 条目,若无对应 outputs/ 文件:
→ 使用 skill ai-literacy-generate-deliverable,传入该题 task_background、material_info、answer_type。
copy_from 条目:复制源 case 正文,勿重写。
3. 运行组装脚本
从本 Skill 仓库(或评测集内同步的 scripts)执行:
export AI_LITERACY_EVAL_ROOT="/path/to/AI素养-结果评分评测集"
python3 eval-toolkit/scripts/build_eval_dataset_from_outputs.py
若在评测集目录下且已设置 AI_LITERACY_EVAL_ROOT 或当前目录含 manifest.json,也可:
cd "$AI_LITERACY_EVAL_ROOT"
python3 /path/to/cursor-skills-ai-literacy-eval/eval-toolkit/scripts/build_eval_dataset_from_outputs.py
产出(写在评测集根目录):
| 文件 | 用途 |
|---|---|
结果评分v2-评测集-罗盘导入.csv |
上传扣子罗盘 |
结果评分v2-评测集.csv |
含数值列,自建评估器 |
结果评分v2-评测集.jsonl |
程序读取 |
4. 校验
python3 eval-toolkit/scripts/list_pending_outputs.py
脚本会列出缺失 output 与「过短」警告(admission_* 短样本除外)。
扣子罗盘列映射
| CSV 列 | 罗盘角色 |
|---|---|
task_background |
输入 |
material_info |
输入 |
candidate_output |
输入 |
reference_output |
预期输出 |
case_id / question_id / case_label / test_focus |
元数据(可选) |
实验配置见评测集内的 扣子罗盘-上传与实验配置.md(若有)。
默认 manifest 范围
脚本假定 materials/ 下有 Q1–Q5 的 任务背景 与 材料 文件。新增题:增加 Q6-*.txt 并在 manifest 中写 question_id: Q6。