# AI Literacy Build Eval Dataset

> Assembles Coze Loop (扣子罗盘) eval CSV/JSONL for 结果评分v2 from a manifest of answer types and generated deliverable files. Use when building or refreshing the result-scoring eval set after generating candidate outputs with ai-literacy-generate-deliverable.

- Skill: `pv56bkd4y8-design/ai-literacy-build-eval-dataset` (Agent Skill)
- Install (CLI): `npx skillmds@latest add pv56bkd4y8-design/ai-literacy-build-eval-dataset`
- Raw SKILL.md: https://api.skillmd.com/api/skills/pv56bkd4y8-design/ai-literacy-build-eval-dataset/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Data & Analytics
- Author: pv56bkd4y8-design (https://skillmd.com/u/pv56bkd4y8-design)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/pv56bkd4y8-design/ai-literacy-build-eval-dataset

---


# 组装结果评分评测集

将 **manifest（答案类型清单）** + **`outputs/*.md` 长文交付物** + **`materials/` 题干材料** 合并为扣子罗盘可导入文件。

## 何时使用

- 已用 `ai-literacy-generate-deliverable` 生成或更新了 `outputs/`
- 需要刷新 `结果评分v2-评测集-罗盘导入.csv`
- 用户要求「按答案类型形成评测集」

## 评测集目录

默认目录名 **`AI素养-结果评分评测集`**，或通过环境变量指定：

```bash
export AI_LITERACY_EVAL_ROOT="/绝对路径/你的评测集目录"
```

目录结构：

```text
{AI_LITERACY_EVAL_ROOT}/
├── materials/          # Q*-任务背景.txt  Q*-材料.txt
├── outputs/            # Q1-minimal_pass.md 等（skill1 产出）
├── manifest.json       # 样本清单（完整版 75 条）
└── （可选）scripts/    # 可与本仓库 eval-toolkit/scripts 同步
```

## 工作流

### 1. 编辑 manifest

在评测集根目录维护 `manifest.json`。每条 case 示例：

```yaml
- case_id: Q1-M01
  question_id: Q1
  answer_type: minimal_pass
  case_label: 基本合格
  test_focus: 准确性
  reference_dim1: 52
  reference_dim2: 50
  reference_dim3: 48
  reference_total: 50
  reference_notes: "≥2处数据回指；未比选全部方案"
  output_file: Q1-minimal_pass.md   # 可选
  copy_from: null                   # 一致性：填 Q1-M01 则正文复制该 case
```

`answer_type` 须在 [answer-types.md](../ai-literacy-generate-deliverable/answer-types.md) 中存在。

### 2. 生成交付物（若尚未生成）

对每个 manifest 条目，若无对应 `outputs/` 文件：

→ 使用 skill **`ai-literacy-generate-deliverable`**，传入该题 `task_background`、`material_info`、`answer_type`。

`copy_from` 条目：复制源 case 正文，勿重写。

### 3. 运行组装脚本

从本 Skill 仓库（或评测集内同步的 scripts）执行：

```bash
export AI_LITERACY_EVAL_ROOT="/path/to/AI素养-结果评分评测集"
python3 eval-toolkit/scripts/build_eval_dataset_from_outputs.py
```

若在评测集目录下且已设置 `AI_LITERACY_EVAL_ROOT` 或当前目录含 `manifest.json`，也可：

```bash
cd "$AI_LITERACY_EVAL_ROOT"
python3 /path/to/cursor-skills-ai-literacy-eval/eval-toolkit/scripts/build_eval_dataset_from_outputs.py
```

产出（写在评测集根目录）：

| 文件 | 用途 |
|------|------|
| `结果评分v2-评测集-罗盘导入.csv` | 上传扣子罗盘 |
| `结果评分v2-评测集.csv` | 含数值列，自建评估器 |
| `结果评分v2-评测集.jsonl` | 程序读取 |

### 4. 校验

```bash
python3 eval-toolkit/scripts/list_pending_outputs.py
```

脚本会列出缺失 output 与「过短」警告（`admission_*` 短样本除外）。

## 扣子罗盘列映射

| CSV 列 | 罗盘角色 |
|--------|----------|
| `task_background` | 输入 |
| `material_info` | 输入 |
| `candidate_output` | 输入 |
| `reference_output` | 预期输出 |
| `case_id` / `question_id` / `case_label` / `test_focus` | 元数据（可选） |

实验配置见评测集内的 `扣子罗盘-上传与实验配置.md`（若有）。

## 默认 manifest 范围

脚本假定 `materials/` 下有 Q1–Q5 的 `任务背景` 与 `材料` 文件。新增题：增加 `Q6-*.txt` 并在 manifest 中写 `question_id: Q6`。

## 延伸阅读

- 生成交付物：[../ai-literacy-generate-deliverable/SKILL.md](../ai-literacy-generate-deliverable/SKILL.md)
- 本仓库说明：[../../README.md](../../README.md)

