生成 AI 素养「候选人交付物」
模拟 AI 按候选人提示词生成的最终结果(不是提示词本身)。输出须足够长、有结构、像真实模型成品。
何时使用
- 为
结果评分v2建评测集,需要替换过短的candidate_output - 用户指定「答案类型」要生成对应档位的交付物
- 需对同一题生成 L/M/H 多档对比样本
评测集目录
数据目录(含 materials/、outputs/、manifest.json)默认名为 AI素养-结果评分评测集,位于当前工作区或其子路径。
自定义路径:
export AI_LITERACY_EVAL_ROOT="/绝对路径/你的评测集目录"
输入(缺一不可)
| 输入 | 说明 |
|---|---|
task_background |
题干任务要求(含交付形态) |
material_info |
材料全文(评分事实依据) |
answer_type |
见 answer-types.md 的 type_id |
question_id |
可选,如 Q1–Q5,用于选用题型语气 |
输出
- 文件:写入
{AI_LITERACY_EVAL_ROOT}/outputs/{question_id}-{answer_type}.md(无 question_id 则用{answer_type}.md) - 文首元数据(YAML frontmatter,3–5 行):
---
question_id: Q1
answer_type: minimal_pass
target_total: 48
char_target: 1200
---
- 正文:仅交付物正文(不要写「我是 AI」、不要评自己的分)
篇幅与形态(硬性)
| 指标 | 要求 |
|---|---|
| 字数 | 中文正文 800–2500 字(excellent / boundary_34_high 宜 1500+;admission_* / unusable 可 80–1200) |
| 结构 | 有标题、分级小节或表格(与任务要求的交付形态一致) |
| 语气 | 像职场报告/方案/大纲:完整句、连接词、适度套话(类型决定套话多少) |
| 禁止 | 用「(略)」「……」代替正文;不要只写摘要式 3 条 |
生成步骤
- 读 answer-types.md,确认该
answer_type的必须出现 / 必须避免行为。 - 从
material_info列出可引用的关键数字与矛盾点(生成时主动用或主动漏,由类型决定)。 - 按任务要求的产出类型选模板(简报 / 对比表 / 活动方案 / PPT 大纲 / 变革方案)。
- 撰写正文,写完后自检:
- 字数是否达标(
unusable/off_topic除外) - 是否误含「提示词」「评分标准」等元话语
- 是否符合该类型的故意缺陷(如模板型不引数据)
- 字数是否达标(
题型语气提示
| 题型 | 典型结构 |
|---|---|
| 数据分析与业务诊断 | 摘要→数据发现→系统局限→方案比选→风险 |
| 信息处理与文档提炼 | 总览表→逐家硬性核对→淘汰理由→推荐与加分项 |
| 策划撰写与创意输出 | 时间表→分区流程→人群分流→预算表→应急 |
| PPT 与演示文稿制作 | 页标题+要点(10–15 页),含数据页与改进页 |
| 复杂沟通与决策辅助 | 阶段表→培训大纲→话术示例→资源与风险 |
质量自检清单
- 长度像真实 AI 输出,不是评分员提纲
- 类型特征明显(差样本要「像认真写了但不对」;好样本要「可核对材料」)
- 未引入材料外的关键数字(除非类型要求编造/失实)
- 已保存到评测集
outputs/并告知用户路径
延伸阅读
- 类型定义与分档锚点:answer-types.md
- 长文示例:examples.md