# Demo Data Builder

> 为售前演示、PoC 或测试环境构造合成且可验证的档案业务数据包，包括知识图谱实体与关系、抽取提示词、跨文档编研样本、智能开放审核规则与待审核文档、人物或机构沿革、图文 PDF 和质检证据。只要用户要构造演示数据、样本数据、测试数据、合成数据、开放审核规则/审核文档或抽取提示词，就使用本 skill；不用于真实档案生产数据、普通人物传记、常规 PDF 或图片制作、正式方案和文件转换。

- Skill: `wjjjjjjjjjjj/demo-data-builder` (Agent Skill, multi-file: 13 files)
- Install (CLI): `npx skillmds@latest add wjjjjjjjjjjj/demo-data-builder`
- Raw SKILL.md: https://api.skillmd.com/api/skills/wjjjjjjjjjjj/demo-data-builder/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Docs & Writing
- Author: wjjjjjjjjjjj (https://skillmd.com/u/wjjjjjjjjjjj)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/wjjjjjjjjjjj/demo-data-builder

---


# 演示环境数据构造

使用本 skill 将一个演示场景转化为可直接用于系统演示的数据环境，包括实体定义、关系设计、编研提示词、结构化字段、来源材料、PDF 文档和简单质检说明。目标不是写一篇单独文章，而是构造一组能验证系统能力的受控样例数据。

本 Skill 主控数据包、样本契约和可测性。客户决策目标与风险判断由 `presales-consultant-persona` 约束；制作 PDF 时叠加当前 `pdf` Skill 并执行逐页视觉质检；需要生成式图片时叠加 `imagegen`。真实人物资料核验只做与样本字段有关的事实查证，不自动扩展为 `research` 的完整多视角报告。

## 核心原则

围绕“系统要证明什么能力”来构造数据：

- 知识图谱：实体和关系必须能从生成文档中被抽取出来。
- 图谱抽取提示词：每套知识图谱数据必须同步生成可被目标系统直接接收的提示词。知识图谱任务必须读取 `references/knowledge-graph-prompt-contract.md`，默认使用其中固定章节、固定 JSON 字段和质量门槛；用户提供既有样例或系统 schema 时，逐字沿用用户的章节结构和字段名。提示词必须控制在 5000 字以内。
- 领导人事任免图谱：这是知识图谱的独立子类型。任务涉及领导任免、干部履历、机构旧称/现名归一、主持工作与正式任命区分时，还必须读取 `references/leadership-appointment-graph-pattern.md`，不得用该子类型覆盖其他知识图谱模式。
- 智能编研：提示词和来源材料必须迫使模型综合多份材料，而不是改写单一文档。
- 图文来源 PDF：正文必须形成足够业务语境，图片必须承担解释、证据或展示作用，不能用大图掩盖内容单薄。用户要求丰富段落或加入图片时，必须读取 `references/visual-pdf-and-multimodal-compilation.md`。
- 多模态智能编研：提示词必须要求发现 PDF 内嵌图片、建立稳定图片 ID、区分图中可见事实与推断、选择图片回填正文，并规定无法取得图片 URI 时的降级占位。具体规则见 `references/visual-pdf-and-multimodal-compilation.md`。
- 智能开放审核：规则表与待审核文档必须分开构造；规则至少保留用户给定的“开放审核规则名称（暂定）”“规则编号（拟定）”“开放标志”三列，文档以段落和图片为主要证据单元，表格只作补充，并为每个预期命中保留可回溯证据。
- 人物/机构专题：字段要在多份文档中保持一致，便于系统聚合。
- 以图搜图/照片档案：优先使用用户提供或公开合法来源图片，保留来源记录，避免未经核验的身份判断。

如果任务涉及真实人物、真实公司、现任领导、政策、新闻、价格或近期事件，除非用户明确提供数据并说明按演示前提使用，否则必须先联网核验。来源优先级依次为：官方网站、任免文件、政府或国资平台、正式公告和原始档案；有署名、日期及原始出处的权威媒体；通用搜索引擎、百科和搜索摘要仅作发现线索。只有可追溯页面明确出现的字段，才能进入“可直接引用事实”。不得为真实人物编造生卒年、籍贯、正式职务、履历或个人成就，也不得收集身份证号、联系方式、家庭信息、人脸特征等与演示目标无关的敏感字段。

## 标准流程

1. 重构演示目标。
   判断客户实际要看的能力：实体抽取、关系构建、编研质量、开放审核判定、人物聚合、以图搜图，还是档案检索。

2. 选择数据模式。
   根据任务类型读取 `references/workflow-patterns.md` 中对应模式：知识图谱、智能编研、智能开放审核、人物/机构专题、以图搜图/照片档案。开放审核任务还必须读取 `references/open-audit-pattern.md`；知识图谱任务还必须读取 `references/knowledge-graph-prompt-contract.md`，不能仅凭通用经验自行设计输出 JSON。领导人事任免图谱在此基础上追加读取 `references/leadership-appointment-graph-pattern.md`。
   当任务要求 PDF 内容更丰富、嵌入图片、图文编研、从 PDF 抽图或把图片回填到编研成果时，追加读取 `references/visual-pdf-and-multimodal-compilation.md`。

3. 进行多源资料发现。
   对真实人物或机构，先查官方网站、任免文件、政府或国资平台、正式公告和原始档案，再用权威媒体补充。搜索引擎、百科和搜索摘要只用于发现候选页面，不能因排名靠前或多个摘要相同就提升为事实。记录页面标题、发布主体、日期、URL 和支持字段；再判断哪些字段可直接引用，哪些只能作为待核验线索。

4. 先定义字段或实体 schema，再写文档。
   schema 要小而可测。默认知识图谱控制在 4-6 个实体类型，人物专题控制在 6-8 个字段，除非用户明确要求扩展。实体类型配置与提示词中的类型名称必须逐字一致。领导人事任免图谱默认固定为人物、机构、事件、时空四类；职务进入动态属性和事件语义，不自动增加第五类实体。

5. 做字段可用性分级。
   对每个关键字段标注：
   - 🟢 直接可用：原文或可靠来源有明确值。
   - 🟡 可推断/可概括：能从材料中审慎归纳，但颗粒度有限。
   - 🔴 严重缺失：来源材料没有，不得编造，只能标为未知或待补充。
   字段分级会影响文档写法：强字段用于标题、表格和反复出现；弱字段放在字段位说明，不要让“资料缺失”占据正文主体。

6. 有意构造来源材料。
   将信息分散在多份文件中。在标题、表格、正文中重复关键实体或字段。必要时加入一个模糊点、缺失字段或未闭环事项，用来测试模型判断能力。
   图文增强模式下，单份 PDF 应包含多段业务叙事、至少一个结构化内容区和至少一张有业务用途的图片；关键事实必须同时落在可抽取文本中，不能只存在于图片里。生成式场景图必须标注为演示模拟，程序化图表必须保留统计口径。开放审核模式下，至少安排段落命中、图片命中、表格补充命中、无命中或边界待复核中的若干判断点，让审核结论能回指实际内容。

7. 生成交付物。
   默认交付物包括：
   - Markdown 目录或说明文件
   - 开放审核场景下的规则表、待审核文档清单、图片清单（如有）和审核标准答案/证据索引
   - PDF 来源材料
   - 可选 CSV/Markdown 结构化字段表
   - 知识图谱场景下的图谱抽取提示词文件
   - 智能编研场景下的编研提示词文件
   - 图文增强场景下的独立图片资产、图片来源与使用清单、图注和编研回填示例

8. 做输出质检。
   使用 `pdfplumber` 或同类工具抽取 PDF 文本，确认目标字段或实体能被识别。如果故意生成扫描件或图片型 PDF，要在结果中说明。知识图谱提示词必须运行 `scripts/validate_graph_prompt.py`；未通过字段、JSON、关系端点、证据和长度校验时不得交付。
   图文增强 PDF 运行 `scripts/validate_visual_pdf_bundle.py`，检查逐页文本、空白页、内嵌图片和文本层；多模态编研提示词运行 `scripts/validate_multimodal_compilation.py` 做静态安全 lint，检查图片发现、稳定 ID、OCR/图像理解、回填、溯源、降级和冲突指令。默认渲染并检查全部生成页；批量规模确实过大只能抽样时，必须说明抽样范围，不得声称全量视觉验收通过。
   开放审核数据包运行 `scripts/validate_open_audit_bundle.py --rules <规则表.csv> --documents <文档清单.csv> --ground-truth <审核标准答案.csv>`，检查规则三列契约、规则编号唯一性、`开放/限制` 枚举、文档与规则引用、证据类型和证据定位；存在图片清单时追加 `--image-manifest <图片清单.csv>`，需要检查文件存在性时追加 `--root <数据包根目录>`。

9. 说明使用方法。
   最终回复中列出文件，说明每组文件验证什么能力，并指出哪些字段是直接可用、可推断、刻意缺失、待确认或未闭环。

## 知识图谱提示词兼容性契约

知识图谱提示词首先是一份系统接口契约，其次才是一段抽取说明。结构看似完整但字段名不匹配，系统仍然无法使用。

默认采用以下契约，除非用户提供了另一套明确 schema：

1. 章节顺序固定为：`# 角色`、`# 实体识别规则`、`## 实体处理约束`、`# 关系抽取规则`、`## 实体-关系-实体`、`# 输出格式`、`# 完整示例`、`# 执行指令`。
2. `entities` 中每个对象默认只包含 `name`、`type`。
3. `relations` 中每个对象默认只包含 `source`、`target`、`relation_type`、`relation_time`、`evidence`。
4. 不要默认增加 `id`、`aliases`、`source_file`、`fact_boundary`、`attributes`、`source_id`、`target_id` 等字段。只有用户或目标系统明确要求时才能增加。
5. 关系键使用 `relation_type`，不要改成 `relation`；时间键使用 `relation_time`，无明确时间填字符串 `none`。
6. `source`、`target` 必须与 `entities[].name` 完全一致；实体 `type` 必须从用户或本次配置的分类列表中原样复制。
7. 完整示例必须包含合法 JSON，不使用省略号替代字段或关系；示例中每条 `evidence` 必须逐字存在于示例输入文档。
8. 执行指令必须保留 `{{档案原文}}`，并明确要求运行时直接输出 JSON，不使用 Markdown 包裹，不添加解释。
9. 用户提供的样例、字段名、占位符或系统接口说明优先级最高。沿用其格式，只替换实体分类、工程约束、关系规则和完整示例。
10. 提示词交付前运行校验：

```powershell
python scripts/validate_graph_prompt.py <提示词.md> --types 工程项目 组织机构 工程标段 工程设施 档案文件 问题事项
```

出现任一失败项时，修正后重新校验。不要把“结构说明文档”“标准答案 JSON”和“可直接投喂模型的抽取提示词”混为同一个文件。

## 二次优化规则

当用户基于生成结果指出字段效果问题时，不要只局部改几句话，要按字段质量重新构造一版：

- 对 🟢 字段：提高出现频次，放入每份 PDF 的固定字段表。
- 对 🟡 字段：给出审慎推断值，并说明颗粒度限制。
- 对 🔴 字段：保留缺失状态，但压缩缺失说明，避免多份文档重复同一大段“资料不足”。
- 对身份标签、主要成就等展示型字段：合并去重，形成更适合系统展示的标签集和成就集。
- 对真实人物：把机构成果写成“任职阶段关联成果”，不要写成“个人独立完成”。
- 生成新版目录、结构化字段表和新版 PDF 文件夹，不覆盖旧版，便于对比演示。
- 如果用户指出 PDF 内容偏薄，不要只放大字号或增加空白页；按“业务背景—过程—判断—结果—边界”补写有信息增量的段落，并把图、表与正文做互证。
- 如果用户要求加入图片，优先使用用户提供或可追溯公开图片；无法安全取得时，使用明确标注的生成式场景图或程序化示意图。同步生成图片清单并改写编研提示词，使图片能够被抽取、筛选和回填。

## 地域文化档案与领导汇报专题模式

当任务要求围绕某个城市、区域或地方文化构造知识图谱、智能编研和智能开放审核数据时，按“地域文化主线—档案对象—结构化数据—审核边界—领导汇报材料”组织一套可独立交付的新数据包。

- 先选定一条连续的主题主线，例如历史地名与城市沿革、传统技艺与传承、数字档案资源、文化保护政策和公共利用；实体、关系、源文档、编研事实台账与审核规则都围绕这条主线展开，不为凑数据堆砌无关人物或机构。
- 源 PDF、内嵌图片和表格必须以主题对象本身为叙事中心：写城市就写其历史沿革、空间线索和文化演变，写技艺就写形成背景、工艺特征、传承与保护，写数字档案就写建设节点、资源类型和统计口径，写开放审核就写资料内容、授权状态和开放处理结论。
- 源材料正文不得出现“本条目把……拆成数据对象”“演示时可点击/反查/回看”“预期命中”“实体识别提示”“图谱判断点”“编研任务”“演示重点”“现场操作建议”“回放说明”“用于验证”等演示操作、模型过程或元叙述。查询路径、讲稿、规则命中、标准答案、验收口径和系统操作说明统一放入导航与质检目录。
- 当用户明确要求“构造文档中的实际内容”或指出不要把演示逻辑写入正文时，将该要求视为源材料交付硬门槛：源 PDF 的标题、段落、表格、图题和图片内容都必须直接描述主题对象、历史/技艺/节俗/传承/活动/授权等业务事实；“点击、反查、回看、用于验证、预期命中、实体识别、编研任务、现场讲解”等话术不得出现在源 PDF、待审核文档或最终编研正文中，只能放入导航、讲稿、标准答案和质检文件。
- 图片必须展示主题对象本身或其可核验的内容线索。非遗场景优先使用项目器物、技艺材料、节俗意象、戏剧舞台、作品细节、展陈卡片或授权凭证示意；不要用流程图、系统架构图、节点关系图或空白占位图冒充主题图片。若使用程序化或生成式图片，图题和图片清单要写明生成方式、关联对象和“不对应真实现场/不作为唯一事实证据”的边界。
- 生成后逐份抽取源 PDF 全文并扫描禁用演示逻辑词；发现命中时必须回写源文档内容或将该说明迁移到导航/质检目录，不能仅在交付说明中解释为“只是示例”。
- 可以参考用户上传文件的页眉、页脚、标题、正文层级、字体、页码和版式，但不复制其事实内容；新包应在正文中明确“演示模拟”及事实边界，避免把示例材料误作正式馆藏或正式业务结论。
- 用户要求“重新生成”“不要现有数据包”或同义表述时，建立新的带版本标识的输出根目录和压缩包；不得读取旧包作为内容来源，不覆盖、不删除旧包。新包完成后应核验新旧目录路径与文件清单确实分离。
- 领导汇报材料要把价值判断落到档案业务：说明地方文化资源为何适合建立实体关系、跨文档编研和分层开放审核，并同时呈现直接可用事实、公开报道时点、演示模拟事项、授权待核事项和当前状态待核事项。
- 该模式完成后至少检查：知识图谱实体与关系能从源文档抽取；编研事实跨 4—6 份材料互证；开放审核同时覆盖段落、图片、表格、无命中或边界复核；每份源 PDF 有中文文本层、2—4 页、约 800—1800 个可抽取中文字符、至少一张有业务用途的图；所有源 PDF 完成禁用演示逻辑词扫描。

## 输出纪律

- 最终交付物默认放在当前会话的 `outputs/` 目录，除非用户指定其他位置。
- 业务目标不要求真实事实时，优先使用虚构但合理的数据。
- 涉及真实组织或人物时，区分“用户提供前提”和“公开核验事实”。
- 未知字段分字段写作，如 `出生年份：公开资料未见明确披露`、`当前状态：按截至日期的公开资料核验` 或 `待补充确认`，不得用混合符号拼接或猜测补齐。
- 面向中文售前演示的材料，默认使用正式中文业务表达。
- 生成 PDF 时使用支持中文的字体，并验证文本层可抽取。
- 图文增强 PDF 默认让每份材料具备连续业务叙事；除非用户另有要求，通常控制为 2-4 页、800-1800 个可抽取中文字符、3-6 个正文段落、至少一个表格或图示。数字不是机械凑字指标，内容必须推动业务事实、判断或边界。
- 图片不得只是装饰。每张图片必须具备图片 ID、图题、来源/生成方式、关联材料、事实边界和编研候选状态；生成式图片不得冒充真实现场照片。
- 多模态编研提示词必须规定：从 PDF 发现图片；执行 OCR/图像理解；区分可见事实和推断；选择 3-5 张不重复图片回填对应章节；使用图片 URI/ID；无 URI 时输出 `【插图建议】`；文末生成插图来源与使用清单。
- 知识图谱场景默认同时交付实体配置、关系配置、抽取提示词和标准答案，但抽取提示词的运行时 JSON 必须遵循兼容性契约，不能把标准答案中的扩展字段带入运行时 schema。
- 新增领域图谱子类型时，采用“通用知识图谱流程 + 独立领域参考文件”的扩展方式；保留已有实体类型、关系配置和工作模式，不把某个领域规则改写成全局默认规则。

## 何时需要先问用户

只有当场景身份会影响整套数据时，才问一个关键确认问题，例如：使用真实客户还是虚构客户、真实人物还是虚构人物、是否允许联网核验。其他情况下做保守假设并继续执行。

