演示环境数据构造
使用本 skill 将一个演示场景转化为可直接用于系统演示的数据环境,包括实体定义、关系设计、编研提示词、结构化字段、来源材料、PDF 文档和简单质检说明。目标不是写一篇单独文章,而是构造一组能验证系统能力的受控样例数据。
本 Skill 主控数据包、样本契约和可测性。客户决策目标与风险判断由 presales-consultant-persona 约束;制作 PDF 时叠加当前 pdf Skill 并执行逐页视觉质检;需要生成式图片时叠加 imagegen。真实人物资料核验只做与样本字段有关的事实查证,不自动扩展为 research 的完整多视角报告。
核心原则
围绕“系统要证明什么能力”来构造数据:
- 知识图谱:实体和关系必须能从生成文档中被抽取出来。
- 图谱抽取提示词:每套知识图谱数据必须同步生成可被目标系统直接接收的提示词。知识图谱任务必须读取
references/knowledge-graph-prompt-contract.md,默认使用其中固定章节、固定 JSON 字段和质量门槛;用户提供既有样例或系统 schema 时,逐字沿用用户的章节结构和字段名。提示词必须控制在 5000 字以内。 - 领导人事任免图谱:这是知识图谱的独立子类型。任务涉及领导任免、干部履历、机构旧称/现名归一、主持工作与正式任命区分时,还必须读取
references/leadership-appointment-graph-pattern.md,不得用该子类型覆盖其他知识图谱模式。 - 智能编研:提示词和来源材料必须迫使模型综合多份材料,而不是改写单一文档。
- 图文来源 PDF:正文必须形成足够业务语境,图片必须承担解释、证据或展示作用,不能用大图掩盖内容单薄。用户要求丰富段落或加入图片时,必须读取
references/visual-pdf-and-multimodal-compilation.md。 - 多模态智能编研:提示词必须要求发现 PDF 内嵌图片、建立稳定图片 ID、区分图中可见事实与推断、选择图片回填正文,并规定无法取得图片 URI 时的降级占位。具体规则见
references/visual-pdf-and-multimodal-compilation.md。 - 智能开放审核:规则表与待审核文档必须分开构造;规则至少保留用户给定的“开放审核规则名称(暂定)”“规则编号(拟定)”“开放标志”三列,文档以段落和图片为主要证据单元,表格只作补充,并为每个预期命中保留可回溯证据。
- 人物/机构专题:字段要在多份文档中保持一致,便于系统聚合。
- 以图搜图/照片档案:优先使用用户提供或公开合法来源图片,保留来源记录,避免未经核验的身份判断。
如果任务涉及真实人物、真实公司、现任领导、政策、新闻、价格或近期事件,除非用户明确提供数据并说明按演示前提使用,否则必须先联网核验。来源优先级依次为:官方网站、任免文件、政府或国资平台、正式公告和原始档案;有署名、日期及原始出处的权威媒体;通用搜索引擎、百科和搜索摘要仅作发现线索。只有可追溯页面明确出现的字段,才能进入“可直接引用事实”。不得为真实人物编造生卒年、籍贯、正式职务、履历或个人成就,也不得收集身份证号、联系方式、家庭信息、人脸特征等与演示目标无关的敏感字段。
标准流程
重构演示目标。 判断客户实际要看的能力:实体抽取、关系构建、编研质量、开放审核判定、人物聚合、以图搜图,还是档案检索。
选择数据模式。 根据任务类型读取
references/workflow-patterns.md中对应模式:知识图谱、智能编研、智能开放审核、人物/机构专题、以图搜图/照片档案。开放审核任务还必须读取references/open-audit-pattern.md;知识图谱任务还必须读取references/knowledge-graph-prompt-contract.md,不能仅凭通用经验自行设计输出 JSON。领导人事任免图谱在此基础上追加读取references/leadership-appointment-graph-pattern.md。 当任务要求 PDF 内容更丰富、嵌入图片、图文编研、从 PDF 抽图或把图片回填到编研成果时,追加读取references/visual-pdf-and-multimodal-compilation.md。进行多源资料发现。 对真实人物或机构,先查官方网站、任免文件、政府或国资平台、正式公告和原始档案,再用权威媒体补充。搜索引擎、百科和搜索摘要只用于发现候选页面,不能因排名靠前或多个摘要相同就提升为事实。记录页面标题、发布主体、日期、URL 和支持字段;再判断哪些字段可直接引用,哪些只能作为待核验线索。
先定义字段或实体 schema,再写文档。 schema 要小而可测。默认知识图谱控制在 4-6 个实体类型,人物专题控制在 6-8 个字段,除非用户明确要求扩展。实体类型配置与提示词中的类型名称必须逐字一致。领导人事任免图谱默认固定为人物、机构、事件、时空四类;职务进入动态属性和事件语义,不自动增加第五类实体。
做字段可用性分级。 对每个关键字段标注:
- 🟢 直接可用:原文或可靠来源有明确值。
- 🟡 可推断/可概括:能从材料中审慎归纳,但颗粒度有限。
- 🔴 严重缺失:来源材料没有,不得编造,只能标为未知或待补充。 字段分级会影响文档写法:强字段用于标题、表格和反复出现;弱字段放在字段位说明,不要让“资料缺失”占据正文主体。
有意构造来源材料。 将信息分散在多份文件中。在标题、表格、正文中重复关键实体或字段。必要时加入一个模糊点、缺失字段或未闭环事项,用来测试模型判断能力。 图文增强模式下,单份 PDF 应包含多段业务叙事、至少一个结构化内容区和至少一张有业务用途的图片;关键事实必须同时落在可抽取文本中,不能只存在于图片里。生成式场景图必须标注为演示模拟,程序化图表必须保留统计口径。开放审核模式下,至少安排段落命中、图片命中、表格补充命中、无命中或边界待复核中的若干判断点,让审核结论能回指实际内容。
生成交付物。 默认交付物包括:
- Markdown 目录或说明文件
- 开放审核场景下的规则表、待审核文档清单、图片清单(如有)和审核标准答案/证据索引
- PDF 来源材料
- 可选 CSV/Markdown 结构化字段表
- 知识图谱场景下的图谱抽取提示词文件
- 智能编研场景下的编研提示词文件
- 图文增强场景下的独立图片资产、图片来源与使用清单、图注和编研回填示例
做输出质检。 使用
pdfplumber或同类工具抽取 PDF 文本,确认目标字段或实体能被识别。如果故意生成扫描件或图片型 PDF,要在结果中说明。知识图谱提示词必须运行scripts/validate_graph_prompt.py;未通过字段、JSON、关系端点、证据和长度校验时不得交付。 图文增强 PDF 运行scripts/validate_visual_pdf_bundle.py,检查逐页文本、空白页、内嵌图片和文本层;多模态编研提示词运行scripts/validate_multimodal_compilation.py做静态安全 lint,检查图片发现、稳定 ID、OCR/图像理解、回填、溯源、降级和冲突指令。默认渲染并检查全部生成页;批量规模确实过大只能抽样时,必须说明抽样范围,不得声称全量视觉验收通过。 开放审核数据包运行scripts/validate_open_audit_bundle.py --rules <规则表.csv> --documents <文档清单.csv> --ground-truth <审核标准答案.csv>,检查规则三列契约、规则编号唯一性、开放/限制枚举、文档与规则引用、证据类型和证据定位;存在图片清单时追加--image-manifest <图片清单.csv>,需要检查文件存在性时追加--root <数据包根目录>。说明使用方法。 最终回复中列出文件,说明每组文件验证什么能力,并指出哪些字段是直接可用、可推断、刻意缺失、待确认或未闭环。
知识图谱提示词兼容性契约
知识图谱提示词首先是一份系统接口契约,其次才是一段抽取说明。结构看似完整但字段名不匹配,系统仍然无法使用。
默认采用以下契约,除非用户提供了另一套明确 schema:
- 章节顺序固定为:
# 角色、# 实体识别规则、## 实体处理约束、# 关系抽取规则、## 实体-关系-实体、# 输出格式、# 完整示例、# 执行指令。 entities中每个对象默认只包含name、type。relations中每个对象默认只包含source、target、relation_type、relation_time、evidence。- 不要默认增加
id、aliases、source_file、fact_boundary、attributes、source_id、target_id等字段。只有用户或目标系统明确要求时才能增加。 - 关系键使用
relation_type,不要改成relation;时间键使用relation_time,无明确时间填字符串none。 source、target必须与entities[].name完全一致;实体type必须从用户或本次配置的分类列表中原样复制。- 完整示例必须包含合法 JSON,不使用省略号替代字段或关系;示例中每条
evidence必须逐字存在于示例输入文档。 - 执行指令必须保留
{{档案原文}},并明确要求运行时直接输出 JSON,不使用 Markdown 包裹,不添加解释。 - 用户提供的样例、字段名、占位符或系统接口说明优先级最高。沿用其格式,只替换实体分类、工程约束、关系规则和完整示例。
- 提示词交付前运行校验:
python scripts/validate_graph_prompt.py <提示词.md> --types 工程项目 组织机构 工程标段 工程设施 档案文件 问题事项
出现任一失败项时,修正后重新校验。不要把“结构说明文档”“标准答案 JSON”和“可直接投喂模型的抽取提示词”混为同一个文件。
二次优化规则
当用户基于生成结果指出字段效果问题时,不要只局部改几句话,要按字段质量重新构造一版:
- 对 🟢 字段:提高出现频次,放入每份 PDF 的固定字段表。
- 对 🟡 字段:给出审慎推断值,并说明颗粒度限制。
- 对 🔴 字段:保留缺失状态,但压缩缺失说明,避免多份文档重复同一大段“资料不足”。
- 对身份标签、主要成就等展示型字段:合并去重,形成更适合系统展示的标签集和成就集。
- 对真实人物:把机构成果写成“任职阶段关联成果”,不要写成“个人独立完成”。
- 生成新版目录、结构化字段表和新版 PDF 文件夹,不覆盖旧版,便于对比演示。
- 如果用户指出 PDF 内容偏薄,不要只放大字号或增加空白页;按“业务背景—过程—判断—结果—边界”补写有信息增量的段落,并把图、表与正文做互证。
- 如果用户要求加入图片,优先使用用户提供或可追溯公开图片;无法安全取得时,使用明确标注的生成式场景图或程序化示意图。同步生成图片清单并改写编研提示词,使图片能够被抽取、筛选和回填。
地域文化档案与领导汇报专题模式
当任务要求围绕某个城市、区域或地方文化构造知识图谱、智能编研和智能开放审核数据时,按“地域文化主线—档案对象—结构化数据—审核边界—领导汇报材料”组织一套可独立交付的新数据包。
- 先选定一条连续的主题主线,例如历史地名与城市沿革、传统技艺与传承、数字档案资源、文化保护政策和公共利用;实体、关系、源文档、编研事实台账与审核规则都围绕这条主线展开,不为凑数据堆砌无关人物或机构。
- 源 PDF、内嵌图片和表格必须以主题对象本身为叙事中心:写城市就写其历史沿革、空间线索和文化演变,写技艺就写形成背景、工艺特征、传承与保护,写数字档案就写建设节点、资源类型和统计口径,写开放审核就写资料内容、授权状态和开放处理结论。
- 源材料正文不得出现“本条目把……拆成数据对象”“演示时可点击/反查/回看”“预期命中”“实体识别提示”“图谱判断点”“编研任务”“演示重点”“现场操作建议”“回放说明”“用于验证”等演示操作、模型过程或元叙述。查询路径、讲稿、规则命中、标准答案、验收口径和系统操作说明统一放入导航与质检目录。
- 当用户明确要求“构造文档中的实际内容”或指出不要把演示逻辑写入正文时,将该要求视为源材料交付硬门槛:源 PDF 的标题、段落、表格、图题和图片内容都必须直接描述主题对象、历史/技艺/节俗/传承/活动/授权等业务事实;“点击、反查、回看、用于验证、预期命中、实体识别、编研任务、现场讲解”等话术不得出现在源 PDF、待审核文档或最终编研正文中,只能放入导航、讲稿、标准答案和质检文件。
- 图片必须展示主题对象本身或其可核验的内容线索。非遗场景优先使用项目器物、技艺材料、节俗意象、戏剧舞台、作品细节、展陈卡片或授权凭证示意;不要用流程图、系统架构图、节点关系图或空白占位图冒充主题图片。若使用程序化或生成式图片,图题和图片清单要写明生成方式、关联对象和“不对应真实现场/不作为唯一事实证据”的边界。
- 生成后逐份抽取源 PDF 全文并扫描禁用演示逻辑词;发现命中时必须回写源文档内容或将该说明迁移到导航/质检目录,不能仅在交付说明中解释为“只是示例”。
- 可以参考用户上传文件的页眉、页脚、标题、正文层级、字体、页码和版式,但不复制其事实内容;新包应在正文中明确“演示模拟”及事实边界,避免把示例材料误作正式馆藏或正式业务结论。
- 用户要求“重新生成”“不要现有数据包”或同义表述时,建立新的带版本标识的输出根目录和压缩包;不得读取旧包作为内容来源,不覆盖、不删除旧包。新包完成后应核验新旧目录路径与文件清单确实分离。
- 领导汇报材料要把价值判断落到档案业务:说明地方文化资源为何适合建立实体关系、跨文档编研和分层开放审核,并同时呈现直接可用事实、公开报道时点、演示模拟事项、授权待核事项和当前状态待核事项。
- 该模式完成后至少检查:知识图谱实体与关系能从源文档抽取;编研事实跨 4—6 份材料互证;开放审核同时覆盖段落、图片、表格、无命中或边界复核;每份源 PDF 有中文文本层、2—4 页、约 800—1800 个可抽取中文字符、至少一张有业务用途的图;所有源 PDF 完成禁用演示逻辑词扫描。
输出纪律
- 最终交付物默认放在当前会话的
outputs/目录,除非用户指定其他位置。 - 业务目标不要求真实事实时,优先使用虚构但合理的数据。
- 涉及真实组织或人物时,区分“用户提供前提”和“公开核验事实”。
- 未知字段分字段写作,如
出生年份:公开资料未见明确披露、当前状态:按截至日期的公开资料核验或待补充确认,不得用混合符号拼接或猜测补齐。 - 面向中文售前演示的材料,默认使用正式中文业务表达。
- 生成 PDF 时使用支持中文的字体,并验证文本层可抽取。
- 图文增强 PDF 默认让每份材料具备连续业务叙事;除非用户另有要求,通常控制为 2-4 页、800-1800 个可抽取中文字符、3-6 个正文段落、至少一个表格或图示。数字不是机械凑字指标,内容必须推动业务事实、判断或边界。
- 图片不得只是装饰。每张图片必须具备图片 ID、图题、来源/生成方式、关联材料、事实边界和编研候选状态;生成式图片不得冒充真实现场照片。
- 多模态编研提示词必须规定:从 PDF 发现图片;执行 OCR/图像理解;区分可见事实和推断;选择 3-5 张不重复图片回填对应章节;使用图片 URI/ID;无 URI 时输出
【插图建议】;文末生成插图来源与使用清单。 - 知识图谱场景默认同时交付实体配置、关系配置、抽取提示词和标准答案,但抽取提示词的运行时 JSON 必须遵循兼容性契约,不能把标准答案中的扩展字段带入运行时 schema。
- 新增领域图谱子类型时,采用“通用知识图谱流程 + 独立领域参考文件”的扩展方式;保留已有实体类型、关系配置和工作模式,不把某个领域规则改写成全局默认规则。
何时需要先问用户
只有当场景身份会影响整套数据时,才问一个关键确认问题,例如:使用真实客户还是虚构客户、真实人物还是虚构人物、是否允许联网核验。其他情况下做保守假设并继续执行。