| | "AI Agent 自主进化" | "基于自主智能体的数据要素全生命周期治理框架" | | "G1-G7质量门控" | "首创七级数据质量门控体系,确保实验可追溯" | | "30模型基准测试" | "覆盖30个主流模型的系统性基准验证" | | "数据泄露检测" | "解决AI医学论文70%可复现危机" | | "方法论级解决方案" | "可审计、可复现的数据治理范式" |
IO_CONTRACT
- input:
template.docx: file— 大赛申报书 DOCX 模板(含合并单元格表格,20列宽) - input:
track: str— 赛道选择(数据基础设施/医疗健康等,须先排查带星号必填字段) - input:
content: json— 4段式叙事内容(痛点→方案→成效→复制),经叙事策略转换表去技术化 - output:
filled_application.docx— python-docx 程序化填充、模板说明文字已清理的申报书 - output:
field_check_report— 必填字段/财务字段/选项勾选("√ 已选"标记)核验结果
原则 (Principles)
- 四段为骨:叙事必循「痛点→方案→成效→复制」之骨,缺一则立论不圆;具体数据为肉,方法论为魂。
- 去技化以通评:「AI Agent」「G1-G7」之术语须经叙事转换表译为评审能解之语;每句必问「对非技术评审何意味」。
- 先查星号必填:赛道必于填充前排查模板中带星号必填字段(营收/融资/Token),单位类型不能填者,先定其可否跳过,以免误选赛道。
- 程式化填充:python-docx 程序化填表,内容置 JSON 与代码分离;合并单元格、模板占位说明文字须逐一识别清理,不留模板之痕。
标准叙事结构(4段式):
- 痛点 — 行业面临什么数据/技术/质量危机(用具体数据说话)
- 方案 — 技术如何系统性解决(强调方法论而非具体模型)
- 成效 — 已落地的具体案例和量化指标
- 复制 — 为什么可以推广到其他领域/机构
Step 3: 模板表格分析
处理DOCX模板表格的要点:
- 识别合并单元格:政府模板大量使用合并单元格,20列宽表格中实际只需要填少数几个cell
- 找到空单元格:标签列(Col 0-1)+ 填充区域(Col 2+)
- 处理选项中选:赛道/场景等选项通过文本标记("√ 医疗健康")而非修改checkbox
- 财务字段:医院/实验室填"0"或"不适用",写注释说明
常见表格坑:
- Row 34 可能不存在(实际行数 < 预期行数)
- 合并单元格写Col 2的内容可能被相邻格覆盖
- 长文本需要手动换行保证DOCX显示正常
Step 4: 填充实现
用python-docx程序化填充,避免手动编辑。分离内容与代码:将正文内容写入JSON文件,脚本从JSON加载后填充DOCX。
from docx import Document
def set_cell(table, row_idx, col_idx, text):
cell = table.rows[row_idx].cells[col_idx]
for p in cell.paragraphs:
for r in p.runs:
r.text = ''
p = cell.paragraphs[0]
p.text = text
for run in p.runs:
run.font.size = Pt(10.5)
run.font.name = '宋体'
run._element.rPr.rFonts.set(qn('w:eastAsia'), '宋体')
Step 5: 清理模板说明文字
填充后,模板中的说明文字(如"(介绍参赛项目的背景...)")会残留为独立段落。需要批量识别并清空:
- 特征:长度 > 40字符 且包含模板占位符标记
- 通过段落索引定位,清空run内容
Genes (策略基因)
紧凑策略表示。条件→策略。需要深度时参考完整文档。
- [COMP-001] 叙事内容包含技术术语 → 必须通过转换表译为非技术评审能理解的通俗语言,强调方法论而非具体模型
- [COMP-002] 选择赛道前 → 必须排查模板中带星号的必填字段(如营收/融资),确认单位类型是否满足要求以避免错选
- [COMP-003] 构建申报书叙事 → 严格遵循「痛点→方案→成效→复制」四段式结构,确保逻辑闭环
- [COMP-004] 处理DOCX模板表格 → 采用python-docx程序化填充,将内容存于JSON与代码分离,并清理合并单元格及模板占位说明文字
- [COMP-005] 填写财务字段且单位无法提供营收数据 → 填写具体可量化指标(如数据量/成本)或注明“不适用(事业单位)”,避免全填0
- [COMP-006] 处理表格选项勾选 → 使用文本标记(如“√ 已选”)替代修改checkbox控件,以兼容模板格式
典型陷阱
🔴 赛道错选
问题:数据基础设施赛道要求营收/Token/融资数据,医院/实验室无法满足 解决:先排查模板中所有带星号的必填字段,确认单位类型能否跳过
🔴 叙事过度技术化
问题:用"AIAgent"、"G1-G7门控"等术语直接出现在申报书中,评审看不懂 解决:按照叙事策略转换表翻译,始终问"这句话对非技术背景的评审意味着什么"
🟡 财务字段应付
问题:医院全填"0"显得项目没价值 解决:能填的填具体数字(数据量、增速、开发成本),不能填的写"不适用(事业单位)"
参考案例
references/data-elements-competition-2026.md— 2026数据要素大赛浙江分赛完整案例scripts/fill_application_template.py— DOCX模板填充脚本模板
验证清单 · VERIFICATION
- 叙事四段式完整:「痛点→方案→成效→复制」每段均有具体数据支撑,逻辑闭环无缺段
- 去技术化核验:逐句问"非技术评审能理解吗",AI Agent/G1-G7 等术语已按转换表翻译为通俗表述
- 赛道必填排查:填充前已排查模板中带星号必填字段(营收/融资/Token),确认单位类型可满足要求
- 财务字段非全 0:单位无法提供营收的已填具体量化指标(数据量/成本)或注明"不适用(事业单位)"
- 选项勾选用文本标记:"√ 已选"文本标记替代修改 checkbox 控件,兼容模板格式
- 模板残留已清理:长度 > 40 字符的模板占位说明文字段落已批量识别并清空,不留模板之痕
- field_check_report 产出:必填字段/财务字段/选项勾选核验结果完整输出
约束规则 · RULES
- 输入约束: 参数类型、范围、格式必须校验
- 输出约束: 返回值结构、编码、命名必须一致
- 异常约束: 错误信息必须包含上下文和恢复建议
- 安全约束: 不执行未验证的任意代码,不暴露内部状态
Golden 集合 · GOLDEN SET
- Golden Input:
template.docx(含 20 列合并单元格表格、带星号必填字段)+track="医疗健康"+ 4 段式叙事 JSON(痛点/方案/成效/复制各 1 段,含技术术语 "AI Agent"、"G1-G7" 待去技化转换) - Golden Output:
filled_application.docx满足三项硬断言:① 四段式叙事完整且每段含具体数据;② "AI Agent"/"G1-G7" 等术语已按转换表译为通俗表述(正文 grep 无原术语残留);③ 赛道行含文本标记 "√ 已选:医疗健康",长度 > 40 字符的模板占位说明段落已清空(无"(介绍参赛项目的背景..."残留) - Golden Error: 模板实际行数 < 预期(如 Row 34 不存在)→ 填充脚本应抛出带行/列上下文与恢复建议的异常("模板行数不足:预期 35 行,实际 N 行"),而非静默截断;或赛道必填字段(营收/融资/Token)对单位类型不可满足时,填充前即报错提示排查星号字段,避免错选赛道
Golden 集合是测试的单一真理来源。所有改进必须通过 golden 测试。
违反规则的操作视为不安全,必须拒绝或隔离。
每项验证必须可执行、可记录、可复现。验证失败时记录原因和修复。