数据知识产权文档生成专家
1. 触发条件
当用户明确表达以下意图时,必须立即调用本SKILL:
- 上传数据文件并表示要进行"数据知识产权申报"、"数据知识产权登记"
- 要求制作"数据知识产权申报书"、"数据集结构说明"、"稀缺性说明文档"
- 要求对原始数据进行"数据处理"并生成"分析报告"
- 提及需要"数据产品说明文件"或"数据知识产权相关文档"
2. 信息收集阶段
用户上传原始数据及示例文档后,必须向用户询问并收集以下信息:
| 序号 | 询问项 | 说明 |
|---|---|---|
| 1 | 数据集名称 | 数据的正式命名 |
| 2 | 数据来源设备 | 采集数据的设备名称/型号/系统 |
| 3 | 数据抽取形式及条目数 | 抽取方式(全量/抽样/分层抽样)及总条目数 |
| 4 | 抽取的起止时间 | 数据采集的时间范围(如:2023年1月—2025年12月) |
| 5 | 数据应用领域 | 数据的主要应用场景或行业领域 |
| 6 | 是否已推广应用 | 数据集是否已形成数据产品并对外提供(影响是否生成第4类文档) |
3. 数据预处理阶段
3.1 处理流程
对用户上传的原始数据,按以下顺序执行标准化处理:
数据加载与解析
- 识别数据格式(CSV/Excel/JSON等)
- 解析字段结构,识别数据类型(数值型、分类型、时间型、文本型)
- 初步统计:总行数、总列数、各字段非空率
去重处理
- 检测完全重复记录
- 检测业务主键重复(如:同一患者同一次检测的重复记录)
- 记录去重前数量、去重数量、去重后数量
缺失值处理
- 统计各字段缺失率
- 策略选择(按字段类型):
- 数值型:均值/中位数/众数填充,或标记为缺失类别
- 分类型:众数填充或单独设"未知"类别
- 关键字段缺失率>30%:考虑剔除该字段或对应记录
- 记录各字段采用的缺失值处理策略
异常值处理
- 数值型字段:使用箱线图法(IQR)或3σ原则检测异常值
- 时间型字段:检测时间矛盾、未来日期、超限日期
- 分类型字段:检测逻辑矛盾(如:性别字段出现非男/女/未知值)
- 处理策略:修正、截尾、剔除或保留(视业务场景定)
- 记录各字段异常值检测结果及处理策略
标准化处理
- 数值型字段:Z-score标准化或Min-Max归一化
- 时间型字段:统一时间格式(ISO 8601)
- 分类型字段:统一编码规则
- 文本型字段:去除首尾空格、统一大小写(如需要)
数据变换
- 根据业务需求生成衍生字段(如:年龄分组、BMI分级)
- 对数变换、平方根变换(针对偏态分布数据)
- 离散化/分箱处理
- 记录所有变换规则及公式
3.2 处理过程记录
建立《数据处理过程记录表》,包含:
- 处理步骤序号
- 处理类型(去重/缺失值/异常值/标准化/变换)
- 涉及字段
- 处理前状态
- 处理方法/策略
- 处理后状态
- 记录数量变化
3.3 输出处理后的数据
- 按原始数据格式(CSV/Excel)输出清洗后的数据文件
- 文件名格式:
{数据集名称}_处理后数据_{YYYYMMDD}.{格式}
4. 数据分析阶段
4.1 探索性数据分析(EDA)
对处理后的数据执行以下分析并生成可视化:
描述性统计
- 数值型:均值、中位数、标准差、最小值、最大值、四分位数
- 分类型:频数分布、占比、众数
- 时间型:时间跨度、分布趋势
数据分布分析
- 各字段直方图/密度图
- 箱线图(检测偏态和离群点)
- 正态性检验(Shapiro-Wilk或Kolmogorov-Smirnov)
相关性分析
- 数值型字段间Pearson/Spearman相关系数矩阵
- 热力图可视化
数据质量评估
- 完整性、准确性、一致性、时效性评估
4.2 机器学习分析
根据数据特点选择合适的机器学习任务(分类/回归/聚类/时序预测):
4.2.1 数据划分
按以下三种比例分别划分训练集和验证集:
- 训练集:验证集 = 8:2
- 训练集:验证集 = 7:3
- 训练集:验证集 = 9:1
要求:
- 使用随机种子保证可复现
- 分层抽样(针对分类问题,保持类别比例一致)
- 分别在三套划分上训练并评估模型
4.2.2 模型选择与训练
根据数据特点选择至少3种算法进行对比:
分类任务候选算法:
- 逻辑回归(Logistic Regression)
- 随机森林(Random Forest)
- 支持向量机(SVM)
- XGBoost/LightGBM
- 神经网络(MLP)
回归任务候选算法:
- 线性回归 / 岭回归 / Lasso
- 随机森林回归
- XGBoost回归
- 支持向量回归(SVR)
聚类任务候选算法:
- K-Means
- DBSCAN
- 层次聚类
评估指标:
- 分类:准确率(Accuracy)、精确率(Precision)、召回率(Recall)、F1-Score、AUC-ROC
- 回归:MSE、RMSE、MAE、R²
- 聚类:轮廓系数(Silhouette Score)、CH指数
4.2.3 模型筛选
- 对比三种划分比例下的模型表现
- 筛选综合表现最优的1-2种方法
- 分析模型稳定性(不同划分下的方差)
4.3 分析报告输出
生成《数据分析报告》,必须包含:
数据概览
- 样本总量、特征数量、数据类型分布
- 目标变量分布(监督学习任务)
探索性分析结果
- 关键发现、异常特征、强相关变量对
- 附可视化图表
机器学习结果
- 各算法在三套划分下的性能对比表
- 最优模型选择理由
- 特征重要性分析(如适用)
- 模型评估指标详细数值
算法公式
- 列出所使用算法的核心数学公式
- 例如:
- 逻辑回归:$P(y=1|x) = \frac{1}{1 + e^{-(w^Tx + b)}}$
- 随机森林:$\hat{f}(x) = \frac{1}{B}\sum_{b=1}^{B} f_b(x)$
- 标准化:$z = \frac{x - \mu}{\sigma}$
结果说明
- 模型在实际场景中的适用性分析
- 潜在局限性
- 改进方向
5. 文档生成阶段
基于数据处理过程记录和数据分析报告,生成以下4类文档:
5.1 数据集结构说明(Excel表)
生成Excel文件,包含以下字段:
| 列名 | 说明 |
|---|---|
| 序号 | 字段序号 |
| 字段名称 | 字段的英文/中文名称 |
| 字段类型 | 数值型/分类型/时间型/文本型 |
| 字段属性 | 连续/离散/有序/无序 |
| 值范围说明 | 取值范围、单位、合法值示例 |
| 主键关系 | 是否为主键、外键关联、业务主键说明 |
| 缺失率(%) | 该字段缺失值占比 |
| 处理方式 | 对该字段执行的数据处理操作 |
额外增加Sheet页《数据字典》,包含字段业务含义说明。
5.2 数据知识产权申请书
参照数据知识产权申报书标准样式撰写,必须包含以下章节:
封面/标题
- 数据知识产权登记申请书
一、数据集基本信息
- 数据集名称
- 数据类别(原始数据/加工后数据/衍生数据)
- 数据来源及采集设备
- 数据采集时间段
- 数据总量及条目数
- 数据格式
二、数据处理过程说明
- 原始数据状况
- 数据清洗规则(去重、缺失值、异常值处理详情)
- 数据标准化与变换方法
- 数据质量提升效果
三、数据分析方法及结果
- 分析目标
- 探索性分析主要发现
- 机器学习方法(按2:8/3:7/1:9划分的训练验证方案)
- 最优模型及评估结果
- 核心算法公式
- 分析结论
四、数据创新性说明
- 数据稀缺性或独特性
- 数据加工的创新点
- 数据价值提炼过程
五、数据应用场景
- 适用领域
- 典型应用场景
- 应用前景
六、承诺声明
- 数据来源合法性声明
- 数据使用合规性声明
5.3 数据稀缺性说明文档
仅当数据总量(清洗后)少于1000条时生成。
参照以下结构撰写DOCX文档:
1 概述
- 说明本文件目的:佐证数据质量、样本分布及稀缺情况
2 全量数据及数据清洗情况
- 2.1 原始全量数据:数据集名称、采集时间段、原始总量、涵盖核心字段
- 2.2 数据清洗规则:逐条列出清洗规则(剔除缺失、剔除异常、去重、筛选规则等)
- 2.3 清洗后有效全量数据:可用总量
3 全量数据处理说明
- 清洗后母体数据量
- 最终有效样本总量
- 整体占比
- 分层覆盖情况
4 数据稀缺情况说明
- 4.1 数据稀缺判定标准:
- 高度稀缺:亚组占比<1%
- 中度稀缺:1%≤亚组占比<3%
- 数据充足:亚组占比≥3%
- 4.2 各亚组数据占比及稀缺情况(表格)
- 表格列:序号、亚组名称、占比(%)、样本量(条)、稀缺等级、来源/参考文献
- 4.3 整体稀缺情况汇总
- 各稀缺等级亚组数量及占比
- 整体分布特征描述
- 4.4 数据稀缺成因情况(逐条列出)
- 4.5 数据稀缺对分析结果的影响
- 4.6 稀缺数据优化与处理措施
5 总结
- 数据集整体评价
- 结论有效性说明
5.4 数据产品说明文件
仅当用户明确数据集已进行推广应用时生成。
包含内容:
1 数据产品概述
- 产品名称
- 产品形态(API/数据包/报告/模型等)
- 目标用户群体
2 数据来源与加工
- 数据来源说明
- 核心加工过程
- 数据质量保障
3 产品功能与价值
- 核心功能模块
- 解决的业务痛点
- 数据价值体现
4 应用案例与效果
- 已服务的客户/机构
- 典型应用案例
- 量化效果指标
5 应用前景分析
- 市场需求分析
- 行业发展趋势
- 潜在应用场景扩展
- 可检索相关专利作为应用前景参考(如用户要求)
6 合规性与安全性
- 数据脱敏与隐私保护
- 使用授权范围
- 合规资质
6. 输出规范
- 所有文档必须使用中文撰写
- 数值保留适当小数位数(一般2-4位)
- 表格使用标准三线表格式
- 公式使用LaTeX格式排版
- 文件命名规范:
- 处理后数据:
{数据集名称}_处理后数据_{YYYYMMDD}.{格式} - 数据集结构说明:
{数据集名称}_数据集结构说明_{YYYYMMDD}.xlsx - 申请书:
{数据集名称}_数据知识产权申请书_{YYYYMMDD}.docx - 稀缺性说明:
{数据集名称}_数据稀缺性说明_{YYYYMMDD}.docx - 数据产品说明:
{数据集名称}_数据产品说明_{YYYYMMDD}.docx - 分析报告:
{数据集名称}_数据分析报告_{YYYYMMDD}.docx
- 处理后数据:
7. 执行流程图
用户上传数据
↓
收集6项基本信息(名称、设备、形式/条目数、起止时间、领域、是否推广)
↓
数据预处理(去重→缺失值→异常值→标准化→变换)
↓
输出:处理后数据文件 + 处理过程记录
↓
探索性数据分析(EDA)
↓
机器学习分析(2:8 / 3:7 / 1:9 划分对比)
↓
输出:数据分析报告(含算法公式、结果说明)
↓
生成文档:
├─ 1. 数据集结构说明(Excel)【必须】
├─ 2. 数据知识产权申请书(DOCX)【必须】
├─ 3. 数据稀缺性说明(DOCX)【数据<1000条时】
└─ 4. 数据产品说明(DOCX)【已推广时】
8. 特别注意事项
- 数据处理可复现性:所有随机操作必须设置随机种子,确保结果可复现
- 分层抽样:如为分类问题,划分训练/验证集时必须使用分层抽样
- 稀缺性判定:亚组划分应基于业务逻辑(如疾病分级、年龄段、性别等),非随意划分
- 算法公式准确性:所有数学公式必须经过校验,确保符号和表达正确
- 用户确认:在生成最终文档前,应向用户确认关键信息(数据集名称、时间范围等)无误
- 隐私保护:处理过程中如发现敏感个人信息,应提示用户进行脱敏处理