# Data Intellectual Property Docs

> 协助用户完成数据知识产权申报全流程文档制作。当用户上传原始数据并申请数据知识产权登记时调用，自动完成数据预处理、数据分析及4类申报文档（数据集结构说明、申请书、稀缺性说明、数据产品说明）的生成。

- Skill: `cslawyer1985/data-intellectual-property-docs` (Agent Skill)
- Install (CLI): `npx skillmds@latest add cslawyer1985/data-intellectual-property-docs`
- Raw SKILL.md: https://api.skillmd.com/api/skills/cslawyer1985/data-intellectual-property-docs/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: cslawyer1985 (https://skillmd.com/u/cslawyer1985)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/cslawyer1985/data-intellectual-property-docs

---


# 数据知识产权文档生成专家

## 1. 触发条件

当用户明确表达以下意图时，必须立即调用本SKILL：
- 上传数据文件并表示要进行"数据知识产权申报"、"数据知识产权登记"
- 要求制作"数据知识产权申报书"、"数据集结构说明"、"稀缺性说明文档"
- 要求对原始数据进行"数据处理"并生成"分析报告"
- 提及需要"数据产品说明文件"或"数据知识产权相关文档"

## 2. 信息收集阶段

用户上传原始数据及示例文档后，必须向用户询问并收集以下信息：

| 序号 | 询问项 | 说明 |
|------|--------|------|
| 1 | 数据集名称 | 数据的正式命名 |
| 2 | 数据来源设备 | 采集数据的设备名称/型号/系统 |
| 3 | 数据抽取形式及条目数 | 抽取方式（全量/抽样/分层抽样）及总条目数 |
| 4 | 抽取的起止时间 | 数据采集的时间范围（如：2023年1月—2025年12月） |
| 5 | 数据应用领域 | 数据的主要应用场景或行业领域 |
| 6 | 是否已推广应用 | 数据集是否已形成数据产品并对外提供（影响是否生成第4类文档） |

## 3. 数据预处理阶段

### 3.1 处理流程

对用户上传的原始数据，按以下顺序执行标准化处理：

1. **数据加载与解析**
   - 识别数据格式（CSV/Excel/JSON等）
   - 解析字段结构，识别数据类型（数值型、分类型、时间型、文本型）
   - 初步统计：总行数、总列数、各字段非空率

2. **去重处理**
   - 检测完全重复记录
   - 检测业务主键重复（如：同一患者同一次检测的重复记录）
   - 记录去重前数量、去重数量、去重后数量

3. **缺失值处理**
   - 统计各字段缺失率
   - 策略选择（按字段类型）：
     - 数值型：均值/中位数/众数填充，或标记为缺失类别
     - 分类型：众数填充或单独设"未知"类别
     - 关键字段缺失率>30%：考虑剔除该字段或对应记录
   - 记录各字段采用的缺失值处理策略

4. **异常值处理**
   - 数值型字段：使用箱线图法（IQR）或3σ原则检测异常值
   - 时间型字段：检测时间矛盾、未来日期、超限日期
   - 分类型字段：检测逻辑矛盾（如：性别字段出现非男/女/未知值）
   - 处理策略：修正、截尾、剔除或保留（视业务场景定）
   - 记录各字段异常值检测结果及处理策略

5. **标准化处理**
   - 数值型字段：Z-score标准化或Min-Max归一化
   - 时间型字段：统一时间格式（ISO 8601）
   - 分类型字段：统一编码规则
   - 文本型字段：去除首尾空格、统一大小写（如需要）

6. **数据变换**
   - 根据业务需求生成衍生字段（如：年龄分组、BMI分级）
   - 对数变换、平方根变换（针对偏态分布数据）
   - 离散化/分箱处理
   - 记录所有变换规则及公式

### 3.2 处理过程记录

建立《数据处理过程记录表》，包含：
- 处理步骤序号
- 处理类型（去重/缺失值/异常值/标准化/变换）
- 涉及字段
- 处理前状态
- 处理方法/策略
- 处理后状态
- 记录数量变化

### 3.3 输出处理后的数据

- 按原始数据格式（CSV/Excel）输出清洗后的数据文件
- 文件名格式：`{数据集名称}_处理后数据_{YYYYMMDD}.{格式}`

## 4. 数据分析阶段

### 4.1 探索性数据分析（EDA）

对处理后的数据执行以下分析并生成可视化：

1. **描述性统计**
   - 数值型：均值、中位数、标准差、最小值、最大值、四分位数
   - 分类型：频数分布、占比、众数
   - 时间型：时间跨度、分布趋势

2. **数据分布分析**
   - 各字段直方图/密度图
   - 箱线图（检测偏态和离群点）
   - 正态性检验（Shapiro-Wilk或Kolmogorov-Smirnov）

3. **相关性分析**
   - 数值型字段间Pearson/Spearman相关系数矩阵
   - 热力图可视化

4. **数据质量评估**
   - 完整性、准确性、一致性、时效性评估

### 4.2 机器学习分析

根据数据特点选择合适的机器学习任务（分类/回归/聚类/时序预测）：

#### 4.2.1 数据划分

按以下三种比例分别划分训练集和验证集：
- 训练集:验证集 = 8:2
- 训练集:验证集 = 7:3
- 训练集:验证集 = 9:1

要求：
- 使用随机种子保证可复现
- 分层抽样（针对分类问题，保持类别比例一致）
- 分别在三套划分上训练并评估模型

#### 4.2.2 模型选择与训练

根据数据特点选择至少3种算法进行对比：

**分类任务候选算法：**
- 逻辑回归（Logistic Regression）
- 随机森林（Random Forest）
- 支持向量机（SVM）
- XGBoost/LightGBM
- 神经网络（MLP）

**回归任务候选算法：**
- 线性回归 / 岭回归 / Lasso
- 随机森林回归
- XGBoost回归
- 支持向量回归（SVR）

**聚类任务候选算法：**
- K-Means
- DBSCAN
- 层次聚类

**评估指标：**
- 分类：准确率(Accuracy)、精确率(Precision)、召回率(Recall)、F1-Score、AUC-ROC
- 回归：MSE、RMSE、MAE、R²
- 聚类：轮廓系数(Silhouette Score)、CH指数

#### 4.2.3 模型筛选

- 对比三种划分比例下的模型表现
- 筛选综合表现最优的1-2种方法
- 分析模型稳定性（不同划分下的方差）

### 4.3 分析报告输出

生成《数据分析报告》，必须包含：

1. **数据概览**
   - 样本总量、特征数量、数据类型分布
   - 目标变量分布（监督学习任务）

2. **探索性分析结果**
   - 关键发现、异常特征、强相关变量对
   - 附可视化图表

3. **机器学习结果**
   - 各算法在三套划分下的性能对比表
   - 最优模型选择理由
   - 特征重要性分析（如适用）
   - 模型评估指标详细数值

4. **算法公式**
   - 列出所使用算法的核心数学公式
   - 例如：
     - 逻辑回归：$P(y=1|x) = \frac{1}{1 + e^{-(w^Tx + b)}}$
     - 随机森林：$\hat{f}(x) = \frac{1}{B}\sum_{b=1}^{B} f_b(x)$
     - 标准化：$z = \frac{x - \mu}{\sigma}$

5. **结果说明**
   - 模型在实际场景中的适用性分析
   - 潜在局限性
   - 改进方向

## 5. 文档生成阶段

基于数据处理过程记录和数据分析报告，生成以下4类文档：

### 5.1 数据集结构说明（Excel表）

生成Excel文件，包含以下字段：

| 列名 | 说明 |
|------|------|
| 序号 | 字段序号 |
| 字段名称 | 字段的英文/中文名称 |
| 字段类型 | 数值型/分类型/时间型/文本型 |
| 字段属性 | 连续/离散/有序/无序 |
| 值范围说明 | 取值范围、单位、合法值示例 |
| 主键关系 | 是否为主键、外键关联、业务主键说明 |
| 缺失率(%) | 该字段缺失值占比 |
| 处理方式 | 对该字段执行的数据处理操作 |

额外增加Sheet页《数据字典》，包含字段业务含义说明。

### 5.2 数据知识产权申请书

参照数据知识产权申报书标准样式撰写，必须包含以下章节：

**封面/标题**
- 数据知识产权登记申请书

**一、数据集基本信息**
- 数据集名称
- 数据类别（原始数据/加工后数据/衍生数据）
- 数据来源及采集设备
- 数据采集时间段
- 数据总量及条目数
- 数据格式

**二、数据处理过程说明**
- 原始数据状况
- 数据清洗规则（去重、缺失值、异常值处理详情）
- 数据标准化与变换方法
- 数据质量提升效果

**三、数据分析方法及结果**
- 分析目标
- 探索性分析主要发现
- 机器学习方法（按2:8/3:7/1:9划分的训练验证方案）
- 最优模型及评估结果
- 核心算法公式
- 分析结论

**四、数据创新性说明**
- 数据稀缺性或独特性
- 数据加工的创新点
- 数据价值提炼过程

**五、数据应用场景**
- 适用领域
- 典型应用场景
- 应用前景

**六、承诺声明**
- 数据来源合法性声明
- 数据使用合规性声明

### 5.3 数据稀缺性说明文档

**仅当数据总量（清洗后）少于1000条时生成。**

参照以下结构撰写DOCX文档：

**1 概述**
- 说明本文件目的：佐证数据质量、样本分布及稀缺情况

**2 全量数据及数据清洗情况**
- 2.1 原始全量数据：数据集名称、采集时间段、原始总量、涵盖核心字段
- 2.2 数据清洗规则：逐条列出清洗规则（剔除缺失、剔除异常、去重、筛选规则等）
- 2.3 清洗后有效全量数据：可用总量

**3 全量数据处理说明**
- 清洗后母体数据量
- 最终有效样本总量
- 整体占比
- 分层覆盖情况

**4 数据稀缺情况说明**
- 4.1 数据稀缺判定标准：
  - 高度稀缺：亚组占比<1%
  - 中度稀缺：1%≤亚组占比<3%
  - 数据充足：亚组占比≥3%
- 4.2 各亚组数据占比及稀缺情况（表格）
  - 表格列：序号、亚组名称、占比(%)、样本量(条)、稀缺等级、来源/参考文献
- 4.3 整体稀缺情况汇总
  - 各稀缺等级亚组数量及占比
  - 整体分布特征描述
- 4.4 数据稀缺成因情况（逐条列出）
- 4.5 数据稀缺对分析结果的影响
- 4.6 稀缺数据优化与处理措施

**5 总结**
- 数据集整体评价
- 结论有效性说明

### 5.4 数据产品说明文件

**仅当用户明确数据集已进行推广应用时生成。**

包含内容：

**1 数据产品概述**
- 产品名称
- 产品形态（API/数据包/报告/模型等）
- 目标用户群体

**2 数据来源与加工**
- 数据来源说明
- 核心加工过程
- 数据质量保障

**3 产品功能与价值**
- 核心功能模块
- 解决的业务痛点
- 数据价值体现

**4 应用案例与效果**
- 已服务的客户/机构
- 典型应用案例
- 量化效果指标

**5 应用前景分析**
- 市场需求分析
- 行业发展趋势
- 潜在应用场景扩展
- 可检索相关专利作为应用前景参考（如用户要求）

**6 合规性与安全性**
- 数据脱敏与隐私保护
- 使用授权范围
- 合规资质

## 6. 输出规范

1. 所有文档必须使用中文撰写
2. 数值保留适当小数位数（一般2-4位）
3. 表格使用标准三线表格式
4. 公式使用LaTeX格式排版
5. 文件命名规范：
   - 处理后数据：`{数据集名称}_处理后数据_{YYYYMMDD}.{格式}`
   - 数据集结构说明：`{数据集名称}_数据集结构说明_{YYYYMMDD}.xlsx`
   - 申请书：`{数据集名称}_数据知识产权申请书_{YYYYMMDD}.docx`
   - 稀缺性说明：`{数据集名称}_数据稀缺性说明_{YYYYMMDD}.docx`
   - 数据产品说明：`{数据集名称}_数据产品说明_{YYYYMMDD}.docx`
   - 分析报告：`{数据集名称}_数据分析报告_{YYYYMMDD}.docx`

## 7. 执行流程图

```
用户上传数据
    ↓
收集6项基本信息（名称、设备、形式/条目数、起止时间、领域、是否推广）
    ↓
数据预处理（去重→缺失值→异常值→标准化→变换）
    ↓
输出：处理后数据文件 + 处理过程记录
    ↓
探索性数据分析（EDA）
    ↓
机器学习分析（2:8 / 3:7 / 1:9 划分对比）
    ↓
输出：数据分析报告（含算法公式、结果说明）
    ↓
生成文档：
  ├─ 1. 数据集结构说明（Excel）【必须】
  ├─ 2. 数据知识产权申请书（DOCX）【必须】
  ├─ 3. 数据稀缺性说明（DOCX）【数据<1000条时】
  └─ 4. 数据产品说明（DOCX）【已推广时】
```

## 8. 特别注意事项

1. **数据处理可复现性**：所有随机操作必须设置随机种子，确保结果可复现
2. **分层抽样**：如为分类问题，划分训练/验证集时必须使用分层抽样
3. **稀缺性判定**：亚组划分应基于业务逻辑（如疾病分级、年龄段、性别等），非随意划分
4. **算法公式准确性**：所有数学公式必须经过校验，确保符号和表达正确
5. **用户确认**：在生成最终文档前，应向用户确认关键信息（数据集名称、时间范围等）无误
6. **隐私保护**：处理过程中如发现敏感个人信息，应提示用户进行脱敏处理

