# Epi Data Access

> 当用户需要获取流行病学与公共卫生数据、查找疾病负担或疫情公开数据源、下载 国际或中国的公卫统计与监测数据、评估某个数据源能不能用/怎么引用时使用。 同义场景：WHO 数据、GHDx/IHME 疾病负担、Our World in Data、ProMED 疫情快报、 国家卫健委疫情通报、中国 CDC 周报、China CDC Weekly、国家统计局人口数据、 CHNS 队列、发病率/死亡率数据去哪找、疫情数据下载、公卫数据源推荐、 个案数据去标识化、涉及人的数据要不要伦理审查、"帮我找找某地某病的数据"。

- Skill: `minimax-ai/epi-data-access` (Agent Skill)
- Install (CLI): `npx skillmds@latest add minimax-ai/epi-data-access`
- Raw SKILL.md: https://api.skillmd.com/api/skills/minimax-ai/epi-data-access/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: MiniMax AI (https://skillmd.com/u/minimax-ai)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/minimax-ai/epi-data-access

---


# epi-data-access：公共卫生数据源获取规程

## 目的

流行病学分析的第一公里是"数据从哪来、能不能用、怎么标注"。本技能给出常用
国际与中国公共卫生数据源的获取规程：每个数据源固定回答四件事——**入口、
格式、许可注意、来源标注标签**，并划定个案数据隐私红线与数据只读原则。

铁律（与包根 CLAUDE.md guardrails 一致，此处为域内具体化）：

1. 凡写入产物的数据事实必须带来源标签；标签描述出处，不暗示置信度。
2. 数据文件落地即冻结：进 `data/` 后不改名、不编辑、不覆盖（原始数据只读
   原则，见 research-workspace）。
3. 个案级数据先过隐私红线检查，再谈分析。
4. 拿不到的数据不编造：留 `[待补证据]` 占位并写明去哪补（evidence-or-silence）。

## 前置检查

1. 明确需求三要素：**指标**（发病率/死亡率/患病率/疾病负担/病原学监测…）、
   **地区**（全球/国家/省级/更小单元）、**时间范围**。三要素不全时先与用户
   对齐，不要带着模糊需求逐个试数据源。
2. 确认需要的是**汇总数据**（已按地区/时间聚合的统计量）还是**个案数据**
   （逐病例记录）。两者走完全不同的合规路径：个案数据必须先完成第 4 节
   的隐私与伦理检查。
3. 确认网络环境与访问权限：部分数据源需要注册、申请或机构权限（如 CHNS
   需要注册并同意数据使用协议）。无权限的源直接标注"无权限"，不要假装能取。
4. 确认工作区已初始化（`data/` 目录存在）；未初始化时引导用户先运行
   research-workspace。

## 1 · 国际数据源

以下入口与条款为模型知识整理，**具体 URL 与许可条款可能已变化**：引用前
应打开页面确认当前条款，并把页面所见按 `[模型知识—待核实]` 与实际访问结果
并列呈现（guardrail 第 5 条）。

### 1.1 WHO 数据（WHO Data / Global Health Observatory）

- **入口**：WHO 官网数据页与 Global Health Observatory（GHO）主题指标库
  [模型知识—待核实：入口页面近年有过改版]。
- **格式**：网页表格在线浏览；GHO 提供 API（OData 风格）与 CSV 下载
  [模型知识—待核实]。
- **许可注意**：WHO 数据通常附带其使用条款，再分发与商用受限；报告中引用
  需注明 "World Health Organization" 及获取日期 [模型知识—待核实]。
- **标注标签**：`[WHO-GHO]`（限本会话真实访问到的内容）。

### 1.2 GHDx / IHME（全球疾病负担研究 GBD）

- **入口**：Global Health Data Exchange（ghdx.healthdata.org），GBD 结果
  工具（GBD Compare / GBD Results）[模型知识—待核实]。
- **格式**：在线可视化工具 + CSV 下载（需免费注册账号）。
- **许可注意**：IHME 数据免费但要求按指定格式引用 GBD 研究署名；下载时
  页面会给出引用文本，照抄即可 [模型知识—待核实]。
- **标注标签**：`[GHDx]`。
- **提示**：GBD 的估计是**模型产出**而非直接观测，写作时应说明"估计值"
  属性与不确定区间，不能与监测直报数字混用 [模型知识—待核实]。

### 1.3 Our World in Data（OWID）

- **入口**：ourworldindata.org 各主题页与 Grapher 图表的下载按钮
  [模型知识—待核实]。
- **格式**：CSV / 图表导出；多数变量附元数据说明。
- **许可注意**：OWID 自身内容多为 CC-BY，但其**转引的底层数据**（如 WHO、
  世界银行）仍受原始来源条款约束——引用时应回溯到底层来源，不能只引 OWID
  [模型知识—待核实]。
- **标注标签**：`[OWID]`，并同时标注底层来源（如 `[WHO-GHO]`）。

### 1.4 ProMED 疫情快报

- **入口**：ProMED-mail（promedmail.org），按主题/地区检索疫情通报邮件
  [模型知识—待核实]。
- **格式**：非结构化英文快报文本（邮件列表档案）。
- **许可注意**：ProMED 是**早期预警信号**而非核实数据，内容未经同行评议；
  引用时必须注明其为未核实通报，并以官方通报复核 [模型知识—待核实]。
- **标注标签**：`[ProMED]`，产物中凡 ProMED 信息均需附"未经官方核实"限定语。

## 2 · 中国数据源

### 2.1 国家卫生健康委疫情通报

- **入口**：国家卫健委官网"疫情通报"/法定传染病疫情概况栏目（月度发布）
  [模型知识—待核实]。
- **格式**：网页文字通报（法定报告传染病分病种发病数、死亡数）。
- **许可注意**：政府公开信息，引用注明发布机构与发布日期；通报数字为
  法定报告口径，存在报告延迟与漏报，解读时需说明口径 [模型知识—待核实]。
- **标注标签**：`[国家卫健委]`。

### 2.2 中国 CDC 周报（China CDC Weekly）

- **入口**：weekly.chinacdc.cn，英文周刊，含监测分析、暴发调查简报与方法
  文章 [模型知识—待核实]。
- **格式**：网页全文 + PDF，开放获取。
- **许可注意**：开放获取但仍需完整引用（刊名、年卷期、DOI）；其"Notes
  from the Field"类文章是快报性质，引用措辞与正式研究论文区分
  [模型知识—待核实]。
- **标注标签**：`[China CDC Weekly]`。

### 2.3 国家统计局人口数据

- **入口**：国家统计局官网年度统计公报、人口普查/抽样调查公报、国家数据
  查询平台 [模型知识—待核实]。
- **格式**：网页表格、公报 PDF；查询平台可导出。
- **许可注意**：政府公开数据；人口分母（计算发病率、粗率必备）注意**口径
  年份**——普查年与非普查年的估计方法不同，跨年比较需统一口径
  [模型知识—待核实]。
- **标注标签**：`[国家统计局]`。

### 2.4 CHNS 等队列数据

- **入口**：China Health and Nutrition Survey（CHNS）官网注册申请
  [模型知识—待核实]；其他常用队列（如 CHARLS、CFPS）各有申请门户
  [模型知识—待核实]。
- **格式**：注册审核后下载 SAS/Stata/CSV 数据文件与问卷文档。
- **许可注意**：需签署数据使用协议，通常禁止再分发原始数据、要求按指定
  格式致谢；**个案级数据，适用第 4 节全部隐私红线**。
- **标注标签**：`[CHNS]`（或对应队列名）。

## 3 · 获取与登记规程

按顺序执行：

1. **定口径**：把需求三要素写成一行查询说明（例："某省 2015–2024 年肺结核
   报告发病率，分年度"），据此选择数据源，一次只取一个口径，不混用。
2. **获取**：人工下载或小量 API 调用。批量抓取、镜像整库属 guardrail 第 8
   条危险操作（联网批量下载），必须先向用户说明并获确认。
3. **落盘冻结**：原始文件存入 `data/`（建议子目录按来源组织，如
   `data/who-gho/`），落地后不再改动。
4. **登记 provenance**：用 provenance-record 登记，note 中
   写明：数据源、获取日期（ISO 8601 带时区）、查询条件/URL、文件清单。
5. **记录口径备注**：在该数据的说明文件（如 `data/<源>/README.md`）写明
   指标定义、分母来源、已知局限（报告延迟、口径变更），供下游引用。

## 4 · 隐私红线与伦理审查

凡涉及**个案级数据**（病例一览表、问卷、队列个体记录），在数据进入分析
环境**之前**逐项检查：

1. **去标识化**：姓名、身份证号、电话、详细住址（精细到门牌/自然村）、
   工作单位等直接标识符**不得进入分析环境**。确需保留的准标识符（年龄、
   性别、乡镇级地区）评估再识别风险，必要时泛化（如年龄分组）。
2. **去标识化在源头做**：在数据整理阶段生成去标识副本，原始含标识符文件
   按机构规定单独保管；分析脚本只接触去标识副本。
3. **伦理审查**：涉及人的数据（含回顾性病历、问卷、队列）先确认已有
   IRB/伦理委员会批件或豁免证明；没有批件的项目停止数据处理，提醒用户
   先办伦理手续。批件编号写入产物的方法学说明。
4. **数据出境**：向境外服务（含在线工具、境外云）传输个案数据前，核对
   《数据安全法》《个人信息保护法》及机构数据管理要求与画像中的合规红线；
   画像写明"不得出境"的一律拒绝并说明。
5. **最小够用**：只取分析所需的变量与时间范围，不囤数据。

## 输出模板

获取完成后向用户输出数据源清单：

```markdown
## 数据源清单（<获取日期>）

| 数据源 | 指标与口径 | 覆盖范围 | 文件 | 标注标签 | 许可/限制 |
| --- | --- | --- | --- | --- | --- |
| WHO GHO | 某病发病率（估计值） | 全球，2000–2021 | data/who-gho/xxx.csv | [WHO-GHO] | 需署名 WHO |
| 国家卫健委 | 法定传染病报告发病数 | 全国，按月 | data/nhc/xxx.html | [国家卫健委] | 政府公开信息 |

- provenance：已登记 .openscience/provenance.jsonl（<记录时间>）
- 口径备注：<报告延迟/口径变更/估计值属性…>
- 未获得：<指标>（原因：无权限/未发布），[待补证据：建议查 <途径>]
- 隐私与伦理：本批为汇总数据，不涉及个案 / 个案数据已去标识化，
  伦理批件 <编号>[用户提供]
```

## 本技能不做什么

- **不做数据质量核验**：数据本身的准确性由发布方负责；本技能只保证来源
  可溯、口径写明。发现明显异常时在产物中标注 `[待复核]`，不擅自"修正"。
- **不做批量抓取与镜像**：任何可能触发数据源风控的批量下载均属危险操作，
  需用户明确确认（guardrail 第 8 条）。
- **不绕过访问控制**：需注册/申请/付费的数据，只引导用户走正规流程，不
  代为伪造申请或共享账号。
- **不做分析**：本技能止于"数据可用且合规地躺在 `data/` 里"；描述性分析
  交给 outbreak-analysis，空间分析交给 spatial-epi。
- **不评估临床内容**：指标定义拿不准时标 `[模型知识—待核实]` 并建议查
  原始文献或咨询领域专家，不编造定义。

## 收尾与下一步

1. 汇总：取得几个数据源、覆盖哪些指标与年份、哪些需求未满足（含原因）。
2. 指向 `data/` 中的落盘文件与 provenance 记录。
3. 建议下一步：
   - 暴发/监测数据分析 → `outbreak-analysis`；
   - 分地区率比较与地图 → `spatial-epi`；
   - 需要人群分母做标化 → 提醒核对国家统计局口径年份后再进分析。

