# Exploratory Data Analysis

> Use when exploring a dataset before formal analysis, modeling, reporting, or dashboarding. Profiles fields, missing values, distributions, outliers, relationships, data quality risks, and next analysis directions.

- Skill: `shisuidata/exploratory-data-analysis` (Agent Skill)
- Install (CLI): `npx skillmds@latest add shisuidata/exploratory-data-analysis`
- Raw SKILL.md: https://api.skillmd.com/api/skills/shisuidata/exploratory-data-analysis/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: shisuidata (https://skillmd.com/u/shisuidata)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/shisuidata/exploratory-data-analysis

---


# Exploratory Data Analysis

## 目标

对一份数据集做探索性分析，先弄清楚“数据到底长什么样”，再决定后续如何分析、建模、做报表或写结论。

这个 Skill 不负责直接写完整业务报告，也不负责复杂建模。它负责在分析前把数据结构、质量问题、变量分布、异常值和初步关系讲清楚。

## 使用场景

使用这个 Skill，当用户需要：

- 拿到一张新表或一份 CSV/Excel 后先摸底
- 判断数据是否能用于后续分析
- 分析字段缺失、重复、异常值和类型问题
- 在做用户分析、销售分析、运营分析前建立数据认知
- 为建模、看板、分析报告准备数据画像
- 找出值得继续深入的维度和假设

典型输入：

```text
请帮我对这份订单数据做 EDA，看哪些字段有质量问题，哪些方向值得继续分析。
```

## 不适用场景

不要用这个 Skill 直接完成：

- 漏斗分析，请使用 `funnel-analysis`
- 留存或 Cohort 分析，请使用 `retention-cohort-analysis`
- A/B 实验分析，请使用 `ab-test-analysis`
- 完整分析报告撰写，请使用 `data-analysis-report-writer`
- SQL 审查，请使用 `sql-reviewer`

如果用户只提供业务问题，没有任何数据字段或样例，先列出需要的数据，而不是假装已经完成 EDA。

## 输入信息

最少输入：

- 数据文件、表结构、字段列表或数据样例

可选输入：

- 分析目标
- 业务背景
- 目标字段
- 时间字段
- 主键或唯一键
- 数据周期
- 数据量级
- 已知异常

## 上下文建议

推荐使用 [数据分析上下文模板](../../context/templates/analysis-context.md)。

最有价值的上下文是：字段列表、数据粒度、时间字段、对象 ID、分析目标和已知异常。缺少真实数据样例时，只能设计 EDA 检查清单，不能声称已经发现具体分布或异常。

## 工作流程

1. 识别数据对象：一行代表什么，字段大致分为哪些类型。
2. 做结构检查：行数、列数、字段类型、主键候选、时间范围。
3. 做质量检查：缺失率、重复行、重复主键、异常编码、混合类型。
4. 做分布检查：数值字段的均值、中位数、分位数、偏度、极值；类别字段的 Top N 和占比。
5. 做异常检查：离群点、突增突降、非法值、常量字段、高基数字段。
6. 做关系探索：核心字段之间的相关性、分组差异、时间趋势、分层差异。
7. 形成初步结论：数据是否可用、主要问题是什么、下一步该分析什么。

## 输出格式

```markdown
## EDA 结果

### 1. 数据概览

| 项目 | 结果 |
| --- | --- |
| 数据对象 |  |
| 数据粒度 |  |
| 行数 |  |
| 字段数 |  |
| 时间范围 |  |
| 主键/唯一键候选 |  |

### 2. 字段画像

| 字段 | 类型 | 含义推测 | 缺失率 | 主要问题 |
| --- | --- | --- | --- | --- |

### 3. 数据质量问题

| 风险等级 | 问题 | 影响 | 建议 |
| --- | --- | --- | --- |

### 4. 分布与异常

### 5. 初步关系与模式

### 6. 可继续分析的方向

### 7. 待确认问题
```

## 质量标准

输出必须：

- 先说明数据粒度和可用性
- 区分数据质量问题和真实业务异常
- 不把相关性直接写成因果关系
- 对字段含义不确定时标记为推测
- 给出后续分析建议，而不是只罗列统计量

## 示例 Prompt

```text
请用 exploratory-data-analysis 分析下面这张用户行为表：

粒度：一行一条用户事件
字段：user_id, event_time, event_name, page, channel, device, session_id
目标：判断是否能用于用户转化路径分析
```

