数据质量评估
目标
在分析开始前或交付前验证数据可信度,输出可复核的评估结论。先验数据,再谈结论。
输入
- 数据集路径或连接信息(CSV / Excel / SQLite / 数据库表)
- 分析用途与关键结论(用于定向检查)
工作流
Step 1:形状画像
读取样本与表结构,记录:
- 粒度(一行代表什么?是否存在一行多事件/多行一事件的混淆)
- 行数、列数、字段类型
- 时间范围与新鲜度(最新数据距今多久,是否覆盖决策窗口)
Step 2:完整性检查
- 空值率:逐列统计,标注 >5% 的列
- 重复:按业务主键查重(注意同一主键多状态行是否合法)
- 唯一性:主键是否唯一,join 键两侧基数是否匹配
Step 3:一致性检查
- 模式漂移:枚举/分类字段的值域与历史基线对比
- 数值合理性:极小值/极大值/负数/零值是否落在业务可解释区间
- 关联完整性:外键是否能全部命中维表
Step 4:结论评级
按以下标准输出评级与理由:
| 评级 | 标准 |
|---|---|
| 可交付 | 关键字段缺失 <1%,主键唯一,时间窗覆盖决策需求,无异常值 |
| 带保留交付 | 存在可解释的缺失/异常,已标注且不影响核心结论 |
| 需返工 | 关键维度缺失、粒度混乱或值域漂移无法解释 |
输出规范
- 每项问题附:字段、现象、样本证据、对分析的影响
- 结论先给评级,再给逐项发现
- 评级为"需返工"时,明确列出返工清单
工具建议
- 结构与小数据:
xlsx技能读取后直接检查 - 大数据与 SQL:
database-inspector技能 - 数值分布与异常:
code-to-chart技能输出直方图/箱线图佐证