在 WorkBuddy 中找到并安装
Skill slug:lls-ai-data-analysis-starter
在 WorkBuddy 新会话粘贴:
请按 https://skillhub.cn/install/skillhub.md 检查 SkillHub,搜索 `lls-ai-data-analysis-starter`;仅在 slug 完全一致时安装到 `~/.workbuddy/skills/`。安装后读取 `~/.workbuddy/skills/lls-ai-data-analysis-starter/SKILL.md`,核对 name、version 和实际路径,然后新开会话触发该 Skill。
也可以打开左侧「技能」→「添加技能 / 查找技能」,搜索 lls-ai-data-analysis-starter 后安装;界面文字可能随 WorkBuddy 版本变化。
罗老师 AI 数据分析入门助手
核心原则
分析不是“把表格丢给 AI 问有什么发现”。正确顺序是:
- 明确要支持的业务判断;
- 了解每一列代表什么;
- 检查数据是否足以回答;
- 按可重复步骤清洗和计算;
- 用图表与数字表达;
- 把事实、解释和建议分开;
- 让另一人可以复核。
一、定义分析问题
将模糊需求改成可计算问题:
- 模糊:“看看销售数据。”
- 清楚:“比较今年第二季度各渠道的有效订单数、净收入和退款率,并找出与第一季度变化最大的渠道。”
任务书至少包含:
使用者:
要做的决定:
分析对象:
时间范围:
核心指标:
比较维度:
排除范围:
输出形式:
二、建立数据字典
| 字段 | 含义 | 类型 | 单位 | 示例 | 缺失规则 | 是否敏感 |
|---|
特别确认:
- 一行代表订单、客户、事件还是汇总;
- 日期是创建、支付、完成还是统计日期;
- 金额含税、未税、退款前还是退款后;
- 状态字段有哪些合法值;
- 唯一键是什么;
- 多张表如何关联。
三、先做数据体检
不修改原文件,先输出体检报告:
- 行数、列数和文件版本;
- 字段类型;
- 缺失值数量与比例;
- 唯一值和重复键;
- 数值范围与异常极值;
- 日期覆盖和断档;
- 分类值拼写差异;
- 表间关联成功率。
异常要区分“明显错误”“业务上可能合理”“需要负责人确认”。
四、制定清洗规则
每条规则写明原值、处理方式、影响行数和原因:
| 规则 | 处理前 | 处理后 | 影响 | 依据 |
|---|
原则:
- 保留原始列,生成清洗列;
- 不静默删除异常;
- 缺失值不默认填零;
- 重复记录先查业务定义;
- 日期、货币和百分比统一格式;
- 清洗日志可以回放。
五、选择最小分析方法
描述现状
计数、总和、均值、中位数、分位数、占比和分布。
比较差异
按时间、渠道、地区、产品或人群分组;同时展示绝对量和比例,避免只看百分比。
观察趋势
统一时间粒度,检查季节性、样本变化和断点。
检查关系
散点、交叉表或相关系数只能说明共同变化;因果需要设计、对照或额外证据。
发现异常
先用业务阈值,再辅以统计阈值;把异常清单交给业务确认。
六、设计图表
| 问题 | 推荐图表 |
|---|---|
| 随时间变化 | 折线图 |
| 类别比较 | 排序条形图 |
| 构成 | 100% 堆叠或条形图 |
| 分布 | 直方图、箱线图 |
| 两变量关系 | 散点图 |
图表必须包含标题、单位、时间范围、口径、来源和必要注释。避免三维图、双轴误导和截断坐标造成夸大。
七、写分析结论
使用四层结构:
- 事实:数字和图表直接支持什么;
- 解释:有哪些合理原因;
- 未知:现有数据不能判断什么;
- 行动:下一步核验或决策。
示例:
事实:渠道 A 的净收入环比下降 18%,退款率从 4% 升至 9%。
解释:可能与本期促销商品结构变化有关。
未知:当前数据没有促销标识,尚不足以确认原因。
行动:补充活动 ID 与商品毛利字段,再分活动比较。
输出物
- 分析任务书;
- 数据字典;
- 数据质量报告;
- 清洗规则与影响行数;
- 指标计算表;
- 图表;
- 事实/解释/未知/行动结论;
- 可复现步骤或脚本;
- 隐私和局限说明。
质量门禁
- 一行数据和唯一键定义清楚;
- 指标、日期和金额口径有说明;
- 原始文件没有被覆盖;
- 缺失、重复和异常有处理日志;
- 图表与问题匹配,单位和来源完整;
- 相关性没有写成因果;
- 关键数字可由独立计算复核;
- 敏感字段已脱敏或留在本地;
- 结论明确写出未知与限制。
检查表见 references/analysis-checklist.md。
使用入口
如果这套流程帮你第一次把数据说清楚,欢迎给总仓库点一个 Star;需要新版提醒时,请订阅 GitHub Releases。