xb-data:数据工作
调用前先读 ../xbskill/references/interaction-settings.md,按用户已选调用强度和保存提示执行;明确指定其他技能或拒绝 XB 时退出。未初始化时只允许配置与说明,禁止代选或先执行后确认。
直调时先读取 ../xbskill/references/contracts.md 与 ../xbskill/references/resolution-standard.md;任何文件缺失时报告精确路径并停止,不得凭记忆补造。用户承担数据分析、数据工程、数据治理或数据产品责任,且岗位/生命周期/阶段会改变动作时,再读取 ../xbskill/references/role-context-model.md 与 ../xbskill/references/data-work-specialties.md;一次性低风险取数不加载全图谱。口径或方法结论依赖外部规范、论文或文档时,再读取 ../xbskill/references/knowledge-source-protocol.md。
任务跨自动化、报告、演示或审查,或出现多来源冲突、批量改动、敏感数据和重复返工时,读取 ../xbskill/references/task-domain-patterns.md;单表低风险整理不加载。
任务定义
报表、排名或数字结论进入个人评价与责任争议时,读取 ../xbskill/references/data-conclusion-review.md,交付能复现的原值/新值/差额与仍成立结论。涉及绩效权重与评价规则时再读取 ../xbskill/references/career-evidence-review.md 的绩效部分;主观评价与可复算项分开。文件缺失时报出路径并停止相应复核,保留当前唯一专科。
数据工作的产物要让有权者基于可追溯证据作出更好的决定;单个数字或图表只是其中的证据载体。先区分:
- 取数 Question:在已确认口径与数据版本下生成可核对结果;
- 解释 Problem:区分真实变化、口径变化、数据质量和随机波动;
- 决策 Problem:说明结论怎样改变动作、资源或风险;
- 治理 Problem:让重复口径、血缘、权限和版本冲突变得可控制。
- 数据产品 Problem:把用户决定、数据契约、服务质量、采用反馈与版本/退役连成闭环。
不知道业务问题时可以做数据体检,但只能称“数据质量审计”,不能自动上升为业务洞察。
核心判断模型:结论可信度取决于最弱环
业务问题 → 决策用途 → 指标定义 → 数据生成 → 抽取与关联
→ 清洗/计算 → 比较基线 → 不确定性 → 结论范围 → 现实验证
用七个门审查结论:
| 门 | 必答问题 | 失败后的含义 |
|---|---|---|
| 定义 | 指标对象、粒度、时间窗、单位、去重和边界是什么? | 数字不可比较 |
| 生成 | 字段怎样在业务流程中产生? | 字段名不能代表业务含义 |
| 完整 | 缺失、迟到、重复、删改和覆盖有多少? | 总量可能失真 |
| 关联 | 键是否唯一,连接是否膨胀或漏配? | 分组和归因不可靠 |
| 计算 | 公式、过滤、版本和中间结果能否复现? | 结论不能复核 |
| 比较 | 基线、对照、季节性、样本和可比范围合理吗? | 变化无法解释 |
| 推断 | 数据支持描述、关联还是因果? | 动作强度必须下降 |
任一关键门未过,不用其他门的完整掩盖。给出能成立的较弱结论和精确缺口。
信号词典
| 信号 | 优先假设 | 必查反例 |
|---|---|---|
| “总数对不上” | 口径、时间窗、去重、迟到数据、关联膨胀 | 两边是否其实统计不同对象 |
| “突然涨/跌” | 数据刷新、埋点/流程、口径、活动、季节性、真实变化 | 绝对量、分母和历史波动 |
| “平均值变了” | 样本构成、极端值、权重或真实变化 | 中位数、分布和分组结构 |
| “相关性很高” | 共同驱动、选择偏差、时间趋势 | 先后顺序和替代解释 |
| “SQL 跑通了” | 只证明语法和执行路径 | 行数、唯一性、总量与边界样本 |
| “Excel 看起来没问题” | 显示格式可能掩盖类型/精度/公式错误 | 原始值、公式、隐藏行列、刷新状态 |
| “缺失不多” | 缺失比例低 | 缺失是否集中在关键人群/时间 |
| “样本很大” | 随机误差可能小 | 系统偏差、口径错误不会因样本大消失 |
| “领导要一个结论” | 需要决策接口 | 不确定性不能静默删除 |
模式与条件分支
A. 取数与报表
先写口径卡,再查询。口径卡至少含:业务定义、对象、粒度、时间窗、范围、去重、空值、币种/单位、时区、数据截至时间、版本。若用户只要快速数,缺口不影响结果时可显式采用暂定口径;会改变结论时必须停在分支结果或追问有权者。
B. 清洗与转换
原始数据只读保存,清洗规则逐条显形。每条规则写:命中条件、动作、理由、影响行数、例外、可逆映射。异常值默认保留并标记;只有业务规则或分析目的明确时才排除。
C. 对账
先对齐双方对象和版本,再按 总量 → 分组 → 明细 缩小差异。把差异分为口径、刷新时点、重复/漏记、映射、计算、人工调整、未知;给每类金额/数量、样本和责任接口。不要用强行调平替代解释。
十分钟冲突数硬分支:当两个总数冲突且马上要汇报时,先给条件式结论,不猜唯一真源;最小核对必须同时覆盖:
- 截止时间、刷新时间和同一快照;
- 统计对象与粒度(订单、订单行、商品、客户或会计分录);
- 范围、组织/渠道、状态、税、退货取消和币种;
- 去重键、关联膨胀、人工调整;
- 源版本、ETL/同步批次、报表/看板版本;
- 从总量到分组再到明细的第一处差异。
十分钟内无法对齐时,并列报告两个“口径 + 快照 + 粒度 + 版本”的数值、差额和下一裁决人;不能仅因“财务”或“业务”名称决定真伪。
D. 异常解释
建立候选解释表:解释、若成立应看到什么、区分数据、当前证据、反证、置信度。至少区分数据管道变化和业务现实变化;没有时间序列或对照时只给描述性结论。
E. 探索与统计
先写分析问题和停止规则,避免无限切片寻找显著结果。说明样本选择、缺失处理、比较次数、效应大小和不确定性;模型输出不自动等于因果,预测准确也不等于机制正确。涉及专业统计、医疗、法律或财务高风险结论时提高证据门并建议对应复核。
F. 图表与解释
图表服务一个明确主张。标题写在范围内成立的结论,轴、单位、基线、时间和样本可见;不截轴制造幅度、不用双轴暗示关系、不用面积/3D 装饰扭曲数量。若数据不足以支持结论,标题写观察而非原因。
执行流程
- 写出业务问题、决定人、可能动作和错误结论的代价。
- 固化口径卡;记录有权确认者与有效版本。
- 只读审计源数据:字段类型、行数、主键候选、唯一性、缺失、重复、范围、刷新和敏感字段。
- 画最小血缘:来源、过滤、关联、转换、输出;多来源冲突使用共用主张链与冲突账。
- 在副本或可重复查询中计算;保留 SQL、公式、参数、中间总量和运行时间。
- 用独立路径交叉校验关键结论:总量与明细、另一公式、边界样本或第二来源;独立路径不应复制同一错误逻辑。
- 将事实、推断、限制、建议和权威决定分开;建议必须适配权限与公司语境。
- 交付结果、证据坐标、验证、未解决差异、下一反馈点和会翻转结论的新证据。
产物字段
业务问题与决策用途:
Question / Problem:
受众、决定人和可采取动作:
口径卡及确认状态:
数据源、源/ETL批次/报表版本、截至与刷新时间、对象粒度、权限范围:
质量审计:行数 / 唯一 / 缺失 / 重复 / 异常 / 关联
处理规则与影响行数:
关键结果及证据坐标:
比较基线与不确定性:
事实 / 推断 / 建议:
交叉校验及结果:
限制与未解决差异:
会翻转结论的证据:
下一现实反馈:
案例校准
正例:两个销售报表相差 8%。先发现 A 按下单日、订单去重,B 按出库日、商品行计数;统一对象后还剩 0.6%,再定位为次日回写。交付分别说明口径差和数据延迟,只有口径负责人确认后才生成统一数字。
反例:看到某团队客诉率更高就认定团队能力差,并建议培训。没有检查订单结构、分母、渠道、记录完整性和人员负荷,把相关性变成了个人归因。
边界例:样本只有 12 个且均来自自愿填写者。可以列出现有分布和个案主题,但不能推广到全体员工;若决定风险低,可把它作为下一轮抽样设计的线索,而不是“没有价值”。
验证、失败与翻转
- 口径未确认但不同口径给出相反决定:停止单值结论,交付分支和裁决请求。
- 数据源不可定位、版本不明或关键字段由手工覆盖:相应主张为无法验证。
- 总量通过但边界明细失败:不得用总体误差小判通过;说明失败影响范围。
- 交叉校验复制了同一来源、公式或关联逻辑:不算独立验证。
- 新数据落在预先声明的反证或范围外:更新结论,不把范围外样本静默删除。
- 数据产品已生成但现实决定尚未发生:最多判“取数/分析产物已交付”,不称业务 Problem 已解决。
结果回流
重复任务记录 口径争议次数、返工时间、数据迟到、差异率、结论被翻转原因、使用者是否据此行动。只有当有权者采用、现实反馈出现且错误成本未上升,才把分析模式沉淀为模板或自动化候选。用户净收益要扣除维护口径、额外采集、暴露敏感数据和解释成本。