# Xb Data

> 调用受用户配置约束：高自动、中先确认、低须明确开启；用户指定其他技能时禁止接管。处理 Excel、SQL、指标口径、数据清洗、对账、异常分析、统计分析、图表和数据结论；把业务问题连接到可复核口径、数据链路和现实决定。触发：$xb-data、帮我看数据、Excel/SQL、指标为什么变了、核对报表、做个图表。

- Skill: `dennydkt/xb-data` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add dennydkt/xb-data`
- Raw SKILL.md: https://api.skillmd.com/api/skills/dennydkt/xb-data/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Data & Analytics
- Author: dennydkt (https://skillmd.com/u/dennydkt)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/dennydkt/xb-data

---


# xb-data：数据工作

调用前先读 `../xbskill/references/interaction-settings.md`，按用户已选调用强度和保存提示执行；明确指定其他技能或拒绝 XB 时退出。未初始化时只允许配置与说明，禁止代选或先执行后确认。

直调时先读取 `../xbskill/references/contracts.md` 与 `../xbskill/references/resolution-standard.md`；任何文件缺失时报告精确路径并停止，不得凭记忆补造。用户承担数据分析、数据工程、数据治理或数据产品责任，且岗位/生命周期/阶段会改变动作时，再读取 `../xbskill/references/role-context-model.md` 与 `../xbskill/references/data-work-specialties.md`；一次性低风险取数不加载全图谱。口径或方法结论依赖外部规范、论文或文档时，再读取 `../xbskill/references/knowledge-source-protocol.md`。

任务跨自动化、报告、演示或审查，或出现多来源冲突、批量改动、敏感数据和重复返工时，读取 `../xbskill/references/task-domain-patterns.md`；单表低风险整理不加载。

## 任务定义

报表、排名或数字结论进入个人评价与责任争议时，读取 `../xbskill/references/data-conclusion-review.md`，交付能复现的原值/新值/差额与仍成立结论。涉及绩效权重与评价规则时再读取 `../xbskill/references/career-evidence-review.md` 的绩效部分；主观评价与可复算项分开。文件缺失时报出路径并停止相应复核，保留当前唯一专科。

数据工作的产物要让有权者基于可追溯证据作出更好的决定；单个数字或图表只是其中的证据载体。先区分：

- **取数 Question**：在已确认口径与数据版本下生成可核对结果；
- **解释 Problem**：区分真实变化、口径变化、数据质量和随机波动；
- **决策 Problem**：说明结论怎样改变动作、资源或风险；
- **治理 Problem**：让重复口径、血缘、权限和版本冲突变得可控制。
- **数据产品 Problem**：把用户决定、数据契约、服务质量、采用反馈与版本/退役连成闭环。

不知道业务问题时可以做数据体检，但只能称“数据质量审计”，不能自动上升为业务洞察。

## 核心判断模型：结论可信度取决于最弱环

```text
业务问题 → 决策用途 → 指标定义 → 数据生成 → 抽取与关联
→ 清洗/计算 → 比较基线 → 不确定性 → 结论范围 → 现实验证
```

用七个门审查结论：

| 门 | 必答问题 | 失败后的含义 |
|---|---|---|
| 定义 | 指标对象、粒度、时间窗、单位、去重和边界是什么？ | 数字不可比较 |
| 生成 | 字段怎样在业务流程中产生？ | 字段名不能代表业务含义 |
| 完整 | 缺失、迟到、重复、删改和覆盖有多少？ | 总量可能失真 |
| 关联 | 键是否唯一，连接是否膨胀或漏配？ | 分组和归因不可靠 |
| 计算 | 公式、过滤、版本和中间结果能否复现？ | 结论不能复核 |
| 比较 | 基线、对照、季节性、样本和可比范围合理吗？ | 变化无法解释 |
| 推断 | 数据支持描述、关联还是因果？ | 动作强度必须下降 |

任一关键门未过，不用其他门的完整掩盖。给出能成立的较弱结论和精确缺口。

## 信号词典

| 信号 | 优先假设 | 必查反例 |
|---|---|---|
| “总数对不上” | 口径、时间窗、去重、迟到数据、关联膨胀 | 两边是否其实统计不同对象 |
| “突然涨/跌” | 数据刷新、埋点/流程、口径、活动、季节性、真实变化 | 绝对量、分母和历史波动 |
| “平均值变了” | 样本构成、极端值、权重或真实变化 | 中位数、分布和分组结构 |
| “相关性很高” | 共同驱动、选择偏差、时间趋势 | 先后顺序和替代解释 |
| “SQL 跑通了” | 只证明语法和执行路径 | 行数、唯一性、总量与边界样本 |
| “Excel 看起来没问题” | 显示格式可能掩盖类型/精度/公式错误 | 原始值、公式、隐藏行列、刷新状态 |
| “缺失不多” | 缺失比例低 | 缺失是否集中在关键人群/时间 |
| “样本很大” | 随机误差可能小 | 系统偏差、口径错误不会因样本大消失 |
| “领导要一个结论” | 需要决策接口 | 不确定性不能静默删除 |

## 模式与条件分支

### A. 取数与报表

先写口径卡，再查询。口径卡至少含：`业务定义、对象、粒度、时间窗、范围、去重、空值、币种/单位、时区、数据截至时间、版本`。若用户只要快速数，缺口不影响结果时可显式采用暂定口径；会改变结论时必须停在分支结果或追问有权者。

### B. 清洗与转换

原始数据只读保存，清洗规则逐条显形。每条规则写：`命中条件、动作、理由、影响行数、例外、可逆映射`。异常值默认保留并标记；只有业务规则或分析目的明确时才排除。

### C. 对账

先对齐双方对象和版本，再按 `总量 → 分组 → 明细` 缩小差异。把差异分为口径、刷新时点、重复/漏记、映射、计算、人工调整、未知；给每类金额/数量、样本和责任接口。不要用强行调平替代解释。

**十分钟冲突数硬分支**：当两个总数冲突且马上要汇报时，先给条件式结论，不猜唯一真源；最小核对必须同时覆盖：

1. 截止时间、刷新时间和同一快照；
2. 统计对象与粒度（订单、订单行、商品、客户或会计分录）；
3. 范围、组织/渠道、状态、税、退货取消和币种；
4. 去重键、关联膨胀、人工调整；
5. 源版本、ETL/同步批次、报表/看板版本；
6. 从总量到分组再到明细的第一处差异。

十分钟内无法对齐时，并列报告两个“口径 + 快照 + 粒度 + 版本”的数值、差额和下一裁决人；不能仅因“财务”或“业务”名称决定真伪。

### D. 异常解释

建立候选解释表：`解释、若成立应看到什么、区分数据、当前证据、反证、置信度`。至少区分数据管道变化和业务现实变化；没有时间序列或对照时只给描述性结论。

### E. 探索与统计

先写分析问题和停止规则，避免无限切片寻找显著结果。说明样本选择、缺失处理、比较次数、效应大小和不确定性；模型输出不自动等于因果，预测准确也不等于机制正确。涉及专业统计、医疗、法律或财务高风险结论时提高证据门并建议对应复核。

### F. 图表与解释

图表服务一个明确主张。标题写在范围内成立的结论，轴、单位、基线、时间和样本可见；不截轴制造幅度、不用双轴暗示关系、不用面积/3D 装饰扭曲数量。若数据不足以支持结论，标题写观察而非原因。

## 执行流程

1. 写出业务问题、决定人、可能动作和错误结论的代价。
2. 固化口径卡；记录有权确认者与有效版本。
3. 只读审计源数据：字段类型、行数、主键候选、唯一性、缺失、重复、范围、刷新和敏感字段。
4. 画最小血缘：来源、过滤、关联、转换、输出；多来源冲突使用共用主张链与冲突账。
5. 在副本或可重复查询中计算；保留 SQL、公式、参数、中间总量和运行时间。
6. 用独立路径交叉校验关键结论：总量与明细、另一公式、边界样本或第二来源；独立路径不应复制同一错误逻辑。
7. 将事实、推断、限制、建议和权威决定分开；建议必须适配权限与公司语境。
8. 交付结果、证据坐标、验证、未解决差异、下一反馈点和会翻转结论的新证据。

## 产物字段

```text
业务问题与决策用途：
Question / Problem：
受众、决定人和可采取动作：
口径卡及确认状态：
数据源、源/ETL批次/报表版本、截至与刷新时间、对象粒度、权限范围：
质量审计：行数 / 唯一 / 缺失 / 重复 / 异常 / 关联
处理规则与影响行数：
关键结果及证据坐标：
比较基线与不确定性：
事实 / 推断 / 建议：
交叉校验及结果：
限制与未解决差异：
会翻转结论的证据：
下一现实反馈：
```

## 案例校准

**正例**：两个销售报表相差 8%。先发现 A 按下单日、订单去重，B 按出库日、商品行计数；统一对象后还剩 0.6%，再定位为次日回写。交付分别说明口径差和数据延迟，只有口径负责人确认后才生成统一数字。

**反例**：看到某团队客诉率更高就认定团队能力差，并建议培训。没有检查订单结构、分母、渠道、记录完整性和人员负荷，把相关性变成了个人归因。

**边界例**：样本只有 12 个且均来自自愿填写者。可以列出现有分布和个案主题，但不能推广到全体员工；若决定风险低，可把它作为下一轮抽样设计的线索，而不是“没有价值”。

## 验证、失败与翻转

- 口径未确认但不同口径给出相反决定：停止单值结论，交付分支和裁决请求。
- 数据源不可定位、版本不明或关键字段由手工覆盖：相应主张为无法验证。
- 总量通过但边界明细失败：不得用总体误差小判通过；说明失败影响范围。
- 交叉校验复制了同一来源、公式或关联逻辑：不算独立验证。
- 新数据落在预先声明的反证或范围外：更新结论，不把范围外样本静默删除。
- 数据产品已生成但现实决定尚未发生：最多判“取数/分析产物已交付”，不称业务 Problem 已解决。

## 结果回流

重复任务记录 `口径争议次数、返工时间、数据迟到、差异率、结论被翻转原因、使用者是否据此行动`。只有当有权者采用、现实反馈出现且错误成本未上升，才把分析模式沉淀为模板或自动化候选。用户净收益要扣除维护口径、额外采集、暴露敏感数据和解释成本。

