# Ab Test Analysis

> Use when designing, checking, or interpreting A/B tests and experiments. Reviews hypothesis, variants, metrics, sample ratio, significance, guardrail metrics, segmentation, validity risks, and business recommendations.

- Skill: `shisuidata/ab-test-analysis` (Agent Skill)
- Install (CLI): `npx skillmds@latest add shisuidata/ab-test-analysis`
- Raw SKILL.md: https://api.skillmd.com/api/skills/shisuidata/ab-test-analysis/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: shisuidata (https://skillmd.com/u/shisuidata)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/shisuidata/ab-test-analysis

---


# A/B Test Analysis

## 目标

设计、审查或解读 A/B 实验，判断实验是否可信、结果是否显著、业务上是否值得推广。

这个 Skill 关注实验分析方法，不负责替代产品决策。实验结论必须同时看统计结果、业务影响和实验有效性。

## 使用场景

使用这个 Skill，当用户需要：

- 设计 A/B 实验方案
- 审查实验指标是否合理
- 解读实验结果
- 判断是否可以全量发布
- 排查实验分流、样本量或统计显著性问题
- 分析新功能、页面、推荐策略、价格策略、运营活动的实验效果

典型输入：

```text
这个实验转化率提升了 0.3 个百分点，p 值 0.04，可以全量吗？
```

## 不适用场景

不要用这个 Skill 直接完成：

- 普通漏斗分析，请使用 `funnel-analysis`
- 留存分析，请使用 `retention-cohort-analysis`
- 指标定义审查，请使用 `metric-definition-reviewer`
- 完整业务报告，请使用 `data-analysis-report-writer`

如果没有实验组、对照组和核心指标，不要强行给实验结论。

## 输入信息

最少输入：

- 实验假设
- 对照组和实验组定义
- 核心指标
- 样本量或指标结果

可选输入：

- 实验周期
- 分流规则
- 显著性水平
- 最小可检测效果
- Guardrail 指标
- 分群结果
- 是否多重检验
- 是否有提前停止
- 埋点或数据口径说明

## 上下文建议

推荐使用 [实验分析上下文模板](../../context/templates/experiment-context.md)。

最有价值的上下文是：实验假设、分组方式、核心指标、护栏指标、样本量、实验周期和显著性结果。缺少护栏指标或分流说明时，不能直接建议全量。

## 分析框架

1. 明确实验假设：预期影响哪个行为，为什么会影响。
2. 检查实验设计：随机分流、互斥性、样本稳定性、实验周期。
3. 检查指标体系：核心指标、辅助指标、护栏指标是否完整。
4. 检查样本量：是否足够支撑预期效果，是否样本比例异常。
5. 计算或解读结果：提升幅度、置信区间、p 值、效果量。
6. 检查有效性风险：污染、跨端、重复曝光、提前停止、多重检验。
7. 做分群分析：只解释预先定义或样本足够的分群。
8. 形成决策建议：全量、继续观察、回滚、重做实验或补充分析。

## 输出格式

```markdown
## A/B 实验分析

### 1. 实验结论

### 2. 实验设计检查

| 项目 | 结果 | 风险 |
| --- | --- | --- |
| 实验假设 |  |  |
| 分组方式 |  |  |
| 实验周期 |  |  |
| 样本量 |  |  |
| 核心指标 |  |  |
| 护栏指标 |  |  |

### 3. 指标结果

| 指标 | 对照组 | 实验组 | 变化 | 显著性 | 解释 |
| --- | --- | --- | --- | --- | --- |

### 4. 有效性风险

### 5. 分群结果

### 6. 决策建议

### 7. 需要补充的数据
```

## 决策规则

- 统计显著但业务收益很小：建议结合成本、风险和护栏指标判断
- 业务提升明显但不显著：建议延长实验或扩大样本，不直接全量
- 核心指标提升但护栏指标恶化：默认不建议直接全量
- 实验设计有严重污染：结论降级为参考，建议重做实验

## 质量标准

输出必须：

- 不只看 p 值
- 同时报告效果大小和业务影响
- 检查样本量、实验周期和护栏指标
- 标记多重检验和提前停止风险
- 把“可以上线”和“数据看起来提升”分开表达

## 示例 Prompt

```text
请用 ab-test-analysis 解读这个实验：

假设：新版会员页能提高开通转化率
对照组：旧版页面，10000 UV，转化 310
实验组：新版页面，10050 UV，转化 355
护栏指标：退款率、页面加载时间、客服投诉
周期：7 天
```

