# Ab Testing

> A/B 测试设计与分析时使用。适用于产品实验、功能验证、转化率优化。融合假设驱动 + 样本量计算 + 置信度判断。

- Skill: `zhaoxuya520/ab-testing` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add zhaoxuya520/ab-testing`
- Raw SKILL.md: https://api.skillmd.com/api/skills/zhaoxuya520/ab-testing/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: zhaoxuya520 (https://skillmd.com/u/zhaoxuya520)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/zhaoxuya520/ab-testing

---


# A/B 测试（A/B Testing）

## 适用场景

- 新功能效果验证
- UI/UX 改版对比
- 定价策略测试
- 推荐算法对比
- 落地页优化

## 核心原则

```text
1. 先有假设再实验
   "改变 X 会让 Y 提升 Z%"

2. 样本量要够
   不够 = 噪音当信号

3. 跑够时长
   至少 1~2 个完整业务周期

4. 看护栏指标
   主指标提升但其他恶化 = 不可上

5. 统计显著 ≠ 业务显著
   p < 0.05 但效果 0.01% = 无意义
```

## 样本量计算

```text
公式因素：
  - 基线转化率（p1）
  - 最小检测效应（MDE）
  - 显著性水平（α = 0.05）
  - 统计功效（1-β = 0.8）

工具：
  - Evan Miller 样本量计算器
  - statsmodels（Python）
  - power.prop.test（R）
```

## 工作流程

```text
1. 明确假设和目标
2. 选择主指标 + 护栏指标
3. 计算样本量
4. 确定分流方式和时长
5. 启动实验
6. 等待（不提前偷看）
7. 分析结果
8. 做决策（全量 / 放弃 / 迭代）
```

## 配套模板

- `templates/ab-test-template.md` — A/B 测试设计 + 结果 + 结论

## 质量自检

```text
□ 假设明确可证伪
□ 样本量计算
□ 分流无偏（hash）
□ 跑够时长
□ 不提前偷看
□ 看护栏指标
□ 结论可行动
```

## 常见坑

1. **样本量不够就下结论**——噪音
2. **提前偷看 p-value**——膨胀
3. **只看主指标**——护栏恶化
4. **时长不够**——周期效应
5. **分流有偏**——新用户 vs 老用户不均

## 与其他 skill 的协作

```text
上游：metric-design → 指标选择
上游：product-manager → 假设来源
下游：analysis-report → 结果纳入报告
```

