Ab Testing

A/B 测试设计与分析时使用。适用于产品实验、功能验证、转化率优化。融合假设驱动 + 样本量计算 + 置信度判断。

zhaoxuya520 dcecd65 2 files · 2.6 KB Updated 12.8k repo stars

File contents

A/B 测试(A/B Testing)

适用场景

  • 新功能效果验证
  • UI/UX 改版对比
  • 定价策略测试
  • 推荐算法对比
  • 落地页优化

核心原则

1. 先有假设再实验
   "改变 X 会让 Y 提升 Z%"

2. 样本量要够
   不够 = 噪音当信号

3. 跑够时长
   至少 1~2 个完整业务周期

4. 看护栏指标
   主指标提升但其他恶化 = 不可上

5. 统计显著 ≠ 业务显著
   p < 0.05 但效果 0.01% = 无意义

样本量计算

公式因素:
  - 基线转化率(p1)
  - 最小检测效应(MDE)
  - 显著性水平(α = 0.05)
  - 统计功效(1-β = 0.8)

工具:
  - Evan Miller 样本量计算器
  - statsmodels(Python)
  - power.prop.test(R)

工作流程

1. 明确假设和目标
2. 选择主指标 + 护栏指标
3. 计算样本量
4. 确定分流方式和时长
5. 启动实验
6. 等待(不提前偷看)
7. 分析结果
8. 做决策(全量 / 放弃 / 迭代)

配套模板

  • templates/ab-test-template.md — A/B 测试设计 + 结果 + 结论

质量自检

□ 假设明确可证伪
□ 样本量计算
□ 分流无偏(hash)
□ 跑够时长
□ 不提前偷看
□ 看护栏指标
□ 结论可行动

常见坑

  1. 样本量不够就下结论——噪音
  2. 提前偷看 p-value——膨胀
  3. 只看主指标——护栏恶化
  4. 时长不够——周期效应
  5. 分流有偏——新用户 vs 老用户不均

与其他 skill 的协作

上游:metric-design → 指标选择
上游:product-manager → 假设来源
下游:analysis-report → 结果纳入报告

zhaoxuya520/ai-fullstack-delivery-workflow/tree/main/workflows/data-analyst/skills/ab-testing commit dcecd651f1

Frequently asked questions

npx skillmds@latest add zhaoxuya520/ab-testing