# Ab Test Designer

> 当你要规划、设计或落地一次 A/B 测试，或搭建持续的增长实验体系时使用；产出含假设、主/次/护栏指标、样本量与运行计划的可执行实验方案，并用 ICE 排期、统计显著性判定结果；不适用于纯埋点实施、单页 CRO 改稿或无对照组的分析。触发词：A/B 测试、ab test、split test、分流测试、多变量测试、MVT、实验设计、假设检验、统计显著性、样本量、ICE 评分、增长实验、experiment backlog、哪个版本更好。

- Skill: `findscripter/ab-test-designer` (Agent Skill)
- Install (CLI): `npx skillmds@latest add findscripter/ab-test-designer`
- Raw SKILL.md: https://api.skillmd.com/api/skills/findscripter/ab-test-designer/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Product & Planning
- License: MIT
- Author: findscripter (https://skillmd.com/u/findscripter)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/findscripter/ab-test-designer

---

## 何时使用

当用户要对比两个（或多个）方案、用数据判断谁更优，或要搭建系统化的增长实验流程时使用。典型场景：设计 A/B / A/B/n / 多变量（MVT）/ Split URL 测试，写实验假设，算样本量与运行时长，定主指标/次指标/护栏指标，用 ICE 给实验排期，按统计显著性判读结果并沉淀实验手册。

**不该用的边界（负边界）：**
- 只是要做埋点/事件追踪的实施 → 用专门的 analytics 类技能。
- 只针对单个落地页做转化文案与版式优化、且不设对照组 → 走 CRO 流程。
- 没有对照组、样本极小或无法分流的「看一眼数据」需求 → 这不是 A/B 测试，别强行套显著性结论。

开始前先确认三件事：① 测试背景（想改进什么、要改什么）；② 现状（基线转化率、当前流量）；③ 约束（技术复杂度、时间、可用工具）。若仓库存在 `.agents/product-marketing.md`（或 `.claude/product-marketing.md`、旧版 `product-marketing-context.md`），先读它，已覆盖的信息不必再问。

## 步骤

1. **写假设**：一次只测一个变量，给出有依据的明确预测，而非「试试看」。
2. **选测试类型**：按可用流量选 A/B（中等流量）、A/B/n（更高）、MVT（极高）、Split URL（中等）。
3. **定指标**：1 个主指标（与业务价值和假设直接挂钩，用它来判定）、若干次指标（解释为什么生效）、护栏指标（不能变差，恶化就停）。
4. **算样本量**：先定最小可检测提升（MDE），再用计算器算每组样本量与时长，**事先确定、运行中不改**。
5. **设计变体**：单一且足够大的改动，忠于假设。
6. **分配流量**：默认 50/50；高风险用 90/10、80/20 或逐步放量；保证回访用户看到同一变体、曝光在时段上均衡。
7. **选实现方式**：客户端（JS 改页面，快但有闪烁，PostHog/Optimizely/VWO）或服务端（渲染前定变体，无闪烁但需开发，PostHog/LaunchDarkly/Split）。
8. **上线前过 checklist**，运行中只监控不偷看，达到样本量后再判读。
9. **判读结果**：按显著性、效应量、次指标一致性、护栏、分群差异得出结论并归档。
10. **（增长体系）** 把赢家沉淀进实验手册，从学习中产出新假设，循环往复。

## 指令

**假设结构：**
```
因为 [观察/数据]，
我们相信 [改动]
会带来 [预期结果]
对于 [受众]。
当 [指标] 变化时，我们就能验证这一点。
```
弱：「改按钮颜色也许能提高点击。」
强：「因为用户反馈很难找到 CTA（热图+反馈佐证），我们相信把按钮放大并用对比色，能让新访客的 CTA 点击率提升 15%+。用从页面浏览到注册开始的点击率衡量。」

**样本量速查（每组所需样本，按基线×相对提升）：**
| 基线 | +10% | +20% | +50% |
|------|------|------|------|
| 1%  | 150k | 39k | 6k |
| 3%  | 47k  | 12k | 2k |
| 5%  | 27k  | 7k  | 1.2k |
| 10% | 12k  | 3k  | 550 |

计算器：Evan Miller `https://www.evanmiller.org/ab-testing/sample-size.html`、Optimizely `https://www.optimizely.com/sample-size-calculator/`。

**上线前 checklist：** 假设已记录 / 主指标已定 / 样本量已算 / 变体实现正确 / 埋点已验证 / 各变体已 QA。

**运行中要做：** 监控技术问题、检查分群质量、记录外部因素。
**运行中禁止：** 偷看结果并提前停（peeking 会制造假阳性）、改动变体、引入新流量来源。

**判读 checklist：** ① 达到样本量了吗（没到=初步结论）② 是否显著（看置信区间）③ 效应量是否有意义（对比 MDE，估算业务影响）④ 次指标是否一致 ⑤ 护栏是否有恶化 ⑥ 分群是否有差异（移动 vs 桌面、新 vs 老）。

**结论对照：** 显著胜出→上线变体；显著落败→保留对照并复盘原因；无显著差异→加流量或做更大胆的测试；信号混杂→下钻分群。

**ICE 排期：** 对每个假设在 Impact（若生效能推动主指标多少）、Confidence（基于数据而非直觉的把握度）、Ease（多快多省地上线并衡量）三项打 1–10 分，ICE = (Impact + Confidence + Ease) / 3，先跑高分实验，每月按上下文重评。

**实验节奏：** 每周（30 分）查技术问题与护栏，护栏显著恶化才停，但不提前判赢；双周收尾已完成实验、更新手册、从 backlog 启动下一个；每月（1 小时）复盘实验速度/胜率/累计提升，补充假设、重排 ICE；每季审计手册（哪些模式已推广、哪些赢家未规模化、漏斗哪段测试不足）。健康指标：每月上线 4–8 个、胜率 20–30%、单测 2–4 周、backlog 储备 20+。

## 示例

**定价页测试：**
- 主指标：套餐选择率
- 次指标：页面停留、套餐分布
- 护栏：客服工单数、退款率

**实验手册条目模板（赢家沉淀）：**
```
## [实验名]
日期：[date]
假设：[假设]
样本量：[每组 n]
结果：[胜/负/不确定] — [主指标] 变化 [X%]（95% CI:[区间]，p=[值]）
护栏：[护栏指标及结果]
分群差异：[设备/分群/同期群上的显著差异]
为何生效/失败：[分析]
可复用模式：[如「定价 CTA 旁加社会证明能提升套餐选择」]
可应用于：[其他可能奏效的页面/流程]
状态：[已实施 / 暂缓 / 需跟进测试]
```

## 注意事项

- **设计陷阱**：改动太小（检测不出）、一次测太多（无法归因）、没有清晰假设。
- **执行陷阱**：提前停、中途改变体、不核对实现是否正确。
- **分析陷阱**：忽略置信区间、挑数据（cherry-pick 分群）、过度解读不显著的结果。
- 95% 置信 = p < 0.05，意味着结果纯随机的概率 < 5%，这只是阈值不是保证。
- 「偷看就停」是最常见的致命错误：事先承诺样本量并相信流程。
- 每个测试都要归档：假设、变体（含截图）、结果（样本/指标/显著性）、决策与学习。

## 互见

- **seo-content-writer**：用于生成变体文案与内容版本，作为实验输入。
- **first-principles-thinking**：在假设生成与原因复盘时拆解第一性问题。

---
本条采编自 coreyhaines31/marketingskills（MIT）。

