何时使用
当用户要对比两个(或多个)方案、用数据判断谁更优,或要搭建系统化的增长实验流程时使用。典型场景:设计 A/B / A/B/n / 多变量(MVT)/ Split URL 测试,写实验假设,算样本量与运行时长,定主指标/次指标/护栏指标,用 ICE 给实验排期,按统计显著性判读结果并沉淀实验手册。
不该用的边界(负边界):
- 只是要做埋点/事件追踪的实施 → 用专门的 analytics 类技能。
- 只针对单个落地页做转化文案与版式优化、且不设对照组 → 走 CRO 流程。
- 没有对照组、样本极小或无法分流的「看一眼数据」需求 → 这不是 A/B 测试,别强行套显著性结论。
开始前先确认三件事:① 测试背景(想改进什么、要改什么);② 现状(基线转化率、当前流量);③ 约束(技术复杂度、时间、可用工具)。若仓库存在 .agents/product-marketing.md(或 .claude/product-marketing.md、旧版 product-marketing-context.md),先读它,已覆盖的信息不必再问。
步骤
- 写假设:一次只测一个变量,给出有依据的明确预测,而非「试试看」。
- 选测试类型:按可用流量选 A/B(中等流量)、A/B/n(更高)、MVT(极高)、Split URL(中等)。
- 定指标:1 个主指标(与业务价值和假设直接挂钩,用它来判定)、若干次指标(解释为什么生效)、护栏指标(不能变差,恶化就停)。
- 算样本量:先定最小可检测提升(MDE),再用计算器算每组样本量与时长,事先确定、运行中不改。
- 设计变体:单一且足够大的改动,忠于假设。
- 分配流量:默认 50/50;高风险用 90/10、80/20 或逐步放量;保证回访用户看到同一变体、曝光在时段上均衡。
- 选实现方式:客户端(JS 改页面,快但有闪烁,PostHog/Optimizely/VWO)或服务端(渲染前定变体,无闪烁但需开发,PostHog/LaunchDarkly/Split)。
- 上线前过 checklist,运行中只监控不偷看,达到样本量后再判读。
- 判读结果:按显著性、效应量、次指标一致性、护栏、分群差异得出结论并归档。
- (增长体系) 把赢家沉淀进实验手册,从学习中产出新假设,循环往复。
指令
假设结构:
因为 [观察/数据],
我们相信 [改动]
会带来 [预期结果]
对于 [受众]。
当 [指标] 变化时,我们就能验证这一点。
弱:「改按钮颜色也许能提高点击。」 强:「因为用户反馈很难找到 CTA(热图+反馈佐证),我们相信把按钮放大并用对比色,能让新访客的 CTA 点击率提升 15%+。用从页面浏览到注册开始的点击率衡量。」
样本量速查(每组所需样本,按基线×相对提升):
| 基线 | +10% | +20% | +50% |
|---|---|---|---|
| 1% | 150k | 39k | 6k |
| 3% | 47k | 12k | 2k |
| 5% | 27k | 7k | 1.2k |
| 10% | 12k | 3k | 550 |
计算器:Evan Miller https://www.evanmiller.org/ab-testing/sample-size.html、Optimizely https://www.optimizely.com/sample-size-calculator/。
上线前 checklist: 假设已记录 / 主指标已定 / 样本量已算 / 变体实现正确 / 埋点已验证 / 各变体已 QA。
运行中要做: 监控技术问题、检查分群质量、记录外部因素。 运行中禁止: 偷看结果并提前停(peeking 会制造假阳性)、改动变体、引入新流量来源。
判读 checklist: ① 达到样本量了吗(没到=初步结论)② 是否显著(看置信区间)③ 效应量是否有意义(对比 MDE,估算业务影响)④ 次指标是否一致 ⑤ 护栏是否有恶化 ⑥ 分群是否有差异(移动 vs 桌面、新 vs 老)。
结论对照: 显著胜出→上线变体;显著落败→保留对照并复盘原因;无显著差异→加流量或做更大胆的测试;信号混杂→下钻分群。
ICE 排期: 对每个假设在 Impact(若生效能推动主指标多少)、Confidence(基于数据而非直觉的把握度)、Ease(多快多省地上线并衡量)三项打 1–10 分,ICE = (Impact + Confidence + Ease) / 3,先跑高分实验,每月按上下文重评。
实验节奏: 每周(30 分)查技术问题与护栏,护栏显著恶化才停,但不提前判赢;双周收尾已完成实验、更新手册、从 backlog 启动下一个;每月(1 小时)复盘实验速度/胜率/累计提升,补充假设、重排 ICE;每季审计手册(哪些模式已推广、哪些赢家未规模化、漏斗哪段测试不足)。健康指标:每月上线 4–8 个、胜率 20–30%、单测 2–4 周、backlog 储备 20+。
示例
定价页测试:
- 主指标:套餐选择率
- 次指标:页面停留、套餐分布
- 护栏:客服工单数、退款率
实验手册条目模板(赢家沉淀):
## [实验名]
日期:[date]
假设:[假设]
样本量:[每组 n]
结果:[胜/负/不确定] — [主指标] 变化 [X%](95% CI:[区间],p=[值])
护栏:[护栏指标及结果]
分群差异:[设备/分群/同期群上的显著差异]
为何生效/失败:[分析]
可复用模式:[如「定价 CTA 旁加社会证明能提升套餐选择」]
可应用于:[其他可能奏效的页面/流程]
状态:[已实施 / 暂缓 / 需跟进测试]
注意事项
- 设计陷阱:改动太小(检测不出)、一次测太多(无法归因)、没有清晰假设。
- 执行陷阱:提前停、中途改变体、不核对实现是否正确。
- 分析陷阱:忽略置信区间、挑数据(cherry-pick 分群)、过度解读不显著的结果。
- 95% 置信 = p < 0.05,意味着结果纯随机的概率 < 5%,这只是阈值不是保证。
- 「偷看就停」是最常见的致命错误:事先承诺样本量并相信流程。
- 每个测试都要归档:假设、变体(含截图)、结果(样本/指标/显著性)、决策与学习。
互见
- seo-content-writer:用于生成变体文案与内容版本,作为实验输入。
- first-principles-thinking:在假设生成与原因复盘时拆解第一性问题。
本条采编自 coreyhaines31/marketingskills(MIT)。