A/B-тесты и эксперименты (RU)
Дизайн статистически валидных A/B-тестов и построение программы роста через эксперименты. Математика языко-независима; инструменты и примеры — под типовой стек (веб-аналитика + продуктовая БД + PostHog/n8n) и типовые продукты — лендинги, подписки на рассылку, формы заявок, email-цепочки, SaaS/курс/услуга.
Перед началом прочитай ~/.claude/business-context.md — разделы «Воронка» (шаги и текущие значения), «Экономика» (конверсии, средний чек) и «Цены». Файла нет — заведи из ~/.claude/templates/business-context.md.
Без него расчёт выборки не на чем построить: навык возьмёт «конверсию 2 %, потому что так обычно», посчитает срок теста по несуществующему трафику и выдаст уверенное «нужно 3 недели» там, где нужно три месяца. Позиционирование, цены и метрики держи только в этом файле — продублируешь в гипотезах, разойдутся.
Когда использовать
- Спланировать и описать конкретный A/B-тест (гипотеза → выборка → метрики → решение).
- Прикинуть размер выборки и длительность под реальный трафик страницы/рассылки.
- Запустить эксперимент по запросу из CRO-скиллов (
page-cro-ru, onboarding-cro-ru, paywall-cro-ru, popup-cro-ru, form-cro-ru).
- Построить программу роста: бэклог гипотез, ICE-приоритизация, плейбук.
Базовые принципы
- Начинай с гипотезы. Не «посмотрим, что будет», а конкретное предсказание с обоснованием.
- Тестируй одну переменную. Иначе непонятно, что сработало.
- Статистическая строгость. Размер выборки фиксируется заранее. Не «подсматривай» и не останавливай тест рано (проблема peeking → ложные срабатывания).
- Меряй то, что важно. Первичная метрика, привязанная к деньгам/воронке; вторичные для интерпретации; guardrail — что не должно ухудшиться.
Фреймворк гипотезы
Так как [наблюдение/данные],
мы считаем, что [изменение]
приведёт к [ожидаемый результат]
для [аудитория].
Подтвердим это, если [метрика].
Слабо: «Может, другой цвет кнопки повысит клики».
Сильно: «Так как записи сессий показывают, что B2B-посетители /services не доходят до формы (drop на 2-м экране), мы считаем, что вынос CTA "Бесплатная консультация" в hero повысит долю заявок на 15%+ для трафика из контекстной рекламы. Подтвердим по конверсии визит → отправка формы».
Размер выборки
Зависит от базовой конверсии и минимально значимого эффекта (MDE). Чем ниже база и меньше эффект — тем больше нужно трафика. Быстрая шпаргалка:
| База |
Эффект +10% |
+20% |
+50% |
| 1% |
~380k/вариант |
~97k |
~16k |
| 3% |
~120k |
~31k |
~5.2k |
| 5% |
~72k |
~18k |
~3.1k |
| 10% |
~34k |
~8.7k |
~1.5k |
Длительность = (выборка на вариант × число вариантов) / (дневной трафик × % в тесте).
Полные таблицы выборки, формулы длительности, минимумы прогона, поправки на A/B/n, последовательное тестирование и фреймворк «можно ли вообще крутить этот тест» — references/sample-size-guide.md.
Калькуляторы (язык не важен): Evan Miller (evanmiller.org/ab-testing/sample-size.html), AB Test Guide (abtestguide.com/calc/).
Реальность низкого трафика
У многих нишевых/B2B-страниц трафик низкий. Это значит:
- Часто классический A/B статзначимости не наберёт за разумный срок. Тогда: брать больший MDE (ловить только крупные сдвиги +30–50%), тестить выше по воронке (где трафика больше — блог/рассылка), либо решать по качественным данным (записи сессий, тепловые карты, интервью), не выдавая это за «тест».
- На малых выборках корректнее байес (PostHog Bayesian) — даёт интерпретируемую вероятность, что вариант лучше, без жёсткого порога n.
- Honest-правило: если выборки не хватает — так и сказать, не называть «результатом» 50 визитов.
Метрики
- Первичная: одна, привязана к деньгам/воронке. Примеры: доля заявок на консультацию (B2B), старт триала (B2C), подтверждённая подписка на рассылку, оплата подписки.
- Вторичные: объясняют почему (время на странице, скролл, распределение по тарифам).
- Guardrail: не должны ухудшиться (отписки от рассылки, отток trial, обращения в поддержку, lead quality в CRM).
Какие именно метрики важны по воронке (подписчики → trial → paid, заявки на консультацию, лиды) — сверяйся со своей картой воронки + performance-analytics.
Что варьировать
| Категория |
Примеры |
| Заголовок/копирайт |
message angle, ценностное предложение, соцпруф в H1 («эксперт-практик учит вас») |
| CTA |
текст («Бесплатная консультация» vs «Обсудить задачу»), размещение, число |
| Контент |
соцпруф у CTA, порядок блоков, founding-оффер vs обычный тариф |
| Письма |
subject line, превью, отправитель, время отправки дайджеста |
Прогон теста
Перед запуском: гипотеза задокументирована, первичная метрика определена и трекается (yandex/performance-analytics), выборка посчитана, варианты собраны, трекинг проверен, QA пройден.
Во время: мониторь технические сбои и guardrail; не подсматривай ради остановки, не меняй варианты, не добавляй новые источники трафика в середине.
Минимум прогона: ≥1 полная неделя (день недели влияет), для B2B — 2 бизнес-цикла.
Анализ результатов
- Набрали выборку? Если нет — предварительно.
- Статзначимо (95% = p<0.05) или байес-вероятность убедительна?
- Эффект практически значим (сравни с MDE, спроецируй на деньги)?
- Вторичные метрики согласуются?
- Guardrail не пострадал?
- Различия по сегментам (мобайл/десктоп, B2B/B2C, источник)?
| Результат |
Вывод |
| Значимый победитель |
Внедрить вариант |
| Значимый проигравший |
Оставить контроль, понять почему |
| Нет разницы |
Нужно больше трафика или смелее тест |
| Смешанные сигналы |
Копать глубже, сегментировать |
Программа экспериментов (рост через тесты)
Цикл: генерим гипотезы (из аналитики/записей сессий, CRM, конкурентов, обратной связи) → приоритизируем ICE → запускаем → анализируем → победителей в плейбук → новые гипотезы из выводов.
ICE = (Impact + Confidence + Ease) / 3, каждое 1–10. Сначала — с наибольшим баллом. Пересматривать раз в месяц.
Каденс: еженедельно — проверка guardrail и техсбоев (не звать победителя рано); раз в 2 недели — закрытие тестов, обновление плейбука, запуск следующего; ежемесячно — velocity, win rate (20–30% норм), накопленный эффект, пополнение бэклога.
Шаблоны (план теста, документация результатов, бэклог гипотез, ICE-скоркарта, стейкхолдер-апдейт, плейбук) — references/test-templates.md.
Спец-форматы тестов
Помимо классического A/B на лендинге, есть три отдельных жанра теста — каждый со своими правилами «когда можно делать вывод». Детали в references:
| Reference |
О чём |
Когда читать |
references/hypothesis-template.md |
Шаблон гипотезы «3 гипотезы × 2-3 недели + объяснение»: формат гипотезы, почему именно 3, как формулировать ожидаемый эффект от бенчмарка (не от потолка), ICE-оценка с реальной калибровкой шкалы |
Нужно сформировать бэклог гипотез под продукт, оформить гипотезу проверяемо, приоритизировать по ICE |
references/direct-ab-testing.md |
A/B автостратегий и связок в контекстной рекламе: минимум 100 кликов / 50 для площадок / 15-20 для запросов для выводов; ≥10 конверсий/неделю для обучения; погрешность алгоритма (25 конв → ±40%, 400 → ~10%, 10K → почти нет); принцип «Работает — не трогай» как guardrail и анти-peeking |
Тестируешь объявления / автостратегии / связки, решаешь «отключать или нет», «почему прыгает цена лида» |
references/vendor-ab-testing.md |
A/B-тест команд-подрядчиков: 50/50 → 60/40 → 70/30 → 80/20 с фиксацией CAC и ROMI на каждом шаге |
Выбираешь между двумя агентствами / фрилансерами, проверяешь нового подрядчика без риска всего бюджета |
Ключевая мысль: работа маркетолога — это генерация гипотез. ICE-приоритизация, минимумы данных и «работает — не трогай» превращают поток идей в управляемую программу, а не казино.
Данные и трекинг (НЕ дублировать — звать существующее)
- Трафик, конверсии целей, сегменты, воронки, размер выборки по факту →
performance-analytics и yandex (Метрика API: цели, параметры, записи сессий).
- Бенчмарки и метрики каналов →
performance-analytics.
- Правки вариантов на странице/лендинге →
tilda.
- Email-варианты (subject/контент) →
html-email + email-sequence; триггеры → n8n.
- Лиды/quality из CRM как guardrail → твоя CRM (какая — раздел «Учёт и аналитика» в
~/.claude/business-context.md; у Битрикс24/amoCRM/HubSpot есть REST API для выгрузки).
Связки
| Нужно |
Скилл |
| Данные воронки/конверсий, сегменты |
performance-analytics |
| Метрика/записи сессий/цели |
yandex |
| Бенчмарки, метрики каналов |
performance-analytics |
| Правки вариантов на странице |
tilda |
| Письма для теста |
html-email, email-sequence |
| CRO-аудит страниц (генерит гипотезы) |
page-cro-ru, onboarding-cro-ru, paywall-cro-ru, popup-cro-ru, form-cro-ru (формы захвата, включая регистрацию) |
| Психология вариантов (что тестить) |
marketing-psychology-ru |
| ICE-приоритизация гипотез воронки (откуда берутся гипотезы) |
funnel-design-ru |
| Настройка целей/стратегий/обучения в контекстной рекламе (для A/B автостратегий) |
yandex-direct-pro-ru |
| Бенчмарки и минимальные пороги для выводов по каналам |
ad-benchmarks-ru |
Вопросы под задачу
- Текущая конверсия и трафик страницы/рассылки?
- Какое изменение тестируем и почему (наблюдение/данные)?
- Минимальный эффект, который стоит ловить (MDE)?
- Хватит ли трафика за разумный срок, или нужен байес / тест выше по воронке?
- Что уже пробовали в этой зоне?
1---2name: ab-testing-ru3description: A/B-тесты и программа экспериментов: гипотезы, выборка, статзначимость, ICE. Триггеры: «сплит-тест», «проверить гипотезу». НЕ CRO страниц→*-cro-ru.4---56# A/B-тесты и эксперименты (RU)78Дизайн статистически валидных A/B-тестов и построение программы роста через эксперименты. Математика языко-независима; инструменты и примеры — под типовой стек (веб-аналитика + продуктовая БД + PostHog/n8n) и типовые продукты — лендинги, подписки на рассылку, формы заявок, email-цепочки, SaaS/курс/услуга.910**Перед началом прочитай `~/.claude/business-context.md`** — разделы «Воронка» (шаги и текущие значения), «Экономика» (конверсии, средний чек) и «Цены». Файла нет — заведи из `~/.claude/templates/business-context.md`.1112Без него расчёт выборки не на чем построить: навык возьмёт «конверсию 2 %, потому что так обычно», посчитает срок теста по несуществующему трафику и выдаст уверенное «нужно 3 недели» там, где нужно три месяца. Позиционирование, цены и метрики держи только в этом файле — продублируешь в гипотезах, разойдутся.1314## Когда использовать1516- Спланировать и описать конкретный A/B-тест (гипотеза → выборка → метрики → решение).17- Прикинуть размер выборки и длительность под реальный трафик страницы/рассылки.18- Запустить эксперимент по запросу из CRO-скиллов (`page-cro-ru`, `onboarding-cro-ru`, `paywall-cro-ru`, `popup-cro-ru`, `form-cro-ru`).19- Построить программу роста: бэклог гипотез, ICE-приоритизация, плейбук.2021## Базовые принципы22231. **Начинай с гипотезы.** Не «посмотрим, что будет», а конкретное предсказание с обоснованием.242. **Тестируй одну переменную.** Иначе непонятно, что сработало.253. **Статистическая строгость.** Размер выборки фиксируется заранее. Не «подсматривай» и не останавливай тест рано (проблема peeking → ложные срабатывания).264. **Меряй то, что важно.** Первичная метрика, привязанная к деньгам/воронке; вторичные для интерпретации; guardrail — что не должно ухудшиться.2728## Фреймворк гипотезы2930```31Так как [наблюдение/данные],32мы считаем, что [изменение]33приведёт к [ожидаемый результат]34для [аудитория].35Подтвердим это, если [метрика].36```3738**Слабо:** «Может, другой цвет кнопки повысит клики».3940**Сильно:** «Так как записи сессий показывают, что B2B-посетители /services не доходят до формы (drop на 2-м экране), мы считаем, что вынос CTA "Бесплатная консультация" в hero повысит долю заявок на 15%+ для трафика из контекстной рекламы. Подтвердим по конверсии визит → отправка формы».4142## Размер выборки4344Зависит от базовой конверсии и минимально значимого эффекта (MDE). Чем ниже база и меньше эффект — тем больше нужно трафика. Быстрая шпаргалка:4546| База | Эффект +10% | +20% | +50% |47|------|-------------|------|------|48| 1% | ~380k/вариант | ~97k | ~16k |49| 3% | ~120k | ~31k | ~5.2k |50| 5% | ~72k | ~18k | ~3.1k |51| 10% | ~34k | ~8.7k | ~1.5k |5253Длительность = (выборка на вариант × число вариантов) / (дневной трафик × % в тесте).5455Полные таблицы выборки, формулы длительности, минимумы прогона, поправки на A/B/n, последовательное тестирование и фреймворк «можно ли вообще крутить этот тест» — `references/sample-size-guide.md`.5657**Калькуляторы (язык не важен):** Evan Miller (evanmiller.org/ab-testing/sample-size.html), AB Test Guide (abtestguide.com/calc/).5859### Реальность низкого трафика6061У многих нишевых/B2B-страниц трафик **низкий**. Это значит:62- Часто классический A/B статзначимости не наберёт за разумный срок. Тогда: брать больший MDE (ловить только крупные сдвиги +30–50%), тестить выше по воронке (где трафика больше — блог/рассылка), либо решать по качественным данным (записи сессий, тепловые карты, интервью), не выдавая это за «тест».63- На малых выборках корректнее **байес** (PostHog Bayesian) — даёт интерпретируемую вероятность, что вариант лучше, без жёсткого порога n.64- Honest-правило: если выборки не хватает — так и сказать, не называть «результатом» 50 визитов.6566## Метрики6768- **Первичная:** одна, привязана к деньгам/воронке. Примеры: доля заявок на консультацию (B2B), старт триала (B2C), подтверждённая подписка на рассылку, оплата подписки.69- **Вторичные:** объясняют почему (время на странице, скролл, распределение по тарифам).70- **Guardrail:** не должны ухудшиться (отписки от рассылки, отток trial, обращения в поддержку, lead quality в CRM).7172Какие именно метрики важны по воронке (подписчики → trial → paid, заявки на консультацию, лиды) — сверяйся со своей картой воронки + `performance-analytics`.7374## Что варьировать7576| Категория | Примеры |77|-----------|---------|78| Заголовок/копирайт | message angle, ценностное предложение, соцпруф в H1 («эксперт-практик учит вас») |79| CTA | текст («Бесплатная консультация» vs «Обсудить задачу»), размещение, число |80| Контент | соцпруф у CTA, порядок блоков, founding-оффер vs обычный тариф |81| Письма | subject line, превью, отправитель, время отправки дайджеста |8283## Прогон теста8485**Перед запуском:** гипотеза задокументирована, первичная метрика определена и трекается (`yandex`/`performance-analytics`), выборка посчитана, варианты собраны, трекинг проверен, QA пройден.8687**Во время:** мониторь технические сбои и guardrail; **не** подсматривай ради остановки, **не** меняй варианты, **не** добавляй новые источники трафика в середине.8889**Минимум прогона:** ≥1 полная неделя (день недели влияет), для B2B — 2 бизнес-цикла.9091## Анализ результатов92931. Набрали выборку? Если нет — предварительно.942. Статзначимо (95% = p<0.05) или байес-вероятность убедительна?953. Эффект практически значим (сравни с MDE, спроецируй на деньги)?964. Вторичные метрики согласуются?975. Guardrail не пострадал?986. Различия по сегментам (мобайл/десктоп, B2B/B2C, источник)?99100| Результат | Вывод |101|-----------|-------|102| Значимый победитель | Внедрить вариант |103| Значимый проигравший | Оставить контроль, понять почему |104| Нет разницы | Нужно больше трафика или смелее тест |105| Смешанные сигналы | Копать глубже, сегментировать |106107## Программа экспериментов (рост через тесты)108109Цикл: генерим гипотезы (из аналитики/записей сессий, CRM, конкурентов, обратной связи) → приоритизируем ICE → запускаем → анализируем → победителей в плейбук → новые гипотезы из выводов.110111**ICE** = (Impact + Confidence + Ease) / 3, каждое 1–10. Сначала — с наибольшим баллом. Пересматривать раз в месяц.112113**Каденс:** еженедельно — проверка guardrail и техсбоев (не звать победителя рано); раз в 2 недели — закрытие тестов, обновление плейбука, запуск следующего; ежемесячно — velocity, win rate (20–30% норм), накопленный эффект, пополнение бэклога.114115Шаблоны (план теста, документация результатов, бэклог гипотез, ICE-скоркарта, стейкхолдер-апдейт, плейбук) — `references/test-templates.md`.116117## Спец-форматы тестов118119Помимо классического A/B на лендинге, есть три отдельных жанра теста — каждый со своими правилами «когда можно делать вывод». Детали в references:120121| Reference | О чём | Когда читать |122|-----------|-------|--------------|123| `references/hypothesis-template.md` | Шаблон гипотезы «3 гипотезы × 2-3 недели + объяснение»: формат гипотезы, почему именно 3, как формулировать ожидаемый эффект от бенчмарка (не от потолка), ICE-оценка с реальной калибровкой шкалы | Нужно сформировать бэклог гипотез под продукт, оформить гипотезу проверяемо, приоритизировать по ICE |124| `references/direct-ab-testing.md` | A/B автостратегий и связок в контекстной рекламе: минимум **100 кликов / 50 для площадок / 15-20 для запросов** для выводов; **≥10 конверсий/неделю** для обучения; погрешность алгоритма (**25 конв → ±40%**, 400 → ~10%, 10K → почти нет); принцип **«Работает — не трогай»** как guardrail и анти-peeking | Тестируешь объявления / автостратегии / связки, решаешь «отключать или нет», «почему прыгает цена лида» |125| `references/vendor-ab-testing.md` | A/B-тест команд-подрядчиков: **50/50 → 60/40 → 70/30 → 80/20** с фиксацией **CAC и ROMI** на каждом шаге | Выбираешь между двумя агентствами / фрилансерами, проверяешь нового подрядчика без риска всего бюджета |126127Ключевая мысль: **работа маркетолога — это генерация гипотез**. ICE-приоритизация, минимумы данных и «работает — не трогай» превращают поток идей в управляемую программу, а не казино.128129## Данные и трекинг (НЕ дублировать — звать существующее)130131- **Трафик, конверсии целей, сегменты, воронки, размер выборки по факту** → `performance-analytics` и `yandex` (Метрика API: цели, параметры, записи сессий).132- **Бенчмарки и метрики каналов** → `performance-analytics`.133- **Правки вариантов на странице/лендинге** → `tilda`.134- **Email-варианты (subject/контент)** → `html-email` + `email-sequence`; триггеры → `n8n`.135- **Лиды/quality из CRM как guardrail** → твоя CRM (какая — раздел «Учёт и аналитика» в `~/.claude/business-context.md`; у Битрикс24/amoCRM/HubSpot есть REST API для выгрузки).136137## Связки138139| Нужно | Скилл |140|------|-------|141| Данные воронки/конверсий, сегменты | `performance-analytics` |142| Метрика/записи сессий/цели | `yandex` |143| Бенчмарки, метрики каналов | `performance-analytics` |144| Правки вариантов на странице | `tilda` |145| Письма для теста | `html-email`, `email-sequence` |146| CRO-аудит страниц (генерит гипотезы) | `page-cro-ru`, `onboarding-cro-ru`, `paywall-cro-ru`, `popup-cro-ru`, `form-cro-ru` (формы захвата, включая регистрацию) |147| Психология вариантов (что тестить) | `marketing-psychology-ru` |148| ICE-приоритизация гипотез воронки (откуда берутся гипотезы) | `funnel-design-ru` |149| Настройка целей/стратегий/обучения в контекстной рекламе (для A/B автостратегий) | `yandex-direct-pro-ru` |150| Бенчмарки и минимальные пороги для выводов по каналам | `ad-benchmarks-ru` |151152## Вопросы под задачу1531541. Текущая конверсия и трафик страницы/рассылки?1552. Какое изменение тестируем и почему (наблюдение/данные)?1563. Минимальный эффект, который стоит ловить (MDE)?1574. Хватит ли трафика за разумный срок, или нужен байес / тест выше по воронке?1585. Что уже пробовали в этой зоне?