# Ab Testing Ru

> A/B-тесты и программа экспериментов: гипотезы, выборка, статзначимость, ICE. Триггеры: «сплит-тест», «проверить гипотезу». НЕ CRO страниц→*-cro-ru.

- Skill: `jhamidun/ab-testing-ru-2` (Agent Skill, multi-file: 6 files)
- Install (CLI): `npx skillmds@latest add jhamidun/ab-testing-ru-2`
- Raw SKILL.md: https://api.skillmd.com/api/skills/jhamidun/ab-testing-ru-2/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Marketing & Growth
- Author: JHamidun (https://skillmd.com/u/jhamidun)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/jhamidun/ab-testing-ru-2

---


# A/B-тесты и эксперименты (RU)

Дизайн статистически валидных A/B-тестов и построение программы роста через эксперименты. Математика языко-независима; инструменты и примеры — под типовой стек (веб-аналитика + продуктовая БД + PostHog/n8n) и типовые продукты — лендинги, подписки на рассылку, формы заявок, email-цепочки, SaaS/курс/услуга.

**Перед началом сверься со своим маркетинг-контекстом** (позиционирование, приоритетные продукты, цены, карта воронки) — чтобы не дублировать позиционирование, цены и метрики в гипотезах.

## Когда использовать

- Спланировать и описать конкретный A/B-тест (гипотеза → выборка → метрики → решение).
- Прикинуть размер выборки и длительность под реальный трафик страницы/рассылки.
- Запустить эксперимент по запросу из CRO-скиллов (`page-cro-ru`, `onboarding-cro-ru`, `paywall-cro-ru`, `popup-cro-ru`, `form-cro-ru`).
- Построить программу роста: бэклог гипотез, ICE-приоритизация, плейбук.

## Базовые принципы

1. **Начинай с гипотезы.** Не «посмотрим, что будет», а конкретное предсказание с обоснованием.
2. **Тестируй одну переменную.** Иначе непонятно, что сработало.
3. **Статистическая строгость.** Размер выборки фиксируется заранее. Не «подсматривай» и не останавливай тест рано (проблема peeking → ложные срабатывания).
4. **Меряй то, что важно.** Первичная метрика, привязанная к деньгам/воронке; вторичные для интерпретации; guardrail — что не должно ухудшиться.

## Фреймворк гипотезы

```
Так как [наблюдение/данные],
мы считаем, что [изменение]
приведёт к [ожидаемый результат]
для [аудитория].
Подтвердим это, если [метрика].
```

**Слабо:** «Может, другой цвет кнопки повысит клики».

**Сильно:** «Так как записи сессий показывают, что B2B-посетители /services не доходят до формы (drop на 2-м экране), мы считаем, что вынос CTA "Бесплатная консультация" в hero повысит долю заявок на 15%+ для трафика из контекстной рекламы. Подтвердим по конверсии визит → отправка формы».

## Размер выборки

Зависит от базовой конверсии и минимально значимого эффекта (MDE). Чем ниже база и меньше эффект — тем больше нужно трафика. Быстрая шпаргалка:

| База | Эффект +10% | +20% | +50% |
|------|-------------|------|------|
| 1% | ~380k/вариант | ~97k | ~16k |
| 3% | ~120k | ~31k | ~5.2k |
| 5% | ~72k | ~18k | ~3.1k |
| 10% | ~34k | ~8.7k | ~1.5k |

Длительность = (выборка на вариант × число вариантов) / (дневной трафик × % в тесте).

Полные таблицы выборки, формулы длительности, минимумы прогона, поправки на A/B/n, последовательное тестирование и фреймворк «можно ли вообще крутить этот тест» — `references/sample-size-guide.md`.

**Калькуляторы (язык не важен):** Evan Miller (evanmiller.org/ab-testing/sample-size.html), AB Test Guide (abtestguide.com/calc/).

### Реальность низкого трафика

У многих нишевых/B2B-страниц трафик **низкий**. Это значит:
- Часто классический A/B статзначимости не наберёт за разумный срок. Тогда: брать больший MDE (ловить только крупные сдвиги +30–50%), тестить выше по воронке (где трафика больше — блог/рассылка), либо решать по качественным данным (записи сессий, тепловые карты, интервью), не выдавая это за «тест».
- На малых выборках корректнее **байес** (PostHog Bayesian) — даёт интерпретируемую вероятность, что вариант лучше, без жёсткого порога n.
- Honest-правило: если выборки не хватает — так и сказать, не называть «результатом» 50 визитов.

## Метрики

- **Первичная:** одна, привязана к деньгам/воронке. Примеры: доля заявок на консультацию (B2B), старт триала (B2C), подтверждённая подписка на рассылку, оплата подписки.
- **Вторичные:** объясняют почему (время на странице, скролл, распределение по тарифам).
- **Guardrail:** не должны ухудшиться (отписки от рассылки, отток trial, обращения в поддержку, lead quality в CRM).

Какие именно метрики важны по воронке (подписчики → trial → paid, заявки на консультацию, лиды) — сверяйся со своей картой воронки + `performance-analytics`.

## Что варьировать

| Категория | Примеры |
|-----------|---------|
| Заголовок/копирайт | message angle, ценностное предложение, соцпруф в H1 («эксперт-практик учит вас») |
| CTA | текст («Бесплатная консультация» vs «Обсудить задачу»), размещение, число |
| Контент | соцпруф у CTA, порядок блоков, founding-оффер vs обычный тариф |
| Письма | subject line, превью, отправитель, время отправки дайджеста |

## Прогон теста

**Перед запуском:** гипотеза задокументирована, первичная метрика определена и трекается (`yandex`/`performance-analytics`), выборка посчитана, варианты собраны, трекинг проверен, QA пройден.

**Во время:** мониторь технические сбои и guardrail; **не** подсматривай ради остановки, **не** меняй варианты, **не** добавляй новые источники трафика в середине.

**Минимум прогона:** ≥1 полная неделя (день недели влияет), для B2B — 2 бизнес-цикла.

## Анализ результатов

1. Набрали выборку? Если нет — предварительно.
2. Статзначимо (95% = p<0.05) или байес-вероятность убедительна?
3. Эффект практически значим (сравни с MDE, спроецируй на деньги)?
4. Вторичные метрики согласуются?
5. Guardrail не пострадал?
6. Различия по сегментам (мобайл/десктоп, B2B/B2C, источник)?

| Результат | Вывод |
|-----------|-------|
| Значимый победитель | Внедрить вариант |
| Значимый проигравший | Оставить контроль, понять почему |
| Нет разницы | Нужно больше трафика или смелее тест |
| Смешанные сигналы | Копать глубже, сегментировать |

## Программа экспериментов (рост через тесты)

Цикл: генерим гипотезы (из аналитики/записей сессий, CRM, конкурентов, обратной связи) → приоритизируем ICE → запускаем → анализируем → победителей в плейбук → новые гипотезы из выводов.

**ICE** = (Impact + Confidence + Ease) / 3, каждое 1–10. Сначала — с наибольшим баллом. Пересматривать раз в месяц.

**Каденс:** еженедельно — проверка guardrail и техсбоев (не звать победителя рано); раз в 2 недели — закрытие тестов, обновление плейбука, запуск следующего; ежемесячно — velocity, win rate (20–30% норм), накопленный эффект, пополнение бэклога.

Шаблоны (план теста, документация результатов, бэклог гипотез, ICE-скоркарта, стейкхолдер-апдейт, плейбук) — `references/test-templates.md`.

## Спец-форматы тестов

Помимо классического A/B на лендинге, есть три отдельных жанра теста — каждый со своими правилами «когда можно делать вывод». Детали в references:

| Reference | О чём | Когда читать |
|-----------|-------|--------------|
| `references/hypothesis-template.md` | Шаблон гипотезы «3 гипотезы × 2-3 недели + объяснение»: формат гипотезы, почему именно 3, как формулировать ожидаемый эффект от бенчмарка (не от потолка), ICE-оценка с реальной калибровкой шкалы | Нужно сформировать бэклог гипотез под продукт, оформить гипотезу проверяемо, приоритизировать по ICE |
| `references/direct-ab-testing.md` | A/B автостратегий и связок в контекстной рекламе: минимум **100 кликов / 50 для площадок / 15-20 для запросов** для выводов; **≥10 конверсий/неделю** для обучения; погрешность алгоритма (**25 конв → ±40%**, 400 → ~10%, 10K → почти нет); принцип **«Работает — не трогай»** как guardrail и анти-peeking | Тестируешь объявления / автостратегии / связки, решаешь «отключать или нет», «почему прыгает цена лида» |
| `references/vendor-ab-testing.md` | A/B-тест команд-подрядчиков: **50/50 → 60/40 → 70/30 → 80/20** с фиксацией **CAC и ROMI** на каждом шаге | Выбираешь между двумя агентствами / фрилансерами, проверяешь нового подрядчика без риска всего бюджета |

Ключевая мысль: **работа маркетолога — это генерация гипотез**. ICE-приоритизация, минимумы данных и «работает — не трогай» превращают поток идей в управляемую программу, а не казино.

## Данные и трекинг (НЕ дублировать — звать существующее)

- **Трафик, конверсии целей, сегменты, воронки, размер выборки по факту** → `performance-analytics` и `yandex` (Метрика API: цели, параметры, записи сессий).
- **Бенчмарки и метрики каналов** → `performance-analytics`.
- **Правки вариантов на странице/лендинге** → `tilda`.
- **Email-варианты (subject/контент)** → `html-email` + `email-sequence`; триггеры → `n8n`.
- **Лиды/quality из CRM как guardrail** → `crm` + твоя CRM.

## Связки

| Нужно | Скилл |
|------|-------|
| Данные воронки/конверсий, сегменты | `performance-analytics` |
| Метрика/записи сессий/цели | `yandex` |
| Бенчмарки, метрики каналов | `performance-analytics` |
| Правки вариантов на странице | `tilda` |
| Письма для теста | `html-email`, `email-sequence` |
| CRO-аудит страниц (генерит гипотезы) | `page-cro-ru`, `onboarding-cro-ru`, `paywall-cro-ru`, `popup-cro-ru`, `form-cro-ru` (формы захвата, включая регистрацию) |
| Психология вариантов (что тестить) | `marketing-psychology-ru` |
| ICE-приоритизация гипотез воронки (откуда берутся гипотезы) | `funnel-design-ru` |
| Настройка целей/стратегий/обучения в контекстной рекламе (для A/B автостратегий) | `yandex-direct-pro-ru` |
| Бенчмарки и минимальные пороги для выводов по каналам | `ad-benchmarks-ru` |

## Вопросы под задачу

1. Текущая конверсия и трафик страницы/рассылки?
2. Какое изменение тестируем и почему (наблюдение/данные)?
3. Минимальный эффект, который стоит ловить (MDE)?
4. Хватит ли трафика за разумный срок, или нужен байес / тест выше по воронке?
5. Что уже пробовали в этой зоне?

