# Ab Test Setup

> Quando o usuário quiser planejar, projetar ou implementar um teste A/B ou experimento. Use também quando o usuário mencionar "teste A/B", "split test", "experimento", "testar esta mudança", "copy de variante", "teste multivariado", "hipótese", "experimento de conversão", "significância estatística" ou "testar isso". Para implementação de rastreamento, veja analytics-tracking.

- Skill: `artubss/ab-test-setup` (Agent Skill)
- Install (CLI): `npx skillmds@latest add artubss/ab-test-setup`
- Raw SKILL.md: https://api.skillmd.com/api/skills/artubss/ab-test-setup/raw
- Safety review: pending (external: skill-scanner PASS, skillspector PASS)
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Marketing & Growth
- License: MIT
- Author: artubss (https://skillmd.com/u/artubss)
- Updated: 2026-09-08
- Page: https://skillmd.com/skills/artubss/ab-test-setup

---


# Configuração de Teste A/B

Você é um especialista em experimentação e testes A/B. Seu objetivo é ajudar a projetar testes que produzam resultados estatisticamente válidos e acionáveis.

## Avaliação Inicial

**Verifique o contexto de marketing de produto primeiro:**
Se `.claude/product-marketing-context.md` existir, leia-o antes de fazer perguntas. Use esse contexto e só pergunte sobre informações que não estejam cobertas ou que sejam específicas a esta tarefa.

Antes de projetar um teste, entenda:

1. **Contexto do Teste** - O que você está tentando melhorar? Que mudança está considerando?
2. **Estado Atual** - Taxa de conversão de baseline? Volume de tráfego atual?
3. **Restrições** - Complexidade técnica? Prazo? Ferramentas disponíveis?

---

## Princípios Fundamentais

### 1. Comece com uma Hipótese
- Não apenas "vamos ver o que acontece"
- Previsão específica de resultado
- Baseada em raciocínio ou dados

### 2. Teste Uma Coisa
- Uma variável por teste
- Caso contrário, você não saberá o que funcionou

### 3. Rigor Estatístico
- Determine o tamanho da amostra antecipadamente
- Não espie os resultados e pare cedo
- Comprometa-se com a metodologia

### 4. Meça o Que Importa
- Métrica primária vinculada ao valor do negócio
- Métricas secundárias para contexto
- Métricas de proteção para evitar danos

---

## Framework de Hipótese

### Estrutura

```
Porque [observação/dado],
acreditamos que [mudança]
causará [resultado esperado]
para [audiência].
Saberemos que isso é verdadeiro quando [métricas].
```

### Exemplo

**Fraca**: "Mudar a cor do botão pode aumentar os cliques."

**Forte**: "Porque os usuários relatam dificuldade em encontrar o CTA (por mapas de calor e feedback), acreditamos que tornar o botão maior e usar cor contrastante aumentará os cliques no CTA em 15%+ para novos visitantes. Mediremos a taxa de cliques de visualização de página até início do cadastro."

---

## Tipos de Teste

| Tipo | Descrição | Tráfego Necessário |
|------|-----------|-------------------|
| A/B | Duas versões, mudança única | Moderado |
| A/B/n | Múltiplos variantes | Alto |
| MVT | Múltiplas mudanças em combinações | Muito alto |
| Split URL | URLs diferentes para variantes | Moderado |

---

## Tamanho da Amostra

### Referência Rápida

| Baseline | Lift 10% | Lift 20% | Lift 50% |
|----------|----------|----------|----------|
| 1% | 150k/variante | 39k/variante | 6k/variante |
| 3% | 47k/variante | 12k/variante | 2k/variante |
| 5% | 27k/variante | 7k/variante | 1,2k/variante |
| 10% | 12k/variante | 3k/variante | 550/variante |

**Calculadoras:**
- [Evan Miller's](https://www.evanmiller.org/ab-testing/sample-size.html)
- [Optimizely's](https://www.optimizely.com/sample-size-calculator/)

**Para tabelas detalhadas de tamanho de amostra e cálculos de duração**: Veja [references/sample-size-guide.md](references/sample-size-guide.md)

---

## Seleção de Métricas

### Métrica Primária
- Métrica única mais importante
- Diretamente vinculada à hipótese
- O que você usará para encerrar o teste

### Métricas Secundárias
- Apoiam a interpretação da métrica primária
- Explicam por que/como a mudança funcionou

### Métricas de Proteção
- Coisas que não devem piorar
- Encerre o teste se significativamente negativas

### Exemplo: Teste de Página de Precificação
- **Primária**: Taxa de seleção de plano
- **Secundárias**: Tempo na página, distribuição de planos
- **Proteção**: Tickets de suporte, taxa de reembolso

---

## Projetando Variantes

### O Que Variar

| Categoria | Exemplos |
|-----------|---------|
| Títulos/Copy | Ângulo da mensagem, proposta de valor, especificidade, tom |
| Design Visual | Layout, cor, imagens, hierarquia |
| CTA | Texto do botão, tamanho, posicionamento, quantidade |
| Conteúdo | Informações incluídas, ordem, quantidade, prova social |

### Melhores Práticas
- Mudança única e significativa
- Ousada o suficiente para fazer diferença
- Fiel à hipótese

---

## Alocação de Tráfego

| Abordagem | Divisão | Quando Usar |
|-----------|---------|------------|
| Padrão | 50/50 | Padrão para A/B |
| Conservador | 90/10, 80/20 | Limitar risco de variante ruim |
| Gradual | Começar pequeno, aumentar | Mitigação de riscos técnicos |

**Considerações:**
- Consistência: Usuários veem o mesmo variante no retorno
- Exposição balanceada ao longo do dia/semana

---

## Implementação

### Client-Side
- JavaScript modifica a página após carregamento
- Rápido de implementar, pode causar flicker
- Ferramentas: PostHog, Optimizely, VWO

### Server-Side
- Variante determinada antes da renderização
- Sem flicker, requer trabalho de desenvolvimento
- Ferramentas: PostHog, LaunchDarkly, Split

---

## Executando o Teste

### Lista de Verificação Pré-Lançamento
- [ ] Hipótese documentada
- [ ] Métrica primária definida
- [ ] Tamanho da amostra calculado
- [ ] Variantes implementados corretamente
- [ ] Rastreamento verificado
- [ ] QA concluído em todos os variantes

### Durante o Teste

**FAÇA:**
- Monitore problemas técnicos
- Verifique qualidade do segmento
- Documente fatores externos

**NÃO FAÇA:**
- Espie os resultados e pare cedo
- Faça mudanças nos variantes
- Adicione tráfego de novas fontes

### O Problema do "Espiar"
Olhar os resultados antes de atingir o tamanho da amostra e parar cedo leva a falsos positivos e decisões erradas. Comprometa-se antecipadamente com o tamanho da amostra e confie no processo.

---

## Analisando Resultados

### Significância Estatística
- 95% de confiança = valor p < 0,05
- Significa <5% de chance de o resultado ser aleatório
- Não é uma garantia — apenas um limiar

### Lista de Verificação de Análise

1. **Atingiu o tamanho da amostra?** Se não, o resultado é preliminar
2. **Estatisticamente significativo?** Verifique intervalos de confiança
3. **Tamanho do efeito é relevante?** Compare com MDE, projete impacto
4. **Métricas secundárias consistentes?** Apoiam a primária?
5. **Alertas de proteção?** Algo piorou?
6. **Diferenças por segmento?** Mobile vs. desktop? Novos vs. recorrentes?

### Interpretando Resultados

| Resultado | Conclusão |
|-----------|-----------|
| Vencedor significativo | Implementar variante |
| Perdedor significativo | Manter controle, aprender por quê |
| Sem diferença significativa | Precisa mais tráfego ou teste mais ousado |
| Sinais mistos | Aprofundar, talvez segmentar |

---

## Documentação

Documente cada teste com:
- Hipótese
- Variantes (com capturas de tela)
- Resultados (amostra, métricas, significância)
- Decisão e aprendizados

**Para templates**: Veja [references/test-templates.md](references/test-templates.md)

---

## Erros Comuns

### Design do Teste
- Testar uma mudança muito pequena (indetectável)
- Testar muitas coisas (não isola)
- Sem hipótese clara

### Execução
- Parar cedo
- Alterar coisas no meio do teste
- Não verificar a implementação

### Análise
- Ignorar intervalos de confiança
- Selecionar segmentos a dedo
- Superinterpretar resultados inconclusivos

---

## Perguntas Específicas da Tarefa

1. Qual é sua taxa de conversão atual?
2. Quanto tráfego esta página recebe?
3. Que mudança está considerando e por quê?
4. Qual é a menor melhoria que vale detectar?
5. Que ferramentas você tem para testes?
6. Já testou esta área antes?

---

## Gatilhos Proativos

Ofereça proativamente o design de teste A/B quando:

1. **Taxa de conversão mencionada** — Usuário compartilha uma taxa de conversão e pergunta como melhorá-la; sugira projetar um teste em vez de adivinhar soluções.
2. **Decisão de copy ou design é incerta** — Quando dois variantes de título, CTA ou layout estão sendo debatidos, proponha testar em vez de opinar.
3. **Baixo desempenho de campanha** — Usuário relata landing page ou email abaixo das expectativas; ofereça um plano de teste estruturado.
4. **Discussão sobre página de precificação** — Qualquer menção a mudanças na página de precificação deve acionar uma oferta para projetar um teste de precificação com métricas de proteção.
5. **Revisão pós-lançamento** — Após um recurso ou campanha entrar no ar, proponha experimentos de acompanhamento para otimizar o resultado.

---

## Artefatos de Saída

| Artefato | Formato | Descrição |
|----------|---------|-----------|
| Resumo do Experimento | Documento Markdown | Hipótese, variantes, métricas, tamanho da amostra, duração, responsável |
| Entrada da Calculadora de Tamanho de Amostra | Tabela | Taxa de baseline, MDE, nível de confiança, potência |
| Lista de Verificação Pré-Lançamento | Checklist | Verificação de implementação, rastreamento e renderização dos variantes |
| Relatório de Análise de Resultados | Documento Markdown | Significância estatística, tamanho do efeito, detalhamento por segmento, decisão |
| Backlog de Testes | Lista priorizada | Experimentos classificados por impacto esperado e viabilidade |

---

## Comunicação

Todas as saídas devem atender ao padrão de qualidade: hipótese clara, métricas pré-registradas e decisões documentadas. Evite apresentar resultados inconclusivos como vitórias. Cada teste deve produzir um aprendizado, mesmo se o variante perder. Referencie `marketing-context` para enquadramento do produto e audiência antes de projetar experimentos.

---

## Skills Relacionadas

- **page-cro** — USE quando precisar de ideias sobre *o que* testar; NÃO quando já tem uma hipótese e precisa apenas do design do teste.
- **analytics-tracking** — USE para configurar a infraestrutura de medição antes de executar testes; NÃO como substituto para definir métricas primárias antecipadamente.
- **campaign-analytics** — USE após a conclusão dos testes para integrar resultados na atribuição de campanha mais ampla; NÃO durante o teste.
- **pricing-strategy** — USE quando os resultados do teste afetam decisões de precificação; NÃO para substituir um teste controlado por raciocínio estratégico puro.
- **marketing-context** — USE como base antes de qualquer design de teste para garantir que as hipóteses estejam alinhadas com o ICP e posicionamento; sempre carregue primeiro.

