InícioFerramentasCalculadora de teste A/B
Calculadora de teste A/B com significância, amostra e duração
Descubra se uma diferença de conversão é significativa, quantos visitantes e dias um teste precisa e veja o resultado pela estatística bayesiana. Gráficos de distribuição com intervalos de confiança e percentis, como nas calculadoras clássicas.
—
| percentil 2,5 | 50 (mediana) | percentil 97,5 | |
|---|---|---|---|
| A | — | — | — |
| B | — | — | — |
| B − A | — | — | — |
Não espie. Decida uma única vez, quando a amostra calculada com antecedência for atingida. Olhar o p-valor todo dia e parar no primeiro “significativo” multiplica os falsos positivos.
—
Efeito que o teste consegue detectar com o seu tráfego
A mesma fórmula da calculadora de Evan Miller (teste bicaudal, aproximação normal). Com mais de duas variantes, o nível de significância é dividido pelo número de comparações com o controle (correção de Bonferroni).
—
Tudo é calculado no seu navegador — nada do que você digita é enviado para lugar nenhum.
Como usar
- Escolha o modoAntes de lançar, use “Amostra e duração” para saber de quantos visitantes e dias você precisa. Depois do teste, use “Verificar resultado” ou “Bayesiano”.
- Informe os dadosVisitantes e conversões do controle (A) e da variante (B). Conversão é um usuário que concluiu a meta, não uma contagem de eventos.
- Leia o vereditoNo topo, o veredito explica o resultado em palavras; abaixo estão o p-valor, os intervalos e os gráficos de distribuição. Passe o mouse sobre um gráfico para ver o valor e o percentil.
- Compartilhe o linkOs dados ficam salvos na URL da página. “Copiar link” gera um endereço em que um colega vê exatamente o mesmo cálculo.
Como a calculadora testa a significância
“Verificar resultado” usa o clássico teste z para duas proporções, o mesmo da maioria das calculadoras de teste A/B. A hipótese nula: as taxas de conversão de A e B são iguais, e a diferença observada é ruído de amostragem.
Primeiro são calculadas as taxas pA = xA / nA e pB = xB / nB. Para o teste, o erro padrão da diferença usa a taxa combinada — sob a hipótese nula, os dois grupos têm a mesma conversão:
Φ é a função de distribuição acumulada da normal padrão. A diferença é significativa quando o p-valor fica abaixo de α = 1 − nível de confiança.
Intervalos de confiança
Os intervalos são calculados sem combinar as taxas — cada grupo mantém a própria variância (intervalo de Wald):
O intervalo do ganho relativo pB/pA − 1 usa o método delta. São essas distribuições normais N(p, SE) que os gráficos mostram: a área sombreada é o intervalo de confiança, as linhas tracejadas são os limites (percentis 2,5 e 97,5 a 95%) e a linha contínua é a mediana.
Poder e verificações da amostra
“Poder” é o poder observado (post hoc): a probabilidade de um teste desse tamanho detectar uma diferença igual à observada. É uma pista sobre se há dados suficientes, não uma evidência a favor da hipótese — o poder observado é função direta do p-valor e não traz informação nova.
A calculadora também verifica o SRM (sample ratio mismatch, desbalanceamento de amostra) com um teste χ² de divisão igual do tráfego. Se os visitantes estão divididos de forma claramente desigual, a randomização provavelmente quebrou e comparar conversões não faz sentido.
Tamanho de amostra e duração do teste
Quantos visitantes você precisa depende de quatro números: a conversão base, o efeito mínimo detectável (MDE), o nível de significância α e o poder 1 − β. A calculadora usa a fórmula de aproximação normal para comparar duas proporções — a mesma da calculadora de Evan Miller, então os resultados batem:
n é o número de visitantes em cada variante. Duração do teste = n × número de variantes ÷ visitantes por dia.
Com mais de duas variantes, cada comparação com o controle é mais uma chance de errar. A calculadora aplica a correção de Bonferroni: α é dividido pelo número de comparações. É conservadora, mas simples e honesta; o preço é uma amostra maior.
Regras práticas:
- Rode testes em semanas inteiras — no mínimo 7 dias, idealmente 14: o público de dias úteis e o de fim de semana são diferentes.
- Cortar o MDE pela metade exige cerca de quatro vezes mais tráfego. Se um teste fosse levar seis meses, teste uma mudança mais ousada ou uma métrica mais próxima da ação.
- No onboarding, métricas com base alta — concluir uma etapa, a primeira ação-chave — funcionam melhor que o pagamento: precisam de várias vezes menos visitantes.
Abordagem bayesiana: a probabilidade de B ser melhor
O modo bayesiano responde à pergunta que as pessoas costumam fazer: qual a probabilidade de B ser melhor que A? A conversão de cada variante é descrita por uma distribuição beta. Com a priori Beta(α, β) e x conversões em n visitantes, a posteriori é Beta(α + x, β + n − x) — o modelo conjugado beta-binomial.
A probabilidade de superar o controle é calculada por integração numérica e verificada nos nossos testes contra a fórmula exata de Evan Miller para parâmetros inteiros e contra uma simulação de Monte Carlo. A perda esperada é quanto de conversão você perde, em média, se a escolha estiver errada. Uma regra de parada prática: encerre o teste quando o risco da variante escolhida ficar abaixo de um limite irrelevante para o negócio.
A inferência bayesiana não desculpa um processo descuidado: espiar e parar “no primeiro 95%” também a prejudica. A priori uniforme Beta(1, 1) quase não afeta o resultado quando há centenas de conversões; uma a priori informativa só faz sentido se refletir honestamente testes anteriores.
Como ler o resultado e quais erros evitar
O que significa “estatisticamente significativo”
Um p-valor de 0,03 quer dizer: se realmente não houvesse diferença, uma distância desse tamanho ou maior apareceria em cerca de 3% dos testes. Não é a probabilidade de B ser melhor nem o tamanho do efeito. O tamanho aparece no intervalo de confiança: “de +0,2 a +1,4 p.p.” é mais honesto que “+16%, significativo”.
Erros comuns
- Espiar. Verificar a significância todo dia e parar no primeiro p < 0,05 é um jeito garantido de ter uma vitória falsa. Calcule a amostra com antecedência e decida uma única vez.
- Parar no “significativo” antes de uma semana inteira. O efeito novidade e os padrões por dia da semana distorcem os primeiros dias do teste.
- Métricas e segmentos demais. Olhe vinte métricas e uma vai parecer “significativa” por acaso. Escolha a métrica principal antes de lançar; trate segmentos como ideias para o próximo teste.
- Divisão desigual (SRM). Se o tamanho dos grupos diverge mais do que o acaso permite, procure um bug na divisão do tráfego, não um vencedor.
- Contar eventos como conversões. Um usuário que clica cinco vezes é uma conversão. O teste pressupõe observações independentes.
- “Não significativo” = “sem efeito”. Um resultado não significativo com amostra pequena só mostra que faltaram dados. Olhe o intervalo: se ele vai de −5% a +10%, o teste não decidiu nada.
Se você está testando o onboarding — um tour contra nenhum tour, ou duas versões de checklist —, compare a ativação (a primeira ação-chave), não “concluiu o tour”. Como aumentá-la: como aumentar a ativação de usuários em SaaS.
Fontes
- Fleiss J. L., Levin B., Paik M. C. Statistical Methods for Rates and Proportions. 3ª ed. Wiley, 2003 — teste z para duas proporções e tamanho de amostra.
- Miller E. Sample Size Calculator — evanmiller.org/ab-testing/sample-size.html; Miller E. Formulas for Bayesian A/B Testing — evanmiller.org/bayesian-ab-testing.html.
- Kohavi R., Tang D., Xu Y. Trustworthy Online Controlled Experiments. Cambridge University Press, 2020 — SRM, espiar resultados, escolha de métricas.
- Marsaglia G. Evaluating the Normal Distribution. Journal of Statistical Software, 11(4), 2004 — cálculo de Φ(x).
- Press W. H. et al. Numerical Recipes. 3ª ed., §6.4 — função beta incompleta.
Perguntas frequentes
Como verificar a significância estatística de um teste A/B?
Informe visitantes e conversões dos dois grupos em “Verificar resultado”. A calculadora faz um teste z para duas proporções e mostra o p-valor: se ele estiver abaixo de 1 − nível de confiança (por exemplo, 0,05 a 95%), a diferença é estatisticamente significativa. Veja também o intervalo de confiança da diferença — ele mostra o tamanho do efeito.
Quanto tempo um teste A/B deve durar?
Até atingir a amostra calculada com antecedência, e nunca menos de 7 dias inteiros. Em “Amostra e duração”, informe a conversão base, o efeito mínimo e o tráfego diário — a calculadora mostra os visitantes por variante e a duração em dias.
Qual nível de confiança usar: 90, 95 ou 99%?
O padrão é 95%. 90% serve para mudanças baratas e reversíveis, em que uma vitória falsa custa pouco; 99%, para decisões arriscadas, como preço. Quanto maior o nível de confiança, maior a amostra necessária.
Qual a diferença entre teste unicaudal e bicaudal?
O bicaudal verifica se B difere de A em qualquer direção; o unicaudal só verifica se B é melhor. O unicaudal precisa de menos dados, mas deve ser escolhido antes do lançamento e não sinaliza queda. Na dúvida, use o bicaudal.
O que é MDE?
O efeito mínimo detectável é a menor diferença de conversão que o teste detecta com segurança (com o poder escolhido). Defina-o antes do teste: quanto menor o MDE, mais visitantes você precisa — aproximadamente na proporção inversa do quadrado do efeito.
Os resultados batem com a calculadora de Evan Miller?
Sim. O tamanho de amostra usa a mesma fórmula; nossos testes automatizados comparam o resultado com a calculadora dele em vários conjuntos de parâmetros, com diferença máxima de um visitante por causa da precisão da função normal inversa.
A abordagem bayesiana é melhor que a frequentista?
Não é melhor; ela responde a outra pergunta. O teste frequentista diz quão surpreendentes são os dados se não houver diferença; o bayesiano, qual a probabilidade de B ser melhor e quanto você arrisca perder. O segundo é mais fácil de explicar para o negócio, mas os dois precisam de regras de parada e disciplina.
Dá para testar mais de duas variantes?
Sim. Informe o número de variantes em “Amostra e duração”: a calculadora aplica a correção de Bonferroni e aumenta a amostra. Ao verificar o resultado, compare cada variante com o controle separadamente, usando α dividido pelo número de comparações.
Mais em Teste A/B
- Calculadora de priorização RICE e ICE
Quais itens do backlog vêm primeiro pelo RICE ou ICE?
- Calculadora de ativação e receita
Quanta receita traz um aumento na taxa de ativação?
- Calculadora de conversão do funil
Em que etapa do funil os usuários se perdem e qual vale corrigir primeiro?
- Calculadora de tamanho de amostra
Quantas respostas uma pesquisa precisa para uma margem de erro?