InícioFerramentasCalculadora de testes A/B
Calculadora de testes A/B com significância, amostra e duração
Verifique se uma diferença de conversão é significativa, saiba quantos visitantes e dias um teste precisa e analise o resultado com estatística bayesiana. Gráficos de distribuição com intervalos de confiança e percentis, como nas calculadoras clássicas.
—
| percentil 2,5 | 50 (mediana) | percentil 97,5 | |
|---|---|---|---|
| A | — | — | — |
| B | — | — | — |
| B − A | — | — | — |
Não espreite. Decida uma única vez, quando atingir o tamanho da amostra calculado previamente. Ver o valor-p todos os dias e parar no primeiro “significativo” multiplica os falsos positivos.
—
Efeito que o teste consegue detetar com o seu tráfego
A mesma fórmula da calculadora de Evan Miller (teste bilateral, aproximação normal). Com mais de duas variantes, o nível de significância é dividido pelo número de comparações com o controlo (correção de Bonferroni).
—
Tudo é calculado no seu navegador — nada do que introduz é enviado para lado nenhum.
Como utilizar
- Escolha o modoAntes de lançar, use “Amostra e duração” para saber quantos visitantes e dias são precisos. Depois do teste, use “Verificar resultado” ou “Bayesiano”.
- Introduza os dadosVisitantes e conversões do controlo (A) e da variante (B). Uma conversão é um utilizador que atingiu o objetivo, não uma contagem de eventos.
- Leia o veredictoNo topo, o veredicto explica o resultado por palavras; abaixo estão o valor-p, os intervalos e os gráficos de distribuição. Passe o cursor sobre um gráfico para ver o valor e o percentil.
- Partilhe a ligaçãoOs dados ficam guardados no URL da página. “Copiar ligação” dá um endereço em que um colega vê exatamente o mesmo cálculo.
Como a calculadora testa a significância
“Verificar resultado” usa o clássico teste z para duas proporções, o mesmo que a maioria das calculadoras de testes A/B. A hipótese nula: as taxas de conversão de A e B são iguais, e a diferença observada é ruído da amostragem.
Primeiro calculam-se as taxas pA = xA / nA e pB = xB / nB. Para o teste, o erro-padrão da diferença usa a taxa conjunta — sob a hipótese nula, os dois grupos partilham a mesma conversão:
Φ é a função de distribuição da normal padrão. A diferença é significativa quando o valor-p é inferior a α = 1 − nível de confiança.
Intervalos de confiança
Os intervalos são calculados sem juntar os grupos — cada um mantém a sua variância (intervalo de Wald):
O intervalo da melhoria relativa pB/pA − 1 usa o método delta. São estas distribuições normais N(p, SE) que os gráficos mostram: a área sombreada é o intervalo de confiança, as linhas tracejadas são os limites (percentis 2,5 e 97,5 a 95%) e a linha contínua é a mediana.
Potência e verificações da amostra
“Potência” é a potência observada (post hoc): a probabilidade de um teste com esta dimensão detetar uma diferença igual à observada. É um indício sobre se há dados suficientes, não uma prova a favor da hipótese — a potência observada é função direta do valor-p e não acrescenta informação.
A calculadora verifica também o SRM (sample ratio mismatch, desequilíbrio da amostra) com um teste χ² de divisão igual do tráfego. Se os visitantes estiverem distribuídos de forma claramente desigual, a aleatorização provavelmente falhou e comparar conversões não faz sentido.
Tamanho da amostra e duração do teste
O número de visitantes necessário depende de quatro valores: a conversão de base, o efeito mínimo detetável (MDE), o nível de significância α e a potência 1 − β. A calculadora usa a fórmula de aproximação normal para comparar duas proporções — a mesma da calculadora de Evan Miller, pelo que os resultados coincidem:
n é o número de visitantes em cada variante. Duração do teste = n × número de variantes ÷ visitantes por dia.
Com mais de duas variantes, cada comparação com o controlo é mais uma oportunidade de erro. A calculadora aplica a correção de Bonferroni: α é dividido pelo número de comparações. É conservadora, mas simples e honesta; o preço é uma amostra maior.
Regras práticas:
- Faça testes em semanas completas — no mínimo 7 dias, idealmente 14: o público dos dias úteis e o do fim de semana são diferentes.
- Reduzir o MDE para metade exige cerca de quatro vezes mais tráfego. Se um teste demorasse seis meses, teste uma alteração mais ambiciosa ou uma métrica mais próxima da ação.
- No onboarding, métricas com uma base elevada — concluir um passo, a primeira ação-chave — funcionam melhor do que o pagamento: precisam de várias vezes menos visitantes.
Abordagem bayesiana: a probabilidade de B ser melhor
O modo bayesiano responde à pergunta que normalmente se faz: qual é a probabilidade de B ser melhor do que A? A conversão de cada variante é descrita por uma distribuição beta. Com uma a priori Beta(α, β) e x conversões em n visitantes, a a posteriori é Beta(α + x, β + n − x) — o modelo conjugado beta-binomial.
A probabilidade de superar o controlo é calculada por integração numérica e verificada nos nossos testes com a fórmula exata de Evan Miller para parâmetros inteiros e com uma simulação de Monte Carlo. A perda esperada é quanta conversão se perde, em média, se a escolha estiver errada. Uma regra de paragem prática: termine o teste quando o risco da variante escolhida ficar abaixo de um limiar irrelevante para o negócio.
A inferência bayesiana não desculpa um processo descuidado: espreitar e parar “no primeiro 95%” também a prejudica. A a priori uniforme Beta(1, 1) quase não afeta o resultado quando há centenas de conversões; uma a priori informativa só faz sentido se refletir honestamente testes anteriores.
Como ler o resultado e que erros evitar
O que significa “estatisticamente significativo”
Um valor-p de 0,03 significa: se realmente não houvesse diferença, uma distância desta dimensão ou maior surgiria em cerca de 3% dos testes. Não é a probabilidade de B ser melhor nem a dimensão do efeito. A dimensão está no intervalo de confiança: “de +0,2 a +1,4 p.p.” é mais honesto do que “+16%, significativo”.
Erros frequentes
- Espreitar. Verificar a significância todos os dias e parar no primeiro p < 0,05 é uma forma segura de obter uma vitória falsa. Calcule a amostra previamente e decida uma única vez.
- Parar no “significativo” antes de uma semana completa. O efeito de novidade e os padrões por dia da semana distorcem os primeiros dias do teste.
- Demasiadas métricas e segmentos. Analise vinte métricas e uma parecerá “significativa” por acaso. Escolha a métrica principal antes de lançar; trate os segmentos como ideias para o próximo teste.
- Divisão desigual (SRM). Se a dimensão dos grupos diverge mais do que o acaso permite, procure um erro na divisão do tráfego, não um vencedor.
- Contar eventos como conversões. Um utilizador que clica cinco vezes é uma conversão. O teste pressupõe observações independentes.
- “Não significativo” = “sem efeito”. Um resultado não significativo com uma amostra pequena só mostra que faltaram dados. Veja o intervalo: se vai de −5% a +10%, o teste não decidiu nada.
Se está a testar o onboarding — um tour contra nenhum tour, ou duas versões de um checklist —, compare a ativação (a primeira ação-chave), não “concluiu o tour”. Como a aumentar: como aumentar a ativação de utilizadores em SaaS.
Fontes
- Fleiss J. L., Levin B., Paik M. C. Statistical Methods for Rates and Proportions. 3.ª ed. Wiley, 2003 — teste z para duas proporções e tamanho da amostra.
- Miller E. Sample Size Calculator — evanmiller.org/ab-testing/sample-size.html; Miller E. Formulas for Bayesian A/B Testing — evanmiller.org/bayesian-ab-testing.html.
- Kohavi R., Tang D., Xu Y. Trustworthy Online Controlled Experiments. Cambridge University Press, 2020 — SRM, espreitar resultados, escolha de métricas.
- Marsaglia G. Evaluating the Normal Distribution. Journal of Statistical Software, 11(4), 2004 — cálculo de Φ(x).
- Press W. H. et al. Numerical Recipes. 3.ª ed., §6.4 — função beta incompleta.
Perguntas frequentes
Como verificar a significância estatística de um teste A/B?
Introduza visitantes e conversões dos dois grupos em “Verificar resultado”. A calculadora faz um teste z para duas proporções e devolve o valor-p: se for inferior a 1 − nível de confiança (por exemplo, 0,05 a 95%), a diferença é estatisticamente significativa. Veja também o intervalo de confiança da diferença — mostra a dimensão do efeito.
Quanto tempo deve durar um teste A/B?
Até atingir o tamanho da amostra calculado previamente, e nunca menos de 7 dias completos. Em “Amostra e duração”, introduza a conversão de base, o efeito mínimo e o tráfego diário — a calculadora devolve os visitantes por variante e a duração em dias.
Que nível de confiança usar: 90, 95 ou 99%?
O padrão é 95%. 90% serve para alterações baratas e reversíveis, em que uma vitória falsa custa pouco; 99%, para decisões arriscadas como preços. Quanto maior o nível de confiança, maior a amostra necessária.
Qual é a diferença entre um teste unilateral e um bilateral?
O bilateral verifica se B difere de A em qualquer sentido; o unilateral só verifica se B é melhor. O unilateral precisa de menos dados, mas tem de ser escolhido antes do lançamento e não assinala uma descida. Na dúvida, use o bilateral.
O que é o MDE?
O efeito mínimo detetável é a menor diferença de conversão que o teste deteta com segurança (com a potência escolhida). Defina-o antes do teste: quanto menor o MDE, mais visitantes são precisos — aproximadamente na proporção inversa do quadrado do efeito.
Os resultados coincidem com a calculadora de Evan Miller?
Sim. O tamanho da amostra usa a mesma fórmula; os nossos testes automáticos comparam o resultado com a calculadora dele em vários conjuntos de parâmetros, com uma diferença máxima de um visitante devido à precisão da função normal inversa.
A abordagem bayesiana é melhor do que a frequencista?
Não é melhor; responde a outra pergunta. O teste frequencista diz quão surpreendentes são os dados se não houver diferença; o bayesiano, qual é a probabilidade de B ser melhor e quanto se arrisca a perder. O segundo é mais fácil de explicar ao negócio, mas ambos precisam de regras de paragem e disciplina.
É possível testar mais de duas variantes?
Sim. Indique o número de variantes em “Amostra e duração”: a calculadora aplica a correção de Bonferroni e aumenta a amostra. Ao verificar o resultado, compare cada variante com o controlo separadamente, usando α dividido pelo número de comparações.
Mais em Testes A/B
- Calculadora de priorização RICE e ICE
Que itens do backlog vêm primeiro segundo o RICE ou o ICE?
- Calculadora de ativação e receita
Quanta receita traz um aumento da taxa de ativação?
- Calculadora de conversão do funil
Em que passo do funil se perdem os utilizadores e qual vale a pena corrigir primeiro?
- Calculadora de dimensão da amostra
Quantas respostas precisa um inquérito para uma dada margem de erro?