Clew

InícioFerramentasCalculadora de teste A/B

Calculadora de teste A/B com significância, amostra e duração

Descubra se uma diferença de conversão é significativa, quantos visitantes e dias um teste precisa e veja o resultado pela estatística bayesiana. Gráficos de distribuição com intervalos de confiança e percentis, como nas calculadoras clássicas.

● Grátis, sem cadastroAtualizado:

A — controle

B — variante

Nível de confiança
Hipótese
O bicaudal detecta tanto ganho quanto queda. Escolha o unicaudal antes de começar o teste.

—

 

Conversão A— 
Conversão B— 
Diferença— 
Ganho relativo— 
p-valor— 
Poder— 
Distribuições da conversão de A e Bsombreado — intervalo de confiança
Distribuições da conversão de A e B
A — controleB — variantetracejado — limites do intervalo, contínuo — mediana
Percentis da distribuição
percentil 2,550 (mediana)percentil 97,5
A———
B———
B − A———
Distribuição da diferença B − A, p.p.intervalo sem o zero — significativo
Distribuição da diferença B − A, p.p.

Não espie. Decida uma única vez, quando a amostra calculada com antecedência for atingida. Olhar o p-valor todo dia e parar no primeiro “significativo” multiplica os falsos positivos.

Tudo é calculado no seu navegador — nada do que você digita é enviado para lugar nenhum.

Como usar

  1. Escolha o modoAntes de lançar, use “Amostra e duração” para saber de quantos visitantes e dias você precisa. Depois do teste, use “Verificar resultado” ou “Bayesiano”.
  2. Informe os dadosVisitantes e conversões do controle (A) e da variante (B). Conversão é um usuário que concluiu a meta, não uma contagem de eventos.
  3. Leia o vereditoNo topo, o veredito explica o resultado em palavras; abaixo estão o p-valor, os intervalos e os gráficos de distribuição. Passe o mouse sobre um gráfico para ver o valor e o percentil.
  4. Compartilhe o linkOs dados ficam salvos na URL da página. “Copiar link” gera um endereço em que um colega vê exatamente o mesmo cálculo.

Como a calculadora testa a significância

“Verificar resultado” usa o clássico teste z para duas proporções, o mesmo da maioria das calculadoras de teste A/B. A hipótese nula: as taxas de conversão de A e B são iguais, e a diferença observada é ruído de amostragem.

Primeiro são calculadas as taxas pA = xA / nA e pB = xB / nB. Para o teste, o erro padrão da diferença usa a taxa combinada — sob a hipótese nula, os dois grupos têm a mesma conversão:

p̂ = (x_A + x_B) / (n_A + n_B) SE₀ = √( p̂ · (1 − p̂) · (1/n_A + 1/n_B) ) z = (p_B − p_A) / SE₀ p-valor = 2 · (1 − Φ(|z|)) — teste bicaudal p-valor = 1 − Φ(z) — unicaudal, H₁: p_B > p_A

Φ é a função de distribuição acumulada da normal padrão. A diferença é significativa quando o p-valor fica abaixo de α = 1 − nível de confiança.

Intervalos de confiança

Os intervalos são calculados sem combinar as taxas — cada grupo mantém a própria variância (intervalo de Wald):

SE_A = √( p_A (1 − p_A) / n_A ) IC_A = p_A ± z₁₋α/₂ · SE_A SE_Δ = √( SE_A² + SE_B² ) IC_Δ = (p_B − p_A) ± z₁₋α/₂ · SE_Δ

O intervalo do ganho relativo pB/pA − 1 usa o método delta. São essas distribuições normais N(p, SE) que os gráficos mostram: a área sombreada é o intervalo de confiança, as linhas tracejadas são os limites (percentis 2,5 e 97,5 a 95%) e a linha contínua é a mediana.

Poder e verificações da amostra

“Poder” é o poder observado (post hoc): a probabilidade de um teste desse tamanho detectar uma diferença igual à observada. É uma pista sobre se há dados suficientes, não uma evidência a favor da hipótese — o poder observado é função direta do p-valor e não traz informação nova.

A calculadora também verifica o SRM (sample ratio mismatch, desbalanceamento de amostra) com um teste χ² de divisão igual do tráfego. Se os visitantes estão divididos de forma claramente desigual, a randomização provavelmente quebrou e comparar conversões não faz sentido.

Tamanho de amostra e duração do teste

Quantos visitantes você precisa depende de quatro números: a conversão base, o efeito mínimo detectável (MDE), o nível de significância α e o poder 1 − β. A calculadora usa a fórmula de aproximação normal para comparar duas proporções — a mesma da calculadora de Evan Miller, então os resultados batem:

δ = MDE (absoluto; um MDE relativo é multiplicado por p) n = ( z₁₋α/₂ · √(2p(1 − p)) + z₁₋β · √(p(1 − p) + (p + δ)(1 − p − δ)) )² / δ²

n é o número de visitantes em cada variante. Duração do teste = n × número de variantes ÷ visitantes por dia.

Com mais de duas variantes, cada comparação com o controle é mais uma chance de errar. A calculadora aplica a correção de Bonferroni: α é dividido pelo número de comparações. É conservadora, mas simples e honesta; o preço é uma amostra maior.

Regras práticas:

  • Rode testes em semanas inteiras — no mínimo 7 dias, idealmente 14: o público de dias úteis e o de fim de semana são diferentes.
  • Cortar o MDE pela metade exige cerca de quatro vezes mais tráfego. Se um teste fosse levar seis meses, teste uma mudança mais ousada ou uma métrica mais próxima da ação.
  • No onboarding, métricas com base alta — concluir uma etapa, a primeira ação-chave — funcionam melhor que o pagamento: precisam de várias vezes menos visitantes.

Abordagem bayesiana: a probabilidade de B ser melhor

O modo bayesiano responde à pergunta que as pessoas costumam fazer: qual a probabilidade de B ser melhor que A? A conversão de cada variante é descrita por uma distribuição beta. Com a priori Beta(α, β) e x conversões em n visitantes, a posteriori é Beta(α + x, β + n − x) — o modelo conjugado beta-binomial.

P(B > A) = ∫ f_B(x) · F_A(x) dx Risco de escolher B = E[ max(p_A − p_B, 0) ] Risco de manter A = E[ max(p_B − p_A, 0) ]

A probabilidade de superar o controle é calculada por integração numérica e verificada nos nossos testes contra a fórmula exata de Evan Miller para parâmetros inteiros e contra uma simulação de Monte Carlo. A perda esperada é quanto de conversão você perde, em média, se a escolha estiver errada. Uma regra de parada prática: encerre o teste quando o risco da variante escolhida ficar abaixo de um limite irrelevante para o negócio.

A inferência bayesiana não desculpa um processo descuidado: espiar e parar “no primeiro 95%” também a prejudica. A priori uniforme Beta(1, 1) quase não afeta o resultado quando há centenas de conversões; uma a priori informativa só faz sentido se refletir honestamente testes anteriores.

Como ler o resultado e quais erros evitar

O que significa “estatisticamente significativo”

Um p-valor de 0,03 quer dizer: se realmente não houvesse diferença, uma distância desse tamanho ou maior apareceria em cerca de 3% dos testes. Não é a probabilidade de B ser melhor nem o tamanho do efeito. O tamanho aparece no intervalo de confiança: “de +0,2 a +1,4 p.p.” é mais honesto que “+16%, significativo”.

Erros comuns

  • Espiar. Verificar a significância todo dia e parar no primeiro p < 0,05 é um jeito garantido de ter uma vitória falsa. Calcule a amostra com antecedência e decida uma única vez.
  • Parar no “significativo” antes de uma semana inteira. O efeito novidade e os padrões por dia da semana distorcem os primeiros dias do teste.
  • Métricas e segmentos demais. Olhe vinte métricas e uma vai parecer “significativa” por acaso. Escolha a métrica principal antes de lançar; trate segmentos como ideias para o próximo teste.
  • Divisão desigual (SRM). Se o tamanho dos grupos diverge mais do que o acaso permite, procure um bug na divisão do tráfego, não um vencedor.
  • Contar eventos como conversões. Um usuário que clica cinco vezes é uma conversão. O teste pressupõe observações independentes.
  • “Não significativo” = “sem efeito”. Um resultado não significativo com amostra pequena só mostra que faltaram dados. Olhe o intervalo: se ele vai de −5% a +10%, o teste não decidiu nada.

Se você está testando o onboarding — um tour contra nenhum tour, ou duas versões de checklist —, compare a ativação (a primeira ação-chave), não “concluiu o tour”. Como aumentá-la: como aumentar a ativação de usuários em SaaS.

Fontes

  1. Fleiss J. L., Levin B., Paik M. C. Statistical Methods for Rates and Proportions. 3ª ed. Wiley, 2003 — teste z para duas proporções e tamanho de amostra.
  2. Miller E. Sample Size Calculator — evanmiller.org/ab-testing/sample-size.html; Miller E. Formulas for Bayesian A/B Testing — evanmiller.org/bayesian-ab-testing.html.
  3. Kohavi R., Tang D., Xu Y. Trustworthy Online Controlled Experiments. Cambridge University Press, 2020 — SRM, espiar resultados, escolha de métricas.
  4. Marsaglia G. Evaluating the Normal Distribution. Journal of Statistical Software, 11(4), 2004 — cálculo de Φ(x).
  5. Press W. H. et al. Numerical Recipes. 3ª ed., §6.4 — função beta incompleta.

Perguntas frequentes

Como verificar a significância estatística de um teste A/B?

Informe visitantes e conversões dos dois grupos em “Verificar resultado”. A calculadora faz um teste z para duas proporções e mostra o p-valor: se ele estiver abaixo de 1 − nível de confiança (por exemplo, 0,05 a 95%), a diferença é estatisticamente significativa. Veja também o intervalo de confiança da diferença — ele mostra o tamanho do efeito.

Quanto tempo um teste A/B deve durar?

Até atingir a amostra calculada com antecedência, e nunca menos de 7 dias inteiros. Em “Amostra e duração”, informe a conversão base, o efeito mínimo e o tráfego diário — a calculadora mostra os visitantes por variante e a duração em dias.

Qual nível de confiança usar: 90, 95 ou 99%?

O padrão é 95%. 90% serve para mudanças baratas e reversíveis, em que uma vitória falsa custa pouco; 99%, para decisões arriscadas, como preço. Quanto maior o nível de confiança, maior a amostra necessária.

Qual a diferença entre teste unicaudal e bicaudal?

O bicaudal verifica se B difere de A em qualquer direção; o unicaudal só verifica se B é melhor. O unicaudal precisa de menos dados, mas deve ser escolhido antes do lançamento e não sinaliza queda. Na dúvida, use o bicaudal.

O que é MDE?

O efeito mínimo detectável é a menor diferença de conversão que o teste detecta com segurança (com o poder escolhido). Defina-o antes do teste: quanto menor o MDE, mais visitantes você precisa — aproximadamente na proporção inversa do quadrado do efeito.

Os resultados batem com a calculadora de Evan Miller?

Sim. O tamanho de amostra usa a mesma fórmula; nossos testes automatizados comparam o resultado com a calculadora dele em vários conjuntos de parâmetros, com diferença máxima de um visitante por causa da precisão da função normal inversa.

A abordagem bayesiana é melhor que a frequentista?

Não é melhor; ela responde a outra pergunta. O teste frequentista diz quão surpreendentes são os dados se não houver diferença; o bayesiano, qual a probabilidade de B ser melhor e quanto você arrisca perder. O segundo é mais fácil de explicar para o negócio, mas os dois precisam de regras de parada e disciplina.

Dá para testar mais de duas variantes?

Sim. Informe o número de variantes em “Amostra e duração”: a calculadora aplica a correção de Bonferroni e aumenta a amostra. Ao verificar o resultado, compare cada variante com o controle separadamente, usando α dividido pelo número de comparações.

Mais em Teste A/B

Tours, tooltips e checklists com efeito visível nas métricas.

Teste o Clew grátisComo funcionaPlano gratuito para sempre · sem cartão de crédito

Tours de produto, pop-ups e onboarding na era da IA

7 padrões com número de passos, regras de texto e métricas, o que a IA muda e um checklist antes de publicar. PDF, 2 páginas. O que tem no guia →

O guia está em inglês.