Clew

InícioFerramentasCalculadora de testes A/B

Calculadora de testes A/B com significância, amostra e duração

Verifique se uma diferença de conversão é significativa, saiba quantos visitantes e dias um teste precisa e analise o resultado com estatística bayesiana. Gráficos de distribuição com intervalos de confiança e percentis, como nas calculadoras clássicas.

● Grátis, sem registoAtualizado:

A — controlo

B — variante

Nível de confiança
Hipótese
O bilateral deteta tanto uma subida como uma descida. Escolha o unilateral antes de iniciar o teste.

—

 

Conversão A— 
Conversão B— 
Diferença— 
Melhoria relativa— 
Valor-p— 
Potência— 
Distribuições da conversão de A e Bsombreado — intervalo de confiança
Distribuições da conversão de A e B
A — controloB — variantetracejado — limites do intervalo, contínuo — mediana
Percentis da distribuição
percentil 2,550 (mediana)percentil 97,5
A———
B———
B − A———
Distribuição da diferença B − A, p.p.intervalo sem o zero — significativo
Distribuição da diferença B − A, p.p.

Não espreite. Decida uma única vez, quando atingir o tamanho da amostra calculado previamente. Ver o valor-p todos os dias e parar no primeiro “significativo” multiplica os falsos positivos.

Tudo é calculado no seu navegador — nada do que introduz é enviado para lado nenhum.

Como utilizar

  1. Escolha o modoAntes de lançar, use “Amostra e duração” para saber quantos visitantes e dias são precisos. Depois do teste, use “Verificar resultado” ou “Bayesiano”.
  2. Introduza os dadosVisitantes e conversões do controlo (A) e da variante (B). Uma conversão é um utilizador que atingiu o objetivo, não uma contagem de eventos.
  3. Leia o veredictoNo topo, o veredicto explica o resultado por palavras; abaixo estão o valor-p, os intervalos e os gráficos de distribuição. Passe o cursor sobre um gráfico para ver o valor e o percentil.
  4. Partilhe a ligaçãoOs dados ficam guardados no URL da página. “Copiar ligação” dá um endereço em que um colega vê exatamente o mesmo cálculo.

Como a calculadora testa a significância

“Verificar resultado” usa o clássico teste z para duas proporções, o mesmo que a maioria das calculadoras de testes A/B. A hipótese nula: as taxas de conversão de A e B são iguais, e a diferença observada é ruído da amostragem.

Primeiro calculam-se as taxas pA = xA / nA e pB = xB / nB. Para o teste, o erro-padrão da diferença usa a taxa conjunta — sob a hipótese nula, os dois grupos partilham a mesma conversão:

p̂ = (x_A + x_B) / (n_A + n_B) SE₀ = √( p̂ · (1 − p̂) · (1/n_A + 1/n_B) ) z = (p_B − p_A) / SE₀ valor-p = 2 · (1 − Φ(|z|)) — teste bilateral valor-p = 1 − Φ(z) — unilateral, H₁: p_B > p_A

Φ é a função de distribuição da normal padrão. A diferença é significativa quando o valor-p é inferior a α = 1 − nível de confiança.

Intervalos de confiança

Os intervalos são calculados sem juntar os grupos — cada um mantém a sua variância (intervalo de Wald):

SE_A = √( p_A (1 − p_A) / n_A ) IC_A = p_A ± z₁₋α/₂ · SE_A SE_Δ = √( SE_A² + SE_B² ) IC_Δ = (p_B − p_A) ± z₁₋α/₂ · SE_Δ

O intervalo da melhoria relativa pB/pA − 1 usa o método delta. São estas distribuições normais N(p, SE) que os gráficos mostram: a área sombreada é o intervalo de confiança, as linhas tracejadas são os limites (percentis 2,5 e 97,5 a 95%) e a linha contínua é a mediana.

Potência e verificações da amostra

“Potência” é a potência observada (post hoc): a probabilidade de um teste com esta dimensão detetar uma diferença igual à observada. É um indício sobre se há dados suficientes, não uma prova a favor da hipótese — a potência observada é função direta do valor-p e não acrescenta informação.

A calculadora verifica também o SRM (sample ratio mismatch, desequilíbrio da amostra) com um teste χ² de divisão igual do tráfego. Se os visitantes estiverem distribuídos de forma claramente desigual, a aleatorização provavelmente falhou e comparar conversões não faz sentido.

Tamanho da amostra e duração do teste

O número de visitantes necessário depende de quatro valores: a conversão de base, o efeito mínimo detetável (MDE), o nível de significância α e a potência 1 − β. A calculadora usa a fórmula de aproximação normal para comparar duas proporções — a mesma da calculadora de Evan Miller, pelo que os resultados coincidem:

δ = MDE (absoluto; um MDE relativo é multiplicado por p) n = ( z₁₋α/₂ · √(2p(1 − p)) + z₁₋β · √(p(1 − p) + (p + δ)(1 − p − δ)) )² / δ²

n é o número de visitantes em cada variante. Duração do teste = n × número de variantes ÷ visitantes por dia.

Com mais de duas variantes, cada comparação com o controlo é mais uma oportunidade de erro. A calculadora aplica a correção de Bonferroni: α é dividido pelo número de comparações. É conservadora, mas simples e honesta; o preço é uma amostra maior.

Regras práticas:

  • Faça testes em semanas completas — no mínimo 7 dias, idealmente 14: o público dos dias úteis e o do fim de semana são diferentes.
  • Reduzir o MDE para metade exige cerca de quatro vezes mais tráfego. Se um teste demorasse seis meses, teste uma alteração mais ambiciosa ou uma métrica mais próxima da ação.
  • No onboarding, métricas com uma base elevada — concluir um passo, a primeira ação-chave — funcionam melhor do que o pagamento: precisam de várias vezes menos visitantes.

Abordagem bayesiana: a probabilidade de B ser melhor

O modo bayesiano responde à pergunta que normalmente se faz: qual é a probabilidade de B ser melhor do que A? A conversão de cada variante é descrita por uma distribuição beta. Com uma a priori Beta(α, β) e x conversões em n visitantes, a a posteriori é Beta(α + x, β + n − x) — o modelo conjugado beta-binomial.

P(B > A) = ∫ f_B(x) · F_A(x) dx Risco de escolher B = E[ max(p_A − p_B, 0) ] Risco de manter A = E[ max(p_B − p_A, 0) ]

A probabilidade de superar o controlo é calculada por integração numérica e verificada nos nossos testes com a fórmula exata de Evan Miller para parâmetros inteiros e com uma simulação de Monte Carlo. A perda esperada é quanta conversão se perde, em média, se a escolha estiver errada. Uma regra de paragem prática: termine o teste quando o risco da variante escolhida ficar abaixo de um limiar irrelevante para o negócio.

A inferência bayesiana não desculpa um processo descuidado: espreitar e parar “no primeiro 95%” também a prejudica. A a priori uniforme Beta(1, 1) quase não afeta o resultado quando há centenas de conversões; uma a priori informativa só faz sentido se refletir honestamente testes anteriores.

Como ler o resultado e que erros evitar

O que significa “estatisticamente significativo”

Um valor-p de 0,03 significa: se realmente não houvesse diferença, uma distância desta dimensão ou maior surgiria em cerca de 3% dos testes. Não é a probabilidade de B ser melhor nem a dimensão do efeito. A dimensão está no intervalo de confiança: “de +0,2 a +1,4 p.p.” é mais honesto do que “+16%, significativo”.

Erros frequentes

  • Espreitar. Verificar a significância todos os dias e parar no primeiro p < 0,05 é uma forma segura de obter uma vitória falsa. Calcule a amostra previamente e decida uma única vez.
  • Parar no “significativo” antes de uma semana completa. O efeito de novidade e os padrões por dia da semana distorcem os primeiros dias do teste.
  • Demasiadas métricas e segmentos. Analise vinte métricas e uma parecerá “significativa” por acaso. Escolha a métrica principal antes de lançar; trate os segmentos como ideias para o próximo teste.
  • Divisão desigual (SRM). Se a dimensão dos grupos diverge mais do que o acaso permite, procure um erro na divisão do tráfego, não um vencedor.
  • Contar eventos como conversões. Um utilizador que clica cinco vezes é uma conversão. O teste pressupõe observações independentes.
  • “Não significativo” = “sem efeito”. Um resultado não significativo com uma amostra pequena só mostra que faltaram dados. Veja o intervalo: se vai de −5% a +10%, o teste não decidiu nada.

Se está a testar o onboarding — um tour contra nenhum tour, ou duas versões de um checklist —, compare a ativação (a primeira ação-chave), não “concluiu o tour”. Como a aumentar: como aumentar a ativação de utilizadores em SaaS.

Fontes

  1. Fleiss J. L., Levin B., Paik M. C. Statistical Methods for Rates and Proportions. 3.ª ed. Wiley, 2003 — teste z para duas proporções e tamanho da amostra.
  2. Miller E. Sample Size Calculator — evanmiller.org/ab-testing/sample-size.html; Miller E. Formulas for Bayesian A/B Testing — evanmiller.org/bayesian-ab-testing.html.
  3. Kohavi R., Tang D., Xu Y. Trustworthy Online Controlled Experiments. Cambridge University Press, 2020 — SRM, espreitar resultados, escolha de métricas.
  4. Marsaglia G. Evaluating the Normal Distribution. Journal of Statistical Software, 11(4), 2004 — cálculo de Φ(x).
  5. Press W. H. et al. Numerical Recipes. 3.ª ed., §6.4 — função beta incompleta.

Perguntas frequentes

Como verificar a significância estatística de um teste A/B?

Introduza visitantes e conversões dos dois grupos em “Verificar resultado”. A calculadora faz um teste z para duas proporções e devolve o valor-p: se for inferior a 1 − nível de confiança (por exemplo, 0,05 a 95%), a diferença é estatisticamente significativa. Veja também o intervalo de confiança da diferença — mostra a dimensão do efeito.

Quanto tempo deve durar um teste A/B?

Até atingir o tamanho da amostra calculado previamente, e nunca menos de 7 dias completos. Em “Amostra e duração”, introduza a conversão de base, o efeito mínimo e o tráfego diário — a calculadora devolve os visitantes por variante e a duração em dias.

Que nível de confiança usar: 90, 95 ou 99%?

O padrão é 95%. 90% serve para alterações baratas e reversíveis, em que uma vitória falsa custa pouco; 99%, para decisões arriscadas como preços. Quanto maior o nível de confiança, maior a amostra necessária.

Qual é a diferença entre um teste unilateral e um bilateral?

O bilateral verifica se B difere de A em qualquer sentido; o unilateral só verifica se B é melhor. O unilateral precisa de menos dados, mas tem de ser escolhido antes do lançamento e não assinala uma descida. Na dúvida, use o bilateral.

O que é o MDE?

O efeito mínimo detetável é a menor diferença de conversão que o teste deteta com segurança (com a potência escolhida). Defina-o antes do teste: quanto menor o MDE, mais visitantes são precisos — aproximadamente na proporção inversa do quadrado do efeito.

Os resultados coincidem com a calculadora de Evan Miller?

Sim. O tamanho da amostra usa a mesma fórmula; os nossos testes automáticos comparam o resultado com a calculadora dele em vários conjuntos de parâmetros, com uma diferença máxima de um visitante devido à precisão da função normal inversa.

A abordagem bayesiana é melhor do que a frequencista?

Não é melhor; responde a outra pergunta. O teste frequencista diz quão surpreendentes são os dados se não houver diferença; o bayesiano, qual é a probabilidade de B ser melhor e quanto se arrisca a perder. O segundo é mais fácil de explicar ao negócio, mas ambos precisam de regras de paragem e disciplina.

É possível testar mais de duas variantes?

Sim. Indique o número de variantes em “Amostra e duração”: a calculadora aplica a correção de Bonferroni e aumenta a amostra. Ao verificar o resultado, compare cada variante com o controlo separadamente, usando α dividido pelo número de comparações.

Mais em Testes A/B

Tours, tooltips e checklists cujo efeito se vê nas métricas.

Experimentar o Clew grátisComo funcionaPlano gratuito para sempre · sem cartão de crédito

Tours de produto, pop-ups e onboarding na era da IA

7 padrões com número de passos, regras de texto e métricas, o que a IA muda e uma lista antes de publicar. PDF, 2 páginas. O que inclui →

O guia está em inglês.