Clew

InicioHerramientasCalculadora de test A/B

Calculadora de test A/B con significación, tamaño de muestra y duración

Comprueba si una diferencia de conversión es significativa, calcula cuántos visitantes y días necesita un test y mira el resultado con estadística bayesiana. Gráficos de distribución con intervalos de confianza y percentiles, como en las calculadoras clásicas.

● Gratis, sin registroActualizado:

A — control

B — variante

Nivel de confianza
Hipótesis
El bilateral detecta tanto una mejora como una caída. Elige el unilateral de antemano, antes de lanzar el test.

—

 

Conversión A— 
Conversión B— 
Diferencia— 
Mejora relativa— 
p-valor— 
Potencia— 
Distribuciones de la conversión de A y Bsombreado — intervalo de confianza
Distribuciones de la conversión de A y B
A — controlB — variantediscontinua — límites del intervalo, continua — mediana
Percentiles de la distribución
percentil 2,550 (mediana)percentil 97,5
A———
B———
B − A———
Distribución de la diferencia B − A, ppintervalo sin el cero — significativo
Distribución de la diferencia B − A, pp

No mires a mitad del test. Decide una sola vez, cuando se alcance el tamaño de muestra calculado de antemano. Mirar el p-valor cada día y parar al primer «significativo» multiplica los falsos positivos.

Todo se calcula en tu navegador: nada de lo que escribes se envía a ningún sitio.

Cómo usarla

  1. Elige un modoAntes de lanzar, usa «Muestra y duración» para saber cuántos visitantes y días necesitas. Después del test, usa «Comprobar resultado» o «Bayesiano».
  2. Introduce los datosVisitantes y conversiones del control (A) y de la variante (B). Una conversión es un usuario que completó el objetivo, no un recuento de eventos.
  3. Lee el veredictoArriba, el veredicto explica el resultado con palabras; debajo están el p-valor, los intervalos y los gráficos de distribución. Pasa el cursor por un gráfico para ver el valor y el percentil.
  4. Comparte el enlaceLos datos se guardan en la URL de la página. «Copiar enlace» te da una dirección en la que tu compañero ve exactamente el mismo cálculo.

Cómo comprueba la calculadora la significación

«Comprobar resultado» usa el clásico test z de dos proporciones, el mismo que usan la mayoría de las calculadoras A/B. La hipótesis nula: las tasas de conversión de A y B son iguales y la diferencia observada es ruido del muestreo.

Primero se calculan las tasas pA = xA / nA y pB = xB / nB. Para el test, el error estándar de la diferencia usa la tasa combinada, porque bajo la hipótesis nula ambos grupos comparten una misma conversión:

p̂ = (x_A + x_B) / (n_A + n_B) SE₀ = √( p̂ · (1 − p̂) · (1/n_A + 1/n_B) ) z = (p_B − p_A) / SE₀ p-valor = 2 · (1 − Φ(|z|)) — test bilateral p-valor = 1 − Φ(z) — unilateral, H₁: p_B > p_A

Φ es la función de distribución de la normal estándar. La diferencia es significativa cuando el p-valor es menor que α = 1 − nivel de confianza.

Intervalos de confianza

Los intervalos se construyen sin combinar: cada grupo conserva su propia varianza (intervalo de Wald):

SE_A = √( p_A (1 − p_A) / n_A ) IC_A = p_A ± z₁₋α/₂ · SE_A SE_Δ = √( SE_A² + SE_B² ) IC_Δ = (p_B − p_A) ± z₁₋α/₂ · SE_Δ

El intervalo de la mejora relativa pB/pA − 1 usa el método delta. Estas distribuciones normales N(p, SE) son las que muestran los gráficos: el área sombreada es el intervalo de confianza, las líneas discontinuas son sus límites (percentiles 2,5 y 97,5 al 95 %) y la línea continua es la mediana.

Potencia y comprobaciones de la muestra

La «potencia» es la potencia observada (post hoc): la probabilidad de que un test de este tamaño detecte una diferencia igual a la observada. Es una pista sobre si tienes datos suficientes, no una prueba a favor de la hipótesis: la potencia observada es una función directa del p-valor y no aporta información nueva.

La calculadora también comprueba el SRM (sample ratio mismatch, desequilibrio de muestra) con un test χ² de reparto equitativo del tráfico. Si los visitantes se reparten de forma claramente desigual, lo más probable es que la aleatorización esté rota y comparar conversiones no tenga sentido.

Tamaño de muestra y duración del test

Cuántos visitantes necesitas depende de cuatro números: la conversión base, el efecto mínimo detectable (MDE), el nivel de significación α y la potencia 1 − β. La calculadora usa la fórmula de aproximación normal para comparar dos proporciones, la misma que la calculadora de Evan Miller, así que los resultados coinciden:

δ = MDE (absoluto; un MDE relativo se multiplica por p) n = ( z₁₋α/₂ · √(2p(1 − p)) + z₁₋β · √(p(1 − p) + (p + δ)(1 − p − δ)) )² / δ²

n es el número de visitantes en cada variante. Duración del test = n × número de variantes ÷ visitantes al día.

Con más de dos variantes, cada comparación con el control es una nueva oportunidad de equivocarse. La calculadora aplica la corrección de Bonferroni: α se divide entre el número de comparaciones. Es conservadora, pero simple y honesta; el precio es una muestra mayor.

Reglas prácticas:

  • Haz tests por semanas completas: como mínimo 7 días, idealmente 14. El público de entre semana y el del fin de semana son distintos.
  • Reducir el MDE a la mitad exige aproximadamente cuatro veces más tráfico. Si un test fuera a durar seis meses, prueba un cambio más ambicioso o una métrica más cercana a la acción.
  • En onboarding funcionan mejor las métricas con una base alta, como completar un paso o la primera acción clave, que el pago: necesitan varias veces menos visitantes.

Enfoque bayesiano: la probabilidad de que B sea mejor

El modo bayesiano responde a la pregunta que la gente suele hacerse: ¿qué probabilidad hay de que B sea mejor que A? La conversión de cada variante se describe con una distribución beta. Con una distribución a priori Beta(α, β) y x conversiones de n visitantes, la distribución a posteriori es Beta(α + x, β + n − x): el modelo conjugado beta-binomial.

P(B > A) = ∫ f_B(x) · F_A(x) dx Riesgo de elegir B = E[ max(p_A − p_B, 0) ] Riesgo de quedarse con A = E[ max(p_B − p_A, 0) ]

La probabilidad de superar al control se calcula por integración numérica y en nuestros tests se compara con la fórmula exacta de Evan Miller para parámetros enteros y con una simulación de Monte Carlo. La pérdida esperada es cuánta conversión pierdes de media si la elección resulta equivocada. Una regla de parada cómoda: termina el test cuando el riesgo de la variante elegida esté por debajo de un umbral que no importe al negocio.

La inferencia bayesiana no justifica un proceso descuidado: mirar a mitad del test y parar «al primer 95 %» también la perjudica. La distribución a priori uniforme Beta(1, 1) apenas influye cuando ya tienes cientos de conversiones; una a priori informativa solo tiene sentido si refleja con honestidad tests anteriores.

Cómo leer el resultado y qué errores evitar

Qué significa «estadísticamente significativo»

Un p-valor de 0,03 significa: si realmente no hubiera diferencia, una distancia igual o mayor aparecería en aproximadamente un 3 % de los tests. No es la probabilidad de que B sea mejor ni el tamaño del efecto. El tamaño lo muestra el intervalo de confianza: «de +0,2 a +1,4 pp» es más honesto que «+16 %, significativo».

Errores frecuentes

  • Mirar a mitad del test. Comprobar la significación cada día y parar al primer p < 0,05 es una forma segura de conseguir una victoria falsa. Calcula el tamaño de muestra de antemano y decide una sola vez.
  • Parar en «significativo» antes de una semana completa. El efecto novedad y los patrones por día de la semana distorsionan los primeros días de un test.
  • Demasiadas métricas y segmentos. Revisa veinte métricas y encontrarás una «significativa» por azar. Elige la métrica principal antes de lanzar; trata los segmentos como ideas para el siguiente test.
  • Reparto desigual (SRM). Si el tamaño de los grupos diverge más de lo que permite el azar, busca un fallo en el reparto de tráfico, no un ganador.
  • Contar eventos como conversiones. Un usuario que hace clic cinco veces es una conversión. El test asume observaciones independientes.
  • «No significativo» = «sin efecto». Un resultado no significativo con una muestra pequeña solo indica que faltaron datos. Mira el intervalo: si va de −5 % a +10 %, el test no ha decidido nada.

Si pruebas el onboarding (un tour frente a ningún tour, o dos versiones de un checklist), compara la activación (la primera acción clave), no «completó el tour». Cómo aumentarla: cómo aumentar la activación de usuarios en SaaS.

Fuentes

  1. Fleiss J. L., Levin B., Paik M. C. Statistical Methods for Rates and Proportions. 3.ª ed. Wiley, 2003 — test z de dos proporciones y tamaño de muestra.
  2. Miller E. Sample Size Calculator — evanmiller.org/ab-testing/sample-size.html; Miller E. Formulas for Bayesian A/B Testing — evanmiller.org/bayesian-ab-testing.html.
  3. Kohavi R., Tang D., Xu Y. Trustworthy Online Controlled Experiments. Cambridge University Press, 2020 — SRM, mirar a mitad del test, elección de métricas.
  4. Marsaglia G. Evaluating the Normal Distribution. Journal of Statistical Software, 11(4), 2004 — cálculo de Φ(x).
  5. Press W. H. et al. Numerical Recipes. 3.ª ed., §6.4 — función beta incompleta.

Preguntas frecuentes

¿Cómo compruebo la significación estadística de un test A/B?

Introduce los visitantes y las conversiones de ambos grupos en «Comprobar resultado». La calculadora hace un test z de dos proporciones y devuelve el p-valor: si es menor que 1 − nivel de confianza (por ejemplo, 0,05 al 95 %), la diferencia es estadísticamente significativa. Mira también el intervalo de confianza de la diferencia: muestra el tamaño del efecto.

¿Cuánto tiempo debe durar un test A/B?

Hasta alcanzar el tamaño de muestra calculado de antemano, y nunca menos de 7 días completos. En «Muestra y duración», introduce la conversión base, el efecto mínimo y el tráfico diario: la calculadora devuelve los visitantes por variante y la duración en días.

¿Qué nivel de confianza uso: 90, 95 o 99 %?

El estándar es el 95 %. El 90 % sirve para cambios baratos y reversibles, donde una victoria falsa cuesta poco; el 99 %, para decisiones arriesgadas como los precios. Cuanto mayor es el nivel de confianza, mayor es la muestra necesaria.

¿Qué diferencia hay entre un test unilateral y uno bilateral?

El bilateral comprueba si B difiere de A en cualquier dirección; el unilateral solo comprueba si B es mejor. El unilateral necesita menos datos, pero hay que elegirlo antes de lanzar y no detectará una caída. Si dudas, usa el bilateral.

¿Qué es el MDE?

El efecto mínimo detectable es la diferencia de conversión más pequeña que el test detecta de forma fiable (con la potencia elegida). Fíjalo antes del test: cuanto menor es el MDE, más visitantes necesitas, aproximadamente en proporción inversa al cuadrado del efecto.

¿Los resultados coinciden con la calculadora de Evan Miller?

Sí. El tamaño de muestra usa la misma fórmula; nuestros tests automáticos comparan el resultado con su calculadora en varios conjuntos de parámetros, con una diferencia máxima de un visitante por la precisión de la función normal inversa.

¿El enfoque bayesiano es mejor que el frecuentista?

No es mejor: responde a otra pregunta. El test frecuentista dice cuán sorprendentes son los datos si no hay diferencia; el bayesiano, qué probabilidad hay de que B sea mejor y cuánto te arriesgas a perder. El segundo es más fácil de explicar al negocio, pero ambos necesitan reglas de parada y disciplina.

¿Puedo probar más de dos variantes?

Sí. Indica el número de variantes en «Muestra y duración»: la calculadora aplica la corrección de Bonferroni y aumenta la muestra. Al comprobar el resultado, compara cada variante con el control por separado, usando α dividido entre el número de comparaciones.

Más en Pruebas A/B

Tours, tooltips y checklists cuyo efecto se ve en las métricas.

Prueba Clew gratisCómo funcionaPlan gratuito para siempre · sin tarjeta

Tours de producto, popups y onboarding en la era de la IA

7 patrones con número de pasos, reglas de texto y métricas, lo que cambia la IA y una lista antes de publicar. PDF, 2 páginas. Qué incluye →

La guía está en inglés.