Cómo hacer tests A/B de product tours y onboarding en Clew
Clew puede mostrar dos versiones del mismo tour a visitantes distintos y contar cuántas personas terminan cada una. Esta guía recorre un test de principio a fin: qué cambiar, cuánto tiempo mantenerlo, cómo leer los números y cómo publicar el ganador sin romper nada.
- Tiempo
- ● 20 minutos de configuración, 1–4 semanas de test
- Quién lo hace
- Product manager o marketer con acceso de editor en Clew
- Pasos
- 6
Paso a paso
- Paso 01
Escribe la hipótesis y una sola métrica
Antes de abrir el editor, escribe una frase: «Si cambiamos X, más personas harán Y, porque Z». Por ejemplo: «Si el primer punto del checklist es Invitar a un compañero en lugar de Completar el perfil, más gente terminará el checklist, porque verá el valor antes».
Elige de antemano una métrica principal. Dentro de Clew es la tasa de finalización del tour: visitantes únicos que lo terminaron entre visitantes únicos que lo vieron. Cambia una sola cosa —texto, orden o número de pasos—; si no, no sabrás qué cambio marcó la diferencia.

Paso 1 · ilustración esquemática - Paso 02
Crea la variante B en el editor del tour
Abre el tour en Tours, despliega Test A/B al final del editor y pon Test en Activado. Pulsa Copiar de A: la variante B empieza como copia exacta de los pasos actuales y solo editas lo que cambia la hipótesis.
La variante B tiene sus propios pasos: elemento (selector), posición, título y texto, y puede tener otro número de pasos. La variante B también puede tener sus propios colores: marca Colores de la variante B y elige fondo, texto, borde, acento y radio de esquinas con los mismos selectores que el tema del tour; el interruptor A / B de la vista previa muestra cualquiera de las dos. Para probar solo los colores, en Contenido de la variante B elige Los mismos pasos que A (probar solo los colores). Todo lo demás es común a ambas: formato, disparador, páginas, reglas de audiencia y frecuencia.

Paso 2 · ilustración esquemática - Paso 03
Calcula el tamaño de muestra y la duración
Abre la calculadora de tests A/B, pestaña de tamaño de muestra y duración. Introduce como conversión base la tasa de finalización actual del tour (está en sus estadísticas), la mejora mínima que merece la pena y las visualizaciones diarias.
Ejemplo: el 40 % de quienes ven el checklist lo terminan y quieres detectar una subida al 45 % (+5 puntos porcentuales) con un 95 % de confianza y un 80 % de potencia. La calculadora da 1515 visitantes por variante. Con 200 visualizaciones al día son 3030 ÷ 200 = 16 días: redondea a 3 semanas completas para cubrir todos los días de la semana.

Paso 3 · ilustración esquemática - Paso 04
Define el reparto y publica
Porcentaje de la variante A, % es la parte de visitantes que ve el original; el resto ve B. Deja 50 salvo que B sea arriesgada. Pon el estado en Publicado y guarda: el test empieza a la vez para visitantes nuevos y recurrentes.
El reparto es estable: el widget calcula un hash del identificador anónimo del visitante guardado en el navegador junto con el slug del tour, así que la misma persona siempre ve la misma variante de ese tour, sin peticiones extra. Alguien en otro navegador o dispositivo, o que borró los datos del sitio, es un visitante nuevo y puede caer en la otra variante.

Paso 4 · ilustración esquemática - Paso 05
Lee la tarjeta de resultados en las estadísticas del tour
Abre el tour y mira las estadísticas arriba del editor (o 📊 Estadísticas en la lista de tours). Mientras el test está en marcha, la tarjeta Resultados del test A/B muestra las visualizaciones, finalizaciones y la tasa de finalización de cada variante con su intervalo del 95%, la mejora de B frente a A con un intervalo del 95% para la diferencia, el valor p de un z-test bilateral, la probabilidad de que B sea mejor (bayesiana) y el avance hacia la muestra planificada para la mejora mínima que te importa, con la misma fórmula que la calculadora. Comparar embudos por variante pone los embudos de pasos de A y B uno al lado del otro, para ver dónde pierde gente cada versión.
La etiqueta de arriba es el veredicto: Recogiendo datos, Tráfico insuficiente, Aún sin diferencia significativa, Sin diferencia significativa, Gana B o Gana A, o bien Reparto descuadrado (SRM) si las visualizaciones no siguen el reparto configurado. Una diferencia significativa antes de alcanzar la muestra planificada se marca como no definitiva: las ventajas tempranas suelen desaparecer, así que espera al plan.

Paso 5 · ilustración esquemática - Paso 06
Haz de B la versión principal o quédate con A
Cuando el veredicto sea definitivo, termina el test desde la misma tarjeta, sin copiar nada ni apuntar números:
- Gana B: pulsa Hacer de B la versión principal. Los pasos de B sustituyen a los principales (y, si B tenía colores propios, pasan a ser los del tour), el test se desactiva y todos ven la nueva versión.
- Gana A o no hay diferencia: pulsa Quedarse con A. El test se desactiva y todos ven A.
En ambos casos el test terminado se guarda en Historial de tests, bajo las estadísticas: los pasos de las dos variantes, el reparto, las fechas, los números finales, la decisión y quién la tomó. Restaurar versión anterior recupera la versión de antes de la decisión. Desactivar Test en el editor y guardar archiva el test igual, y los tests terminados no cuentan para el límite de tu plan. Si terminas un test antes de que el resultado sea definitivo, la confirmación te avisa primero.
Detener un test no vuelve a mostrar el tour a quien ya lo terminó o cerró: con la frecuencia Una vez por visitante sigue marcado como visto.

Paso 6 · ilustración esquemática
Qué puedes probar en Clew
| Idea | Cómo en Clew | Métrica |
|---|---|---|
| Texto de un paso | Variante B con otro título o texto | Tasa de finalización |
| Orden de pasos o puntos del checklist | Reordena los pasos copiados en B | Tasa de finalización |
| Tour más corto o más largo | Quita o añade pasos en B | Tasa de finalización, abandono |
| A qué elemento apunta un tooltip | Otro selector en B | Tasa de finalización |
| Modal frente a tooltip, disparador, audiencia | Dos tours separados, repartidos por una propiedad tuya (ejemplo 3) | Tasa de finalización de cada tour |
Qué mide Clew y qué no
Clew cuenta visitantes únicos por variante que vieron el tour y que lo terminaron (el último paso de un tour o todos los puntos de un checklist). No ve lo que la gente hace después en tu producto. Si el objetivo real es la activación o la conversión, usa la finalización como indicador adelantado y confirma el efecto en tu analítica de producto tras el despliegue. Una tarea del checklist cuenta como terminada tanto si la marcó el visitante como si la marcó su propia regla (una página visitada, un clic o Clew.complete() desde tu app), así que una variante que se marca sola no puntúa distinto — pero dale las mismas reglas a las dos variantes.
Traducciones
Las traducciones añadidas en el editor pertenecen a la variante A. La variante B muestra su texto tal cual, en cualquier idioma. Si tu audiencia es multilingüe, prueba en un idioma cada vez, por ejemplo limitando el tour con una regla de audiencia. Cuando B pasa a ser la versión principal y tiene el mismo número de pasos, la confirmación permite conservar las traducciones existentes; si no, se eliminan y hay que traducir los nuevos pasos.
Varios tests a la vez
Un test cuenta para el límite del plan mientras su tour está publicado con Test: Activado; los borradores no cuentan.
| Plan | Tests A/B a la vez | Historial de analítica |
|---|---|---|
| Free | — | 1 mes |
| Pro | 1 | 3 meses |
| Business | 5 | 12 meses |
| Lifetime | 5 | 12 meses |
| Servidores propios | Sin límite | Sin límite |
La prueba de 14 días tras el registro incluye los límites de Business. Las variantes de tours distintos se asignan de forma independiente, porque el slug forma parte del hash. Aun así, evita dos tests en la misma página y para la misma audiencia: solo se muestra un tour a la vez, así que un test le quitaría tráfico al otro.
Errores que arruinan un test de tours
Mirar antes de tiempo
Revisar cada día y parar en cuanto B «va ganando» encuentra ganadores que no existen. Fija la muestra de antemano y decide cuando se alcance. La tarjeta de resultados ayuda: muestra el avance hacia la muestra planificada y marca como no definitivo un resultado que se volvió significativo antes.
Cambiar el test a mitad
Editar el reparto mueve a parte de los visitantes a la otra variante; renombrar el slug los reasigna a todos; editar el texto de una variante mezcla dos versiones en un mismo grupo. Si necesitas cambiar algo, desactiva el test y empieza uno nuevo.
Efecto novedad
Los usuarios habituales pueden hacer clic en un tour con aspecto nuevo por curiosidad. Mantén el test al menos una o dos semanas completas y, si puedes, mira a los usuarios nuevos por separado.
Desajuste de muestras (SRM)
Las visualizaciones de A y B deben seguir el reparto que configuraste. Si difieren más de lo que explica el azar —por ejemplo 1800 frente a 1400 con 50/50—, algo falla: un selector que solo existe para una variante, la caché, un bot. La tarjeta de resultados lo comprueba con una prueba chi-cuadrado frente al reparto configurado y muestra un aviso de SRM en lugar de un ganador; corrige la causa antes de fiarte.
Estacionalidad y lanzamientos
Festivos, campañas y lanzamientos de frontend afectan de forma desigual a un test corto. Usa semanas completas y revisa Estado durante el test: un paso roto en una variante distorsiona el resultado.
Tres ejemplos resueltos
1. Orden del checklist
Hipótesis: empezar por Conectar tus datos hace que se terminen más checklists que empezar por Completar el perfil. Configuración: tour de tipo checklist, test activado, «Copiar de A», subir ese punto en B. Métrica: tasa de finalización. Duración: la de la calculadora con la tasa actual como base; los checklists se completan en varias sesiones, así que al menos dos semanas.
2. Texto de un tooltip
Hipótesis: un título centrado en el beneficio («Tu primer informe en 2 minutos») supera a la etiqueta de la función («Informes»). Configuración: tour de tooltips, «Copiar de A», cambiar solo el título y el texto del primer paso. Lectura: A 1560 visualizaciones, 624 terminados (40 %); B 1540 visualizaciones, 709 terminados (46 %). La calculadora: p ≈ 0,0007, diferencia de +2,6 a +9,5 puntos al 95 %: gana B. Las visualizaciones están equilibradas, no hay SRM.
3. Modal frente a tooltip
El formato es de todo el tour, así que hacen falta dos tours. Reparte a los usuarios en tu app, por ejemplo Clew.identify({ onboarding_arm: Math.random() < 0.5 ? 'modal' : 'tooltip' }), guardado una sola vez por usuario. Crea un tour modal con la regla de audiencia Propiedad onboarding_arm es igual a modal y un tour de tooltips con tooltip, con las mismas páginas y disparador. Compara la tasa de finalización de ambos tours en la calculadora. Como tu app conoce el grupo, también puedes comparar la activación en tu propia analítica. Las reglas de audiencia requieren un plan de pago o la prueba.
Problemas frecuentes y preguntas
¿El test A/B está en el plan Free?
No. Los tests A/B empiezan en Pro (un test a la vez); Business y Lifetime permiten hasta cinco simultáneos. Las cuentas nuevas tienen una prueba de 14 días con los límites de Business.
¿Un visitante verá variantes distintas en visitas distintas?
No. La variante se calcula con el identificador anónimo del visitante guardado en el navegador y el slug del tour, así que es la misma en cada visita. Solo cambia en otro navegador o dispositivo, tras borrar los datos del sitio o si renombras el slug del tour.
¿Clew calcula la significación estadística?
Sí. Mientras el test está en marcha, las estadísticas del tour muestran la mejora de B frente a A con un intervalo del 95%, el valor p de un z-test bilateral, la probabilidad bayesiana de que B sea mejor, un control de desajuste de muestras y el avance hacia la muestra planificada, resumidos en un veredicto. La calculadora de tests A/B gratuita sigue siendo útil para planificar la muestra antes de empezar.
¿Puedo probar más de dos variantes?
Un tour tiene dos variantes, A y B. Para comparar tres versiones, haz los tests uno tras otro o reparte a los usuarios en tres grupos con una propiedad propia y tres tours.
¿Puedo comparar un modal con un tooltip o dos disparadores?
No dentro de un mismo tour: formato, disparador, páginas y audiencia son comunes a ambas variantes. Usa dos tours con reglas de audiencia sobre una propiedad que tu app asigne al azar; mira el ejemplo 3.
¿Qué pasa con los resultados al detener el test?
No se pierde nada. Terminar un test —con Hacer de B la versión principal, Quedarse con A o desactivándolo— lo guarda en el historial de tests del tour con los pasos de ambas variantes y los números finales, y Restaurar versión anterior deshace el cambio.
¿El reparto funciona en aplicaciones de una sola página?
Sí. El widget vuelve a comprobar los tours tras los cambios de ruta en el cliente, y la variante no depende de la página, así que el visitante mantiene la suya en todas las rutas.
¿Cuánto debe durar un test de un tour?
Hasta alcanzar la muestra de la calculadora y como mínimo una semana completa; dos o más si muchos visitantes vuelven solo unas pocas veces por semana.
¿Aún no lo has instalado? Elige una vía
Google Tag Manager
Etiqueta de HTML personalizado en todas las páginas, comprobación en vista previa y publicación. Para sitios que ya usan GTM.
Abrir guía →Vibe codingAsistentes de IA para programar
Un prompt para Claude Code, Cursor, Lovable, Bolt.new, v0 y Replit que coloca la línea en el archivo raíz correcto.
Abrir guía →Sin códigoConstructores web y CMS
WordPress, Webflow, Shopify, Wix, Squarespace, Framer, Tilda o HTML: dónde está el campo de código del head y qué pulsar.
Abrir guía →