Cómo funciona
La calculadora compara la tasa de conversión de cada variante contra el control con un test z de dos proporciones, el método habitual para tasas de conversión con muestras grandes:
Tasa pooled = (conv. control + conv. variante) ÷ (visitantes control + visitantes variante)
Error estándar = √(pooled × (1 − pooled) × (1/n₁ + 1/n₂))
z = (CR variante − CR control) ÷ error estándar
Con el valor z se obtiene el valor p (bilateral). La confianza es 1 − valor p: si es mayor al umbral que elegiste, la diferencia es significativa.
Qué más controla
- Uplift relativo: cuánto mejora (o empeora) la variante respecto del control, en porcentaje del CR del control.
- Intervalo de confianza: el rango plausible de la diferencia real, en puntos porcentuales. Si incluye el cero, no hay evidencia de diferencia.
- Varias variantes: cada comparación se evalúa contra un umbral más exigente (corrección de Bonferroni: el nivel de error se divide por la cantidad de variantes) para no declarar ganadores por azar.
- SRM (sample ratio mismatch): un test chi-cuadrado verifica que los visitantes se hayan repartido de forma pareja entre grupos. Si el valor p es menor a 0,001, algo falló en la asignación y el resultado no es confiable.
- Duración: si cargás los días, avisa cuando son menos de 14, para cubrir al menos dos ciclos semanales.
Esta calculadora asume que cada visitante se cuenta una sola vez y que el reparto esperado es parejo entre grupos. Mirar los resultados todos los días y frenar apenas aparece significancia aumenta los falsos positivos: definí la muestra antes con la calculadora de tamaño de muestra.
Ejemplo
El control tuvo 10.000 visitantes y 500 conversiones (5 %). La variante B tuvo 10.000 visitantes y 570 conversiones (5,7 %). La diferencia es de 0,7 puntos porcentuales, un uplift relativo de +14 %. El valor z es 2,2 y el valor p es 0,028, es decir 97,2 % de confianza: supera el umbral del 95 %, así que la variante B es ganadora.
Preguntas frecuentes
¿Qué es la significancia estadística en un test A/B?
Es la probabilidad de que la diferencia observada no se deba solo al azar. Con 95 % de confianza aceptás un 5 % de riesgo de declarar un ganador cuando en realidad no hay diferencia.
¿Qué nivel de confianza conviene usar?
El 95 % es el estándar de la industria. Usá 99 % si implementar un falso ganador tiene un costo alto y 90 % solo para decisiones de bajo riesgo o exploratorias.
¿Cuánto tiempo tiene que correr un test?
Lo que tarde en alcanzar la muestra calculada de antemano y, como mínimo, dos ciclos semanales completos (14 días), para que el comportamiento de lunes a domingo esté bien representado.
¿Qué significa SRM y por qué invalida el test?
Es una desviación en el reparto de visitantes entre grupos respecto de lo esperado (por ejemplo, 50/50). Suele indicar un error técnico de asignación o de medición, y vuelve poco confiables las conclusiones.
¿Puedo mirar los resultados antes de que termine el test?
Mirar no es problema; decidir en base a lo que ves sí. Frenar el test apenas aparece significancia infla los falsos positivos. Definí la muestra y la duración antes de empezar.
¿Esta calculadora sirve para métricas que no son tasas de conversión?
No. Está pensada para métricas binarias (convirtió o no convirtió). Para métricas continuas, como ingreso por visitante, hace falta otro método.
Última revisión: octubre de 2026.