Calculadora de Muestra para A/B Testing de Conversión

Calcula el tamaño de tu muestra

Ingresa los parámetros

Usando valores predeterminados

Se han aplicado valores estándar recomendados. Puedes modificarlos según tus necesidades.

Tasa de conversión actual (benchmarks: E-commerce 1-2%, SaaS 5-10%)

Mejora mínima que quieres detectar

Visitantes por día para estimar la duración

TL;DR

Un A/B test no estima un valor en una población: decide si la diferencia entre dos variantes es real o ruido. Por eso su tamaño de muestra no sale de la fórmula de Cochran sino de un análisis de potencia (Kohavi et al., 2009), donde el tamaño de la población no participa y el número que obtienes es por variante.

¿Cuándo usar esta calculadora?

Úsala cuando vas a comparar variantes y necesitas saber si la diferencia entre ellas es real:

Tienes una tasa de conversión base medida en la variante de control (no estimada de memoria)

Puedes nombrar el efecto mínimo que justificaría el cambio (MDE): cuánto tiene que mejorar para que valga la pena implementarlo

El tráfico se acumula en el tiempo: no hay una población cerrada que limite cuántas personas pueden entrar al test

La métrica es una proporción (conversión, clics, activación). Si comparas tiempos o puntajes SUS, usa las otras variantes de A/B testing de la calculadora.

Si en cambio quieres estimar un valor en una población — cuánta gente prefiere X — la pregunta es de encuesta, no de experimento.

Fundamento Matemático: Análisis de Potencia

La fórmula estándar para comparar dos proporciones (Kohavi et al., 2009; Cohen, 1988) es:

n = 2 * (Za + Zb)^2 * p * (1-p) / D^2

n = Muestra por variante | Za = Z del nivel de confianza | Zb = Z de la potencia

p = Conversión base en proporción | D = Efecto mínimo detectable (MDE) en proporción

El resultado es por variante. Un test A/B necesita 2n personas en total; uno con tres variantes, 3n. Es el error de lectura más caro de esta fórmula.

La relación con el MDE es cuadrática: detectar la mitad del efecto cuesta cuatro veces la muestra. Por eso bajar el MDE de 10% a 5% no encarece el test al doble, sino al cuádruple.

Ausencia notable: el tamaño de la población no aparece. No hay corrección por población finita porque no estás muestreando un universo cerrado.

Los Cuatro Parámetros que Fijan el Tamaño

Conversión base (p): mídela, no la estimes. Con una base baja (1-2%) la muestra se dispara, y ese es el dato que decide si el test es viable antes de diseñarlo.

MDE: es una decisión de negocio, no estadística. La pregunta correcta no es 'qué mejora espero' sino 'qué mejora sería tan pequeña que no implementaría el cambio'. Ese umbral es tu MDE.

MDE relativo vs absoluto: 10% relativo sobre una base de 5% son 0,5 puntos; 10% absoluto son 10 puntos. La diferencia entre ambos es de dos órdenes de magnitud en la muestra requerida. La calculadora te deja elegir cuál usas.

Confianza (95% por defecto): controla el falso positivo — declarar ganadora una variante que no lo es.

Potencia (80% por defecto): controla el falso negativo — no detectar una mejora que sí existe. Subirla a 90% es defendible cuando el costo de dejar pasar la mejora es alto, pero encarece la muestra.

Errores que Invalidan el Resultado

Mirar el test antes de tiempo y pararlo al ver significancia: es el error más común y el más caro. Revisar a diario y detener cuando el p-valor cruza 0,05 infla el falso positivo muy por encima del 5% declarado. El tamaño que entrega esta calculadora es un compromiso previo, no una meta a la que llegar antes.

Cortar en mitad de un ciclo semanal: el comportamiento de un martes no es el de un domingo. Redondea la duración a semanas completas aunque la muestra ya esté cubierta.

Evaluar muchas métricas y reportar la que salió bien: cada métrica adicional es otra oportunidad de encontrar un falso positivo. Define la métrica primaria antes de lanzar.

Confundir significancia con relevancia: con muestra suficiente, una diferencia irrelevante sale significativa. Por eso el MDE se define antes: es tu umbral de relevancia.

Extender el test hasta que gane: si el resultado no es concluyente con la muestra planificada, el hallazgo es que el efecto es menor al MDE que definiste. Eso también es información.

Consideraciones para Productos con Poco Tráfico

La mayoría de los productos con los que trabajamos en LatAm no tiene el tráfico para detectar mejoras pequeñas. Con una conversión base de 3% y 500 visitas diarias, detectar una mejora relativa del 5% toma más de un año. Eso no es una limitación del método: es el método diciéndote que ese test no se puede correr.

La salida no es bajar la potencia ni la confianza para que el número quepa en el calendario. Eso no acorta el test, solo aumenta la probabilidad de tomar una decisión equivocada con la misma cara de certeza.

Prueba cambios más grandes. Si solo puedes detectar efectos de 20% o más, testea rediseños de flujo completos, no variaciones de copy en un botón.

Sube en el embudo. Una métrica más frecuente que la compra — agregar al carrito, iniciar el registro — tiene base más alta y necesita menos muestra, siempre que puedas argumentar que se mueve junto con la conversión final.

Cambia de método. Cuando el experimento no es viable, cinco sesiones de usabilidad bien conducidas responden más que un A/B test sin potencia. La decisión de método es previa a la de tamaño.

Referencias

  • Kohavi, R., Longbotham, R., Sommerfield, D., y Henne, R. M. (2009). Controlled Experiments on the Web: Survey and Practical Guide. Data Mining and Knowledge Discovery, 18(1), 140–181. link.springer.com
  • Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences (2.ª ed.). Hillsdale, NJ: Lawrence Erlbaum Associates. routledge.com

Recursos Relacionados

Última actualización: