Dos preguntas, una calculadora
Toda prueba de anuncios plantea dos cosas, en este orden. Antes de empezar: ¿cuántos visitantes necesita para encontrar la diferencia que me importa? Después de terminar: ¿la diferencia entre A y B es real o podría ser casualidad? Usa las dos pestañas de arriba en ese orden. Calcular primero el tamaño de muestra es lo que da sentido a la respuesta de la segunda pregunta.
Los “visitantes” pueden ser visitantes de la página de destino, clics en el enlace o cualquier otra persona que tuvo una oportunidad justa de convertir, siempre que ambas versiones se cuenten de la misma forma. Las “conversiones” son las personas que hicieron aquello que estás probando.
Cómo funciona la prueba de significancia
La calculadora ejecuta una prueba z de dos proporciones, la prueba de muestras grandes para comparar dos tasas descrita en el NIST/SEMATECH e-Handbook of Statistical Methods:
- Tasa combinada p = (conversiones A + conversiones B) ÷ (visitantes A + visitantes B).
- z = (tasa B − tasa A) ÷ √(p × (1 − p) × (1/visitantes A + 1/visitantes B)).
- valor p de dos colas = 2 × (1 − Φ(|z|)), donde Φ es la distribución normal estándar.
- El intervalo para la diferencia es (tasa B − tasa A) ± z × √(tasa A × (1 − tasa A) ÷ visitantes A + tasa B × (1 − tasa B) ÷ visitantes B). El rango de mejora divide eso por la tasa A, lo que trata la tasa A como conocida, así que es una aproximación.
Ejemplo resuelto. La versión A logra 200 conversiones de 10.000 visitantes (2,00%). La versión B logra 245 de 10.000 (2,45%), una mejora relativa del 22,5%. La tasa combinada es 445 ÷ 20.000 = 2,225%, el error estándar es 0,209 puntos porcentuales y z = 0,45 ÷ 0,209 = 2,157. El valor p de dos colas es 0,031, por debajo de 0,05, así que con un 95% de confianza gana B. El intervalo del 95% para la diferencia va de +0,04 a +0,86 puntos porcentuales: B es mejor, pero la mejora real podría estar entre cerca del 2% y el 43%.
La prueba es una aproximación que necesita datos suficientes. El manual de NIST da un criterio: al menos 5 éxitos y 5 fracasos. La calculadora retiene su veredicto y dice todavía no hay datos suficientes hasta que cada versión tenga 5 conversiones y 5 no conversiones. Con menos que eso, NIST remite a una prueba exacta para muestras pequeñas, pero para una prueba de anuncios la respuesta práctica es mantenerla en marcha.
Cómo se calcula el tamaño de muestra
Para una prueba de dos colas, los visitantes por versión:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Aquí p1 es tu tasa actual, p2 es esa tasa con el aumento aplicado, y p̄ es su promedio. Es la aproximación normal, sin corrección por continuidad, y tiene la misma forma que la fórmula del tamaño de muestra para una sola proporción del manual del NIST, con un segundo grupo añadido. Con un 95% de confianza z1−α/2 es 1,959964, y con un 80% de potencia z1−β es 0,841621.
Ejemplo resuelto. Una tasa de conversión del 2% y quieres detectar un aumento del 20%, o sea 2,0% frente a 2,4%. La tasa promedio es 2,2%. La línea superior es 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, al cuadrado es 0,3377, y dividido por 0,004² da 21.109 visitantes por versión, 42.218 en total. A 3.000 visitantes por día, eso son 15 días.
El aumento que pides es lo que más pesa. Con la misma tasa del 2%, un aumento del 30% necesita 9.798 por versión y uno del 10% necesita 80.682. Reducir el aumento a la mitad casi cuadruplica el tráfico, porque la diferencia aparece al cuadrado en el denominador de la fórmula.
Por qué parar antes de tiempo infla los falsos positivos
Un nivel de confianza del 95% significa que, cuando A y B convierten de verdad igual, una sola prueba con un tamaño de muestra fijo aún declara un ganador cerca del 5% de las veces. Ese 5% solo es cierto si miras una vez, al final.
Revisar el resultado cada día y parar la primera vez que marca significativo es otro procedimiento. Las tasas fluctúan a medida que llegan datos, y cada vistazo es otra oportunidad de que una diferencia por azar cruce el umbral. Si paras en el primer cruce, has elegido el momento más afortunado, así que la tasa real de falsos positivos acaba por encima del 5%, y crece cuanto más miras. El valor p en pantalla no sabe que espiaste, así que se muestra como si hubieras mirado una sola vez.
El arreglo es aburrido y funciona: decide el tamaño de muestra antes de empezar la prueba, deja que lo alcance y lee el resultado una sola vez. Mirar a mitad para comprobar que nada esté roto está bien. Parar porque el número se ve bien, no.
Qué dicen Meta y Google Ads sobre la duración de las pruebas
- Las mejores prácticas de pruebas A/B de Meta recomiendan pruebas de al menos 7 días, advierten que las pruebas más cortas pueden dar resultados no concluyentes y limitan las pruebas A/B a 30 días. La misma página sugiere alargarlas si los clientes suelen tardar más de 7 días en convertir.
- Meta suele sugerir una potencia estimada del 80% o más, la potencia por defecto aquí. Sus resultados A/B muestran un porcentaje de confianza, y considera un 65% o más como resultado ganador en una prueba A/B. Esa cifra proviene del método propio de Meta y no es lo mismo que el nivel de confianza de esta página, así que ambas no coincidirán.
- Meta también desaconseja probar de forma informal activando y desactivando conjuntos de anuncios, porque las audiencias pueden solaparse, y recomienda el mismo presupuesto para ambas versiones.
- Google Ads recomienda dejar un experimento activo de 2 a 3 semanas, muestra por defecto un intervalo de confianza del 80% con otros niveles a petición, y marca los resultados significativos con un asterisco azul. Su método estadístico usa remuestreo jackknife sobre 20 segmentos por grupo, así que sus intervalos tampoco coincidirán exactamente con una prueba z.
Lo que esta calculadora no hace
- Compara dos versiones. Con tres o más, cada comparación extra es otra oportunidad de un falso ganador, y la prueba simple de aquí no lo ajusta.
- Prueba tasas de conversión, no ingresos por visitante ni valor del pedido, que requieren otra prueba.
- No es una prueba secuencial. Supone que lees el resultado una sola vez, con el tamaño de muestra que planificaste.
- No puede decir si tu reparto fue justo. Si una versión recibió una audiencia, un presupuesto o una franja horaria distintos, ninguna fórmula lo arregla.
Si prefieres no hacer las cuentas a mano
Hermoso es marketing en piloto automático. Pregúntale qué escalar, pausar y probar a continuación y lee cada plataforma de anuncios que hayas conectado, pone las campañas con muy pocos datos en su propio grupo en vez de juzgarlas, y da a cada prueba sugerida una hipótesis, la única cosa a cambiar, la métrica que la decide, un presupuesto y una duración. También crea variantes de imagen y vídeo acordes a tu marca para probar, y monta campañas en tus propias cuentas publicitarias, creadas en pausa. Funciona en la app web, o dentro de Claude, ChatGPT y Cursor a través de su servidor MCP. Una vez que una prueba tiene un ganador, la calculadora de ROAS gratuita te dice si además es rentable.
Herramientas gratis: · Calculadora de ROAS · Verificador de longitud de textos publicitarios
Preguntas frecuentes
¿Cómo sé si mi test A/B de anuncios es estadísticamente significativo?
Introduce visitantes y conversiones de ambas versiones. La calculadora ejecuta una prueba z de dos proporciones y da un valor p de dos colas. Con un 95% de confianza, un valor p por debajo de 0.05 significa que es poco probable que la diferencia sea azar. Para 200 de 10.000 frente a 245 de 10.000, p es 0.031, así que gana B.
¿Cuántos visitantes necesita un test A/B?
Depende de tu tasa de conversión y de la mejora más pequeña que quieras detectar. Con una tasa de conversión del 2%, detectar una mejora del 20% con un 95% de confianza y un 80% de potencia requiere 21.109 visitantes por versión. Una mejora del 10% requiere 80.682.
¿Por qué dice la calculadora que aún no hay datos suficientes?
La prueba z es una aproximación para muestras grandes. La calculadora espera hasta que cada versión tenga al menos 5 conversiones y 5 no conversiones, un criterio indicado en el NIST e-Handbook, antes de dar un veredicto.
¿Puedo detener un test en cuanto parece significativo?
No si quieres que el nivel de confianza signifique lo que dice. Revisar repetidamente y detenerte en la primera lectura significativa le da al azar más oportunidades de cruzar la línea, así que la tasa real de falsos positivos acaba siendo más alta que la que elegiste. Fija primero el tamaño de muestra y lee el resultado una sola vez.
¿Cuánto debe durar un test A/B de Meta?
Meta recomienda al menos 7 días, dice que los test más cortos pueden ser poco concluyentes, y permite hasta 30 días. Google Ads recomienda de 2 a 3 semanas para los experimentos. Usa la pestaña de tamaño de muestra con tu tráfico diario para ver cuánto necesita tu propio test.
¿Se envía a algún sitio lo que escribo?
No. Los cálculos se ejecutan en tu navegador. No hay ninguna petición de red que transporte lo que escribes y no se guarda nada.
Hermoso te dice qué escalar, pausar y probar a continuación en tus cuentas publicitarias. Empieza gratis, más de 250 créditos gratuitos que puedes ganar, sin tarjeta.
Empieza gratis → Ver precios