lección 10
Leer resultados y decidir: el test terminó, ¿y ahora qué?
El test ha terminado y tienes un p-valor, un intervalo de confianza y una diferencia en puntos porcentuales. Ahora viene lo difícil: convertir esos números en una decisión de negocio que alguien pueda defender.
⏱ 50 min
Viernes por la tarde. Tu test A/B del botón naranja ha llegado a su fecha de evaluación. 14 días, 43.000 usuarios por grupo, sin incidentes técnicos, sin peeking. Abres la herramienta de experimentación y ves: grupo control (verde) convirtió al 4,2%. Grupo variante (naranja) convirtió al 4,5%. Diferencia: +0,3 puntos porcentuales. p-valor: 0,031. Intervalo de confianza del efecto: [+0,03 pp, +0,57 pp]. La directora de producto te manda un mensaje: "¿Funciona o no? Tengo que decidir antes del lunes".
Este es el momento de la verdad. Los 14 días anteriores fueron espera disciplinada. Ahora tienes números, y tu trabajo es convertirlos en una recomendación. Pero "el p-valor es menor que 0,05, así que funciona" no es una recomendación — es una lectura parcial. Para decidir bien necesitas juntar tres cosas: la significancia estadística (¿es real?), el tamaño del efecto (¿es grande?), y la relevancia de negocio (¿merece la pena?). Las tres tienen que alinearse.
### Leer los tres números que importan
Cuando un test termina, una herramienta de experimentación te da muchos números. De todos ellos, tres son los que mandan:
- 01.El p-valor. La probabilidad de ver una diferencia tan grande (o más) si realmente no hubiera ningún efecto. Si p < 0,05, la diferencia es estadísticamente significativa — probablemente no es azar.
- 02.El intervalo de confianza del efecto. El rango plausible del efecto real. Si el IC es [+0,03 pp, +0,57 pp], el efecto verdadero está probablemente entre esos valores. Si el 0 está dentro del intervalo, el resultado no es significativo.
- 03.El tamaño del efecto observado. La diferencia bruta entre A y B: 4,5% - 4,2% = +0,3 pp, o +7,1% relativo. Este es el número que conviertes en euros.
### Significancia estadística vs significancia práctica
Imagina un grifo que gotea. Gotea una gota cada hora. ¿Lo arreglas? Probablemente no — el coste de llamar al fontanero es mayor que el agua que pierdes en un año. Ahora imagina que gotea un litro por hora. Lo arreglas hoy. En ambos casos el grifo gotea (la diferencia es "real"). Pero la decisión de actuar depende del tamaño del problema, no de su existencia.
Lo mismo pasa con tu test. Una mejora de 0,01 puntos porcentuales en la conversión puede ser estadísticamente significativa si tienes millones de usuarios — pero en un e-commerce con 100.000 visitas al mes, eso son 10 compras adicionales. Si implementar el cambio cuesta dos semanas de trabajo, los números no cuadran. La significancia práctica pregunta: ¿este efecto, aunque sea real, es lo bastante grande como para justificar la acción?
Para responder necesitas traducir los puntos porcentuales a unidades de negocio. Si tu conversión sube 0,3 puntos y tienes 200.000 visitas al mes, son 600 compras más. Si el ticket medio es de 45 euros, son 27.000 euros mensuales. Ahora la directora de producto puede comparar eso con el coste de implementar el cambio y decidir.
Consejo de senior: nunca presentes un resultado de test sin la traducción a dinero (o a la unidad que obsesione a tu empresa: registros, activaciones, tickets cerrados). Un p-valor no mueve a nadie. "+27.000 euros/mes" mueve a todo el mundo. El número estadístico es para tu análisis; la cifra de negocio es para tu presentación.
### Los cuatro resultados posibles (y qué hacer con cada uno)
Cuando un test termina, caes en una de cuatro casillas. Solo una es la victoria limpia. Las otras tres requieren matices:
### Errores tipo I y tipo II como riesgos de negocio
Ya conoces los dos errores desde la lección anterior. Pero en el contexto de un test A/B que acaba de terminar, adquieren un significado muy concreto en dinero y reputación:
- Error tipo I (falso positivo): "Implemento algo que no funciona." El test dice que B gana, pero en realidad era azar. Despliegas, dedicas días de ingeniería, comunicas la victoria... y tres meses después la conversión sigue igual. Coste: tiempo desperdiciado y credibilidad erosionada.
- Error tipo II (falso negativo): "Descarto algo que sí funcionaba." El test dice "no significativo" y vuelves a A. Pero B SÍ mejoraba — no lo detectaste por falta de muestra. Coste: oportunidad perdida, invisible y acumulativa. Nadie se entera de lo que te perdiste.
La pregunta práctica: ¿cuál de los dos errores es más caro para tu empresa en ESTE test? Si pruebas un cambio menor y reversible (color de botón), un falso positivo es barato — vuelves al verde. Pero si pruebas una feature de meses de desarrollo, un falso positivo desperdicia esos meses. Y si buscas una mejora que puede valer millones, un falso negativo es carísimo.
Por eso en algunos tests se usa un umbral más permisivo: alfa = 0,10 en vez de 0,05. Aceptas más falsos positivos a cambio de menos falsos negativos. Y en otros tests se usa alfa = 0,01: más exigente, para estar muy seguro antes de invertir. No hay un umbral universal — depende del coste relativo de cada error para TU situación.
"No significativo" NO significa "no funciona". Significa "no tengo pruebas suficientes para afirmar que funciona". Es la diferencia entre "el acusado es inocente" y "no hemos encontrado pruebas para condenarlo". Antes de decir "B no funciona", pregunta: ¿tenía el test potencia suficiente para detectar el efecto que esperábamos?
### Qué hacer cuando el resultado no es concluyente
Quizá el resultado más frustrante de un test no es "B pierde" — es "no sé". p = 0,12. El IC cruza el cero. La diferencia es de 0,2 pp pero podría ser 0 o 0,4. No puedes decir que funciona, pero tampoco puedes descartar que funcione. ¿Qué haces?
- 01.Diagnostica POR QUÉ no es concluyente. ¿Falta de muestra? ¿Efecto más pequeño de lo esperado? ¿Ruido inesperado? Cada causa tiene una solución distinta.
- 02.Si fue falta de muestra: puedes extender el test (si declaras la extensión ANTES de mirar los datos finales) o aceptar que no tienes respuesta.
- 03.Si el efecto es más pequeño de lo esperado: pregunta si ese efecto más pequeño vale la pena. Si +3% relativo equivale a 2.000 euros/mes y la implementación cuesta 500 euros, quizá sí.
- 04.Si fue ruido externo: documéntalo y plantea repetir en un periodo más limpio.
- 05.Opción pragmática: si el cambio es barato y el resultado apunta en la dirección esperada (aunque sin significancia), a veces la decisión racional es implementarlo de todos modos aceptando el riesgo informado.
Consejo de senior: la respuesta "no lo sé con estos datos" es perfectamente válida y a veces la más honesta. Lo que NO es aceptable es forzar una conclusión — ni "funciona" porque p = 0,08 "casi llega", ni "no funciona" porque no cruzó el umbral. Presenta las dos lecturas y deja que la decisión la tome quien tiene el contexto del negocio.
### Quasi-experimentos: qué hacer cuando no puedes aleatorizar
El A/B test es el gold standard porque la aleatorización aísla la causa. Pero hay situaciones donde no puedes asignar usuarios al azar: el cambio ya se implementó para todos, afecta a una región entera, o es una política sin excepciones. En esos casos necesitas quasi-experimentos — métodos que se aproximan al A/B test sin aleatorización.
No necesitas dominar las matemáticas detrás de estos métodos. Pero necesitas saber que existen, cuándo aplican, y qué limitaciones tienen:
- Diferencia en diferencias (diff-in-diff). Mides la métrica antes y después del cambio en el grupo afectado, Y en un grupo similar NO afectado. La diferencia entre las dos diferencias es tu estimación del efecto. Ejemplo: subes precios en España pero no en Portugal. Si España cae un 10% y Portugal un 5% (tendencia del mercado), el efecto de tu subida es -5%, no -10%.
- Pre/Post simple (antes y después). El más débil. Mides antes del cambio y después. Problema: todo lo demás también cambió. Solo es creíble si el cambio fue abrupto y grande, y no coincidió con nada más.
- Regresión discontinua. Cuando hay un umbral arbitrario que determina quién recibe el tratamiento. Ejemplo: promoción para clientes con más de 100 euros de compra. Los de 99 euros y los de 101 son casi idénticos, pero unos reciben la promo y otros no. Comparando los que están justo arriba y abajo del umbral estimas el efecto.
### El informe del experimento: lo que entregas
El test ha terminado. Has analizado los datos. Ahora tienes que contarlo. Tu público es la directora de producto, el PM, quizá el director de tecnología. Ninguno quiere ver la fórmula del z-test. Todos quieren saber: ¿funciona? ¿cuánto vale? ¿qué hacemos? Tu informe tiene estas secciones:
- 01.Una frase de resumen (el veredicto). "El botón naranja mejora la conversión un 7% relativo con alta confianza. Recomiendo desplegarlo." Esto va al principio, no al final.
- 02.Contexto y diseño (3 frases). Qué se probó, por qué, con cuántos usuarios, durante cuánto tiempo.
- 03.Resultado cuantificado. Métrica primaria en ambos grupos, diferencia en pp, diferencia relativa, p-valor, IC. Y la TRADUCCIÓN a negocio: euros, usuarios.
- 04.Métricas de protección. "El ticket medio no cambió. La tasa de error se mantuvo estable."
- 05.Recomendación. Qué hacer y por qué. Con la razón, no solo la conclusión.
- 06.Limitaciones y siguientes pasos. Qué no sabes todavía. ¿El efecto se mantendrá? ¿Hay novelty effect?
Una página. Nunca más de una página para el informe principal. Si alguien quiere los detalles técnicos, los pones en un anexo. El documento que circula por email es de una página.
No entierres un resultado negativo. Si el test dice que tu variante perdió, repórtalo con el mismo rigor y la misma estructura que una victoria. Las empresas que esconden los tests negativos pierden el aprendizaje. Saber que algo NO funciona vale: evita que otro equipo lo pruebe y estrecha el espacio de búsqueda.
### La cultura de experimentación: por qué las empresas que testean más, ganan
Booking.com llevaba años en marcha antes de empezar a probar las cosas de forma sistemática. A mediados de los 2000 empezaron, y de ahí no se movieron: hoy tienen más de mil experimentos en marcha a la vez. Al cabo de una década y miles de tests, la web se había optimizado hasta convertir mejor que ninguna competidora. No fue un golpe de genio: fue la acumulación de cientos de mejoras pequeñas, cada una validada con datos — y de miles de ideas descartadas por el camino.
Los números de la industria dicen todos lo mismo: la mayoría de los tests no ganan. En Google y en Bing, solo entre un 10% y un 20% de los experimentos dan un resultado positivo. En Microsoft, en conjunto, aproximadamente un tercio salen positivos, un tercio neutros y un tercio negativos. ¿Es un fracaso? No: cada test que no gana te dice dónde NO está la palanca. Las empresas que testean mucho aprenden rápido. Las que testean poco toman decisiones por opinión — y eso funciona hasta que deja de funcionar.
Amazon es el ejemplo que todo el mundo cita, y su fundador lo ha resumido muchas veces en la misma idea: si duplicas el número de experimentos que haces al año, duplicas tu capacidad de inventar. No es que tengan analistas más listos — es que han construido un sistema donde testear es lo normal y lanzar sin testear es la excepción. Eso es lo replicable: no el talento, sino la costumbre.
### Cómo proponer un test siendo junior
Si tu empresa no tiene cultura de experimentación y tú eres junior, proponer un A/B test puede parecer una batalla perdida. "No tenemos herramienta", "no tenemos tiempo", "ya sabemos lo que funciona". Aquí tienes el playbook:
- 01.Empieza pequeño. No propongas testear el rediseño de la home. Propón testear el asunto de un email, o el texto de un botón. Algo que se implementa en una hora.
- 02.Pon dinero en la propuesta. "Si el asunto nuevo mejora la apertura un 10%, son 3.000 suscriptores más que leen la oferta, o sea 4.000 euros/mes." ESO mueve.
- 03.Haz el trabajo tú. Presenta el test ya diseñado: hipótesis, métrica, muestra, duración, fecha. Que quien aprueba solo diga "sí" o "no".
- 04.Comparte el resultado, gane o pierda. El primer test es marketing interno. Si gana, tienes un caso de éxito. Si pierde, evitaste un error costoso.
- 05.Nombra a los gigantes. "Booking ejecuta 1.000 tests simultáneos. Netflix dice que solo el 10% de sus ideas funcionan. ¿Podemos probar una cosa al mes?"
Esto te lo van a preguntar en la entrevista: "Cuéntame un caso donde propusiste un test A/B y cómo lo diseñaste". No necesitas que fuera un éxito. Lo que quieren oír es: identificaste la pregunta, diseñaste con rigor, presentaste la recomendación con los tres números, y aprendiste del resultado.
### El framework completo: de la pregunta a la decisión
### Resumen
Después de estas dos lecciones de A/B testing, tienes una caja de herramientas completa para la experimentación. Lo esencial:
- 01.Un resultado tiene tres lecturas: estadística (¿es real?), práctica (¿es grande?) y de negocio (¿merece la pena?).
- 02.El intervalo de confianza del efecto importa más que el p-valor solo, porque dice el rango plausible.
- 03."No significativo" no es "no funciona" — es "no tengo evidencia suficiente".
- 04.Error tipo I y tipo II son riesgos de negocio. Cuál es más caro depende del contexto.
- 05.Cuando no puedes aleatorizar, baja en la escala de evidencia — no renuncia a medir.
- 06.Tu entregable es un informe de una página con veredicto, números y recomendación.
- 07.La cultura de experimentación se construye con un test a la vez, empezando pequeño.
Regístrate para guardar tu progreso.
## comentarios
Reporta erratas, ayuda a otros o comparte tu opinión. Sé constructivo.
Inicia sesión para comentar y responder.
cargando comentarios...