lección 7
Intervalos de confianza: la incertidumbre honesta
No es 4,2%. Es entre 3,8% y 4,6% con un 95% de confianza. Qué significa eso de verdad, por qué importa, y cómo se calcula.
⏱ 55 min
Ya sabes calcular un porcentaje de conversión. Pero ¿cuánto te fías de ese número? Si tu e-commerce tuvo 10 visitas esta mañana y 3 compraron, ¿la conversión es realmente un 30%? ¿O podría ser un 5% que tuvo un golpe de suerte con la muestra? Ahora imagina 10.000 visitas y 3.000 compras: ese 30% ya convence más, ¿verdad? La diferencia entre los dos escenarios no es el porcentaje — es la certidumbre que puedes poner detrás del porcentaje. Con 10 visitas, tu estimación podría estar entre el 7% y el 65% sin que nadie pudiera demostrar que te equivocas. Con 10.000, el rango se estrecha a algo como 29%-31%. Esa horquilla que rodea a tu estimación — cuánto puede variar el valor real respecto al que has calculado — es el intervalo de confianza, y es lo que separa un dato que sustenta una decisión de un dato que solo parece hacerlo.
Este es el problema que resolvemos hoy. Cada vez que calculas una métrica a partir de una muestra — una encuesta de satisfacción, un test A/B, el porcentaje de abandono del último mes — el número que obtienes NO es el valor real. Es una estimación basada en los datos que has visto. Y la pregunta crítica no es "cuál es el número", sino "cuál es el rango de valores razonables dado lo que he observado". Ese rango es el intervalo de confianza, y aprenderlo cambiará la forma en que presentas resultados.
### La analogía: pescar con red, no con anzuelo
Imagina que quieres saber la temperatura media de tu ciudad hoy. Pones un termómetro en el balcón a las 10 de la mañana: marca 22 grados. Eso es una medición puntual — un solo dato. Si alguien te pregunta "¿cuál es la temperatura media de hoy?", 22 grados es tu mejor estimación con un solo punto. Pero sabes que no es LA temperatura del día: a las 7 hacía más frío, a las 15 hará más calor. Si pusieras 100 termómetros repartidos por la ciudad, cada uno daría un número distinto. Tu único termómetro te da UN punto; el intervalo de confianza te dice "probablemente la temperatura real del día está entre 19 y 25 grados".
Ahora trasládalo al negocio. Envías una encuesta a 200 usuarios y el 68% dice estar satisfecho. Ese 68% es tu termómetro en el balcón: un solo dato de una sola muestra. Si hubieras enviado la encuesta a OTROS 200 usuarios distintos, habrías obtenido un número diferente — quizá 65%, quizá 71%. El intervalo de confianza dice: "con la muestra que tengo, estoy razonablemente seguro de que la satisfacción real de TODA la base está entre el 61% y el 75%". No te da certeza absoluta; te da una horquilla honesta.
### Lo que "95% de confianza" NO significa
Aquí viene el error que comete todo el mundo, incluidos profesionales con años de experiencia. Cuando dices "con un 95% de confianza, la conversión está entre 3,8% y 4,6%", la interpretación natural — la que tu cerebro quiere hacer — es: "hay un 95% de probabilidad de que el valor real esté entre 3,8% y 4,6%". Eso es INCORRECTO. El valor real es un número fijo (existe una conversión verdadera de toda la población); no es aleatorio, no "está" en ningún sitio con probabilidad. Lo que es aleatorio es el intervalo, porque depende de la muestra que hayas cogido.
El error más extendido sobre intervalos de confianza: decir "hay un 95% de probabilidad de que el valor real esté dentro del intervalo". La interpretación correcta es: si repitieras el muestreo 100 veces y calcularas 100 intervalos, aproximadamente 95 de esos intervalos contendrían el valor real. Es el MÉTODO el que acierta el 95% de las veces, no un intervalo concreto. Cuando ya has calculado tu intervalo, el valor real está dentro o no está — no hay 95% de nada. Es la distinción entre "mi método de pesca captura algo el 95% de las veces" y "este pez concreto tiene un 95% de probabilidad de estar en mi red".
La analogía que lo aclara: imagina que fabricas redes de pescar. Tu proceso de fabricación produce redes que capturan peces el 95% de las veces. Coges UNA red, la lanzas al agua y la sacas cerrada. Ahora: ¿hay un pez dentro o no? No puedes decir "hay un 95% de probabilidad de que haya un pez". El pez está o no está — ya no es probabilidad, es un hecho. Lo que puedes decir es: "mi método de fabricar redes funciona el 95% de las veces, así que confío en que esta red tiene un pez". Es una declaración sobre el PROCESO, no sobre este resultado concreto.
### Por qué importa: el margen de error
Cuando alguien presenta "la conversión es 4,2%", la pregunta correcta del analista es: "¿4,2% con qué margen de error?". Porque 4,2% con un margen de +/-0,3 puntos (es decir, entre 3,9% y 4,5%) es una cifra útil para tomar decisiones. Pero 4,2% con un margen de +/-3 puntos (es decir, entre 1,2% y 7,2%) no te dice casi nada: el valor real podría ser el triple o la mitad. El margen de error es la mitad de la anchura del intervalo de confianza, y depende de dos cosas: cuánta variabilidad hay en los datos y cuántos datos tienes.
La intuición es directa: cuanto más grande sea tu muestra, más estrecho será el intervalo. Preguntar a 30 personas no es lo mismo que preguntar a 3.000. Y el efecto no es lineal — es la raíz cuadrada. Para reducir el margen de error a la mitad, necesitas CUATRO veces más datos, no el doble. Eso explica por qué las encuestas electorales entrevistan a 1.000-2.000 personas y no a 10.000: el coste de pasar de 1.000 a 4.000 es enorme, y la ganancia en precisión es "solo" dividir el margen por dos.
Consejo de senior: cuando un stakeholder te pida "la conversión exacta" o "el NPS exacto", recuerda que ese número no existe. Solo existen estimaciones con mayor o menor precisión. Tu trabajo es dar la estimación MÁS el rango: "la conversión es del 4,2%, con un margen de error de +/-0,8 puntos al 95% de confianza. Para estrechar ese margen a +/-0,4, necesitaríamos el cuádruple de datos". Eso es transparencia, no inseguridad.
### La fórmula del intervalo para una proporción
El caso más común en análisis de negocio es estimar una proporción: qué porcentaje de usuarios convierte, qué porcentaje está satisfecho, qué porcentaje abandona. Para una proporción, la fórmula del margen de error es elegante y fácil de memorizar:
1# Formula del margen de error para una proporcion2# ME = z * sqrt( p * (1 - p) / n )3#4# Donde:5# p = proporcion observada (ej: 0.042 para 4,2%)6# n = tamano de la muestra7# z = valor critico segun el nivel de confianza:8# - 90% de confianza -> z = 1.6459# - 95% de confianza -> z = 1.96010# - 99% de confianza -> z = 2.57611#12# El intervalo de confianza es: [ p - ME, p + ME ]1314import math1516p = 0.042 # Conversion observada: 4,2%17n = 180 # Tamano de la muestra18z = 1.96 # Para 95% de confianza1920margen_error = z * math.sqrt(p * (1 - p) / n)2122limite_inferior = p - margen_error23limite_superior = p + margen_error2425print(f"Proporcion observada: {p:.1%}")26print(f"Margen de error: +/- {margen_error:.1%}")27print(f"Intervalo al 95%: [{limite_inferior:.1%}, {limite_superior:.1%}]")
El intervalo de confianza para la conversión del 4,2% con 180 usuarios
### Tamaño de muestra: por qué 30 personas no dicen nada
Ahora que tienes la fórmula, vamos a hacer el ejercicio más revelador: ver cómo cambia el margen de error al aumentar la muestra. Supongamos una proporción del 50% (el peor caso posible, donde la incertidumbre es máxima). Mira cómo se comporta el margen:
1import math23z = 1.96 # 95% de confianza4p = 0.5 # Peor caso (maxima incertidumbre)56print(f"{'Muestra':>10} | {'Margen error':>12} | {'Intervalo':>20}")7print("-" * 50)89for n in [30, 100, 200, 500, 1000, 2000, 5000, 10000]:10 me = z * math.sqrt(p * (1 - p) / n)11 inf = p - me12 sup = p + me13 print(f"{n:>10} | {me:>11.1%} | [{inf:.1%}, {sup:.1%}]")
Cómo encoge el margen de error al aumentar la muestra (caso p=50%)
Esto te lo van a preguntar en la entrevista: "Hemos hecho una encuesta a 50 clientes y el 40% dice que usaría la nueva funcionalidad. ¿Lanzamos?". La respuesta que esperan: "Con 50 respuestas, el margen de error es de +/-14 puntos. Ese 40% podría ser un 26% o un 54%. No tenemos suficiente precisión para decidir — necesitamos al menos 300 respuestas para bajar el margen a +/-6 puntos". Eso es criterio, no pedantería.
### Caso de negocio: el test A/B que no era significativo
Volvamos a la reunión del principio. Variante A: 3,89% de conversión (7 de 180 usuarios). Variante B: 4,44% de conversión (8 de 180 usuarios). La diferencia observada es de 0,56 puntos porcentuales. Parece que B gana. Pero calculemos los intervalos de confianza de cada variante:
1import math23z = 1.9645# Variante A6p_a = 7 / 180 # 3,89%7n_a = 1808me_a = z * math.sqrt(p_a * (1 - p_a) / n_a)910# Variante B11p_b = 8 / 180 # 4,44%12n_b = 18013me_b = z * math.sqrt(p_b * (1 - p_b) / n_b)1415print("VARIANTE A")16print(f" Conversion: {p_a:.2%}")17print(f" Intervalo: [{p_a - me_a:.2%}, {p_a + me_a:.2%}]")18print()19print("VARIANTE B")20print(f" Conversion: {p_b:.2%}")21print(f" Intervalo: [{p_b - me_b:.2%}, {p_b + me_b:.2%}]")22print()23print("DIFERENCIA")24diff = p_b - p_a25# Error estandar de la diferencia de proporciones26se_diff = math.sqrt(p_a*(1-p_a)/n_a + p_b*(1-p_b)/n_b)27me_diff = z * se_diff28print(f" B - A = {diff:.2%}")29print(f" Intervalo de la diferencia: [{diff - me_diff:.2%}, {diff + me_diff:.2%}]")30print()31if (diff - me_diff) > 0:32 print(" SIGNIFICATIVO: el intervalo no cruza el cero")33else:34 print(" NO significativo: el intervalo cruza el cero")
Dos variantes con intervalos que se solapan: la diferencia no es real
### La regla práctica: cuándo un resultado es estadísticamente significativo
Después de todo este desarrollo, la regla para el día a día es sencilla. Si quieres saber si una variante es MEJOR que otra (no solo distinta por azar), calcula el intervalo de confianza de la diferencia entre ambas:
- Si el intervalo de la diferencia NO incluye el cero: la diferencia es estadísticamente significativa al nivel que hayas elegido (normalmente 95%). Puedes decir "B es mejor que A con un 95% de confianza".
- Si el intervalo de la diferencia INCLUYE el cero: no puedes descartar que la diferencia sea cero (es decir, que no haya efecto real). NO puedes decir "B es mejor" — solo puedes decir "no tenemos suficientes datos para afirmarlo".
- Cuidado: "no significativo" no significa "son iguales". Significa "no tengo precisión suficiente para distinguirlos". Con más datos, quizá sí los distinguirías.
Hay una forma más visual de verlo, aunque no es equivalente: si los intervalos de confianza de las dos variantes NO se solapan, la diferencia es significativa con seguridad. Si se solapan un poco, puede que la diferencia sea significativa o no (hay que calcular el intervalo de la diferencia para estar seguro). Si se solapan mucho, casi seguro que no es significativa. La regla del "no solapamiento" es más exigente: produce menos falsos positivos, pero a cambio deja escapar diferencias que sí son reales. La del intervalo de la diferencia es la forma correcta y completa.
### Historia: de dónde sale todo esto
Los intervalos de confianza no nacieron en un laboratorio abstracto. Nacieron de un problema muy práctico: en 1934, Jerzy Neyman, un matemático polaco que trabajaba en Londres, se enfrentó a la pregunta del muestreo. Si quieres saber cuánta gente de un país está en paro y no puedes preguntar a todo el mundo, preguntas a unos miles. ¿Y luego qué? ¿Con qué derecho dices que ese porcentaje vale para el país entero? Neyman necesitaba una forma de acompañar cada estimación con su precisión sin tener que encuestar a toda la población. Su solución — el intervalo de confianza — fue tan útil que se convirtió en la base de la inferencia estadística moderna.
Lo curioso es que durante décadas, la interpretación de "un 95% de probabilidad de que el valor esté ahí" fue la que se enseñó en las universidades. El propio Neyman se quejó de ello en vida: la gente confundía la confianza del método con la probabilidad de un resultado concreto. Ochenta años después, seguimos cometiendo el mismo error en las reuniones de producto. No te sientas mal por haberlo pensado — pero ahora ya sabes la diferencia.
### Cómo presentar un intervalo de confianza a un stakeholder
Nunca digas "con un 95% de confianza el valor está entre..." a un director de marketing. Le estás hablando en un idioma que no usa. Lo que funciona es una de estas tres fórmulas:
- 01."La conversión es del 4,2%, más o menos 1 punto. Es decir, estamos bastante seguros de que está entre el 3,2% y el 5,2%." — Simple, directo, sin jerga.
- 02."De los 500 usuarios que probaron el diseño nuevo, el 4,2% convirtió. Con esa cantidad de datos, el margen de error es de casi 2 puntos: la conversión real está entre el 2,4% y el 6,0%. Para bajar el margen a 1 punto necesitaríamos unos 1.550 usuarios." — Vincula la precisión al esfuerzo.
- 03."La diferencia entre A y B es de medio punto, pero con esta muestra no podemos saber si eso es real o es ruido. Necesitamos 2 semanas más de test para poder decidir con seguridad." — Traduce la estadística a una acción concreta.
Consejo de senior: jamás digas "no es estadísticamente significativo" a un stakeholder sin ofrecer una alternativa. Esa frase se oye como "no se puede saber" o "el dato no sirve". En su lugar: "con los datos que tenemos, la diferencia está dentro del margen de error. Podemos esperar una semana más para acumular muestra, o podemos aceptar el riesgo de elegir B sabiendo que quizá no sea mejor". Dale opciones, no un muro.
### El nivel de confianza: por qué 95% y no 99%
El 95% es una convención, no una ley de la física. Es más viejo que la estadística moderna: viene de una costumbre del siglo XIX para decidir cuándo un resultado era "raro de verdad", y Ronald Fisher lo asentó en los años 1920 desde una estación de investigación agrícola inglesa. Se quedó porque es un buen equilibrio entre "no quiero equivocarme" y "no quiero necesitar un millón de datos". Un nivel de confianza más alto (99%) te da un intervalo más ancho: reduces la probabilidad de error, pero pierdes precisión. Uno más bajo (90%) te da un intervalo más estrecho: ganas precisión pero aumentas el riesgo de que tu intervalo NO contenga el valor real.
En la práctica: usa el 95% como valor por defecto para decisiones de producto (tests A/B, encuestas, métricas de negocio). Usa el 99% cuando el coste de equivocarte es muy alto (decisiones médicas, cambios de precio que afectan a toda la base, migraciones irreversibles). Y usa el 90% cuando necesitas decidir rápido y el coste de equivocarte es bajo (un cambio de copy que se puede revertir mañana).
### Resumen: las cinco preguntas antes de creer un número
Después de esta lección, cada vez que alguien te presente una métrica puntual — "la conversión es 4,2%", "el NPS es 42", "el 68% está satisfecho" — tu lista mental de preguntas debería ser:
- 01.¿De cuántos datos sale ese número? (tamaño de muestra)
- 02.¿Cuál es el margen de error? (anchura del intervalo)
- 03.¿Esos datos son representativos de la población que me interesa? (sesgo de selección)
- 04.¿El periodo de medición es suficiente? (estacionalidad, efectos temporales)
- 05.Si hay una comparación (A vs B), ¿la diferencia está fuera del margen de error? (significancia)
Si no puedes responder las tres primeras, el número es una anécdota, no un dato. Y una anécdota no debería mover una decisión de producto.
Regístrate para guardar tu progreso.
## comentarios
Reporta erratas, ayuda a otros o comparte tu opinión. Sé constructivo.
Inicia sesión para comentar y responder.
cargando comentarios...