Saltar al contenido

lección 4

Distribuciones: qué forma tienen tus datos y por qué te importa

Normal, sesgada, bimodal, power law: el histograma es lo primero que miras, y la forma de los datos decide qué estadístico puedes usar sin mentir.

50 min

¿Por qué el 68% de tus clientes gastan una cantidad parecida entre sí, y luego aparecen unos pocos que gastan diez veces más? ¿Es un error en los datos? ¿Son fraudes? ¿Hay que ignorarlos? No — es la forma natural en que se reparten los datos, y tiene nombre: distribución. Lo mismo pasa con los tiempos de sesión de una app, los precios de las viviendas o los importes de los pedidos: no se distribuyen como la estatura humana, donde casi todo el mundo cae cerca de la media. Se concentran abajo y se estiran hacia arriba, con una cola larga de valores extremos que son perfectamente reales. Si no reconoces esa forma antes de calcular un estadístico, acabas optimizando para un usuario que no existe — como el equipo de producto que rediseñó su app para sesiones de 23 minutos porque era la media, sin ver que sus usuarios se dividían en dos grupos que jamás se parecieron a esos 23 minutos.

Ese día aprendí algo que no venía en ningún libro de estadística empresarial: antes de calcular cualquier estadístico — media, mediana, percentil — necesitas ver la FORMA de los datos. Esa forma se llama distribución, y es el tema de esta lección. No vamos a hacer probabilidad teórica ni integrales: vamos a responder una pregunta muy práctica: "¿cuando miro un montón de números, qué patrones de forma pueden tener, y qué consecuencias tiene cada forma para las decisiones que tomo?".

### Qué es una distribución (sin fórmulas)

Imagina que mides la estatura de 10.000 personas y anotas cada medida en un post-it. Ahora los ordenas de izquierda a derecha — los más bajos a la izquierda, los más altos a la derecha — y los apilas: cada vez que se repite un valor (o un rango de valores), pones el post-it encima del anterior. Lo que te sale es un perfil, una silueta. Esa silueta es la distribución: la forma en que los datos se reparten a lo largo de los valores posibles. Donde se apilan muchos, hay un pico; donde hay pocos, la silueta baja. Esa forma visual te dice más sobre tus datos que cualquier media o mediana sola.

La herramienta para ver esa forma se llama histograma: un gráfico de barras donde el eje horizontal son los valores (divididos en tramos) y la altura de cada barra es cuántos datos caen en ese tramo. Leer un histograma es como leer un mapa topográfico: ves dónde están las montañas (los valores más frecuentes), los valles (los huecos) y las colas (los extremos que se alargan). Toda esta lección gira alrededor de cuatro formas típicas que vas a encontrarte una y otra vez en datos de negocio.

Las cuatro formas básicas y la regla práctica de qué hacer con cada una

### La distribución normal: la campana de Gauss

La distribución normal — también llamada campana de Gauss — es la forma más famosa de la estadística. Es simétrica: un pico en el centro y dos colas que caen exactamente igual a ambos lados. La estatura de personas adultas, las notas de un examen a 500 alumnos, la temperatura media diaria de julio en Madrid durante 30 años: todas tienden a esa forma de campana. La razón es profunda y bonita: cuando un valor es el resultado de MUCHOS factores pequeños que suman (la estatura depende de cientos de genes más nutrición más ejercicio más...), la distribución resultante converge hacia una normal. Es el llamado Teorema Central del Límite, y es la razón por la que la campana aparece en tantos sitios naturales.

Para un analista, la normal es importante no porque tus datos sean normales — spoiler: en negocio, casi nunca lo son — sino porque es la REFERENCIA. Es el "caso fácil" donde todo funciona: la media coincide con la mediana, los percentiles son simétricos, y la desviación estándar tiene un significado directo. Aprender la normal es como aprender a conducir en un circuito cerrado: la calle luego será más caótica, pero necesitas la referencia para entender en qué se desvían tus datos reales.

### La regla 68-95-99,7

En una distribución normal, la desviación estándar te dice exactamente cuánta gente cae en cada franja. La regla es esta: el 68% de los datos están a menos de 1 desviación estándar del centro; el 95% a menos de 2; y el 99,7% a menos de 3. Fuera de 3 desviaciones no queda casi nadie: solo 3 de cada 1.000.

Ejemplo concreto: si la estatura media de hombres adultos en España es 175 cm con una desviación estándar de 7 cm, entonces el 68% mide entre 168 y 182 cm (175 +/- 7). El 95% mide entre 161 y 189 cm (175 +/- 14). Y el 99,7% mide entre 154 y 196 cm (175 +/- 21). Si alguien te dice que mide 210 cm, está a 5 desviaciones del centro — un evento extremadamente raro, lo que cuadra con que haya un puñado de personas así en todo el país.

La regla 68-95-99,7: cuanto más lejos del centro, menos probable

Consejo de senior: la regla 68-95-99,7 es útil para detectar valores anómalos rápidamente. Si un dato está a más de 3 desviaciones estándar de la media, pasa en el 0,3% de los casos en una distribución normal. Si ves muchos así, tus datos NO son normales — y tratar una distribución sesgada como si fuera normal es el error estadístico más común en dashboards de negocio.

### Cuando tus datos NO son normales (spoiler: casi siempre en negocio)

Aquí viene la parte más importante de esta lección: la mayoría de las métricas de negocio NO siguen una distribución normal. Los ingresos por cliente, el tiempo de sesión, el importe de pedido, los días hasta la primera compra, el número de interacciones con soporte — casi todo lo que mides en una empresa tiene una distribución sesgada a la derecha (muchos valores bajos y una cola larga de valores altos) o sigue una ley de potencias (unos pocos concentran casi todo). La normal es la excepción, no la regla.

Esto importa porque si aplicas estadística "de normal" a datos que no lo son, sacas conclusiones falsas. Si calculas "a 2 sigmas del centro está el 95%" en una distribución sesgada, te equivocas: la cola derecha llega mucho más lejos de lo que la fórmula predice. Si usas la media como "valor típico" en una power law, describes a alguien que no existe. El primer mandamiento del analista es: mira la forma antes de calcular. Siempre.

### La distribución sesgada: ingresos, tiempos y pedidos

La distribución sesgada a la derecha (en inglés, right-skewed o positively skewed) es la que vas a encontrar más a menudo en tu vida como analista. Tiene un pico a la izquierda — muchos valores concentrados en la zona baja — y una cola que se extiende hacia la derecha, con cada vez menos valores pero cada vez más altos. Los sueldos de una empresa, los importes de los pedidos de un e-commerce, el tiempo que tarda un usuario en completar un formulario, los días entre que un lead entra y cierra la venta: todos tienen esta forma.

La analogía: piensa en una carrera popular de 10 km. La mayoría de corredores termina entre 45 y 60 minutos — ahí está el pico. Pero la cola derecha se estira mucho: hay gente que tarda 80 minutos, 100, incluso 150 porque se para a descansar. Nadie termina en menos de 30 (hay un límite físico a la izquierda), pero por la derecha no hay límite teórico. Esa asimetría — un tope duro a la izquierda y una cola libre a la derecha — es la razón por la que tantas métricas de negocio son sesgadas. Un pedido no puede valer menos de 0, pero por arriba no tiene techo.

Consecuencia práctica inmediata: en una distribución sesgada, la media SIEMPRE es mayor que la mediana. Cuanto más larga sea la cola, más se separan. Si ves que la media de tus pedidos es 78 euros pero la mediana es 42, ya sabes sin mirar el histograma que la distribución tiene cola derecha. Ese gap es tu señal de alarma — te está diciendo "no uses la media para describir al cliente típico".

### La distribución bimodal: dos picos, dos poblaciones

Volvamos a la historia del principio: una app de música con una "media de 23 minutos de sesión" que no representaba a nadie. Cuando dibujas el histograma, ves dos montañas: una en 4 minutos y otra en 45. Eso es una distribución bimodal — dos modas, dos picos — y es la señal más fuerte de que tienes DOS POBLACIONES MEZCLADAS en el mismo dataset. No son datos "con mucha varianza": son dos grupos diferentes que has metido en el mismo saco.

Ejemplos donde esto aparece todo el tiempo en negocio: una app con usuarios gratis y premium (los gratis usan 3 minutos al día, los premium 40); un e-commerce con clientes B2C y B2B (los B2C gastan 30-60 euros, los B2B 500-2.000); un SaaS con equipos de 1-3 personas y empresas de 50+ (el uso es completamente distinto). Si promedias un grupo con el otro, el número que sale describe un usuario ficticio que no existe en ninguno de los dos grupos.

La regla práctica ante una bimodal: SEGMENTA ANTES DE PROMEDIAR. Separa los dos grupos, calcula los estadísticos de cada uno por separado, y presenta los dos. "Los usuarios free hacen sesiones de 4 minutos de mediana; los premium, de 45. La media conjunta de 23 no describe a nadie." Esa frase es 10 veces más útil que el número solo.

Consejo de senior: si ves una varianza enorme en un dato que debería ser "razonablemente homogéneo" (tiempo de sesión, ticket medio, tiempo de respuesta), antes de asumir que hay mucho ruido, dibuja el histograma. Una varianza alta puede ser la señal de una bimodal encubierta — y la respuesta correcta no es "la varianza es alta" sino "hay dos segmentos mezclados". En la entrevista técnica, ver eso y decirlo demuestra más criterio que cualquier cálculo.

### La ley de potencias: el 20% que genera el 80%

Hay una forma de distribución aún más extrema que la sesgada: la ley de potencias (power law). Es la distribución de las desigualdades radicales. Seguidores en redes sociales: el 1% de las cuentas tiene el 90% de los seguidores. Ventas por producto: el 20% de los SKU genera el 80% de la facturación. Visitas a páginas web: unas pocas páginas acumulan casi todo el tráfico. Es el principio de Pareto llevado al extremo.

En una power law, la mediana y la media están MUY separadas, y ninguna de las dos te dice gran cosa sobre el individuo típico, porque no hay un "individuo típico": lo que hay es una masa enorme de valores pequeños y unos pocos gigantes que concentran casi todo el total. Si tienes 1.000 productos y 5 de ellos generan el 60% de la facturación, el "producto medio" es una ficción: no hay nada en el medio. Hay un océano de productos que venden poco y un puñado de superventas.

Implicación práctica: en una power law, necesitas pensar en TRAMOS, no en promedios. "El top 10% de clientes genera el X% del ingreso" es mucho más informativo que "el ingreso medio es Y". Por eso la segmentación RFM (que viste en SQL analítico) funciona tan bien en contextos de power law: divide en tramos y trata cada tramo de forma diferente, en lugar de aplicar la misma estrategia al "cliente promedio" que no existe.

### El histograma: tu primer acto como detective

El histograma es la herramienta visual para ver la distribución. No es un gráfico de barras cualquiera: las barras representan TRAMOS continuos (de 0 a 10, de 10 a 20, de 20 a 30...) y la altura es cuántos datos caen en cada tramo. A diferencia de un gráfico de barras categórico (ventas por país, usuarios por plan), en un histograma el orden y la anchura de las barras importan: están en el eje numérico.

En SQL, construyes un histograma agrupando valores en tramos, y la herramienta básica es FLOOR: la expresión FLOOR(valor / ancho) * ancho te da el inicio del tramo al que pertenece cada fila. Si el ancho es 20 y el valor es 38, FLOOR(38/20) vale 1 y el tramo empieza en 20. Eso convierte un valor continuo en una etiqueta discreta, que es justo lo que necesita un GROUP BY para poder contar cuántas filas caen en cada tramo. Cuando los tramos no pueden ser todos del mismo ancho — porque la cola se estira tanto que los últimos se quedan vacíos — se combina con un CASE WHEN, y eso lo verás más abajo.

1-- Histograma de importes de pedido con FLOOR
2-- Tramos de 20 euros: 0-20, 20-40, 40-60...
3WITH pedidos AS (
4 SELECT * FROM (VALUES
5 (8.50),(12.00),(15.90),(18.00),(22.00),(23.50),(25.00),(27.00),
6 (31.00),(34.00),(38.00),(41.00),(42.50),(45.00),(48.00),(52.00),
7 (55.00),(62.00),(78.00),(95.00),(120.00),(185.00),(340.00),(510.00)
8 ) AS t(importe)
9)
10SELECT
11 FLOOR(importe / 20) * 20 AS tramo_desde,
12 FLOOR(importe / 20) * 20 + 20 AS tramo_hasta,
13 COUNT(*) AS frecuencia,
14 REPEAT('*', COUNT(*)::INT) AS barra_visual
15FROM pedidos
16GROUP BY FLOOR(importe / 20)
17ORDER BY tramo_desde;

Un histograma en SQL puro: FLOOR agrupa valores en tramos de anchura fija

El número de tramos de un histograma cambia lo que ves. Pocos tramos (5-6) esconden detalles: una bimodal puede parecer normal si los dos picos caen en el mismo tramo. Demasiados tramos (50+) generan ruido: cada barra tiene 2-3 datos y la forma se deshace. La regla práctica: empieza con la raíz cuadrada del número de filas (1.000 filas = unos 30 tramos) y ajusta a ojo. Si sospechas una bimodal, prueba con más tramos para ver si el pico central se parte en dos.

### Implicaciones prácticas: la guía de decisión

Ahora que conoces las cuatro formas básicas, aquí va el framework de decisión que uso cada vez que abro un dataset nuevo. Son tres preguntas, en orden:

  1. 01.Dibuja el histograma (o calcula media vs mediana como proxy rápido). Responde: ¿qué forma tiene?
  2. 02.Si es sesgada: usa la mediana como cifra principal, acompaña con percentiles (p25, p75, p90). Nunca presentes solo la media.
  3. 03.Si es bimodal: NO promedies. Segmenta primero (identifica los dos grupos), calcula estadísticos separados para cada uno, y presenta los dos.
  4. 04.Si es power law: ni media ni mediana son útiles como "resumen". Habla en tramos: "el top 10% genera el X% del total". La concentración es el dato relevante, no el promedio.
  5. 05.Si es normal (raro en negocio, pero pasa): media y mediana coinciden, la desviación estándar tiene significado directo. Puedes usar ambas libremente.
El framework completo: forma → estadístico → comunicación

### Un caso real: detectar una bimodal con SQL

Vamos a reproducir el caso de la app de streaming. Tenemos una tabla de sesiones y queremos saber si la distribución de tiempos es normal (un pico), sesgada (un pico con cola) o bimodal (dos picos). La técnica es simple: construir el histograma con SQL y leer la forma en la columna de barras visuales.

1-- Detectar bimodalidad: histograma de tiempos de sesion
2WITH sesiones AS (
3 SELECT * FROM (VALUES
4 (2),(3),(3),(4),(4),(4),(5),(5),(5),(5),(6),(6),(7),
5 (35),(38),(40),(42),(42),(45),(45),(45),(48),(50),(52),(55),(58)
6 ) AS t(minutos)
7)
8SELECT
9 FLOOR(minutos / 10) * 10 AS tramo_desde,
10 FLOOR(minutos / 10) * 10 + 10 AS tramo_hasta,
11 COUNT(*) AS frecuencia,
12 REPEAT('|', COUNT(*)::INT) AS barra
13FROM sesiones
14GROUP BY FLOOR(minutos / 10)
15ORDER BY tramo_desde;

Dos picos claros: uno en 0-10 y otro en 40-60. Bimodal confirmada.

### El tramo de cierre: qué hacer cuando la cola se estira demasiado

FLOOR funciona bien mientras los datos estén en un rango razonable, pero con una cola muy larga se rompe. Si el pedido más caro es de 1.200 euros y los tramos son de 40, te salen treinta tramos y los veinte últimos tienen una fila o ninguna: el histograma se convierte en una alfombra de barras de altura 1 y la forma deja de verse. La solución es el tramo de cierre: agrupas con tramos normales hasta un umbral y todo lo que lo supera va a un cajón único, "200 o más". Se hace con un CASE WHEN alrededor del FLOOR, y lo has visto mil veces sin darle nombre: es el "más de 65 años" de cualquier tabla de población y el "más de 500 euros" de cualquier informe de ventas.

Un aviso que te va a ahorrar una tarde: en PostgreSQL y en Oracle existe una función pensada para esto, WIDTH_BUCKET(valor, min, max, cubetas), que parte un rango en N cubetas iguales y te dice en cuál cae cada fila. La verás en muchos manuales de SQL presentada como si fuese estándar. En DuckDB no existe — el editor de esta lección responde "Catalog Error: Scalar Function with name width_bucket does not exist!" — y en MySQL tampoco. Cuando el motor no la tiene, el sustituto es exactamente el CASE WHEN de aquí abajo, que además te deja poner los bordes donde tú quieras y no solo repartidos por igual.

1-- Concentracion en importes: tramos de 40 euros y un tramo de cierre
2WITH pedidos AS (
3 SELECT * FROM (VALUES
4 (5),(8),(12),(15),(18),(20),(22),(25),(28),(30),
5 (32),(35),(38),(40),(45),(52),(60),(78),(95),(110),
6 (150),(200),(340),(500),(820),(1200)
7 ) AS t(importe)
8)
9SELECT
10 CASE WHEN importe >= 200 THEN '200 o más'
11 ELSE (FLOOR(importe / 40) * 40)::INT || ' - ' || (FLOOR(importe / 40) * 40 + 40)::INT
12 END AS rango,
13 COUNT(*) AS frecuencia,
14 REPEAT('#', COUNT(*)::INT) AS barra
15FROM pedidos
16GROUP BY 1
17ORDER BY MIN(importe);

FLOOR para los tramos y un CASE para el de cierre: sin él, la cola genera seis tramos con una fila cada uno

Esto te lo van a preguntar en la entrevista: "Dame un histograma en SQL". La respuesta esperada es FLOOR(valor / ancho) * ancho + GROUP BY + COUNT. Si además añades el CASE WHEN del tramo de cierre, demuestras que has mirado datos de verdad y no solo el ejemplo del manual, porque ese detalle solo se te ocurre cuando te has peleado con una cola larga. Y un aviso: WIDTH_BUCKET, que muchos manuales presentan como LA función para esto, existe en PostgreSQL y en Oracle pero no en DuckDB ni en MySQL. Antes de citar una función en una entrevista, compruébala en el motor del que estáis hablando — queda mucho peor nombrar algo que no existe que resolverlo con FLOOR.

### Cómo describir la distribución a un stakeholder

Un director de marketing no quiere oír "la distribución es leptocurtica con sesgo positivo". Quiere oír: "la mayoría de los pedidos son de entre 20 y 50 euros, pero hay un grupo pequeño de clientes grandes que pide 500+ y arrastra la media hacia arriba. El cliente típico gasta 35 euros, no los 78 que dice el dashboard." Traducir la forma de la distribución a una frase de negocio es tan importante como calcularla.

Tres fórmulas que funcionan siempre para comunicar la forma de los datos:

  • "El cliente TÍPICO [mediana]. La media es mayor porque [explicación de la cola]."
  • "El X% de los [lo que sea] está por debajo de [umbral]. Solo el Y% supera [otro umbral]."
  • "Hay DOS grupos distintos: [grupo A, su perfil] y [grupo B, su perfil]. Promediarlos no tiene sentido."

### Nota histórica: de dónde viene la campana de Gauss

En 1809, Carl Friedrich Gauss publicó su "Theoria motus corporum coelestium", donde usaba la distribución normal para ajustar errores de medición astronómica. Su razonamiento fue al revés de lo que uno esperaría: partió de que la media aritmética tiene que ser el valor más probable de varias mediciones — que es lo que los astrónomos ya hacían por costumbre — y dedujo de ahí qué forma debía tener la curva de error para que eso fuese verdad. La forma que salió fue la campana. Antes de eso, los astrónomos descartaban mediciones "malas" a ojo; lo que Gauss les dio fue algo mejor que una regla para tirar datos: un modelo de cómo se comporta el error, con el que se puede calcular cuánto de raro es una medición en lugar de decidirlo por instinto. Las reglas concretas para descartar observaciones llegaron medio siglo más tarde, ya con ese modelo en la mano: la de Benjamin Peirce en 1852 y la de William Chauvenet en 1863.

La ironía es que Gauss desarrolló la herramienta para fenómenos FÍSICOS — donde muchos factores independientes suman — y durante 150 años se aplicó sin cuestionar a fenómenos SOCIALES y ECONÓMICOS, donde NO se da esa suma de independientes. Los ingresos no son la suma de muchos factorcitos iguales: hay retroalimentación (quien más tiene, más gana), barreras de entrada, y monopolios. Por eso los sueldos NO son normales y los precios de las acciones NO son normales: Mandelbrot lo demostró en 1963 estudiando el precio del algodón, y la industria financiera tardó más de cuarenta años en prestarle atención de verdad (hasta la crisis de 2008).

La mayoría de métricas de negocio caen en la columna derecha

### Resumen: la checklist antes de reportar un número

  1. 01.Calcula media Y mediana. Si difieren más del 20-30%, la distribución es sesgada y la media engaña.
  2. 02.Dibuja (o calcula) el histograma. Busca: un pico (normal/sesgada), dos picos (bimodal), o un pico extremo a la izquierda con cola infinita (power law).
  3. 03.Si es sesgada: reporta la mediana y acompaña con percentiles.
  4. 04.Si es bimodal: segmenta y reporta cada grupo por separado.
  5. 05.Si es power law: reporta la concentración ("el top X% genera Y%") y usa percentiles altos (p90, p95, p99).
  6. 06.Nunca presentes un solo número sin saber qué forma tienen los datos que lo generan.

Regístrate para guardar tu progreso.

## comentarios

Reporta erratas, ayuda a otros o comparte tu opinión. Sé constructivo.

Inicia sesión para comentar y responder.

cargando comentarios...