Saltar al contenido
BásicoArturo Lorenzo·21 de agosto de 2026·10 min

Científico de datos: el oficio de predecir con matemáticas (explicado sin fórmulas)

Seis paradas: de qué problema resuelve un científico de datos a cómo empezar el camino

Spotify te pone una playlist el lunes que parece que te ha leído la mente. Tu banco te manda un aviso: "Ojo, este cargo no parece tuyo". Una tienda online te enseña exactamente los productos que ibas a buscar. Detrás de cada una de esas cosas hay alguien que ha construido un modelo que aprende de lo que ya ha pasado para predecir lo que va a pasar. Esa persona es el científico de datos, y su trabajo se parece más a ser meteorólogo que a ser mago.

Este artículo es para alguien que ha oído el término, le suena a ciencia ficción y quiere saber de qué va sin que le suelten fórmulas ni acrónimos incomprensibles. Vamos desde cero.

### 1. El problema: necesitamos predecir, no solo contar

El analista de datos mira el pasado y te dice qué ha pasado: "Las ventas cayeron un 12% en marzo". Muy útil. Pero la empresa necesita más: necesita saber qué va a pasar para poder anticiparse. "¿Cuántos clientes se van a dar de baja el mes que viene?" "¿Qué precio maximiza el beneficio?" "¿Este correo es spam o no?" Esas preguntas no se responden mirando una tabla. Se responden construyendo un modelo que aprenda de los patrones del pasado para hacer predicciones sobre el futuro.

Piénsalo como un meteorólogo. El meteorólogo no adivina si va a llover: mira presiones, temperaturas, humedad y vientos de los últimos días, los mete en un modelo y el modelo dice "hay un 80% de probabilidades de lluvia mañana". No es magia ni bola de cristal: es experiencia pasada convertida en una máquina de predecir. El científico de datos hace lo mismo, pero en vez de lluvias predice comportamientos de clientes, fallos de máquinas o fraudes en tarjetas de crédito.

No es una bola de cristal: es experiencia convertida en probabilidades

### 2. Un poco de historia: de la estadística al machine learning

El término "data scientist" lo popularizó LinkedIn alrededor de 2008, pero la idea es mucho más vieja. La estadística lleva siglos prediciendo cosas: cosechas, epidemias, resultados electorales. Lo que cambió no fue la idea sino la potencia. Cuando tienes un ordenador que puede procesar millones de datos en segundos, los modelos que antes eran teóricos de repente se vuelven prácticos. Ya no calculas a mano sobre 50 datos: dejas que la máquina aprenda de 50 millones.

De ahí viene el nombre "machine learning" (aprendizaje automático): la máquina aprende patrones sola, sin que nadie le programe cada regla. Tú le das miles de ejemplos de correos que son spam y miles que no lo son, y ella aprende a distinguirlos. Le das miles de clientes que se fueron y miles que se quedaron, y ella aprende qué señales predicen una baja. El científico de datos es quien elige qué modelo usar, lo alimenta con los datos correctos, evalúa si funciona bien y lo mejora hasta que las predicciones sean útiles.

### 3. El día a día: hipótesis, experimentos y "volver a empezar"

El trabajo diario se parece más a la investigación científica que a la programación. Un jueves cualquiera:

  • Reunirse con producto para entender el problema: "Queremos reducir la tasa de abandono del carrito de compra".
  • Formular una hipótesis: "Los clientes que abandonan tienen carritos más caros y llevan menos tiempo registrados".
  • Explorar los datos para ver si la hipótesis se sostiene. Aquí entra el SQL y el análisis exploratorio.
  • Elegir un modelo y entrenarlo: darle datos históricos para que aprenda los patrones.
  • Evaluar: ¿predice bien? ¿Acierta un 60% o un 90%? ¿Se equivoca de forma peligrosa?
  • Iterar: cambiar variables, probar otro modelo, limpiar mejor los datos. Repetir hasta que funcione.
  • Presentar los resultados y decidir con el equipo si el modelo es lo bastante bueno para usarlo en producción.

Lo que nadie te dice es que el 80% del tiempo no es "construir modelos sofisticados" sino preparar los datos, explorar si hay suficiente información para predecir algo útil y descartar hipótesis que parecían buenas y resultaron no serlo. Es frustrante a veces, pero es el método científico: la mayoría de los caminos son callejones sin salida, y encontrar el que funciona es el valor del oficio.

El glamour del machine learning: iterar, fallar, iterar, fallar, y al final encontrar el modelo que funciona

### 4. Las herramientas: Python, estadística y paciencia

La herramienta número uno es Python. A diferencia del analista, que vive en SQL y usa Python de vez en cuando, el científico de datos vive en Python y usa SQL para sacar los datos que necesita. Python tiene librerías (paquetes de herramientas ya hechas) que hacen todo el trabajo pesado de los modelos. La más famosa se llama scikit-learn, y con ella puedes entrenar un modelo de predicción en pocas líneas:

1# Predecir que clientes se van a dar de baja
2# (version simplificada para que se entienda la idea)
3
4from sklearn.ensemble import RandomForestClassifier
5from sklearn.model_selection import train_test_split
6import pandas as pd
7
8# 1. Cargar los datos historicos de clientes
9clientes = pd.read_csv("clientes_historico.csv")
10
11# 2. Separar: datos para entrenar y datos para evaluar
12X = clientes[['antiguedad_meses', 'gasto_mensual', 'incidencias']]
13y = clientes['se_dio_de_baja'] # 1 = si, 0 = no
14
15X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3)
16
17# 3. Entrenar el modelo: aprende de los ejemplos pasados
18modelo = RandomForestClassifier()
19modelo.fit(X_train, y_train)
20
21# 4. Evaluar: que tal predice con datos que no ha visto?
22precision = modelo.score(X_test, y_test)
23print(f"Acierta el {precision:.0%} de las veces")
24# -> "Acierta el 84% de las veces"

No hay magia: le das ejemplos, aprende, y luego predice. Así funciona el machine learning

Además de Python y sus librerías, el científico de datos necesita estadística. No hace falta ser un genio de las matemáticas, pero sí entender conceptos como probabilidad, distribuciones, correlación y significancia estadística. La estadística es la que te dice si tu modelo es bueno de verdad o si estás viendo patrones donde no los hay (como cuando ves caras en las nubes).

Y luego están los A/B tests: experimentos controlados donde divides a los usuarios en dos grupos, les enseñas algo distinto y mides cuál funciona mejor. "¿El botón rojo vende más que el azul?" No es una opinión: es un experimento con datos y una respuesta estadísticamente sólida. El científico de datos diseña el experimento, calcula cuántos usuarios necesita, recoge los datos y dice si la diferencia es real o es casualidad.

La estadística asusta a mucha gente, pero el 90% de lo que usa un científico de datos en el día a día cabe en un cuatrimestre de universidad. No necesitas un doctorado en matemáticas. Necesitas entender bien los fundamentos y saber cuándo un resultado es fiable y cuándo te estás engañando. Eso se aprende practicando con datos reales, no memorizando fórmulas.

### 5. En qué se diferencia del analista y del ingeniero

Los tres trabajan con datos, pero responden preguntas distintas y miran en direcciones distintas. Piénsalo como tres personas en un hospital:

El ingeniero de datos es el técnico de laboratorio: mantiene las máquinas, calibra los equipos y se asegura de que las muestras de sangre lleguen en buen estado al médico. El analista de datos es el médico de cabecera: lee los resultados de las pruebas, te dice qué tienes y te recomienda qué hacer. El científico de datos es el investigador clínico: diseña ensayos, prueba tratamientos nuevos y busca patrones que nadie ha visto antes para curar enfermedades que hoy no tienen cura.

El científico mira al futuro, pero necesita lo que los otros dos construyen y descubren

El matiz importante: el científico de datos no trabaja en el vacío. Necesita los datos limpios que el ingeniero prepara (sin tuberías no hay datos que modelar) y muchas veces las preguntas que el analista plantea son las que disparan la investigación ("oye, he visto que los clientes que compran A nunca vuelven a comprar B, ¿se puede predecir quién va a dejar de comprar?").

### 6. Qué buscan las empresas (y la realidad del rol)

Las ofertas de científico de datos suelen pedir Python sólido, conocimientos de estadística y machine learning, y experiencia con librerías como scikit-learn, pandas y algún framework de deep learning (redes neuronales). En España, un perfil junior se mueve entre los 30.000 y los 38.000 euros al año, y con experiencia sube bastante (50.000+ no es raro con tres o cuatro años).

Pero hay una realidad que las ofertas no cuentan: muchas empresas que buscan un "científico de datos" en realidad necesitan un analista con algo de Python. Si la empresa no tiene datos limpios, no tiene un ingeniero que los prepare, y no tiene un problema que requiera predicción, no necesita ciencia de datos. Necesita análisis. Esto es importante al buscar trabajo: pregunta siempre en la entrevista "¿tenéis los datos preparados para modelar?" y "¿qué problema concreto queréis predecir?". Si no tienen respuesta clara, probablemente el día a día va a ser más de analista que de científico.

Cuidado con la trampa del "científico de datos en empresa que no tiene datos". Es más común de lo que parece. Si la empresa no tiene pipelines de datos montados, no tiene un data warehouse y no tiene preguntas claras que requieran predicción, vas a acabar haciendo de ingeniero, analista y científico a la vez, mal las tres. Pregunta siempre por la madurez de datos de la empresa antes de aceptar una oferta.

### 7. Cómo se empieza desde cero

El camino del científico de datos es el más largo de los tres roles, porque necesitas piezas de los otros dos más una capa propia. El orden sensato:

  1. 01.Aprende Python hasta sentirte cómodo manipulando datos: pandas, leer ficheros, limpiar tablas, hacer gráficos.
  2. 02.Aprende SQL lo suficiente para sacar los datos que necesites de una base de datos. No necesitas ser un experto como el analista, pero sí manejarte.
  3. 03.Aprende estadística fundamental: probabilidad, distribuciones, correlación, tests de hipótesis. No con fórmulas abstractas: con datos reales y preguntas concretas.
  4. 04.Aprende machine learning básico: qué es un modelo de clasificación, uno de regresión, cómo se entrena, cómo se evalúa, qué es el overfitting (cuando el modelo se aprende los datos de memoria en vez de aprender los patrones).
  5. 05.Construye proyectos de principio a fin: desde la pregunta hasta la predicción. Un modelo que predice algo útil con datos reales vale más en una entrevista que diez certificados.

Y un consejo que me habría ahorrado meses: no empieces por deep learning ni por inteligencia artificial generativa. Empieza por lo simple. Un modelo de regresión logística bien hecho resuelve el 80% de los problemas de negocio, y te enseña los fundamentos que necesitas para todo lo demás. La gente que empieza por redes neuronales y GPTs sin entender estadística básica construye castillos en el aire.

Resumiendo: el científico de datos predice y experimenta. Responde "¿qué va a pasar?" y "¿por qué pasó?" usando modelos que aprenden de los datos del pasado. Necesita Python, estadística y paciencia para iterar. Depende del ingeniero (que le da datos limpios) y del analista (que le plantea las preguntas del negocio). Es el camino más largo de los tres roles, pero también el que tiene más profundidad técnica y, cuando se aplica bien, más impacto directo en las decisiones de la empresa. Si te gusta la idea de enseñarle a una máquina a distinguir patrones y hacer predicciones útiles, este es tu sitio.

$ whoami

Regístrate gratis para dar like, guardar posts en carpetas y recibir nuevos artículos por email.

Leer está bien. Ejecutar está mejor.

## comentarios

¿Te ha servido? ¿Añadirías algo? ¿Lo has vivido de otra forma en tu trabajo? Cuéntalo.

Inicia sesión para comentar y responder.

cargando comentarios...