Saltar al contenido

lección 8

¿Qué hace un ingeniero de datos? Tu futuro trabajo explicado

El rol, el día a día, las habilidades que necesitas y lo que aprenderás en las siguientes skills. Tu mapa de ruta.

45 min

Has llegado a la penúltima lección de Fundamentos. Ya sabes qué son los datos, cómo se almacenan, qué formatos existen, qué es una base de datos y cómo fluyen los datos en un pipeline. Ahora toca hablar de TI: la persona que hace que todo esto funcione. El ingeniero de datos. Es tu futuro trabajo, y quiero que entiendas exactamente qué vas a hacer, por qué es valioso y qué habilidades necesitarás dominar (spoiler: las aprenderás en las siguientes skills).

Volvamos a la analogía del restaurante. El analista de datos es el chef: decide qué cocinar y presenta platos hermosos. El científico de datos es el chef investigador: experimenta con nuevas recetas y técnicas moleculares. El ingeniero de datos es el que construye la cocina: instala el gas, conecta el agua, monta la cámara frigorífica, negocia con proveedores para que los ingredientes lleguen frescos cada mañana a las 6AM, y cuando a las 2AM se rompe la cámara, se levanta a arreglarla para que mañana haya servicio.

### El día a día: qué haces de 9 a 18

Un día típico de un ingeniero de datos mid-level en una empresa mediana podría ser así:

  • 9:00 — Revisas los dashboards de monitorización: ¿todos los pipelines de la noche se ejecutaron correctamente? Si alguno falló, investigas por qué.
  • 9:30 — Un pipeline falló porque la API del proveedor de pagos cambió un campo de "amount" a "total_amount". Actualizas tu script y lo relanzas.
  • 10:00 — Reunión con el equipo de producto: quieren un nuevo dato en su dashboard ("tasa de abandono de carrito por hora"). Discutes cómo calcularlo y de dónde sacar los datos.
  • 11:00 — Desarrollas el nuevo pipeline: lees eventos de la app, filtras los de tipo "añadir al carrito" y "compra", calculas la tasa de abandono y la cargas en la tabla del dashboard.
  • 13:00 — Almuerzo.
  • 14:00 — Code review del trabajo de un compañero: un pipeline nuevo que ingesta datos de redes sociales. Le sugieres añadir reintentos y manejo de errores.
  • 15:30 — El equipo de finanzas reporta que "los números no cuadran". Investigas: resulta que un cambio de zona horaria hizo que se contaran pedidos del día anterior.
  • 17:00 — Documentas el pipeline nuevo y escribes tests para verificar que funciona con datos de ejemplo.
La realidad del trabajo: no es 100% código — la comunicación y el mantenimiento importan igual

Consejo de senior: el código que escribes es menos del 50% del trabajo. El resto es entender qué se necesita, investigar cuándo algo falla, comunicar con otros equipos y documentar para que tu futuro yo (o tu compañero) entienda lo que hiciste. Si solo te gusta escribir código y odias hablar con gente, vas a sufrir. Si te gusta resolver problemas y trabajar en equipo, vas a brillar.

### Las habilidades que necesitas (y que vas a aprender)

Ahora que entiendes el contexto, veamos qué herramientas y habilidades necesita un ingeniero de datos moderno. La buena noticia: vas a aprender todas en este curso. Cada una es una Skill que viene después de esta. Aquí te explico por qué cada una importa:

  1. 01.Docker (Skill siguiente): entornos reproducibles para levantar bases de datos, servicios y pipelines en segundos, sin ensuciar tu máquina.
  2. 02.SQL (dos skills más): el lenguaje para hablar con bases de datos. Lo usarás TODOS los días. Es como el inglés del mundo de datos — si no lo dominas, no puedes trabajar.
  3. 03.Python avanzado para datos: ya sabes Python básico. Ahora aprenderás librerías especializadas para leer datos de cualquier fuente, limpiarlos eficientemente y automatizar tareas.
  4. 04.Modelado de datos: cómo diseñar tablas que respondan preguntas de negocio rápidamente. No es solo "guardar datos" — es organizarlos para que sean ÚTILES.
  5. 05.Formatos y almacenamiento moderno: profundizar en Parquet, aprender a organizar millones de archivos en zonas, entender cuándo necesitas un "lago de datos".
  6. 06.Procesamiento distribuido: cuando los datos son tan grandes que un solo ordenador no puede. Aprenderás a procesar terabytes usando decenas de máquinas en paralelo.
  7. 07.Orquestación: cómo hacer que tus pipelines se ejecuten solos cada día, con reintentos automáticos, alertas cuando fallan y dependencias entre tareas.
  8. 08.Cloud: la infraestructura moderna donde todo vive. Almacenamiento infinito, procesamiento elástico y pago por uso.

### Junior, Mid, Senior: la progresión de carrera

Como en cualquier profesión, hay niveles. Un junior (0-2 años) construye pipelines con supervisión, sigue patrones establecidos y aprende el dominio del negocio. Un mid (2-5 años) diseña pipelines complejos de forma autónoma, optimiza los existentes y propone mejoras. Un senior (5+ años) define la arquitectura de datos de la empresa, toma decisiones técnicas de alto impacto, mentoriza juniors y negocia con otros equipos.

  • Junior: "construyo el pipeline que me piden, pregunto cuando me atasque".
  • Mid: "diseño el pipeline, elijo las herramientas y lo pongo en producción".
  • Senior: "defino cómo hacemos datos en esta empresa, guío al equipo y evito que repitamos errores del pasado".

Al terminar este curso completo estarás entre junior avanzado y mid. Tendrás las habilidades técnicas para construir pipelines reales, usar herramientas de la industria y trabajar con datos en la nube. La experiencia de producción real la ganarás en tu primer trabajo — pero llegarás con una base sólida que muchos juniors no tienen.

### El mercado laboral: datos reales

La ingeniería de datos es una de las profesiones tecnológicas con más demanda y mejores salarios. No te voy a vender humo con cifras exactas porque varían mucho por país y empresa, pero sí te doy contexto: en España, un junior cobra entre 28-38K€, un mid entre 40-55K€ y un senior entre 55-80K€ (datos 2024-2026, revisar anualmente). En Latinoamérica los números son diferentes pero la proporción es similar. En remoto para empresas de EE.UU. o Europa, los salarios pueden ser significativamente más altos.

La demanda es alta porque TODAS las empresas que generan datos necesitan ingenieros de datos, y hoy eso incluye prácticamente toda empresa con más de 50 empleados. Hay más ofertas que candidatos cualificados. Y la palabra clave es "cualificados" — saber hacer un SELECT no te hace ingeniero de datos. Dominar SQL, Python, modelado, pipelines y cloud sí.

Realismo profesional: no esperes conseguir trabajo con solo terminar un curso online. Este curso te da las habilidades técnicas, pero las empresas también buscan experiencia. Tu estrategia debe ser: 1) dominar las habilidades, 2) construir proyectos que puedas enseñar (los harás en la sección Mundo Real), 3) contribuir a proyectos open-source o publicar tu trabajo, 4) aplicar a posiciones junior con confianza.

### Lo que viene a continuación

Has completado los Fundamentos. Ahora sabes QUÉ son los datos, CÓMO se almacenan y POR QUÉ importan. La siguiente Skill es Docker — que te permitirá levantar cualquier herramienta (incluida tu primera base de datos) en segundos. Después viene SQL: el lenguaje que usarás para hablar con bases de datos, con 50 años de historia y que sigue siendo el estándar indiscutible de la industria.

  1. 01.Siguiente: Docker — entornos reproducibles para levantar PostgreSQL, Redis y más en segundos.
  2. 02.Después: SQL — instalarás una base de datos (con Docker) y aprenderás a consultar datos.
  3. 03.Después: Python avanzado — librerías profesionales para datos.
  4. 04.Luego: Modelado — cómo diseñar sistemas de datos que respondan preguntas de negocio.
  5. 05.Finalmente: Cloud — infraestructura moderna donde vive todo.

Mi último consejo de esta Skill: la curiosidad es tu superpoder. Cada vez que uses una app, compres algo online o veas una recomendación de Netflix, pregúntate "¿cómo habrán montado esto? ¿qué datos estarán usando? ¿qué pipeline genera este resultado?". Esa curiosidad te hará aprender más rápido que cualquier curso.

### Resumen de toda la Skill

  1. 01.Los datos son hechos en bruto que se convierten en información y decisiones a través de contexto y análisis.
  2. 02.La historia va de tarjetas perforadas → cintas → relacional → internet masivo → nube. Cada era resolvió las limitaciones de la anterior.
  3. 03.Datos estructurados (tablas), semiestructurados (JSON) y no estructurados (imágenes) tienen usos diferentes.
  4. 04.CSV es simple pero traicionero; JSON es flexible pero verboso; Parquet es binario, columnar y eficiente.
  5. 05.Las bases de datos son programas especializados en servir datos con garantías de seguridad y velocidad.
  6. 06.Un pipeline (ETL) extrae, transforma y carga datos desde orígenes a destinos pasando por zonas.
  7. 07.El ingeniero de datos construye y mantiene toda esta infraestructura para que el negocio tome mejores decisiones.

## ejercicios

[01]

Clasifica tareas del día a día

Clasifica cada tarea como "construir", "mantener" o "comunicar". El contador de abajo solo admite esas tres palabras.

💡 Resultado esperado

  [ construir] Escribir un pipeline nuevo que ingesta datos de la API de pagos
  [  mantener] Investigar por qué el reporte de ayer tiene datos incorrectos
  [ comunicar] Reunión con marketing para entender qué métricas necesitan
  [  mantener] Optimizar una consulta que tarda 30 minutos en ejecutarse
Cargando editor...
[02]

Mapea skills a tareas del ingeniero

Cada tarea requiere una skill concreta. Hay siete tareas y siete skills: cada una se usa una vez.

💡 Resultado esperado

  [          sql] Consultar la tabla de pedidos para obtener ventas por mes
  [       python] Escribir un script que lee un JSON y lo limpia
  [     modelado] Diseñar las tablas para un sistema de facturación
  [      parquet] Convertir CSVs diarios a formato columnar comprimido
Cargando editor...
[03]

Elige el formato: aplica la regla

No de memoria: aplica la regla en orden. 1) persona→csv 2) línea a línea→jsonl 3) >1M registros→parquet 4) anidado→json 5) otro→csv.

💡 Resultado esperado

  [    csv] 200 productos al proveedor por email
  [parquet] 3 años de eventos para análisis mensual
  [   json] Respuesta de una API con datos anidados
  [  jsonl] Log de 10M de eventos, línea a línea
Cargando editor...
[04]

Tu pipeline completo: de raw a decisión

Ventas del Black Friday con errores. Filtra, calcula facturación y agrega por categoría. La categoría ganadora se promociona el año siguiente.

💡 Resultado esperado

Registros válidos: 5 de 8
=== FACTURACIÓN POR CATEGORÍA (Black Friday) ===
  consolas     →   131,497.00€
  juegos       →    24,496.50€
Cargando editor...

Regístrate para guardar tu progreso.

## comentarios

Reporta erratas, ayuda a otros o comparte tu opinión. Sé constructivo.

Inicia sesión para comentar y responder.

cargando comentarios...