lección 8
¿Qué hace un ingeniero de datos? Tu futuro trabajo explicado
El rol, el día a día, las habilidades que necesitas y lo que aprenderás en las siguientes skills. Tu mapa de ruta.
⏱ 45 min
Has llegado a la penúltima lección de Fundamentos. Ya sabes qué son los datos, cómo se almacenan, qué formatos existen, qué es una base de datos y cómo fluyen los datos en un pipeline. Ahora toca hablar de TI: la persona que hace que todo esto funcione. El ingeniero de datos. Es tu futuro trabajo, y quiero que entiendas exactamente qué vas a hacer, por qué es valioso y qué habilidades necesitarás dominar (spoiler: las aprenderás en las siguientes skills).
Volvamos a la analogía del restaurante. El analista de datos es el chef: decide qué cocinar y presenta platos hermosos. El científico de datos es el chef investigador: experimenta con nuevas recetas y técnicas moleculares. El ingeniero de datos es el que construye la cocina: instala el gas, conecta el agua, monta la cámara frigorífica, negocia con proveedores para que los ingredientes lleguen frescos cada mañana a las 6AM, y cuando a las 2AM se rompe la cámara, se levanta a arreglarla para que mañana haya servicio.
### El día a día: qué haces de 9 a 18
Un día típico de un ingeniero de datos mid-level en una empresa mediana podría ser así:
- 9:00 — Revisas los dashboards de monitorización: ¿todos los pipelines de la noche se ejecutaron correctamente? Si alguno falló, investigas por qué.
- 9:30 — Un pipeline falló porque la API del proveedor de pagos cambió un campo de "amount" a "total_amount". Actualizas tu script y lo relanzas.
- 10:00 — Reunión con el equipo de producto: quieren un nuevo dato en su dashboard ("tasa de abandono de carrito por hora"). Discutes cómo calcularlo y de dónde sacar los datos.
- 11:00 — Desarrollas el nuevo pipeline: lees eventos de la app, filtras los de tipo "añadir al carrito" y "compra", calculas la tasa de abandono y la cargas en la tabla del dashboard.
- 13:00 — Almuerzo.
- 14:00 — Code review del trabajo de un compañero: un pipeline nuevo que ingesta datos de redes sociales. Le sugieres añadir reintentos y manejo de errores.
- 15:30 — El equipo de finanzas reporta que "los números no cuadran". Investigas: resulta que un cambio de zona horaria hizo que se contaran pedidos del día anterior.
- 17:00 — Documentas el pipeline nuevo y escribes tests para verificar que funciona con datos de ejemplo.
Consejo de senior: el código que escribes es menos del 50% del trabajo. El resto es entender qué se necesita, investigar cuándo algo falla, comunicar con otros equipos y documentar para que tu futuro yo (o tu compañero) entienda lo que hiciste. Si solo te gusta escribir código y odias hablar con gente, vas a sufrir. Si te gusta resolver problemas y trabajar en equipo, vas a brillar.
### Las habilidades que necesitas (y que vas a aprender)
Ahora que entiendes el contexto, veamos qué herramientas y habilidades necesita un ingeniero de datos moderno. La buena noticia: vas a aprender todas en este curso. Cada una es una Skill que viene después de esta. Aquí te explico por qué cada una importa:
- 01.Docker (Skill siguiente): entornos reproducibles para levantar bases de datos, servicios y pipelines en segundos, sin ensuciar tu máquina.
- 02.SQL (dos skills más): el lenguaje para hablar con bases de datos. Lo usarás TODOS los días. Es como el inglés del mundo de datos — si no lo dominas, no puedes trabajar.
- 03.Python avanzado para datos: ya sabes Python básico. Ahora aprenderás librerías especializadas para leer datos de cualquier fuente, limpiarlos eficientemente y automatizar tareas.
- 04.Modelado de datos: cómo diseñar tablas que respondan preguntas de negocio rápidamente. No es solo "guardar datos" — es organizarlos para que sean ÚTILES.
- 05.Formatos y almacenamiento moderno: profundizar en Parquet, aprender a organizar millones de archivos en zonas, entender cuándo necesitas un "lago de datos".
- 06.Procesamiento distribuido: cuando los datos son tan grandes que un solo ordenador no puede. Aprenderás a procesar terabytes usando decenas de máquinas en paralelo.
- 07.Orquestación: cómo hacer que tus pipelines se ejecuten solos cada día, con reintentos automáticos, alertas cuando fallan y dependencias entre tareas.
- 08.Cloud: la infraestructura moderna donde todo vive. Almacenamiento infinito, procesamiento elástico y pago por uso.
### Junior, Mid, Senior: la progresión de carrera
Como en cualquier profesión, hay niveles. Un junior (0-2 años) construye pipelines con supervisión, sigue patrones establecidos y aprende el dominio del negocio. Un mid (2-5 años) diseña pipelines complejos de forma autónoma, optimiza los existentes y propone mejoras. Un senior (5+ años) define la arquitectura de datos de la empresa, toma decisiones técnicas de alto impacto, mentoriza juniors y negocia con otros equipos.
- Junior: "construyo el pipeline que me piden, pregunto cuando me atasque".
- Mid: "diseño el pipeline, elijo las herramientas y lo pongo en producción".
- Senior: "defino cómo hacemos datos en esta empresa, guío al equipo y evito que repitamos errores del pasado".
Al terminar este curso completo estarás entre junior avanzado y mid. Tendrás las habilidades técnicas para construir pipelines reales, usar herramientas de la industria y trabajar con datos en la nube. La experiencia de producción real la ganarás en tu primer trabajo — pero llegarás con una base sólida que muchos juniors no tienen.
### El mercado laboral: datos reales
La ingeniería de datos es una de las profesiones tecnológicas con más demanda y mejores salarios. No te voy a vender humo con cifras exactas porque varían mucho por país y empresa, pero sí te doy contexto: en España, un junior cobra entre 28-38K€, un mid entre 40-55K€ y un senior entre 55-80K€ (datos 2024-2026, revisar anualmente). En Latinoamérica los números son diferentes pero la proporción es similar. En remoto para empresas de EE.UU. o Europa, los salarios pueden ser significativamente más altos.
La demanda es alta porque TODAS las empresas que generan datos necesitan ingenieros de datos, y hoy eso incluye prácticamente toda empresa con más de 50 empleados. Hay más ofertas que candidatos cualificados. Y la palabra clave es "cualificados" — saber hacer un SELECT no te hace ingeniero de datos. Dominar SQL, Python, modelado, pipelines y cloud sí.
Realismo profesional: no esperes conseguir trabajo con solo terminar un curso online. Este curso te da las habilidades técnicas, pero las empresas también buscan experiencia. Tu estrategia debe ser: 1) dominar las habilidades, 2) construir proyectos que puedas enseñar (los harás en la sección Mundo Real), 3) contribuir a proyectos open-source o publicar tu trabajo, 4) aplicar a posiciones junior con confianza.
### Lo que viene a continuación
Has completado los Fundamentos. Ahora sabes QUÉ son los datos, CÓMO se almacenan y POR QUÉ importan. La siguiente Skill es Docker — que te permitirá levantar cualquier herramienta (incluida tu primera base de datos) en segundos. Después viene SQL: el lenguaje que usarás para hablar con bases de datos, con 50 años de historia y que sigue siendo el estándar indiscutible de la industria.
- 01.Siguiente: Docker — entornos reproducibles para levantar PostgreSQL, Redis y más en segundos.
- 02.Después: SQL — instalarás una base de datos (con Docker) y aprenderás a consultar datos.
- 03.Después: Python avanzado — librerías profesionales para datos.
- 04.Luego: Modelado — cómo diseñar sistemas de datos que respondan preguntas de negocio.
- 05.Finalmente: Cloud — infraestructura moderna donde vive todo.
Mi último consejo de esta Skill: la curiosidad es tu superpoder. Cada vez que uses una app, compres algo online o veas una recomendación de Netflix, pregúntate "¿cómo habrán montado esto? ¿qué datos estarán usando? ¿qué pipeline genera este resultado?". Esa curiosidad te hará aprender más rápido que cualquier curso.
### Resumen de toda la Skill
- 01.Los datos son hechos en bruto que se convierten en información y decisiones a través de contexto y análisis.
- 02.La historia va de tarjetas perforadas → cintas → relacional → internet masivo → nube. Cada era resolvió las limitaciones de la anterior.
- 03.Datos estructurados (tablas), semiestructurados (JSON) y no estructurados (imágenes) tienen usos diferentes.
- 04.CSV es simple pero traicionero; JSON es flexible pero verboso; Parquet es binario, columnar y eficiente.
- 05.Las bases de datos son programas especializados en servir datos con garantías de seguridad y velocidad.
- 06.Un pipeline (ETL) extrae, transforma y carga datos desde orígenes a destinos pasando por zonas.
- 07.El ingeniero de datos construye y mantiene toda esta infraestructura para que el negocio tome mejores decisiones.
## ejercicios
Clasifica tareas del día a día
Clasifica cada tarea como "construir", "mantener" o "comunicar". El contador de abajo solo admite esas tres palabras.
💡 Resultado esperado
[ construir] Escribir un pipeline nuevo que ingesta datos de la API de pagos [ mantener] Investigar por qué el reporte de ayer tiene datos incorrectos [ comunicar] Reunión con marketing para entender qué métricas necesitan [ mantener] Optimizar una consulta que tarda 30 minutos en ejecutarse
Mapea skills a tareas del ingeniero
Cada tarea requiere una skill concreta. Hay siete tareas y siete skills: cada una se usa una vez.
💡 Resultado esperado
[ sql] Consultar la tabla de pedidos para obtener ventas por mes [ python] Escribir un script que lee un JSON y lo limpia [ modelado] Diseñar las tablas para un sistema de facturación [ parquet] Convertir CSVs diarios a formato columnar comprimido
Elige el formato: aplica la regla
No de memoria: aplica la regla en orden. 1) persona→csv 2) línea a línea→jsonl 3) >1M registros→parquet 4) anidado→json 5) otro→csv.
💡 Resultado esperado
[ csv] 200 productos al proveedor por email [parquet] 3 años de eventos para análisis mensual [ json] Respuesta de una API con datos anidados [ jsonl] Log de 10M de eventos, línea a línea
Tu pipeline completo: de raw a decisión
Ventas del Black Friday con errores. Filtra, calcula facturación y agrega por categoría. La categoría ganadora se promociona el año siguiente.
💡 Resultado esperado
Registros válidos: 5 de 8 === FACTURACIÓN POR CATEGORÍA (Black Friday) === consolas → 131,497.00€ juegos → 24,496.50€
Regístrate para guardar tu progreso.
## comentarios
Reporta erratas, ayuda a otros o comparte tu opinión. Sé constructivo.
Inicia sesión para comentar y responder.
cargando comentarios...