Saltar al contenido

[12]Data Lakes y formatos modernos

intermedio8 lecciones

Del warehouse al lago de datos: zonas raw/silver/gold, Parquet en profundidad, particionado, Apache Iceberg, Delta Lake, time travel y el paradigma lakehouse.

[01]

El lago de datos: cuando el warehouse se quedó pequeño

Historia y motivación del data lake. Qué problema resuelve, cómo se diferencia del warehouse, el data swamp y por qué cambió la industria.

50 min
[02]

Zonas del lago: raw, silver y gold — del caos al orden

La arquitectura medallion que convierte el caos del data lake en un sistema organizado con capas de calidad creciente.

55 min
[03]

Parquet: el formato que cambió las reglas del juego

Row groups, column chunks, compresión, predicate pushdown, estadísticas y demo completa con PyArrow. El formato que usarás cada día.

60 min
[04]

Particionado: organizar terabytes para encontrar lo que necesitas

Hive-style partitioning, partition pruning, el small file problem y estrategias para organizar datos masivos de forma eficiente.

55 min
[05]

Apache Iceberg: transacciones ACID sobre el lago

Qué problema resuelve Iceberg, cómo funciona su capa de metadata, snapshots, manifest files y merge-on-read vs copy-on-write.

55 min
[06]

Time travel y versionado: volver al pasado de tus datos

Snapshots, rollback, auditoría temporal, branching y cherry-pick. El killer feature de los table formats modernos.

50 min
[07]

Delta Lake y el ecosistema de table formats

Delta Lake en profundidad, MERGE INTO, vacuum, optimize, y comparación objetiva Delta vs Iceberg vs Hudi.

50 min
[08]

Catálogos y gobernanza: saber qué datos tienes y quién puede verlos

Data catalogs, descubrimiento, linaje, permisos, data contracts y el arte de gobernar un data lake sin convertirlo en pantano.

50 min

## recursos