[12]Data Lakes y formatos modernos
Del warehouse al lago de datos: zonas raw/silver/gold, Parquet en profundidad, particionado, Apache Iceberg, Delta Lake, time travel y el paradigma lakehouse.
El lago de datos: cuando el warehouse se quedó pequeño
Historia y motivación del data lake. Qué problema resuelve, cómo se diferencia del warehouse, el data swamp y por qué cambió la industria.
Zonas del lago: raw, silver y gold — del caos al orden
La arquitectura medallion que convierte el caos del data lake en un sistema organizado con capas de calidad creciente.
Parquet: el formato que cambió las reglas del juego
Row groups, column chunks, compresión, predicate pushdown, estadísticas y demo completa con PyArrow. El formato que usarás cada día.
Particionado: organizar terabytes para encontrar lo que necesitas
Hive-style partitioning, partition pruning, el small file problem y estrategias para organizar datos masivos de forma eficiente.
Apache Iceberg: transacciones ACID sobre el lago
Qué problema resuelve Iceberg, cómo funciona su capa de metadata, snapshots, manifest files y merge-on-read vs copy-on-write.
Time travel y versionado: volver al pasado de tus datos
Snapshots, rollback, auditoría temporal, branching y cherry-pick. El killer feature de los table formats modernos.
Delta Lake y el ecosistema de table formats
Delta Lake en profundidad, MERGE INTO, vacuum, optimize, y comparación objetiva Delta vs Iceberg vs Hudi.
Catálogos y gobernanza: saber qué datos tienes y quién puede verlos
Data catalogs, descubrimiento, linaje, permisos, data contracts y el arte de gobernar un data lake sin convertirlo en pantano.