[14]Cloud (AWS) para datos
Infraestructura moderna de datos en la nube: S3, IAM, Glue, Athena, EMR, Redshift, Lambda, Step Functions y Terraform. Practicamos con LocalStack (gratuito) para S3, IAM, Lambda, SQS y Step Functions. Para Glue, Athena, EMR y Redshift, los ejercicios usan Python puro o diseño — no necesitas cuenta AWS de pago.
¿Qué es "la nube"? La infraestructura de otras empresas
Desmitificamos la nube: historia de AWS, on-premise vs cloud, modelos IaaS/PaaS/SaaS, regiones, y por qué AWS domina el ecosistema de datos.
Setup: AWS CLI + LocalStack + credenciales
Instalación paso a paso de AWS CLI y LocalStack en Windows y Mac. Configurar credenciales, verificar conexión y tu primer comando contra AWS local.
S3 en profundidad: el almacenamiento infinito
Buckets, objetos, prefijos, clases de almacenamiento, lifecycle policies, versionado y access points. S3 es el corazón de todo data lake en AWS.
IAM: el sistema de seguridad que no puedes ignorar
Users, groups, roles, policies y el principio de mínimo privilegio. IAM es la puerta de entrada a todo en AWS — un error aquí es una brecha de seguridad.
Glue: el pegamento que cataloga y transforma
Crawlers para descubrir esquemas, Data Catalog como metastore central, y ETL jobs serverless. Glue conecta tu data lake con todo el ecosistema AWS.
Athena: SQL directo sobre tu data lake
Consultas SQL serverless sobre datos en S3. Partition pruning, formatos óptimos, coste por escaneo y cuándo elegir Athena vs Redshift.
EMR: Spark gestionado en la nube
Cuándo usar EMR vs Glue, tipos de clúster, Spot instances para ahorrar hasta 90%, dimensionamiento y configuración de jobs Spark.
Redshift: el warehouse columnar de AWS
Cuándo Redshift vs Athena, arquitectura columnar, distribution keys, sort keys, COPY command y estrategias de carga masiva.
Lambda: funciones serverless para datos
Triggers S3, ingesta event-driven, límites de memoria/tiempo, cold starts y patrones comunes de Lambda para pipelines de datos.
Step Functions + Lambda: pipelines serverless completos
Orquestar Lambdas con Step Functions: estados, transiciones, manejo de errores, paralelismo y el patrón de pipeline serverless completo.
Terraform: infraestructura como código
Instalar Terraform, HCL, plan/apply/destroy, módulos, variables, outputs y gestión de state. Define tu infraestructura AWS en archivos versionables.
Control de costes: cómo no arruinarte (historias de terror)
Billing alerts, budgets, reservas, Spot, rightsizing y las historias de terror que todo ingeniero de datos debería conocer antes de tocar producción.
Proyecto: pipeline end-to-end en AWS
Construye paso a paso un pipeline completo con LocalStack: S3 como lake, Lambda para ingesta, Glue para catálogo, Athena para consultas y Step Functions para orquestación.