Saltar al contenido

[14]Cloud (AWS) para datos

avanzado13 lecciones

Infraestructura moderna de datos en la nube: S3, IAM, Glue, Athena, EMR, Redshift, Lambda, Step Functions y Terraform. Practicamos con LocalStack (gratuito) para S3, IAM, Lambda, SQS y Step Functions. Para Glue, Athena, EMR y Redshift, los ejercicios usan Python puro o diseño — no necesitas cuenta AWS de pago.

[01]

¿Qué es "la nube"? La infraestructura de otras empresas

Desmitificamos la nube: historia de AWS, on-premise vs cloud, modelos IaaS/PaaS/SaaS, regiones, y por qué AWS domina el ecosistema de datos.

50 min
[02]

Setup: AWS CLI + LocalStack + credenciales

Instalación paso a paso de AWS CLI y LocalStack en Windows y Mac. Configurar credenciales, verificar conexión y tu primer comando contra AWS local.

55 min
[03]

S3 en profundidad: el almacenamiento infinito

Buckets, objetos, prefijos, clases de almacenamiento, lifecycle policies, versionado y access points. S3 es el corazón de todo data lake en AWS.

60 min
[04]

IAM: el sistema de seguridad que no puedes ignorar

Users, groups, roles, policies y el principio de mínimo privilegio. IAM es la puerta de entrada a todo en AWS — un error aquí es una brecha de seguridad.

60 min
[05]

Glue: el pegamento que cataloga y transforma

Crawlers para descubrir esquemas, Data Catalog como metastore central, y ETL jobs serverless. Glue conecta tu data lake con todo el ecosistema AWS.

55 min
[06]

Athena: SQL directo sobre tu data lake

Consultas SQL serverless sobre datos en S3. Partition pruning, formatos óptimos, coste por escaneo y cuándo elegir Athena vs Redshift.

55 min
[07]

EMR: Spark gestionado en la nube

Cuándo usar EMR vs Glue, tipos de clúster, Spot instances para ahorrar hasta 90%, dimensionamiento y configuración de jobs Spark.

55 min
[08]

Redshift: el warehouse columnar de AWS

Cuándo Redshift vs Athena, arquitectura columnar, distribution keys, sort keys, COPY command y estrategias de carga masiva.

55 min
[09]

Lambda: funciones serverless para datos

Triggers S3, ingesta event-driven, límites de memoria/tiempo, cold starts y patrones comunes de Lambda para pipelines de datos.

50 min
[10]

Step Functions + Lambda: pipelines serverless completos

Orquestar Lambdas con Step Functions: estados, transiciones, manejo de errores, paralelismo y el patrón de pipeline serverless completo.

55 min
[11]

Terraform: infraestructura como código

Instalar Terraform, HCL, plan/apply/destroy, módulos, variables, outputs y gestión de state. Define tu infraestructura AWS en archivos versionables.

60 min
[12]

Control de costes: cómo no arruinarte (historias de terror)

Billing alerts, budgets, reservas, Spot, rightsizing y las historias de terror que todo ingeniero de datos debería conocer antes de tocar producción.

50 min
[13]

Proyecto: pipeline end-to-end en AWS

Construye paso a paso un pipeline completo con LocalStack: S3 como lake, Lambda para ingesta, Glue para catálogo, Athena para consultas y Step Functions para orquestación.

65 min

## recursos