The Data Platform Challenge

The Data Platform Challenge · AWS Community

Construyendo un
Self-Service Data Platform en AWS

Cómo darle a tus equipos autonomía sobre sus datos — sin volver a ser el cuello de botella

CZ
Carlos Zambrano
AWS Data Hero · Colombia · speaker
×
CC
Carlos Cortez
AWS Hero · Perú · co-speaker

Bloque A — punto de inicio para revisar/ajustar (borrador)

Tu presentador

Carlos Zambrano

Carlos Zambrano

AWS Data Hero · Colombia
  • [TODO Zambrano: bio corta / rol actual]
  • [TODO: experiencia en data platforms / analytics en AWS]
  • [TODO: comunidad / charlas / logros]
LinkedIn
LinkedIn
[TODO]
Web / X
Web / X
[TODO]

El challenge

Dar autonomía sin perder control

Dos Heroes, dos mitades de la misma historia:
construir la plataforma que libera a los equipos, y sostenerla sin que explote en costo o gobernanza.

🏗️ Construyendo (Zambrano)

Arquitectura del self-service data platform en AWS: storage, catálogo, discovery, producción de data products.

🛡️ El challenge sostenible (Cortez)

Costo, gobernanza y calidad: governance-as-code para que la autonomía no se vuelva caos.

El problema que resolvemos

El equipo de datos como cuello de botella

La promesa del self-service: los equipos producen y consumen datos por sí mismos — gobernados, no en el salvaje oeste.

🏛️
Plataforma, no un lago de archivos

Qué es un self-service data platform

Una plataforma, no un data lake suelto

SÍ es: capacidades self-service sobre datos gobernados — descubrir, acceder, producir y consumir con contratos.

NO es: tirar todo a S3 y esperar que la gente se organice. Eso es un data swamp.

Arquitectura de referencia · AWS-nativo

Los pilares de la plataforma

🗄️ Storage / Lakehouse

S3 + S3 Tables (Iceberg gestionado): ACID, time-travel, compaction automática.

📚 Catálogo técnico

AWS Glue Data Catalog: tablas, esquemas, particiones — la fuente de metadatos.

🔐 Governance

AWS Lake Formation: permisos fine-grained (row/column) + LF-Tags escalables.

🔎 Query engine

Amazon Athena (serverless) / Redshift para cargas analíticas pesadas.

⚡ Ingesta

Glue / Zero-ETL / Data Firehose: batch y streaming al lakehouse.

🧭 Discovery / self-service

SageMaker Unified Studio / DataZone: buscar, pedir acceso, publicar.

Cómo fluye el dato

De la ingesta al data product gobernado

reference architecture
# flujo de referencia
Fuentes (apps, DBs, streams)
  → Ingesta (Glue / Zero-ETL / Firehose)
  → S3 + S3 Tables (Iceberg) # lakehouse
  → Glue Data Catalog # metadatos
  → Lake Formation # permisos fine-grained
  → Athena / Redshift # query
  → DataZone / Unified Studio # discovery + self-service

↑ cada dominio es dueño de su porción end-to-end

El self-service en la práctica

Data domains & data products (data mesh light)

El ciclo de un data product

Publicar → descubrir → consumir

1 · PRODUCE
El equipo dueño publica el dataset con esquema, owner y contrato en el catálogo.
2 · CATALOG
Glue + DataZone lo indexan: metadatos, calidad, frescura, linaje.
3 · DISCOVER
Otro equipo lo encuentra buscando por dominio/tag, ve el contrato, pide acceso.
4 · GRANT
Lake Formation concede permiso fine-grained tras aprobación — no acceso total.
5 · CONSUME
Consume vía Athena/Redshift/BI. Todo auditado, con costo atribuible.
DEMO EN VIVO

Crear un data product y consumirlo desde otro equipo

Punto de demo (a definir por Zambrano): publicar un dataset en el catálogo → buscarlo en DataZone → pedir/otorgar acceso con Lake Formation → consultarlo desde Athena en otro dominio.

1 · Publish

dataset + contrato al catálogo

2 · Discover

búsqueda en DataZone

3 · Access

grant con Lake Formation

4 · Query

consumo desde Athena

Placeholder — reemplazar con el caso real de Zambrano.

La otra mitad del challenge

Ya construimos la plataforma...
¿cómo evitamos que explote?

El self-service libera a los equipos — pero autonomía sin barandas = costo y riesgo sin límite.
A continuación, Carlos Cortez toma el challenge sostenible: governance-as-code, costo por producto de datos y calidad como gate en CI/CD.

Carlos Zambrano (AWS Data Hero, Colombia) & Carlos Cortez (AWS Hero, Perú)

1 / 10