Dominios: cada equipo (finance, marketing…) es dueño de sus datos end-to-end
Discovery: un analista busca un dataset en DataZone, pide acceso, lo obtiene con aprobación
Producción: un equipo publica un dataset nuevo siguiendo un contrato/plantilla
Guardrails desde el diseño: tags, contratos y políticas — (aquí engancha el Bloque B)
El ciclo de un data product
Publicar → descubrir → consumir
1 · PRODUCE
El equipo dueño publica el dataset con esquema, owner y contrato en el catálogo.
2 · CATALOG
Glue + DataZone lo indexan: metadatos, calidad, frescura, linaje.
3 · DISCOVER
Otro equipo lo encuentra buscando por dominio/tag, ve el contrato, pide acceso.
4 · GRANT
Lake Formation concede permiso fine-grained tras aprobación — no acceso total.
5 · CONSUME
Consume vía Athena/Redshift/BI. Todo auditado, con costo atribuible.
DEMO EN VIVO
Crear un data product y consumirlo desde otro equipo
Punto de demo (a definir por Zambrano): publicar un dataset en el catálogo → buscarlo en DataZone → pedir/otorgar acceso con Lake Formation → consultarlo desde Athena en otro dominio.
1 · Publish
dataset + contrato al catálogo
2 · Discover
búsqueda en DataZone
3 · Access
grant con Lake Formation
4 · Query
consumo desde Athena
Placeholder — reemplazar con el caso real de Zambrano.
La otra mitad del challenge
Ya construimos la plataforma... ¿cómo evitamos que explote?
El self-service libera a los equipos — pero autonomía sin barandas = costo y riesgo sin límite. A continuación, Carlos Cortez toma el challenge sostenible: governance-as-code, costo por producto de datos y calidad como gate en CI/CD.
Carlos Zambrano (AWS Data Hero, Colombia) & Carlos Cortez (AWS Hero, Perú)