Temario del curso
Introducción, Objetivos y Estrategia de Migración
- Objetivos del curso, alineación del perfil del participante y criterios de éxito.
- Enfoques de migración a alto nivel y consideraciones de riesgo.
- Configuración de espacios de trabajo, repositorios y conjuntos de datos de laboratorio.
Día 1 — Fundamentos de Migración y Arquitectura
- Conceptos de Lakehouse, visión general de Delta Lake y arquitectura de Databricks.
- Diferencias entre SMP y MPP e implicaciones para la migración.
- Diseño Medallion (Bronze→Silver→Gold) y visión general de Unity Catalog.
Laboratorio del Día 1 — Traducción de un Procedimiento Almacenado
- Migración práctica de un procedimiento almacenado de ejemplo a un notebook.
- Mapeo de tablas temporales y cursores a transformaciones de DataFrame.
- Validación y comparación con la salida original.
Día 2 — Delta Lake Avanzado y Carga Incremental
- Transacciones ACID, registros de commit, versionado y time travel.
- Auto Loader, patrones MERGE INTO, upserts y evolución de esquema.
- OPTIMIZE, VACUUM, Z-ORDER, particionado y ajuste de almacenamiento.
Laboratorio del Día 2 — Ingesta Incremental y Optimización
- Implementación de ingesta con Auto Loader y flujos de trabajo MERGE.
- Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados.
- Medición de las mejoras en el rendimiento de lectura y escritura.
Día 3 — SQL en Databricks, Rendimiento y Depuración
- Funciones de SQL analítico: funciones de ventana, funciones de orden superior, manejo de JSON/arrays.
- Lectura de la interfaz de Spark UI, DAGs, shuffles, etapas, tareas y diagnóstico de cuellos de botella.
- Patrones de ajuste de consultas: unidos de difusión (broadcast joins), pistas (hints), caché y reducción de derrame (spill).
Laboratorio del Día 3 — Refactorización de SQL y Ajuste de Rendimiento
- Refactorizar un proceso SQL pesado a Spark SQL optimizado.
- Usar trazas de la interfaz de Spark UI para identificar y corregir problemas de sesgo (skew) y shuffles.
- Realizar pruebas de rendimiento antes y después y documentar los pasos de ajuste.
Día 4 — PySpark Táctico: Reemplazando la Lógica Procedural
- Modelo de ejecución de Spark: conductor (driver), ejecutores, evaluación perezosa y estrategias de particionado.
- Transformación de bucles y cursores en operaciones vectorizadas de DataFrame.
- Modularización, UDFs/pandas UDFs, widgets y bibliotecas reutilizables.
Laboratorio del Día 4 — Refactorización de Guiones Procedurales
- Refactorizar un guion ETL procedural en notebooks de PySpark modulares.
- Introducir parametrización, pruebas de estilo unidad y funciones reutilizables.
- Revisión de código y aplicación de listas de verificación de mejores prácticas.
Día 5 — Orquestación, Pipeline de Extremo a Extremo y Mejores Prácticas
- Databricks Workflows: diseño de trabajos, dependencias de tareas, desencadenantes y manejo de errores.
- Diseño de pipelines Medallion incrementales con reglas de calidad y validación de esquema.
- Integración con Git (GitHub/Azure DevOps), CI y estrategias de pruebas para lógica de PySpark.
Laboratorio del Día 5 — Construcción de un Pipeline Completo de Extremo a Extremo
- Ensamblar el pipeline Bronze→Silver→Gold orquestado con Workflows.
- Implementar registro (logging), auditoría, reintentos y validaciones automatizadas.
- Ejecutar el pipeline completo, validar las salidas y preparar notas de despliegue.
Operativización, Gobernanza y Listez de Producción
- Mejores prácticas de gobernanza de Unity Catalog, linaje y controles de acceso.
- Costos, dimensionamiento de clusters, autoscaling y patrones de concurrencia de trabajos.
- Listas de verificación de despliegue, estrategias de reversión y creación de libros de operaciones (runbooks).
Revisión Final, Transferencia de Conocimiento y Próximos Pasos
- Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas.
- Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de capacitación.
- Referencias, rutas de aprendizaje adicionales y opciones de soporte.
Requerimientos
- Comprensión de los conceptos de ingeniería de datos.
- Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server).
- Conocimiento de los conceptos de orquestación ETL (ADF o similar).
Audiencia
- Gerentes de tecnología con experiencia en ingeniería de datos.
- Ingenieros de datos que transicionan la lógica OLAP procedural a patrones Lakehouse.
- Ingenieros de plataforma responsables de la adopción de Databricks.
Reseñas (1)
Todos los temas que abarca, aunque muchos fueron muy rápidos, nos da una idea de lo que necesitaremos ahondar. Además me gustó que pudimos hacer practicas, aunque insisto, creo que el curso amerita mas.