Curso de Introducción a Data Engineering
Duración
5 semanas
Modalidad
Online en vivo
Público
General
Curso de Introducción a Data Engineering
Aprende a construir un flujo de datos desde cero.
Ventajas del curso
De datos crudos a datos útiles
Aprende a leer, limpiar, transformar y organizar información para que pueda utilizarse de forma confiable.
Una base técnica transversal
Comprende cómo se conectan SQL, procesamiento programático, almacenamiento analítico, calidad de datos y pipelines.
Herramientas actuales
Trabaja con tecnologías utilizadas en entornos reales: Python, DuckDB, Polars, Databricks, Pandera y Deepnote.
Proyecto demostrable
Concluye con un flujo de datos documentado que puedes explicar y presentar como evidencia de lo aprendido.
Temario del Curso
Módulo 1 - Introducción a la ingeniería de datos y al entorno de trabajo
Rol del ingeniero de datos, diferencia frente a analistas y científicos de datos, anatomía de un flujo de datos, panorama laboral, notebooks en la nube, reproducibilidad, carga y lectura inicial de datos.
Módulo 2 - Python esencial para datos
Variables, tipos, operadores, listas, diccionarios, condicionales, ciclos, funciones, módulos y lectura de mensajes de error.
Módulo 3 - Fundamentos de datos y formatos de almacenamiento
Datos estructurados, semiestructurados y no estructurados; esquema, tipado y metadatos; CSV, JSON, Parquet; criterios de selección y panorama de Apache Arrow, Delta Lake e Iceberg.
Módulo 4 - SQL I: consultas, cruces y agregaciones
Modelo relacional, claves y relaciones, selección, filtrado, ordenamiento, nulos, INNER JOIN, LEFT JOIN, hechos, dimensiones, agregaciones y agrupamiento.
Módulo 5 - SQL II y almacenamiento analítico de datos
Subconsultas, CTEs, funciones de ventana, OLTP vs. OLAP, normalización, modelado dimensional, esquemas estrella y copo de nieve, lakehouse, capas bronce/plata/oro y ETL vs. ELT.
Módulo 6 - Procesamiento de datos con Polars I
Series y DataFrames, tipos y esquema, expresiones, selección, filtrado, derivación de columnas, encadenamiento, evaluación inmediata y diferida, y optimización automática.
Módulo 7 - Procesamiento de datos con Polars II
Conversión de tipos, fechas y texto, manejo de nulos y duplicados, agregaciones múltiples, joins, funciones de ventana, procesamiento en flujo y lectura de múltiples archivos.
Módulo 8 - Plataformas empresariales de datos: Databricks
Ecosistema Databricks, lakehouse, Delta Lake, transacciones y versionado, tablas gestionadas, catálogo de datos, cómputo serverless, SQL y notebooks.
Módulo 9 - Flujos de ingesta y calidad de datos
ETL y ELT en la práctica, capas bronce/plata/oro, idempotencia, cargas incrementales, calidad de datos, validación por reglas y esquemas, registros inválidos, logs, métricas y panorama de orquestadores.
Módulo 10 - Proyecto final documentado
Integración del flujo completo, colaboración y revisión entre pares, historial de versiones, documentación, reproducibilidad, publicación, presentación de hallazgos y ruta de aprendizaje posterior.