
Data EngineeringProyecto académico aplicado2026
Plataforma de datos Spark, Kafka y Airflow
Plataforma local reproducible con batch, streaming, arquitectura Medallion y orquestación.
Problema
Mantener un catálogo vivo de metadatos combinando fuentes estructuradas, semiestructuradas y eventos en tiempo real.
Arquitectura
SQL Server, CSV y Kafka alimentan jobs Spark que publican capas Bronze, Silver y Gold sobre Delta Lake y MinIO. Airflow orquesta los flujos batch.
Flujo de datos
Fuentes → ingesta batch o streaming → Spark → Delta Lake Medallion → previews Gold verificables.
Resultados
3
Patrones de ingesta
SQL batch incremental, CSV batch y Kafka streaming
Ver fuente3
Capas de datos
Bronze, Silver y Gold en cada pipeline
Ver fuenteContribución y autoría
- Diseño del caso de uso y de la arquitectura Medallion
- Implementación de los jobs Spark y de los DAGs de Airflow
- Integración reproducible de Kafka, SQL Server, MinIO y Delta Lake
Alonso Marcos Muñoz · Autor y desarrollador
Evidencias
Limitaciones
- • Entorno local reproducible con datos de demostración, no una plataforma empresarial en producción
- • Las credenciales incluidas son exclusivamente valores locales de desarrollo
Stack
https://github.com/AlonsoMarcosM/spark-kafka-airflow-data-platform