Saltar al contenido
Volver a proyectos
Evidencia principal de Plataforma de datos Spark, Kafka y Airflow
Data EngineeringProyecto académico aplicado2026

Plataforma de datos Spark, Kafka y Airflow

Plataforma local reproducible con batch, streaming, arquitectura Medallion y orquestación.

Problema

Mantener un catálogo vivo de metadatos combinando fuentes estructuradas, semiestructuradas y eventos en tiempo real.

Arquitectura

SQL Server, CSV y Kafka alimentan jobs Spark que publican capas Bronze, Silver y Gold sobre Delta Lake y MinIO. Airflow orquesta los flujos batch.

Flujo de datos

Fuentes → ingesta batch o streaming → Spark → Delta Lake Medallion → previews Gold verificables.

Resultados

3

Patrones de ingesta

SQL batch incremental, CSV batch y Kafka streaming

Ver fuente

3

Capas de datos

Bronze, Silver y Gold en cada pipeline

Ver fuente

Contribución y autoría

  • Diseño del caso de uso y de la arquitectura Medallion
  • Implementación de los jobs Spark y de los DAGs de Airflow
  • Integración reproducible de Kafka, SQL Server, MinIO y Delta Lake
Alonso Marcos Muñoz · Autor y desarrollador

Evidencias

Arquitectura ejecutiva
Arquitectura ejecutiva
Arquitectura técnica
Arquitectura técnica

Limitaciones

  • • Entorno local reproducible con datos de demostración, no una plataforma empresarial en producción
  • • Las credenciales incluidas son exclusivamente valores locales de desarrollo

Stack

https://github.com/AlonsoMarcosM/spark-kafka-airflow-data-platform