Skip to the content.

Plataforma de datos Spark, Kafka y Airflow

Documentación técnica: https://alonsomarcosm.github.io/spark-kafka-airflow-data-platform/

Caso de estudio: https://alonsomarcosm.github.io/es/projects/big-data-catalog-batch-streaming/

Proyecto académico aplicado y reproducible, basado en un caso de uso realista: mantener un catalogo de datasets actualizado combinando batch y streaming con arquitectura Medallion (Bronze/Silver/Gold) sobre Delta Lake.

Resumen ejecutivo

Pipelines principales

Arquitectura

Vista ejecutiva

Arquitectura ejecutiva

Vista técnica

Arquitectura técnica

Las fuentes Mermaid permanecen versionadas junto a los SVG para que el render sea reproducible y comprobable en CI.

Estado y objetivos

Arquitectura y componentes (resumen)

Resultados visibles

Ejecucion rapida (local)

1) Entrar al directorio de docker compose:

cd docker-compose

2) Verificar el archivo .env con el identificador de usuario de Airflow:

echo -e "AIRFLOW_UID=$(id -u)" > .env
"AIRFLOW_UID=1000" | Set-Content -NoNewline .env

3) Levantar servicios:

docker compose up -d --build

4) Accesos utiles:

Documentacion principal

Estructura del repositorio