# Plataforma de datos Spark, Kafka y Airflow

> Plataforma local reproducible con batch, streaming, arquitectura Medallion y orquestación.

- Categoría: Data Engineering
- Año / Year: 2026

## Contexto

Mantener un catálogo vivo de metadatos combinando fuentes estructuradas, semiestructuradas y eventos en tiempo real.

## Aspectos destacados

- Diseño del caso de uso y de la arquitectura Medallion
- Implementación de los jobs Spark y de los DAGs de Airflow
- Integración reproducible de Kafka, SQL Server, MinIO y Delta Lake

## Resultados

- Patrones de ingesta: 3. Fuente: docs/ejecucion-y-pruebas.md
- Capas de datos: 3. Fuente: docs/arquitectura-pmd.md

## Tecnologías

Python · Apache Spark · Apache Airflow · Apache Kafka · Delta Lake · MinIO · SQL Server · Docker Compose

## Enlaces verificables

- Página del portfolio: https://alonsomarcosm.github.io/es/projects/big-data-catalog-batch-streaming/
- Repositorio GitHub: https://github.com/AlonsoMarcosM/spark-kafka-airflow-data-platform
- technical_docs: https://alonsomarcosm.github.io/spark-kafka-airflow-data-platform/
- architecture: https://alonsomarcosm.github.io/spark-kafka-airflow-data-platform/docs/visualizaciones/arquitectura-ejecutiva.svg
