
Big Data · MLOpsProyecto académico aplicado2026
Lakehouse y MLOps de churn telco
Lakehouse Medallion y ciclo MLOps reproducible sobre Databricks con evidencia de ejecución.
Problema
Construir un ciclo reproducible de datos y ML para anticipar la fuga de clientes sin ocultar la naturaleza sintética del conjunto de datos.
Arquitectura
Databricks Lakehouse con ingesta incremental, arquitectura Medallion sobre Delta Lake, feature engineering temporal, MLflow, Unity Catalog e inferencia batch monitorizada.
Flujo de datos
Datos sintéticos → Auto Loader → Bronze/Silver/Gold → dataset point-in-time → entrenamiento y registro → inferencia y monitorización simuladas.
Resultados
16,316,445
Filas de entrenamiento
Ver fuente2,042,162
Clientes distintos
Ver fuente33
Variables del modelo
Ver fuente2023-07 → 2024-12
Ventana de entrenamiento
Ver fuenteContribución y autoría
- Coimplementación end-to-end confirmada por Alonso el 2026-09-14
- Experimento MLflow, job de ML de tres tareas y ejecución de simulación asociados a Alonso
- Trabajo compartido en pipeline Medallion, ciclo de modelo y validación diaria
Alonso Marcos Muñoz · Coautor end-to-endJose Barros · Coautor
Evidencias
Limitaciones
- • Los datos son sintéticos y el escenario denominado producción es una simulación académica
- • La validación y el despliegue autenticados requieren un workspace Databricks activo
- • La autoría es compartida y se mantiene la atribución de ambos coautores
Stack
DatabricksPySparkDelta LakeAuto LoaderDatabricks Asset BundlesMLflowUnity CatalogLakehouse Monitoring
https://github.com/AlonsoMarcosM/databricks-telco-churn-lakehouse
