# Alonso Marcos Muñoz

> Data Engineer · Pipelines, modelado y plataformas. Construyo pipelines, modelos y plataformas de datos con Python y SQL. Aporto experiencia profesional en metadatos públicos y proyectos aplicados con Databricks, Spark, Airflow, Kafka y AWS.

Portfolio canónico / Canonical portfolio: https://alonsomarcosm.github.io/es/

## Perfil profesional

Data Engineer centrado en construir pipelines fiables, modelos mantenibles y soluciones operables. Trabajo en Tragsatec dentro de ImpulsaDATA para la Dirección General del Dato, una iniciativa con 5.771 datasets publicados y federados, 22 ministerios y organismos y 13 servicios comunes según su balance público.

Mi trabajo combina Python, SQL y modelado sobre PostgreSQL/Oracle con ETL de metadatos, CKAN, DCAT-AP-ES, RDF/JSON-LD y SHACL. Abarca transformaciones, agregaciones, vistas y optimización, junto con contenedorización, seguridad, administración de entornos test/desa/pre/pro y documentación operativa.

Lo complemento con un Máster en Big Data y Computación en la Nube, la certificación CAPM y proyectos en OpenMetadata, Kubernetes, Airflow, Spark, Kafka, Databricks y AWS, además de IA generativa aplicada y AI harness engineering para acelerar análisis, desarrollo y documentación.

## Experiencia

### Tragsatec — Ingeniero de Datos · ImpulsaDATA (Dirección General del Dato, AGE)

- 2025-10 — actualidad
- Sector público · España

Ingeniería de datos y gobierno del dato en la Administración General del Estado. El balance público de ImpulsaDATA acredita 5.771 datasets publicados y federados, 22 ministerios y organismos y 13 servicios comunes.

**Contribuciones**

- Evolución y mantenimiento de pipelines ETL de metadatos: normalización, mapeo a modelos comunes y publicación en CKAN.
- Alineación de metadatos con DCAT-AP-ES y generación de salidas RDF y JSON-LD con validación semántica SHACL previa y posterior a la carga.
- Desarrollo y evolución de extensiones y plugins de CKAN (DCAT, scheming, harvest, spatial) y de un plugin propio común a todos los organismos.
- Configuración de stacks contenedorizados (Docker/Podman) y administración de entornos test, desarrollo, preproducción y producción del equipo.
- Modelado de datos en SQL sobre el modelo de metadatos (transformaciones, agregaciones, vistas y optimización) en PostgreSQL.
- Documentación operativa y tutorización de perfiles junior, con criterio de calidad, mantenibilidad y baja deuda técnica.

**Tecnologías:** Python · CKAN · DCAT-AP-ES · RDF/JSON-LD · SHACL · PostgreSQL · Docker/Podman · ETL

datos.gob.es: https://datos.gob.es/es/catalogo/conjuntos-datos

### Tragsatec — Ingeniero de Datos en prácticas · ImpulsaDATA

- 2025-06 — 2025-09
- Provincia de Albacete · España

Primera etapa en el proyecto ImpulsaDATA, centrada en el diseño y desarrollo inicial de un conversor ETL de metadatos para flujos de gobernanza del dato en el sector público.

**Contribuciones**

- Desarrollo de flujos ETL de metadatos en Python, desde extracción y normalización hasta estructuras JSON/JSON-LD estandarizadas.
- Mapeo de metadatos a un modelo común alineado con DCAT-AP-ES y generación de RDF para publicación interoperable.
- Validación semántica mediante SHACL e integración con catálogos CKAN a través de la CKAN Action API.
- Implementación de configuración externa, logs estructurados, documentación técnica, diagramas, diccionarios de datos y guías operativas.

**Tecnologías:** Python · CKAN · CKAN Action API · JSON/JSON-LD · RDF · SHACL · Docker · GitLab

datos.gob.es: https://datos.gob.es/es/catalogo/conjuntos-datos

### La Fábrica del Tiempo — Consultor de Automatización de Procesos y Productividad

- 2024-02 — 2024-08
- Almansa, España

Automatización de procesos y productividad con Power Platform sobre Microsoft 365, con formación a clientes y generación de contenido técnico.

**Contribuciones**

- App interna y flujos sin código con Power Apps + Power Automate para gestión de leads en un CRM.
- Sincronización SharePoint–CRM y notificaciones/aprobaciones automáticas.
- Más del 25 % de mejora de eficiencia operativa sobre la metodología ADOCC.

**Tecnologías:** Power Apps · Power Automate · Microsoft 365 · SharePoint

### Ayuntamiento de Alcázar de San Juan — Técnico informático

- 2019-03 — 2019-06
- Administración local · España

Soporte IT y administración básica de sistemas y redes en entorno municipal.

**Contribuciones**

- Resolución de incidencias y soporte a usuarios.
- Mantenimiento de sistemas y tareas básicas de infraestructura.
- Documentación técnica en un contexto de administración pública.

**Tecnologías:** Soporte IT · Sistemas · Redes

## Proyectos públicos

### Lakehouse y MLOps de churn telco (2026)

Lakehouse Medallion y ciclo MLOps reproducible sobre Databricks con evidencia de ejecución.

- Detalles en Markdown: https://alonsomarcosm.github.io/es/projects/telco-churn-mlops-databricks/index.md
- technical_docs: https://alonsomarcosm.github.io/databricks-telco-churn-lakehouse/
- case_study: https://alonsomarcosm.github.io/es/projects/telco-churn-mlops-databricks/
- github: https://github.com/AlonsoMarcosM/databricks-telco-churn-lakehouse

### Smart Parking Albacete (2026)

Plataforma IoT serverless probada en AWS Academy, desde telemetría MQTT hasta API y dashboard.

- Detalles en Markdown: https://alonsomarcosm.github.io/es/projects/smart-parking-albacete/index.md
- live_demo: https://smart-parking-albacete.streamlit.app/
- case_study: https://alonsomarcosm.github.io/es/projects/smart-parking-albacete/
- architecture: https://github.com/AlonsoMarcosM/smart-parking-albacete/blob/main/memoria/imagenes/diagrama_arquitectura.png
- github: https://github.com/AlonsoMarcosM/smart-parking-albacete

### Plataforma de datos Spark, Kafka y Airflow (2026)

Plataforma local reproducible con batch, streaming, arquitectura Medallion y orquestación.

- Detalles en Markdown: https://alonsomarcosm.github.io/es/projects/big-data-catalog-batch-streaming/index.md
- technical_docs: https://alonsomarcosm.github.io/spark-kafka-airflow-data-platform/
- case_study: https://alonsomarcosm.github.io/es/projects/big-data-catalog-batch-streaming/
- architecture: https://alonsomarcosm.github.io/spark-kafka-airflow-data-platform/docs/visualizaciones/arquitectura-ejecutiva.svg
- github: https://github.com/AlonsoMarcosM/spark-kafka-airflow-data-platform

### OpenMetadata + DCAT-AP-ES (2026)

Modelo de metadatos gobernado con exportación RDF/JSON-LD y validación SHACL.

- Detalles en Markdown: https://alonsomarcosm.github.io/es/projects/tfm-openmetadata-dcat-ap-es/index.md
- live_demo: https://tfm-plataforma-gobierno-dato.vercel.app
- github: https://github.com/AlonsoMarcosM/TFM_Alonso_Marcos_Mu-oz

### Gobierno y Calidad del Dato · UNE (2026)

Aplicación de la familia UNE 0077-0081 materializada en OpenMetadata.

- Detalles en Markdown: https://alonsomarcosm.github.io/es/projects/gobierno-calidad-dato-openmetadata/index.md
- technical_docs: https://alonsomarcosm.github.io/TrabajoGobiernoCalidadDatos/
- github: https://github.com/AlonsoMarcosM/TrabajoGobiernoCalidadDatos

### Honeypot en AWS con Terraform (2026)

Honeypot SSH con análisis serverless de logs e infraestructura como código.

- Detalles en Markdown: https://alonsomarcosm.github.io/es/projects/honeypot-aws-terraform/index.md
- technical_docs: https://alonsomarcosm.github.io/DAMN-TEAMSSN/
- github: https://github.com/AlonsoMarcosM/DAMN-TEAMSSN

### Ejecución remota de scripts en R (2025)

Aplicación full stack para ejecutar scripts R mediante API REST, contenedores y JWT.

- Detalles en Markdown: https://alonsomarcosm.github.io/es/projects/tfg-remote-r-scripts/index.md
- technical_docs: https://alonsomarcosm.github.io/TFG_AlonsoMarcosMu-oz/
- github: https://github.com/AlonsoMarcosM/TFG_AlonsoMarcosMu-oz

## Competencias

- **Ingeniería de datos:** Python · ETL / ELT · Modelado de datos · CKAN + extensiones · PostgreSQL · Oracle · Redis · Solr · SQL avanzado · REST APIs · Jinja2
- **Big Data:** Apache Spark · Apache Airflow · Apache Kafka · Delta Lake · MinIO · Databricks · MLflow · Unity Catalog
- **Cloud y DevOps:** AWS · Terraform · Docker / Compose · Podman · Kubernetes · Helm · nginx · Linux / SSH · Git / GitLab / GitHub
- **Gobernanza y calidad del dato:** DCAT-AP-ES · RDF · JSON-LD · SHACL / pySHACL · OpenMetadata · Metadata management · Data lineage · UNE 0077–0081
- **IA aplicada y calidad:** AI harness engineering · Context engineering · Automatización de flujos técnicos · Pruebas end-to-end asistidas · Revisión técnica de código · Documentación reproducible
- **Gestión e idiomas:** PMI / CAPM · Kanban · ADOCC · Español (nativo) · Inglés B2

## Formación

- **Máster Universitario en Big Data y Computación en la Nube** — UCLM · Sept. 2025 – Jun. 2026 · Finalizado · TFM 9,2/10
- **Grado en Ingeniería Informática · Especialización en Tecnologías de la Información** — UCLM · Sept. 2019 – Jun. 2025
- **C.F.G.S. en Administración de Sistemas Informáticos en Red** — IES Juan Bosco · Sept. 2017 – Jun. 2019

## Certificaciones

- **CAPM** — Project Management Institute. Fundamentos certificados de dirección de proyectos PMI.
- **First Certificate in English (B2)** — Cambridge English. Competencia profesional acreditada en inglés.

## Contacto y perfiles públicos

- Email: mailto:alonsomarcosm99@gmail.com
- GitHub: https://github.com/AlonsoMarcosM
- LinkedIn: https://www.linkedin.com/in/alonsomarcosm99/
- Timeline CV · Manfred: https://www.getmanfred.com/perfil/735337eb-0689-4fa6-8776-0dc0784bfb27
- Perfil profesional · Tecnoempleo: https://www.tecnoempleo.com/alonso-marcos-munoz.mpt
- Email: mailto:alonsomarcosm99@gmail.com
- CV PDF: https://alonsomarcosm.github.io/cv/CV_Alonso_Marcos_Munoz_ES.pdf
