Empleo de Ingeniero de datos (Databricks) en Guadalajara,JAL-114723-MX

Publicado hoy.

Ingeniero de datos (Databricks)

Sueldo oculto

Jalisco - Híbrido

Empleado de tiempo completo

Inglés : Nivel Intermedio

Estamos buscando un Ingeniero de Datos especializado en el ecosistema de Databricks y arquitecturas Lakehouse. En este rol, serás responsable de diseñar, construir y operar pipelines de datos distribuidos a gran escala, asegurando el gobierno, la calidad y el rendimiento de nuestras soluciones analíticas y operativas.


Responsabilidades Principales
  • Procesamiento y Arquitectura Lakehouse en Databricks:  Diseñar y construir pipelines distribuidos utilizando Apache Spark y el formato Delta Lake para las capas Raw, Silver y Gold (Arquitectura Medallion). Implementarás la lógica pesada de matching, reglas de survivorship, procesamiento de deltas (batch y Structured Streaming), así como el mantenimiento del índice maestro (Cross-walk) e históricos SCD Tipo 2.

  • Orquestación con Databricks Workflows:  Versionar, orquestar y probar los flujos de transformación de datos para la limpieza y consolidación del Golden Record, aplicando buenas prácticas de CI/CD, assertions y gestión de dependencias entre modelos.

  • Gobierno de Datos con Unity Catalog:  Configurar y administrar el catálogo unificado de datos, estableciendo políticas de control de acceso, reglas de calidad estructurales (completitud, unicidad, consistencia) y habilitando la trazabilidad y el linaje de metadatos de extremo a extremo.

  • Gestión de Almacenamiento (Cloud Storage / Data Lake):  Administrar los buckets de almacenamiento de objetos que sirven como capa base para las tablas Delta, zonas de aterrizaje de archivos planos y almacenamiento temporal.

  • Modelado en Cloud SQL (PostgreSQL):  Diseñar y administrar la Serving Layer operativa de baja latencia para el Golden Record vigente. Implementarás particionamiento lógico, índices avanzados (B-tree, GIN) y estrategias de aislamiento de cargas analíticas vs. transaccionales.

  • Experiencia sólida y comprobable en Databricks , optimización de clústeres, Apache Spark (PySpark/Scala) y formato  Delta Lake  (Time Travel, OPTIMIZE, Z-ORDER).

  • Experiencia implementando gobierno de datos, seguridad y linaje a través de  Unity Catalog .

  • Conocimiento avanzado en la implementación de  Arquitecturas Medallion  (Raw, Silver, Gold).

  • Experiencia en el diseño de bases de datos relacionales con optimización de índices para servir datos a aplicaciones operativas de baja latencia.

  • Familiaridad con servicios de la nube (GCP, AWS o Azure) para la integración de almacenamiento, bases de datos transaccionales y despliegue de contenedores.


¿Por qué unirte a nuestro equipo?

¿Eres un apasionado del Big Data y buscas llevar tus habilidades técnicas al siguiente nivel? No solo construimos pipelines; diseñamos soluciones estratégicas de gobierno y arquitecturas Lakehouse robustas que transforman la manera en que las organizaciones toman decisiones. Si te entusiasma la idea de exprimir al máximo el poder del procesamiento distribuido con Databricks, resolver desafíos complejos de Master Data Management y ser parte de un equipo de alto rendimiento donde tu innovación tiene un impacto real desde el primer día, ¡queremos conocerte!