Data Engineer · Yom
YOM · Chile ·
- Work mode
- Hybrid
- Category
- Data engineering
YOM · Chile ·
Taligent · Buenos Aires, Argentina
Improving · Remote
adlytics GmbH · Jalisco, Mexico
ITSM Consulting · Peru
2BRAINS · Remote
Data engineer who designs, builds, and operates ETL/ELT pipelines pulling data from client sources (ERPs, REST APIs, webhooks, SFTP, S3) into PostgreSQL on AWS RDS, orchestrated with Airflow. Core focus is data-quality contracts, pipeline observability, and data modeling, working alongside data science and product teams.
Diseñar, construir y operar pipelines de integración desde el origen de cada cliente (ERPs, APIs REST, webhooks, SFTP, VPN, archivos en S3) hasta PostgreSQL en AWS RDS.
Escribir procesos ETL y ELT en Python, orquestados con Apache Airflow. Migrar los pipelines legados (AWS Glue y flujos heredados) al nuevo stack.
Definir contratos de datos declarativos por cliente y entidad: esquema, tipos, vocabularios, ventanas de entrega y umbrales de cuarentena.
Implementar reglas de calidad por dimensión (completitud, validez, unicidad, integridad referencial, consistencia, oportunidad) y verificar que cada transformación preserve los invariantes del dato.
Diseñar el modelo de datos, versionarlo con migraciones y hacer el onboarding de clientes nuevos.
Construir la observabilidad del pipeline: hallazgos de calidad por corrida, alertas y detección de fallas silenciosas, como el proceso que termina “con éxito” sin haber recibido un solo archivo.
Cuadrar nuestras cifras con las del cliente, explicar cada diferencia y arreglar la causa en el pipeline.
Gestionar accesos y credenciales de procesos y cuentas de servicio con mínimo privilegio.
Documentar flujos, contratos de datos y procedimientos operativos.
Trabajar con data science, producto e ingeniería en los datos que alimentan el motor de recomendaciones y la plataforma.
Experiencia
5+ años en roles de datos, o 3+ años como Data Engineer construyendo y operando pipelines en producción.
Python y SQL
Python avanzado para procesamiento de datos (pandas), con tests automatizados (pytest). SQL avanzado en PostgreSQL: modelado, índices, planes de ejecución y cargas incrementales (upserts).
Integración
Experiencia integrando fuentes heterogéneas: APIs REST (autenticación, paginación), webhooks, SFTP, archivos planos y bases de datos de terceros. Diseño de procesos ETL/ELT con un orquestador (idealmente Airflow).
Calidad y contratos de datos
Validación de datos con esquemas y contratos (pandera, pydantic, Great Expectations o similares). Criterio para pensar la calidad del dato desde el diseño del pipeline.
Cloud
AWS: S3, RDS y al menos un servicio de procesamiento (Glue, Lambda, Batch o ECS).
Pipelines reales en producción, con ownership de punta a punta. Un equipo en crecimiento, con stack moderno y uso intensivo de IA en el día a día.
Modalidad híbrida y horario flexible.
Beneficios de deporte, educación, compra de equipo y días administrativos.
5 días extras de vacaciones
Cultura horizontal y cercana.