Data engineer on an internal data platform team: integrating source systems via APIs, building and maintaining Python/PySpark/Databricks pipelines on Azure, monitoring daily processing, checking data quality, and handling platform security and access control alongside analysts and BI colleagues. Hybrid role based in Utrecht, Netherlands.
Je komt te werken in een intern dataplatformteam. Het platform verzamelt data uit de systemen die door de hele organisatie gebruikt worden en maakt die bruikbaar voor analyse en rapportage.
Het grootste deel van je werk zit in integratie. Er komen veel verschillende bronsystemen binnen, elk met een eigen structuur en een eigen manier van ontsluiten. Jij bouwt de koppelingen, brengt de data naar een gezamenlijk model en zorgt dat die stroom betrouwbaar blijft draaien.
Daarnaast beheer je de bestaande pipelines, houd je de dagelijkse verwerking in de gaten en grijp je in als er iets misgaat. Beveiliging en toegangsbeheer zijn onderdeel van de rol, niet iets wat een ander team erna doet.
Wat je gaat doen
Bronsystemen aansluiten en integreren via API-koppelingen
Data pipelines bouwen en onderhouden in Python, PySpark en Databricks op Azure
Bestaande dataflows optimaliseren en de dagelijkse verwerking monitoren
Datakwaliteit controleren en afwijkingen opsporen
Toegangsbeheer en beveiliging van het platform inrichten
Samenwerken met analisten en BI-collega's om hun eisen technisch te vertalen
Wat je meebrengt
Minimaal 2 jaar ervaring als data engineer
Python op productieniveau, PySpark is een pré
Ervaring met Spark of vergelijkbare gedistribueerde verwerking