Senior Data Engineer / Spark Developer @ Upvanta
Upvanta · Wrocław, Poland ·
- Seniority
- Senior
- Category
- Data engineering
Upvanta · Wrocław, Poland ·
UPVANTA SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ · Wrocław, Poland
Upvanta sp. z o.o. · Wrocław, Poland
B2B.NET S.A. · Warszawa, Poland
Arche Solutions · Polska, Poland
Senior Data Engineer / Spark Developer designing and building a Data Lakehouse on Apache Spark, MongoDB, and Apache Iceberg — developing data processing, synchronization, and reconciliation pipelines, data quality rules, CI/CD pipelines, and monitoring. Hybrid role based in Wrocław with 1-2 office days per week.
O projekcie
Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.
Mile widziane
O projekcie
Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.
,(Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL)., Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności., Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii., Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold., Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych., Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych., Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark., Implementacja monitoringu, metryk i alertowania dla procesów danych., Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator., Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych., Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków., Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi., Udział w code review oraz mentoring mniej doświadczonych członków zespołu.) Requirements: Apache Spark, PySpark, Spark, SQL, API, MongoDB, Prometheus, Jenkins, Jira, Kubernetes, Docker, Azure, AWS, GCP
Inter Cars S.A. · Poland