Senior Data Engineer - Spark / Data Lakehouse

Clurgo to firma stworzona przez developerów dla developerów. Nasze zespoły łączą pełne spektrum kompetencji - od rozwoju oprogramowania i infrastruktury, przez analizę oraz testy, aż po strategiczne zarządzanie produktem i procesami. Realizujemy różnorodne projekty IT dla klientów z wielu branż, dbając o dobre praktyki programistyczne i zachowanie work-life balance. Tworzymy rozwiązania, które mają znaczenie - dla firm w Polsce i na całym świecie.

✅Dołącz do zespołu Data Platform naszego Klienta z sektora bankowego, gdzie będziesz projektować i wdrażać rozwiązania do rekoncyliacji danych w ODS opartym o MongoDB oraz budować warstwy danych w architekturze Data Lakehouse. Rola łączy rozwój rozwiązań opartych o Apache Spark, PySpark i Spark SQL z optymalizacją przetwarzania danych, wdrażaniem CI/CD oraz monitoringiem procesów batch i streamingowych. Będziesz mieć wpływ na jakość, wydajność i niezawodność kluczowych procesów danych w środowisku dużej organizacji bankowej.

✅Technologie i narzędzia: Python, Apache Spark, PySpark, Spark-SQL, DataFrames, Structured Streaming, MongoDB, MongoDB Spark Connector, Delta Lake, Apache Iceberg, Hudi, Jenkins, Prometheus, Grafana, OpenTelemetry, Dynatrace, Kubernetes, Docker, Spark Operator

✅Model hybrydowy: 1 raz w tygodniu z biura we Wrocławiu

Szukamy Ciebie, jeśli:

👉 Posiadasz min. 4 lata praktycznego doświadczenia w środowiskach produkcyjnych z wykorzystaniem Apache Spark

👉 Masz doświadczenie z  PySpark, Spark-SQL, DataFrames oraz Structured Streaming

👉 Posiadasz doświadczenie w odczycie i zapisie danych z/ do MongoDB przy użyciu MongoDB Spark Connector

👉 Posiadasz praktyczne doświadczenie z architekturą Data Lakehouse (zarządzanie tabelami wersjonowanymi przy użyciu Iceberg, Delta Lake lub Hudi)

👉 Znasz Jenkinsa i potrafisz automatyzować testy (unit/integration) oraz procesy deploymentu aplikacji Spark

👉 Znasz narzędzia do monitoringu i obserwowalności (Prometheus, Grafana)

👉 Swobodnie komunikujesz się w języku angielskim (min. B2) i efektywnie pracujesz w metodykach Agile (Scrum/Kanban)

Mile widziane:

  • Praktyczna znajomość Dynatrace i OpenTelemetry
  • Doświadczenie z Docker oraz Spark Operator w środowisku Kubernetes

Zadania:

  • Projektowanie i implementacja zadań Spark-SQL/PySpark do weryfikacji spójności danych między ODS (MongoDB) a systemami źródłowymi
  • Łączenie Spark z MongoDB przy użyciu MongoDB Spark Connector
  • Optymalizacja odczytów z MongoDB
  • Budowa architektury medalionowej z wykorzystaniem technologii Iceberg/Delta Lake/Hudi
  • Implementacja CI/CD dla schematów tabel, migracji i wersjonowania
  • Kosztowa optymalizacja zapytań w środowisku Data Lakehouse
  • Konfiguracja metryk (Prometheus + Grafana), logów oraz śledzenia (OpenTelemetry, Dynatrace) dla Spark i procesów batch/stream
  • Definiowanie SLA/SLO oraz alertów
  • Diagnoza problemów z rekordami, opóźnieniami i niezgodnościami danych
  • Praca w Scrum/Kanban z Data Engineerami, Business Analystami, testerami i zespołem DevOps

Czego możesz się spodziewać:

  • współpracy w oparciu o kontrakt B2B
  • pracy hybrydowej: raz w tygodniu z biura we Wrocławiu
  • profesjonalnego procesu rekrutacyjnego – zawsze otrzymasz od nas feedback niezależnie od decyzji

 

Poznaj nas lepiej👉 https://www.facebook.com/clurgo/

 

145 – 160 PLN

salary_range.period.net.hourly - salary_range.contract_type.b2b

job_post.job_details

job_post.remote_status

remote_status.hybrid
ID: 234 job_post.published_on: 02/09/2026
announcement.apply