Inżynier SRE / Specjalista ds. Operacji Incydentowych

Clurgo to firma stworzona przez developerów dla developerów. Nasze zespoły łączą pełne spektrum kompetencji - od rozwoju oprogramowania i infrastruktury, przez analizę oraz testy, aż po strategiczne zarządzanie produktem i procesami. Realizujemy różnorodne projekty IT dla klientów z wielu branż, dbając o dobre praktyki programistyczne i zachowanie work-life balance. Tworzymy rozwiązania, które mają znaczenie - dla firm w Polsce i na całym świecie.

 

✅ Dołącz do zespołu odpowiedzialnego za stabilność i niezawodność środowiska produkcyjnego dla Klienta z branży finansowej. W tej roli będziesz zajmować się obsługą incydentów, analizą problemów technicznych oraz automatyzacją działań operacyjnych. Będziesz pracować z systemami monitoringu i observability, analizować logi oraz metryki, a także współpracować z zespołami developerskimi i infrastrukturalnymi przy identyfikowaniu przyczyn problemów i zapobieganiu ich ponownemu występowaniu.

✅Technologie i narzędzia: Datadog, Chronosphere, PagerDuty, Backstage, Jira, Python, Kafka, API.

 

Szukamy Ciebie, jeśli:

👉 masz minimum 5 lat doświadczenia w obszarze IT Operations, Site Reliability Engineering (SRE), Technical Operations lub podobnej roli

👉 masz praktyczne doświadczenie w obsłudze incydentów produkcyjnych, analizie problemów oraz prowadzeniu działań troubleshootingowych w środowiskach o wysokiej dostępności

👉 bardzo dobrze znasz narzędzia observability i monitoringu, takie jak Datadog, Chronosphere lub rozwiązania o podobnym zastosowaniu, oraz potrafisz pracować z systemami alertowania, np. PagerDuty

👉 potrafisz analizować logi, metryki i dane systemowe, identyfikować przyczyny problemów oraz przekładać wnioski z incydentów na konkretne usprawnienia

👉 masz doświadczenie z integracjami API, automatyzacją procesów oraz skryptowaniem w Pythonie; znajomość Kafka będzie dodatkowym atutem

👉 potrafisz zachować skuteczność działania podczas incydentów, jasno komunikować status i współpracować z zespołami technicznymi oraz biznesowymi

 

Zadania:

  • monitorowanie logów, metryk i alertów w celu szybkiego wykrywania oraz rozwiązywania incydentów
  • prowadzenie i koordynowanie działań związanych z incident response oraz troubleshootingiem problemów produkcyjnych
  • analiza przyczyn źródłowych incydentów oraz identyfikowanie możliwości poprawy niezawodności systemów
  • tworzenie i utrzymywanie runbooków, procedur operacyjnych oraz dokumentacji związanej z obsługą incydentów
  • automatyzacja powtarzalnych zadań operacyjnych z wykorzystaniem skryptów i integracji API
  • współpraca z zespołami developerskimi, infrastrukturalnymi i produktowymi przy rozwiązywaniu problemów oraz wdrażaniu usprawnień
  • rozwój dashboardów, alertów i mechanizmów monitorowania wspierających proaktywne wykrywanie problemów
  • udział w działaniach post-incident, wyciąganie wniosków i wdrażanie usprawnień zapobiegających podobnym incydentom w przyszłości

 

Czego możesz się spodziewać:

  • współpracy w oparciu o kontrakt B2B
  • pracy zdalnej
  • 🏃‍♀️benefitów: opieka medyczna, karta multisport, lekcje języka angielskiego
  • 🎉integracji - lubimy spędzać razem czas
  • profesjonalnego procesu rekrutacyjnego – zawsze otrzymasz od nas feedback niezależnie od decyzji

 

Poznaj nas lepiej👉 https://www.facebook.com/clurgo/

 

140 – 170 PLN

salary_range.period.net.hourly - salary_range.contract_type.b2b

job_post.job_details

job_post.remote_status

remote_status.remote
ID: 217 job_post.published_on: 21/08/2026
announcement.apply