Site Reliability Engineer

Transeugroup — Poland · Posted ~2 hours ago

Mid Full-time

Skills

SRE DevOps Monitoring Incident response Automation Cloud optimization SLI/SLO Root cause analysis Scalability Cloud cost optimization Cloud Alerting

🔓 Log in to save this job, tailor your resume & track your apply process — 7 days free, no card needed.

Log in to add to target list

Summary ✨ AI‑Generated

A technology organization is seeking an SRE/DevOps professional to improve the reliability, performance, security, scalability, and cost efficiency of critical systems. You will define and maintain SLI/SLOs, manage incidents and root-cause analysis, improve monitoring and alerting, benchmark systems, and develop scaling strategies.

Highlights

Focus on system reliability, performance, security, scalability, and cost efficiency while working collaboratively with platform and development teams on monitoring, incident management, and cloud optimization.

Description

Kogo szukamy Szukamy osoby z doświadczeniem w SRE/DevOps, która potrafi zadbać o stabilność, wydajność oraz bezpieczeństwo infrastruktury. Ważne, żeby swobodnie poruszała się w chamonitoringu, reagowaniu na incydenty, automatyzacji i optymalizacji oraz lubiła szukać i rozwiązywać problemy. Rola i zespół: Dołączysz do zespołu odpowiedzialnego za zapewnienie niezawodności, skalowalności i efektywności systemów Trans.eu poprzez inżynieryjne podejście do problemów operacyjnych. Zespół dba o utrzymanie równowagi pomiędzy doskonałością operacyjną a efektywnością kosztową. Na co dzień współpracuje m.in. z zespołami Platform Engineering oraz zespołami deweloperskimi. Co będziesz robić: Definiować i utrzymywać SLI/SLO dla krytycznych usług oraz zarządzać incydentami, dostarczając analizę przyczyn źródłowych (RCA).Współpracować z innymi zespołami w zakresie systemów monitoringu, alertingu i optymalizacji kosztów Cloud.Przeprowadzać benchmarking, definiować strategię skalowania i zapewniać testy obciążeniowe dla krytycznych zmian.Uczestniczyć w planowaniu i testowaniu disaster recovery oraz wspierać hardening infrastruktury.Wykonywać pre-deployment readiness checks, walidując aplikacje przed wdrożeniem na produkcję. Wymagania: Umiejętność projektowania i obsługi systemów monitoringu oraz alertówZnajomość narzędzi do analizy logów i zarządzania politykami retencjiZnajomość i praktyczne stosowanie procesów SLI/SLO, error budgets, RCA oraz postmortemówPraktyczna znajomość AWS, Kubernetes oraz narzędzi wspierających zarządzanie infrastrukturą i automatyzacjęUmiejętność planowania i optymalizacji wydajności infrastruktury, w tym benchmarkingu, load testingu, capacity planningu i autoscalinguUmiejętność diagnozowania i rozwiązywania problemów w środowiskach rozproszonych oraz sprawnego reagowania na incydentyZnajomość narzędzi i praktyk związanych z CI/CD, GitOps oraz automatyzacją infrastrukturyUmiejętność tworzenia skryptów i narzędzi automatyzujących pracę z wykorzystaniem Bash i Python Dostaniesz plusa za: Posiadane certyfikaty takie jak: Google Cloud Professional Cloud DevOps Engineer, AWS Certified DevOps Engineer, Certified Kubernetes Administrator (CKA), Linux Foundation Certified System Administrator (LFCS).Możliwości rozwoju: Praca w zespole, który stawia na eksperymentowanie i innowacje, dając Ci przestrzeń do wdrażania własnych pomysłów i rozwiązań – u nas masz realny wpływ na rozwój projektów, produktów i usług.Wymiana wiedzy w ramach tematycznych gildii organizowanych przez współpracowników – dzięki temu możesz być na bieżąco w swojej dziedzinie lub zdobywać nowe umiejętności.Środowisko nastawione na rozwój – kultura, która uczy się na błędach i wspiera eksperymentowanie.Rozwój umiejętności w pracy z nowoczesnymi narzędziami AI – inwestujemy w najnowsze technologie i doskonalimy procesy wewnętrzne, abyś zawsze był na bieżąco w branży technologicznej.