Summary
A cloud infrastructure role focused on ensuring reliability of large-scale distributed platforms. The engineer works closely with customers, investigates complex technical issues, improves operational processes, and develops automation for resilient systems.
Highlights
Opportunity to work on advanced cloud infrastructure, solve complex reliability challenges, collaborate with customers, and contribute to automation and platform improvements in a secure environment.
Description
Schwarz Digits schafft das technologische Fundament für digitale Entscheidungsfreiheit in Europa.
Als IT- und Digitalsparte der Schwarz Gruppe entwickeln und verantworten wir einerseits die IT-Infrastrukturen für die Handelssparten Lidl und Kaufland sowie die Schwarz Produktion und PreZero.
Gleichzeitig agieren wir als unabhängiger Anbieter am externen Markt, um Unternehmen in ganz Europa bei ihrer digitalen Transformation zu unterstützen.
Unsere Kernleistungen bündeln wir in den Bereichen Cloud, Cyber Security, Data & AI, Communication und Workspace.
Trage auch du zur digitalen Entscheidungsfreiheit in Europa bei.
Bei uns arbeitest du an der Schnittstelle zwischen Agilität und Sicherheit: Du profitierst von den schnellen Entscheidungswegen, genießt echte Gestaltungsspielräume in deinen Projekten und baust dabei auf das stabile Fundament der Schwarz Gruppe.
Deine Aufgaben
Du bist technischer Partner und Eskalationsstufe zugleich - direkt an der Seite des Kunden auf unseren hochkomplexen Plattformen (Kubernetes, KubeVirt, Cilium, Ceph, Talos).
Tickets organisieren die Arbeit; die eigentliche Tätigkeit findet im gemeinsamen Debug-Session, Call und War Room statt - mit dem Kunden, nicht für ihn.Du lebst Shared Fate: In PRRs analysierst du Design, Betrieb und Monitoring von Kunden-Workloads, identifizierst Reliability-Lücken und hilfst, messbare SLOs zu definieren.
Mit Guides, Tutorials und Talks befähigst du Kunden, ihre Workloads von Anfang an richtig aufzubauen - statt reaktive Incidents zu debuggen.Du analysierst geschäftskritische Kunden-Workloads in der Tiefe, debuggst komplexe Störungen gemeinsam mit dem Kunden-Team und beseitigst sie dauerhaft.
Wiederkehrende Probleme behandelst du als Softwareaufgabe und automatisierst sie mit Tools und Skripten.
Erkenntnisse fließen als präventive Optimierungen an das SRE-Kernteam zurück.Du arbeitest in hochsensiblen Umgebungen, mit allen daraus folgenden Sicherheits- und Compliance-Anforderungen.
Dein Profil
Du hast ein abgeschlossenes Studium in Informatik oder eine vergleichbare Qualifikation und bringst eine ausgeprägte Leidenschaft für systemnahe Technologien mit.Du besitzt mindestens 2 Jahre aktive Erfahrung im Betrieb von Cloud-Infrastrukturen mit Kubernetes und bringst eine ausgeprägte „Customer-First“-Mentalität mit - denn du weißt, dass eine stabile Plattform wertlos ist, wenn der Kunde sie nicht optimal nutzen kann.Du liebst es, tief in Log-Files, Traces und Metriken einzutauchen, um komplexe Fehlerbilder im Systemverbund zu isolieren und nachhaltig zu beheben.Du verfügst über Kenntnisse in der Softwareentwicklung und nutzt diese, um wiederkehrende Aufgaben dauerhaft und zuverlässig zu automatisieren.Da wir in einem hochgradig regulierten Umfeld agieren, bringst du die Bereitschaft zur Erfüllung unserer strengen Compliance-Vorgaben sowie für die Teilnahme an einer flexiblen Rufbereitschaft mit.Du schätzt den engen, organisationsweiten Austausch und arbeitest hochgradig partnerschaftlich mit dem SRE-Plattform-Team sowie unseren Software- und Produktentwicklern zusammen, um eine nahtlose Brücke zwischen Plattform-Infrastruktur und Anwendungsentwicklung zu schlagen.