Staff Storage Reliability Engineer

Ionos — Germany · Posted ~8 hours ago

Full-time Visa History ✓

Skills

Ceph Object Storage Linux Storage Systems Production Operations Performance Optimization Cluster Management Reliability Engineering

🔓 Log in to save this job, tailor your resume & track your apply process — 7 days free, no card needed.

Log in to add to target list

Summary ✨ AI‑Generated

Join a large-scale infrastructure team responsible for a rapidly growing public object-storage platform. You will deploy and operate distributed storage clusters, optimize performance, remove bottlenecks, and help maintain availability, security, and reliability as the platform scales across multiple locations.

Highlights

Work on a large-scale global object-storage platform with petabyte-scale infrastructure. The role offers substantial ownership over production reliability, performance, security, deployment, and operational improvements while collaborating closely with operations teams.

Description

Als Staff Storage Reliability Engineer arbeitest du an unserer globalen, öffentlichen Object-Storage-Plattform auf Ceph-Basis. Du entwickelst Lösungen, die in der Produktion skalieren, und arbeitest eng mit unserem Operations-Team zusammen, um die Plattformen zu bauen, zu deployen und zu betreuen. Derzeit liegen wir im zweistelligen Petabyte-Bereich, verteilt über mehrere Standorte. Unsere Ceph-Plattform wächst schnell und ist ein kritischer Bestandteil unserer internen und öffentlichen Infrastruktur. Du wirst aktiv an der Weiterentwicklung mitwirken, unsere Produktionsumgebungen verbessern und betreuen und dafür sorgen, dass Verfügbarkeit, Performance und Sicherheit beim Skalieren erhalten bleiben. Aufgaben Ceph-Deployment und -Management: Ceph-Cluster bereitstellen, konfigurieren und betreiben – inklusive der Verwaltung von Storage-Pools, Placement-Groups und weiteren Kernkomponenten.Performance-Optimierung: Ceph für optimale Leistung abstimmen, Engpässe beseitigen und eine effiziente Ressourcennutzung sicherstellen.Automation: Automatisierungs-Strategien für Ceph-Deployments, Upgrades und Wartungsaufgaben entwickeln und umsetzen.Fehlersuche und Problemlösung: Komplexe technische Probleme im Zusammenhang mit Ceph-Storage diagnostizieren und beheben – häufig in Zusammenarbeit mit anderen Teams.Zusammenarbeit: Eng mit Entwicklungsteams, System-Administratoren und anderen Stakeholdern kooperieren, um Ceph in verschiedene Systeme und Anwendungen zu integrieren.Auf dem Laufenden bleiben: Die neuesten Ceph-Entwicklungen, neuen Features und Best-Practices verfolgen und in der Ceph-Community aktiv mitwirken und Wissen teilen. Qualifikationen 5+ Jahre Erfahrung als Senior Linux Engineer oder Site Reliability Engineer; tiefes und breites Verständnis von Linux-Systemen und Netzwerken.Fundierte Kenntnisse in Ceph-Architektur und -Administration.Erfahrung mit Cloud-Storage-Technologien (File, Object, Block).Praxis mit Automatisierungstools (z. B. Ansible) sowie Monitoring- und Observability-Lösungen.Vertrautheit mit Cloud-Plattformen und Container-Technologien (z. B. Docker).Hervorragende Fähigkeiten zur Fehlersuche und Problemlösung, starke Kommunikations- und Kollaborationsfähigkeiten. Benefits Hybrid Arbeitsmodell.Flexible Arbeitszeiten durch Vertrauensarbeitszeit.An einigen Standorten eine bezuschusste Kantine und verschiedene kostenfreie Getränke.Moderne Büroflächen mit sehr guter Verkehrsanbindung.Diverse Mitarbeiterrabatte für Aktivitäten und Produkte.Mitarbeiterevents wie Sommer- und Winterfeiern sowie Workshops.Zahlreiche Weiterbildungs- und Entwicklungsmöglichkeiten.Verschiedene Gesundheitsangebote, wie Sport- und Gesundheitskurse.