Senior Site Reliability Engineer

Cplace Software — Germany · Posted ~7 hours ago

Senior Full-time Remote

Skills

Kubernetes cloud operations Terraform GitOps networking storage scalability Linux cloud infrastructure Elasticsearch Ansible cloud

🔓 Log in to save this job, tailor your resume & track your apply process — 7 days free, no card needed.

Log in to add to target list

Summary ✨ AI‑Generated

A Senior Site Reliability Engineer position for a Germany-remote cloud operations team. You will operate and improve production cloud environments while helping build a Kubernetes-based next-generation platform, developing reusable Terraform modules, GitOps repositories, automation, networking, storage, tenant isolation, and migration strategies.

Highlights

Fully remote within Germany, with a senior role shaping a Kubernetes-based cloud platform and its operating model. Strong focus on infrastructure as code, GitOps, automation, scalability, cloud architecture, and practical use of AI.

Description

Deine Aufgaben cplace ist die Plattform für Projekt- und Portfoliomanagement, mit der führende Unternehmen ihre komplexesten Vorhaben steuern – gewachsen in der DACH-Region und mit dem Start in den USA auf dem Weg zum internationalen Anbieter. Als Senior SRE in unserem Cloud-Operations-Team betreibst du die bestehende cplace Cloud 1.0 für Kunden aus Automotive, Life Sciences, Industrie und Handel stabil und sicher – und gestaltest Architektur und Betriebsmodell der Kubernetes-basierten cplace Cloud 2.0 aktiv mit. KI liegt in der DNA von cplace: Wir nutzen sie intensiv in allen Aufgaben und erwarten, dass du sie produktiv und kritisch einsetzt und mit uns weiterentwickelst. cplace Cloud 2.0: Mitaufbau der Kubernetes-Plattform – von Cluster-Design, Netzwerk und Storage bis zu Mandantentrennung und Skalierung – sowie Planung und Begleitung der Migration der Kundenumgebungen aus Cloud 1.0Everything as Code: Entwicklung wiederverwendbarer Terraform-Module, GitOps-Repositories und eigener Plattform-Software (Self-Service-Portal, APIs, Automatisierungen) inkl. Code-Reviews, automatisierter Tests und Policy as Codecplace Cloud 1.0: Betrieb und Weiterentwicklung der Umgebung aus Linux-Servern, Containern, SQL-Datenbanken und Elasticsearch, nachhaltige Behebung von Fehlern, Findings und Capacity-Themen (Incident- und Problem-Management, Post-Mortems) sowie Überführung manueller Abläufe in versionierten, getesteten Code (Ansible, Terraform, n8n)Verbesserung von Monitoring, Logging und Alerting; Verantwortung für Backup & Recovery, Disaster Recovery und Business Continuity inkl. regelmäßiger TestsTechnische Umsetzung von Security- und Compliance-Anforderungen (z. B. SOC 2, ISO 27001, DSGVO) sowie Optimierung von Kosten und KapazitätenVorantreiben von KI im Betrieb, z. B. für Incident- und Log-Analyse und Agenten für Runbooks und RoutineaufgabenEnge Zusammenarbeit mit der Produktentwicklung für reibungslose Releases, technische Vertretung des Teams in Kundengesprächen, Ausschreibungen und Kundenprojekten sowie Wissensweitergabe über interne und externe Dokumentation und als Mentor*inRufbereitschaft in fairer Rotation Dein Profil Studium der Informatik oder eines verwandten MINT-Fachs oder vergleichbare Ausbildung (z. B. Fachinformatiker*in) sowie mehrjährige Erfahrung (idealerweise 5+) als SRE, DevOps- oder Platform-Engineer in geschäftskritischen ProduktionsumgebungenFundierte Praxis mit Kubernetes in Produktion (Betrieb, Upgrades, Troubleshooting, Storage, Netzwerk) und mit mindestens einem Cloud-Provider – AWS, GCP, Azure und/oder Hetzner Cloud als klares PlusTiefe Erfahrung mit Infrastructure as Code (Terraform, Ansible), CI/CD, GitOps und Git-basierter Zusammenarbeit über Pull Requests und Code-Reviews – mit modularem, getestetem und im Team wartbarem CodeSehr gute Linux-Kenntnisse sowie Erfahrung mit SQL-Datenbanken (z. B. MariaDB), Elasticsearch/OpenSearch und Observability-Stacks (z. B. Prometheus, Grafana, Loki/ELK)Solide Software-Engineering-Kenntnisse, idealerweise in Go oder Python – Tools und Automatisierungen mit Tests und sauberer Struktur statt Einweg-Skripten; sicheres Bash-Skripting vorausgesetztGutes Verständnis von Cloud-Security (z. B. Netzwerksegmentierung, Secrets-Management, WAF)Praxiserfahrung mit KI-Werkzeugen im Engineering-Alltag und Gespür für deren Möglichkeiten und GrenzenKundenorientierte, strukturierte Arbeitsweise, Fähigkeit zur verständlichen Vermittlung technischer Themen sowie sehr gute Deutsch- und Englischkenntnisse Was wir bieten Flexibles Arbeitsmodell und Remote Work OptionRaum für Kreativität, Mitgestaltung und WeiterentwicklungWettbewerbsfähiges Gehalt, 30 Tage Urlaub & Sabbatical OptionWellpass, Jobrad & Corporate BenefitsModerne und zentrale Offices in München, Hannover und LudwigsburgHardware deiner Wahl