Summary
✨ AI‑Generated
Join a platform operations team responsible for deploying, monitoring, and maintaining software across complex cloud, on-premises, and operational-technology environments. You will monitor system health, respond to incidents, coordinate resolutions, and help maintain stable 24/7 operations while working closely with engineering and customer IT/OT teams.
Highlights
Own reliable operation, monitoring, and deployment of software across complex customer environments. The role combines cloud, on-premises, and operational technology, with strong exposure to incident management, system reliability, and cross-functional collaboration.
Description
Deine Rolle
Als Platform Operations Engineer (all genders) bist du verantwortlich für den zuverlässigen Betrieb, die Überwachung und das Deployment der Softwarelösungen von envelio in komplexen Kundenumgebungen.
Du stellst sicher, dass Updates, Bugfixes und neue Versionen der Intelligent Grid Platform (IGP) reibungslos in Cloud-, On-Premise- und Operational-Technology-(OT)-Umgebungen ausgerollt werden.
Ein zentraler Bestandteil deiner Rolle ist der tägliche Betrieb der Kundensysteme, einschließlich der Überwachung der Systemgesundheit, der Bearbeitung von Incidents und der Koordination einer effektiven Incident-Lösung.
Du trägst aktiv zu einem stabilen 24/7-Betrieb bei, indem du Probleme frühzeitig erkennst, auf Incidents reagierst und eine klare Kommunikation sowie Übergaben sicherstellst.
Du arbeitest an der Schnittstelle zwischen Engineering, Betrieb und Kunden.
In enger Zusammenarbeit mit den IT- und OT-Teams der Kunden hilfst du dabei, Betriebsmodelle zu klären, die bestehende Infrastruktur zu verstehen und sicherzustellen, dass unsere Software zuverlässig und sicher in realen Netzumgebungen läuft.
Wie du etwas bewirkst
Du führst Software-Updates, Patches und Bugfixes in Kundenumgebungen aus - sowohl in Cloud-, On-Premise- als auch in OT-InfrastrukturenDu betreibst und wartest Kundensysteme und stellst einen stabilen und sicheren Tagesbetrieb sicherDu trägst zum 24/7-Betrieb bei, indem du an Bereitschaftsdiensten teilnimmst und eine schnelle Reaktionszeit im Falle von Incidents sicherstellstDu unterstützt Kunden bei Rollouts, Upgrades und operativen Incidents - auch außerhalb der regulären Geschäftszeiten, wenn erforderlichDu arbeitest direkt mit Kunden zusammen, um ihre Cloud-Kundenumgebungen (Kubernetes, meist Single-Tenant pro Kunde) sowie On-Premise- und OT-Landschaften zu verstehen und passende Betriebsmodelle zu definierenDu analysierst operative Probleme und koordinierst Troubleshooting gemeinsam mit Development, SRE und Security TeamsDu dokumentierst kundenspezifische Setups, operative Prozesse und Deployment-VerfahrenDu trägst dazu bei, Deployment- und Betriebsprozesse kundenübergreifend zu verbessern und zu standardisierenDu unterstützt interne Teams, indem du Feedback aus dem realen Kundenbetrieb in Produkt- und Engineering-Entscheidungen einbringst
Dein Profil
Perfektion ist ein Mythos! Viel mehr interessiert uns der Mensch hinter dem Bildschirm.
Diese Kriterien sind also eher als Orientierungshilfe für dich gedacht.
Wir sind gespannt, wie deine individuellen Fähigkeiten zu uns passen.
Du hast starke Erfahrung im Betrieb komplexer Cloud-Applikationen und weißt, wie man Services unter realen Bedingungen zuverlässig betreibtDu betreibst produktive Services auf Cloud-Infrastruktur (AWS/Azure/GCP) und kennst typische Failure-ModesDu hast praktische Erfahrung mit Linux und Networking-Basics im Troubleshooting (Logs, Systemzustand, Connectivity)Du kennst moderne Betriebsmodelle, wie Container/Kubernetes (oder vergleichbar) und kannst Deployments im Betrieb bewerten (Rollouts, Rollbacks)Du hast Erfahrung mit Infrastructure-as-Code-Tools (Terraform)Du arbeitest gerne hands-on operativ - von Deployments bis zum Troubleshooting in ProduktionsumgebungenDu verfügst über gute Kenntnisse in grundlegenden Security-KonzeptenDu arbeitest gerne eng mit Kunden zusammen und kannst technische Themen klar und pragmatisch erklärenDu hast Erfahrung mit Monitoring- und Observability-Plattformen (z.
B.
Datadog, Grafana oder vergleichbar)Du bist bereit und in der Lage, zum 24/7-Betrieb durch Bereitschaftsdienste im Rahmen einer geteilten Team-Rotation beizutragenDu bist strukturiert, zuverlässig und übernimmst Verantwortung für operative AufgabenDu arbeitest gut mit Software-Entwicklern zusammen und kannst operative Anforderungen in technische Requirements übersetzenDu bist mit Teilen unseres Tech Stacks vertraut oder traust dir zu, dich schnell einzuarbeitenDu beherrschst Deutsch und Englisch fließend in Wort und Schrift
Wie wir Software entwickeln
Klar definierte Verantwortung für Produktthemen und effiziente Koordination zwischen Squads und Customer SuccessStrukturiertes Incident Management (Service wiederherstellen, klar kommunizieren, dann Ursachenanalyse)Release-Prozesse mit pragmatischem Risikomanagement (sichere Änderungen, schnelle Rollbacks bei Bedarf)Monitoring- und Alerting-Hygiene (signal over noise)Umfassende Runbooks und Automatisierung zur langfristigen Reduzierung operativer Belastung
Unser Tech Stack
Hybrid-Cloud und on-prem Umgebungen, einschließlich vom Kunden betriebener InfrastrukturContainerisierte Anwendungen, orchestriert mit Kubernetes und HelmAnwendung primär in Python und TypeScriptStandard Backing Services wie PostgreSQL, RabbitMQ, RedisCloudflareGitlab & Gitlab CI zur Verwaltung des Software-Delivery-LifecyclesMehrere Cloud-AnbieterTerraform und Automatisierungs-Tooling zur Unterstützung von Deployments und BetriebDatadog (Monitoring, Alerting, Dashboards)Linux-Systeme, VPN-Technologien
Deine Benefits
Passe den Arbeitsmodus an deinen Lifestyle an - fully remote () oder hybrid mit Office-OptionOption zum mobilen Arbeiten aus dem Ausland (bis zu drei Monate pro Jahr von überall in der EU oder den USA)State of the Art Technologie und moderner Tech StackSehr gute Hardware-Ausstattung (16 Zoll MacBooks, 2 Bildschirme an deinem Arbeitsplatz)30 Urlaubstage + 3 corporate holidaysUnterstützung deiner Gesundheit mit der Urban Sports Club KooperationFlexible Nutzung eines monatlichen Mobilitätsbudgets (z.B.
Jobrad, ÖPNV)Zeit und Budget für individuelles Wachstumoptionale Betriebliche AltersvorsorgeRegelmäßige Company und Team Events