Summary
✨ AI‑Generated
Develop and operate a scalable data platform designed for massive heterogeneous datasets, including imagery, video, sensor, geographic, and other unstructured data. You will build robust batch and streaming pipelines, establish storage and lifecycle strategies, and implement semantic models that connect data objects and relationships across systems.
Highlights
Build scalable data infrastructure for very large and diverse datasets, combining modern lakehouse architecture, batch and streaming pipelines, advanced storage strategies, and semantic data modeling.
Description
WOFÜR WIR SIE SUCHEN
Konzeption, Weiterentwicklung und praktische Implementierung einer skalierbaren Data-Lakehouse- und Datenplattform-Architektur für sehr große, heterogene DatenmengenEntwicklung einer langfristigen Daten- und Speicherstrategie unter Berücksichtigung von Performance, Skalierbarkeit, Datenlebenszyklus, Kosten, Verfügbarkeit und betrieblichen AnforderungenKonzeption geeigneter Speicher- und Zugriffskonzepte für große Mengen an Bild-, Video-, Sensor-, Geo- sowie weiteren unstrukturierten und semi-strukturierten Daten, einschließlich Metadaten, Partitionierung, Indexierung, Kompression und ArchivierungAufbau und Betrieb robuster Batch- und Streaming-Pipelines für die Aufnahme, Verarbeitung, Transformation und Bereitstellung von Daten aus heterogenen QuellenMitgestaltung und Implementierung eines semantischen Datenmodells bzw.
einer Ontologie, mit der Datenobjekte, Entitäten, Beziehungen und Kontext systemübergreifend beschrieben und verknüpft werden könnenSchaffung einer belastbaren Datenbasis für Machine Learning, KI-basierte Anwendungen und autonome Systeme, einschließlich nachvollziehbarer Datenherkunft sowie reproduzierbarer Trainings- und ValidierungsdatensätzeSicherstellung von Data Lineage, Datenversionierung, Datenqualität, Schema-Management und geeigneten Governance- und Zugriffskonzepten über den gesamten DatenlebenszyklusEntwicklung und Betrieb der Datenplattform in großen, verteilten Kubernetes-basierten Infrastrukturen sowie Integration in Infrastructure-as-Code- und CI/CD-/DevSecOps-ProzesseAnalyse und Optimierung von Datenlayouts, Datenlokalität, Compute-Nähe und Datenbewegungen für datenintensive AnwendungenBewertung geeigneter Open-Source- und kommerzieller Technologien sowie Umsetzung von Proofs of Concept bis hin zu produktionsreifen, skalierbaren LösungenEnge Zusammenarbeit mit AI/ML-, Software-, Plattform- und Cyber-Security-Teams bei Architekturentscheidungen, Schnittstellen, Datenprodukten und operativer Umsetzung
WAS SIE MITBRINGEN SOLLTEN
Erfolgreich abgeschlossenes Studium im Bereich Informatik, Data Engineering, Software Engineering, Wirtschaftsinformatik oder eine vergleichbare QualifikationMehrjährige praktische Erfahrung im Data Engineering und im Aufbau bzw.
in der Weiterentwicklung verteilter DatenplattformenSehr gutes Verständnis moderner Data-Lake-/Lakehouse-Architekturen, Object Storage sowie der grundlegenden Trade-offs zwischen Speicher, Compute, Datenbewegung, Performance und KostenNachweisbare Hands-on-Erfahrung mit Datenpipelines, Datenmodellierung, SQL und mindestens einer relevanten Programmiersprache, vorzugsweise PythonSolide Kenntnisse zu Metadaten, Datenqualität, Schema-Management, Data Lineage und reproduzierbarer VerarbeitungPraktisches Verständnis von Linux, Containern und Kubernetes sowie die Fähigkeit, Datenkomponenten in einer verteilten Plattform selbst zu implementieren, zu betreiben und zu analysierenSichere Englischkenntnisse in Wort und SchriftFähigkeit, Architekturentscheidungen mit praktischer Umsetzung zu verbinden und Probleme systematisch bis auf technische Ursachen zu untersuchenStrukturierte und teamorientierte Arbeitsweise Erfahrung mit sehr großen Mengen an Bild-, Video-, Sensor- oder Geodaten sowie Kenntnisse in Ontologien, Knowledge Graphs, semantischen Datenmodellen, Entity Resolution oder vergleichbaren Ansätzen von VorteilErfahrung mit Technologien für verteilte Datenverarbeitung und Streaming, z.
B.
Spark, Flink, Trino, Kafka oder vergleichbaren Lösungen sowie Erfahrung mit offenen Lakehouse-Tabellenformaten bzw.
vergleichbaren Technologien, z.
B.
Apache Iceberg, Delta Lake oder Apache Hudi sind förderlichErfahrung in der Bereitstellung und Versionierung von Daten für Machine-Learning-, MLOps-, AI- oder Autonomie-Workloads von VorteilKenntnisse in Infrastructure as Code, GitOps oder automatisierten Plattform- und Deployment-Prozessen sowie Erfahrung mit hochverfügbaren, On-Premises-, Edge- oder zeitweise nicht verbundenen Datenplattformen von Vorteil
Für diese Rolle sind belastbare Grundlagen und praktische Umsetzungserfahrung entscheidend.
Die zusätzlichen Spezialkenntnisse sind ausdrücklich keine Voraussetzung.
Stärken und Erfahrungen zählen bei Rheinmetall, auch wenn vielleicht nicht alle aufgeführten Anforderungen vollständig erfüllt sind.
Wir freuen uns auf Bewerber (m/w/d), die Lust haben, etwas zu bewegen und Verantwortung zu übernehmen.
Wir legen Wert auf Individualität und Chancengleichheit.
Schwerbehinderte Bewerber (m/w/d) werden bei gleicher Eignung besonders berücksichtigt.
WAS WIR IHNEN BIETEN
An unserem Standort in Bremen bieten wir Ihnen:
Betriebliche AltersvorsorgeAktienkaufprogramm30 UrlaubstageZugang zu den Corporate BenefitsDeutschlandticketUmzugsunterstützungVIVA FamilienserviceIndividuelle und vielfältige externe sowie interne Weiterentwicklungsmöglichkeiten u.a.
in der Rheinmetall AcademyProfessioneller Einarbeitungsprozess begleitet durch ein digitales Onboarding
KONTAKTDETAILS
Zuständige/r Ansprechpartner/in: Özge Demirkaya
Für Fragen zu Ihrer Bewerbung, nutzen Sie bitte das Kontaktformular.