Summary
✨ AI‑Generated
An AIOps engineering role focused on building and operating high-performance AI inference infrastructure. You will deploy and optimize model-serving services on Kubernetes-based platforms, manage NVIDIA GPU resources, automate model onboarding and deployment, implement autoscaling, and build comprehensive monitoring, logging, and tracing capabilities.
Highlights
Work on advanced AI infrastructure, GPU optimization, model serving, automation, autoscaling, and observability at large scale. The role offers hands-on responsibility across the full AI inference lifecycle.
Description
Deine Aufgabe
Design, Bereitstellung und Wartung von vLLM-Inference-Services auf OpenShift/Kubernetes, die auf Bare-Metal-GPU-Infrastruktur laufen.Verwaltung von NVIDIA-GPU-Ressourcen, einschließlich GPU-Partitionierung und -Zuweisung, um die Auslastung über mehrere Modelle und Mandanten hinweg zu maximieren.Automatisierung des Modell-Lifecycle-Managements, einschließlich Modell-Onboarding, Versionierung, Deployment, Hot-Swapping und Rollback aus privaten Registries wie Hugging Face Enterprise und S3.Implementierung und Verwaltung von Horizontal Pod Autoscaling (HPA) basierend auf Workload-Nachfrage, Queue-Tiefe und GPU-Ressourcenauslastung.
Optimierung von vLLM-Konfigurationen und Serving-Parametern zur Maximierung von Performance, Durchsatz und Ressourceneffizienz.Aufbau und Wartung von Observability- und Monitoring-Lösungen für AI-Inference-Services, einschließlich Metriken-Erfassung, Logging und Tracing.Instrumentierung von vLLM-Endpoints zur Bereitstellung von Metriken zu Token-Verbrauch, Latenz, Durchsatz und Fehlerraten.Entwicklung von Mechanismen zur Nutzungsverfolgung, um den Token-Verbrauch nach API-Key, Benutzer, Team oder Abteilung zu überwachen und Quota-Management sowie Chargeback-/Showback-Anforderungen zu unterstützen.Erstellung und Wartung von Grafana-Dashboards, die Infrastruktur-Health, GPU-Auslastung, Inference-Performance, Service-Verfügbarkeit und Business-Consumption-Metriken abdecken.Konfiguration von proaktivem Monitoring und Alerting mit Prometheus und Alertmanager zur Erkennung von Infrastrukturausfällen, Performance-Degradation und ungewöhnlichen Verbrauchsmustern.Implementierung und Wartung von API-Gateway-Lösungen zur Bereitstellung von Authentifizierung, Autorisierung, Rate Limiting und intelligentem Routing zu Inference-Services.Sicherstellung des sicheren Betriebs von AI-Services durch Netzwerksegmentierung, Ingress- und Egress-Kontrollen sowie Einhaltung von Security-Best-Practices.Wartung von Audit-Logging-Funktionen zur Unterstützung von Compliance, Sicherheitsuntersuchungen und operativer Governance.Zusammenarbeit mit AI Engineering, Platform Engineering, Security und Infrastructure-Teams zur Bereitstellung zuverlässiger, skalierbarer und sicherer AI-Services.Teilnahme an Troubleshooting, Incident Response, Root-Cause-Analysen und kontinuierlichen Plattform-Verbesserungsinitiativen.
Dein Profil
Mindestens 5 Jahre Erfahrung in DevOps, Site Reliability Engineering (SRE), Platform Engineering oder Infrastructure Operations.
Mindestens 2 Jahre praktische Erfahrung in der Unterstützung von MLOps, AI-Infrastruktur oder Large Language Model (LLM) Plattformen.
Ausgeprägte Erfahrung mit Kubernetes- und OpenShift-Administration in Produktionsumgebungen.
Nachgewiesene Erfahrung im Deployment und Betrieb von vLLM-basierten Inference-Plattformen in Produktionsumgebungen.
Fundiertes Verständnis von LLM-Serving-Konzepten, einschließlich Paged Attention, Continuous Batching und Inference-Optimierungstechniken.
Tiefgreifende Kenntnisse in NVIDIA GPU-Technologien, CUDA-Treibern, NVIDIA Container Toolkit und GPU-Troubleshooting.
Praktische Erfahrung mit Prometheus, Grafana, OpenTelemetry und ELK Stack.
Erfahrung im Aufbau von Observability-Lösungen, einschließlich Custom Metrics, Exporters, Dashboards und Alerting-Mechanismen.
Ausgeprägte Python-Programmierkenntnisse mit Erfahrung in der Entwicklung von Automatisierungs- und Operational-Tooling.
Erfahrung mit Bash-Scripting und Linux-Systemadministration.
Vertrautheit mit GitLab CI, Jenkins, ArgoCD und Infrastructure-as-Code-Praktiken.
Ausgeprägte analytische und Problemlösungsfähigkeiten mit der Fähigkeit, in komplexen, verteilten Umgebungen zu arbeiten.
Ausgezeichnete Kommunikations- und Kollaborationsfähigkeiten.
Über uns
Bei T Hub zu arbeiten bietet dir eine einzigartige und äußerst lohnende Erfahrung auf dem IT-Markt.
Als führendes Unternehmen in der Telekommunikationsbranche bieten wir dir nicht nur eine Plattform, um deine technischen Fähigkeiten zu verfeinern, sondern befähigen dich auch, ein Katalysator für Innovation zu sein.
Du hast die Möglichkeit, an der Spitze moderner Technologien zu arbeiten, von 5G über IoT bis hin zu KI, und die Zukunft der Konnektivität zu gestalten.
Beschäftigungsform: Arbeitsvertrag
Standort: Warschau/Remote/Hybrides Arbeitsmodell
Hast du dich jemals gefragt, ob du lieber in einem Big-Tech-Unternehmen, einem Software-Haus oder einem Startup arbeiten möchtest? Zu Hause oder im Büro? In internationalen Teams oder polnischen? Bei T Hub gibt es eine Antwort - JA!
T Hub Poland ist eine dynamische, zukunftsorientierte Abteilung in T-Mobile Poland, wo Technologie zählt! Es ist ein Ort, an dem die besten Talente zusammenkommen, um innovative Lösungen in internationalen Projekten der Deutsche Telekom Group zu entwickeln, zu prototypisieren und umzusetzen.