DevOps Observability Lead

Carecone โ€” Australia ยท Posted ~1 day ago

Lead Full-time Onsite

Skills

AWS CloudWatch AWS EKS AWS Lambda AWS SNS Observability SRE SLI/SLO Infrastructure as Code Terraform CloudFormation Incident Management AWS CloudWatch EKS Lambda SNS Grafana Datadog Splunk Dynatrace

๐Ÿ”“ Log in to save this job, tailor your resume & track your apply process โ€” 7 days free, no card needed.

Log in to add to target list

Summary

Lead observability initiatives for a cloud-native environment by designing monitoring solutions, improving reliability, defining service objectives, and collaborating across engineering teams using modern cloud technologies.

Highlights

Lead observability strategy for a cloud-native platform, shape reliability standards, and work with modern AWS technologies in a permanent position.

Description

Title: DevOps Observability Lead Location: Sydney Permanent Role. Job Summary: We are seeking an experienced DevOps Observability Lead to drive observability and monitoring initiatives for our cloud-native AWS platform. This role involves designing monitoring solutions, defining SRE standards, establishing SLIs/SLOs, and improving platform reliability through proactive monitoring and alerting. Responsibilities: Design and implement observability solutions for AWS-based platforms including EKS, Lambda, and SNS.Define SLIs, SLOs, monitoring standards, and alerting strategies to ensure optimal performance.Build and maintain centralized monitoring solutions using AWS CloudWatch.Develop dashboards and alerts tailored for engineering, operations, and business stakeholders.Lead incident monitoring, troubleshooting, and reliability improvement initiatives.Drive Infrastructure-as-Code (IaC) adoption for observability deployments.Collaborate with cross-functional teams to enhance platform reliability and operational excellence. Mandatory Skills: Proficient in AWS CloudWatch, EKS, Lambda, and SNS.Strong understanding of Observability & Monitoring practices.Experience with SRE Practices including SLIs/SLOs and Incident Management.Expertise in Dashboarding & Alerting.Proficient in Infrastructure as Code (Terraform/CloudFormation preferred).Solid background in DevOps & Cloud Operations.Experience in Root Cause Analysis and Performance Monitoring. Preferred Skills: Familiarity with monitoring tools such as Grafana, Datadog, Splunk, Dynatrace, or similar.AWS and/or DevOps certifications. Qualifications: Bachelor's degree in Computer Science, Information Technology, or a related field.8 -12+ years of relevant experience in DevOps and observability.Proven track record of leading observability initiatives in cloud environments.Strong analytical and problem-solving skills.Excellent communication and collaboration abilities.