Site Reliability Engineering (SRE) Architect

Infoway Solutions — Canada · Posted ~4 hours ago

Lead Full-time

Skills

Site Reliability Engineering Observability SLO governance Reliability engineering Operational excellence Cloud-native architecture SLI/SLO/SLA design Error budgets Reliability governance Automation Resilience engineering Production readiness Dynatrace OpenTelemetry APM Distributed Tracing RUM Synthetic Monitoring Cloud-native technologies

🔓 Log in to save this job, tailor your resume & track your apply process — 7 days free, no card needed.

Log in to add to target list

Summary ✨ AI‑Generated

An experienced SRE Architect is sought to lead reliability transformation across large-scale cloud-native environments. The role focuses on enterprise SLI, SLO, SLA, error-budget and reliability-governance frameworks, alongside observability strategy, automation, resilient architecture, and production readiness. You will provide strong technical leadership and help establish reliable operational practices for mission-critical platforms.

Highlights

Lead enterprise-wide reliability transformation across large-scale cloud-native environments, shaping observability, governance, resilience, automation, and production-readiness practices for mission-critical platforms.

Description

Site Reliability Engineering (SRE) Architect Location: Vancouver, Canada Role Overview We are seeking an experienced Site Reliability Engineering (SRE) Architect to lead enterprise reliability transformation initiatives across large-scale cloud-native environments. The ideal candidate will have deep expertise in observability strategy, SLO governance, reliability engineering, operational excellence, and enterprise-scale SRE adoption. This role requires strong technical leadership to drive reliability frameworks, automation, resilience, and production readiness across mission-critical platforms. Key Responsibilities Define and implement enterprise SLI, SLO, SLA, Error Budget, and Reliability Governance frameworks.Develop and execute enterprise observability strategies using platforms such as Dynatrace, OpenTelemetry, APM, Distributed Tracing, RUM, and Synthetic Monitoring.Design and implement highly available, resilient, and scalable cloud-native architectures.Lead initiatives around High Availability (HA), Disaster Recovery (DR), Resilience Engineering, and Business Continuity.Drive Incident Management, Problem Management, Root Cause Analysis (RCA), and Continuous Service Improvement practices.Lead automation initiatives focused on toil reduction, self-healing, auto-remediation, and operational excellence.Establish enterprise monitoring standards, governance models, and observability frameworks.Implement AIOps, predictive analytics, intelligent alerting, and event correlation capabilities.Support CI/CD, DevSecOps, GitOps, and Infrastructure as Code (IaC) adoption.Lead Production Readiness Reviews (PRR), Operational Readiness Reviews (ORR), and reliability assessments.Collaborate with engineering, architecture, and business leadership to improve platform reliability and operational maturity.Drive enterprise-wide SRE transformation and reliability engineering adoption across large-scale environments.Required Qualifications Extensive experience implementing SLI, SLO, SLA, Error Budget, and Reliability Governance frameworks.Strong expertise with Dynatrace and enterprise observability platforms including:Application Performance Monitoring (APM)Distributed TracingReal User Monitoring (RUM)Synthetic MonitoringOpenTelemetryStrong experience with:KubernetesDockerOpenShiftCloud-native architecturesExperience designing:High Availability (HA)Disaster Recovery (DR)Resilience EngineeringBusiness Continuity solutionsProven expertise in:Incident ManagementProblem ManagementRoot Cause Analysis (RCA)Continuous Service ImprovementExperience driving:Toil reductionSelf-healing solutionsAuto-remediationOperational automationStrong understanding of:Capacity PlanningPerformance EngineeringChaos EngineeringExperience establishing enterprise observability strategies, governance, and monitoring standards.Familiarity with:AIOpsPredictive AnalyticsIntelligent Alert ManagementEvent CorrelationExperience with:CI/CDDevSecOpsGitOpsInfrastructure as Code (IaC)Ability to lead:Production Readiness ReviewsOperational Readiness ReviewsReliability AssessmentsExcellent stakeholder management and leadership skills with the ability to influence engineering, architecture, and business teams.Preferred Qualifications Experience leading enterprise-wide SRE transformation initiatives.Proven expertise in developing enterprise observability strategies and reliability engineering adoption.Strong background in SLO governance and operational excellence programs.Relevant certifications in:AzureKubernetesDynatraceSite Reliability Engineering (SRE)DevOpsCloud ArchitectureKey Skills Site Reliability Engineering (SRE)Enterprise SRE TransformationSLI / SLO / SLAError Budget ManagementReliability GovernanceDynatraceOpenTelemetryAPMDistributed TracingReal User Monitoring (RUM)Synthetic MonitoringKubernetesDockerOpenShiftCloud-Native ArchitectureHigh Availability (HA)Disaster Recovery (DR)Business ContinuityIncident ManagementProblem ManagementRoot Cause Analysis (RCA)Operational ExcellenceToil ReductionSelf-HealingAuto-RemediationCapacity PlanningPerformance EngineeringChaos EngineeringObservability StrategyMonitoring FrameworksAIOpsPredictive AnalyticsEvent CorrelationIntelligent AlertingCI/CDDevSecOpsGitOpsInfrastructure as Code (IaC)