Site Reliability Engineer / AWS DevOps Engineer

Tata Consultancy Services β€” United States Β· Posted ~22 hours ago

Senior Full-time

Skills

AWS DevOps SRE Arize AI observability monitoring MLOps Terraform AWS CloudFormation Ansible CI/CD Docker Kubernetes incident response root cause analysis Python Bash PowerShell SQL EC2 EKS ECS Lambda S3 RDS Redshift CloudWatch IAM VPC CloudFormation Jenkins GitHub Actions GitLab CI/CD Helm Prometheus Grafana Datadog ELK Stack OpenTelemetry

πŸ”“ Log in to save this job, tailor your resume & track your apply process β€” 7 days free, no card needed.

Log in to add to target list

Summary ✨ AI‑Generated

Join a sophisticated reliability engineering team focused on highly automated cloud infrastructure and AI-aware observability. You will build and operate AWS environments, automate infrastructure and deployments, manage Kubernetes workloads, improve reliability through SLI/SLO practices, and monitor machine-learning systems for performance, drift, and data quality.

Highlights

Technically broad SRE/DevOps opportunity combining AWS infrastructure, automation, reliability engineering, observability, and MLOps. Provides exposure to modern AI monitoring, Kubernetes, infrastructure as code, CI/CD, and production reliability practices.

Description

Job Description Must Have Technical/Functional Skills For an SRE / AWS DevOps Engineer with Arize Observability, the candidate should have knowledge on AWS Cloud, DevOps, Reliability Engineering, Monitoring, MLOps, and AI Observability. AWS Cloud Services – EC2, EKS, ECS, Lambda, S3, RDS, Redshift, CloudWatch, IAM, VPC. Infrastructure as Code (IaC) – Terraform, AWS CloudFormation, Ansible. CI/CD Automation – Jenkins, GitHub Actions, GitLab CI/CD, AWS CodePipeline. Containerization & Orchestration – Docker, Kubernetes (EKS), Helm. Site Reliability Engineering (SRE) – SLI/SLO/SLA management, incident response, root cause analysis (RCA), reliability engineering. Monitoring & Observability – Arize AI, Prometheus, Grafana, Datadog, ELK Stack, OpenTelemetry, CloudWatch. MLOps & AI Observability – Arize platform, model monitoring, drift detection, model performance tracking, data quality monitoring, LLM observability. Programming & Scripting – Python, Bash, PowerShell, SQL. Security & DevSecOps – IAM, Secrets Manager, AWS Security Hub, vulnerability scanning, policy enforcement. Collaboration & Agile Delivery – Scrum, Jira, stakeholder communication, cross-functional incident management, technical documentation. Roles & Responsibilities SRE Lead with 8+ years of experience in building and managing scalable, secure, and highly available AWS cloud platforms leveraging DevOps, Kubernetes, and Infrastructure-as-Code practices. Experienced in implementing CI/CD pipelines, driving SRE best practices, and ensuring platform reliability through proactive monitoring, incident management, and performance optimization using CloudWatch, Prometheus, Grafana, and Arize. Strong collaborator with engineering, data, and ML teams, enabling MLOps, AI model observability, drift detection, and reliable deployment of production-grade AI/GenAI solutions. Generic Managerial Skills, If any Strong leadership and stakeholder management skills, with experience leading cross-functional teams and driving delivery excellence. Effective communication with business and technical stakeholders. TCS Employee Benefits Summary Discretionary Annual Incentive. Comprehensive Medical Coverage: Medical & Health, Dental & Vision, Disability Planning & Insurance, Pet Insurance Plans. Family Support: Maternal & Parental Leaves. Insurance Options: Auto & Home Insurance, Identity Theft Protection. Convenience & Professional Growth: Commuter Benefits & Certification & Training Reimbursement. Time Off: Vacation, Time Off, Sick Leave & Holidays. Legal & Financial Assistance: Legal Assistance, 401K Plan, Performance Bonus, College Fund, Student Loan Refinancing. Salary Range: $155,000 - $170,000 a year Qualifications: BACHELOR OF COMPUTER SCIENCE