SRE AWS DevOps Engineer

Tata Consultancy Services β€” United States Β· Posted ~2 hours ago

Senior Visa History βœ“

Skills

AWS DevOps SRE Kubernetes Terraform CI/CD Monitoring Python Docker Jenkins Prometheus Grafana

πŸ”“ Log in to save this job, tailor your resume & track your apply process β€” 7 days free, no card needed.

Log in to add to target list

Summary ✨ AI‑Generated

A site reliability engineering role focused on cloud operations, infrastructure automation, monitoring, incident response, and AI-enabled observability practices.

Highlights

Advanced cloud reliability role involving AWS, automation, observability, AI operations, and scalable production systems.

Description

Job Description Must Have Technical/Functional Skills For an SRE / AWS DevOps Engineer with Arize Observability, the candidate should have knowledge on AWS Cloud, DevOps, Reliability Engineering, Monitoring, MLOps, and AI Observability. AWS Cloud Services – EC2, EKS, ECS, Lambda, S3, RDS, Redshift, CloudWatch, IAM, VPC. Infrastructure as Code (IaC) – Terraform, AWS CloudFormation, Ansible. CI/CD Automation – Jenkins, GitHub Actions, GitLab CI/CD, AWS CodePipeline. Containerization & Orchestration – Docker, Kubernetes (EKS), Helm. Site Reliability Engineering (SRE) – SLI/SLO/SLA management, incident response, root cause analysis (RCA), reliability engineering. Monitoring & Observability – Arize AI, Prometheus, Grafana, Datadog, ELK Stack, OpenTelemetry, CloudWatch. MLOps & AI Observability – Arize platform, model monitoring, drift detection, model performance tracking, data quality monitoring, LLM observability. Programming & Scripting – Python, Bash, PowerShell, SQL. Security & DevSecOps – IAM, Secrets Manager, AWS Security Hub, vulnerability scanning, policy enforcement. Collaboration & Agile Delivery – Scrum, Jira, stakeholder communication, cross-functional incident management, technical documentation. Roles & Responsibilities SRE Lead with 8+ years of experience in building and managing scalable, secure, and highly available AWS cloud platforms leveraging DevOps, Kubernetes, and Infrastructure-as-Code practices. Experienced in implementing CI/CD pipelines, driving SRE best practices, and ensuring platform reliability through proactive monitoring, incident management, and performance optimization using CloudWatch, Prometheus, Grafana, and Arize. Strong collaborator with engineering, data, and ML teams, enabling MLOps, AI model observability, drift detection, and reliable deployment of production-grade AI/GenAI solutions. Generic Managerial Skills, If any Strong leadership and stakeholder management skills, with experience leading cross-functional teams and driving delivery excellence. Effective communication with business and technical stakeholders. TCS Employee Benefits Summary Discretionary Annual Incentive. Comprehensive Medical Coverage: Medical & Health, Dental & Vision, Disability Planning & Insurance, Pet Insurance Plans. Family Support: Maternal & Parental Leaves. Insurance Options: Auto & Home Insurance, Identity Theft Protection. Convenience & Professional Growth: Commuter Benefits & Certification & Training Reimbursement. Time Off: Vacation, Time Off, Sick Leave & Holidays. Legal & Financial Assistance: Legal Assistance, 401K Plan, Performance Bonus, College Fund, Student Loan Refinancing. Salary Range: $155,000 - $170,000 a year Qualifications: BACHELOR OF COMPUTER SCIENCE