Mid-Level DevOps / SRE Observability Analyst

Mailamericas Mailatinamerica — Colombia · Posted ~4 hours ago

Mid Onsite

Skills

DevOps Site Reliability Engineering Observability OpenTelemetry Grafana Prometheus Loki Tempo AWS CloudWatch Metrics and alerting SLI/SLO management Mimir EC2 ECS EKS Fargate ALB NLB RDS Aurora ElastiCache SQS SNS Lambda API Gateway PHP Laravel

🔓 Log in to save this job, tailor your resume & track your apply process — 7 days free, no card needed.

Log in to add to target list

Summary ✨ AI‑Generated

A mid-level DevOps/SRE opportunity focused on establishing observability and reliability practices. You will implement OpenTelemetry for metrics, logs, and traces, build dashboards and alerts, integrate cloud monitoring with open-source visualization tools, and monitor a broad range of cloud services. You will also collaborate on defining and maintaining SLIs and SLOs.

Highlights

Opportunity to establish an observability and reliability practice from the ground up, work with a broad AWS environment, and shape SLI/SLO practices across technology teams.

Description

En MailAmericas, importante Compañía de Logística Internacional, nos encontramos en la búsqueda de un/a Analista Ssr. DevOps – SRE / Observability para sumarse al equipo de Tecnología en Bogotá, Colombia. Con enfoque en Site Reliability Engineering (SRE) para ayudarnos a iniciar la práctica de observabilidad y reliability dentro de la compañía. ¿Qué desafíos te esperan? Implementar OpenTelemetry para métricas, logs y trazas en aplicaciones PHP/Laravel y otros servicios backend.Diseñar y mantener dashboards, métricas y alertas orientadas a la salud, disponibilidad y performance de los sistemas.Integrar AWS CloudWatch con Grafana OSS (on-premise).Implementar observabilidad basada en OpenTelemetry, utilizando Grafana, Prometheus/Mimir, Loki y Tempo, siguiendo las buenas prácticas del ecosistema Grafana.Monitorear servicios AWS: EC2, ECS/EKS (Fargate), ALB/NLB, RDS/Aurora, ElastiCache, SQS/SNS, Lambda y API Gateway.Definir y mantener SLIs y SLOs junto a los equipos de desarrollo.Configurar alertamiento proactivo para detección temprana de incidentes.Automatizar monitoreo, alertas y tareas operativas usando Terraform, AWS CLI y scripting (Bash / Python).Colaborar en la mejora continua de la confiabilidad y operabilidad de los sistemas. ¿Qué esperamos de vos? Al menos 2 años de experiencia en roles similares (DevOps, Cloud Engineer o afines).Experiencia como DevOps o Cloud Engineer con foco en observabilidad, monitoreo y confiabilidad.Sólidos conocimientos de AWS (especialmente CloudWatch) y uso de AWS CLI.Experiencia implementando o trabajando con OpenTelemetry.Manejo de Grafana OSS (dashboards, alertas y datasources) y conocimientos de Prometheus/Mimir, Loki y Tempo.Experiencia con aplicaciones backend en producción (principalmente PHP/Laravel, deseable Node.js o Python).Conocimientos de Linux, troubleshooting y bases de datos PostgreSQL.Experiencia en infraestructura como código (Terraform) y scripting en Bash y/o Python.Mentalidad SRE, con orientación a la confiabilidad y estabilidad de los sistemas.Capacidad analítica, enfoque preventivo ante incidentes y autonomía en la gestión del tiempo.Buenas habilidades de comunicación, trabajo colaborativo y documentación de procesos.Interés por la mejora continua y la calidad del servicio. ¡Súmate a nuestro equipo!