Summary
✨ AI‑Generated
A mid-level DevOps/SRE opportunity focused on establishing observability and reliability practices. You will implement OpenTelemetry for metrics, logs, and traces, build dashboards and alerts, integrate cloud monitoring with open-source visualization tools, and monitor a broad range of cloud services. You will also collaborate on defining and maintaining SLIs and SLOs.
Highlights
Opportunity to establish an observability and reliability practice from the ground up, work with a broad AWS environment, and shape SLI/SLO practices across technology teams.
Description
En MailAmericas, importante Compañía de Logística Internacional, nos encontramos en la búsqueda de un/a Analista Ssr.
DevOps – SRE / Observability para sumarse al equipo de Tecnología en Bogotá, Colombia.
Con enfoque en Site Reliability Engineering (SRE) para ayudarnos a iniciar la práctica de observabilidad y reliability dentro de la compañía.
¿Qué desafíos te esperan?
Implementar OpenTelemetry para métricas, logs y trazas en aplicaciones PHP/Laravel y otros servicios backend.Diseñar y mantener dashboards, métricas y alertas orientadas a la salud, disponibilidad y performance de los sistemas.Integrar AWS CloudWatch con Grafana OSS (on-premise).Implementar observabilidad basada en OpenTelemetry, utilizando Grafana, Prometheus/Mimir, Loki y Tempo, siguiendo las buenas prácticas del ecosistema Grafana.Monitorear servicios AWS: EC2, ECS/EKS (Fargate), ALB/NLB, RDS/Aurora, ElastiCache, SQS/SNS, Lambda y API Gateway.Definir y mantener SLIs y SLOs junto a los equipos de desarrollo.Configurar alertamiento proactivo para detección temprana de incidentes.Automatizar monitoreo, alertas y tareas operativas usando Terraform, AWS CLI y scripting (Bash / Python).Colaborar en la mejora continua de la confiabilidad y operabilidad de los sistemas.
¿Qué esperamos de vos?
Al menos 2 años de experiencia en roles similares (DevOps, Cloud Engineer o afines).Experiencia como DevOps o Cloud Engineer con foco en observabilidad, monitoreo y confiabilidad.Sólidos conocimientos de AWS (especialmente CloudWatch) y uso de AWS CLI.Experiencia implementando o trabajando con OpenTelemetry.Manejo de Grafana OSS (dashboards, alertas y datasources) y conocimientos de Prometheus/Mimir, Loki y Tempo.Experiencia con aplicaciones backend en producción (principalmente PHP/Laravel, deseable Node.js o Python).Conocimientos de Linux, troubleshooting y bases de datos PostgreSQL.Experiencia en infraestructura como código (Terraform) y scripting en Bash y/o Python.Mentalidad SRE, con orientación a la confiabilidad y estabilidad de los sistemas.Capacidad analítica, enfoque preventivo ante incidentes y autonomía en la gestión del tiempo.Buenas habilidades de comunicación, trabajo colaborativo y documentación de procesos.Interés por la mejora continua y la calidad del servicio.
¡Súmate a nuestro equipo!