Senior DevOps Engineer

Apexprotocol — Singapore · Posted ~1 day ago

Senior Full-time

Skills

DevOps SRE Linux Networking Kubernetes AWS Terraform Terragrunt CI/CD GitHub Actions Ansible Bash Python Observability Incident response Disaster recovery Infrastructure security Prometheus Grafana ELK Loki MySQL Redis Kafka RocketMQ

🔓 Log in to save this job, tailor your resume & track your apply process — 7 days free, no card needed.

Log in to add to target list

Summary ✨ AI‑Generated

A technology organization is seeking a senior DevOps/SRE engineer to ensure the stability, security, and availability of production systems. You will design and operate AWS and Kubernetes infrastructure, build IaC and CI/CD automation, improve observability and incident response, and manage high availability for databases and core services. The role combines architecture with hands-on troubleshooting and offers broad ownership of production engineering.

Highlights

Own production reliability, security, and availability across AWS and Kubernetes environments, with strong architectural responsibility, automation, observability, disaster recovery, and cost optimization.

Description

岗位职责 负责生产环境的稳定性、安全性和可用性,能够深入一线处理部署发布、系统变更、性能问题及复杂故障;参与重大生产故障的应急响应,并推动问题从应急处理走向长期治理。负责 AWS 云基础设施及 Kubernetes(K8s)平台的建设和持续优化,参与基础设施规划和架构设计;同时参与业务系统技术架构设计,从稳定性、安全性和可运维性角度提出方案并推动落地。推动运维工作的自动化、标准化和工程化,完善基础设施即代码(IaC)、CI/CD 和自动化运维体系,建立可靠的发布、验证和回滚机制,减少人工操作和生产变更风险。建设和持续完善监控、日志、告警、应急响应及故障复盘机制,提升生产问题的发现、定位和恢复效率,并推动研发共同解决应用及架构层面的长期问题。负责数据库及核心基础组件的高可用、容量规划、备份恢复和故障处理,保障关键基础服务稳定运行。推动基础设施安全治理,完善权限控制、安全基线、网络与容器安全、数据及密钥安全、漏洞管理、安全审计及事件响应机制。持续优化云资源架构和使用效率,在保障稳定性和安全性的前提下做好容量规划和成本管理;关注云原生、自动化及安全领域的技术发展,并结合实际业务推动技术改进。 任职要求 计算机或相关专业本科及以上学历,5 年以上 DevOps、SRE 或运维相关经验,具备生产环境实际运维经验;兼具架构设计和一线执行能力,能够完成基础设施方案设计、实施落地及复杂故障处理。具备扎实的 Linux、网络和容器技术基础,以及生产级 Kubernetes(K8s)实践经验,能够独立完成集群部署、升级、调优及复杂故障排查;了解 Java、Go 等常见应用的运行环境和基本排障方法。具备 AWS 生产环境实践经验,熟悉 IAM、VPC、EC2、EKS 等核心服务,并有 Terraform/Terragrunt 等 IaC 实践经验。具备较强的自动化和工程化能力,熟悉 GitHub Actions、Ansible 等 CI/CD 和自动化工具,熟练使用 Bash、Python 等脚本语言。具备生产级可观测性和稳定性治理经验,熟悉 Prometheus、Grafana、ELK/Loki 等技术,以及监控告警、应急响应、容量和容灾机制。熟悉 MySQL、Redis、Kafka/RocketMQ 等常见数据库和基础组件,理解高可用、性能、备份恢复及故障处理;具备基本的 SQL 编写和数据库问题排查能力。具备较强的安全意识和实际安全运维经验,熟悉云平台权限与网络安全、主机及容器安全、数据及密钥安全、漏洞治理、安全审计和事件响应。具备较强的责任意识、风险意识和跨团队协作能力,能够主动发现问题并持续推动技术和流程改进。 公司概述 Davion Labs 现诚邀一位具备丰富云基础设施、Kubernetes 及生产环境运维经验的高级运维工程师(Senior DevOps Engineer)加入 ApeX Protocol 核心团队。 ApeX Protocol 是业内领先的去中心化交易所 (DEX) 平台,致力于为用户提供流畅、高效、安全的加密货币交易体验。我们专注于技术创新与用户赋能,旨在通过极致的交互体验与全面的产品组合,重新定义去中心化交易格局。 我们的核心产品 ApeX Omni (v2) 提供多链流动性、灵活且以用户为中心的设计,以及基于零知识证明的顶级安全保障。为了支撑海量的跨链交互与高频的实时行情数据推送,我们正在不断打磨和优化专业、丝滑的金融级交易终端。 作为高级运维工程师,您将深度参与生产基础设施的建设与持续优化,覆盖 AWS、Kubernetes(K8s)、IaC、CI/CD、可观测性、稳定性及安全治理等方向。您既需要具备基础设施规划和架构设计能力,也需要保持较强的一线实践能力,能够深入生产环境处理复杂问题,并推动问题从应急处理走向长期改进。 我们期待您具备扎实的工程能力和风险意识,能够与研发团队紧密协作,持续提升系统的稳定性、安全性、自动化程度和运维效率,共同支撑 ApeX Protocol 核心交易业务长期稳定发展。