Senior DevOps SRE Engineer - Distributed Database Platform

Lycorpjp — Japan · Posted ~3 hours ago

Senior Full-time

Skills

DevOps SRE Distributed databases Infrastructure automation CI/CD Reliability engineering Kafka Redis MongoDB Elasticsearch Terraform Grafana IaC Automation

🔓 Log in to save this job, tailor your resume & track your apply process — 7 days free, no card needed.

Log in to add to target list

Summary ✨ AI‑Generated

A senior SRE role responsible for operating and improving highly available distributed database systems. You will lead automation, reliability improvements, incident response, and platform engineering initiatives.

Highlights

Senior reliability engineering role working on large-scale distributed systems, automation strategies, performance optimization, and technical mentoring.

Description

ポジション概要 「LINE」のMessaging Platformは、世界中の数億人のユーザーにサービスを提供しており、その基盤としてペタバイト規模のデータ、毎秒数百万件のクエリ、厳格な信頼性目標のもとで運用される大規模な分散データベースシステムが稼働しています。 本ポジションでは、LINE Messaging PlatformおよびLINE Developer Product Platformを支える大規模分散データベースシステムについて、管理・運用、信頼性向上、パフォーマンス最適化を主導します。重要な運用領域に責任を持ち、自動化およびツール戦略を推進し、エンジニアのメンタリングを行います。高トラフィックをもつマルチデータセンターインフラストラクチャー全体の高い信頼性目標の達成に貢献します。 LINE Messaging PlatformおよびLINE Developer Product Platformを支える大規模な分散データベースシステムについて、安定運用、信頼性向上、パフォーマンス最適化をリードしていただきます。複数のデータセンターにまたがる環境で、デプロイ、アップグレード、スケーリング、データマイグレーション、キャパシティプランニングなど、重要な運用領域に責任を持ちます。 また、自動化やプラットフォームエンジニアリング、Infrastructure as Code(IaC)、CI/CDパイプライン、運用ツールの設計・実装を推進し、運用負荷を削減します。複雑な障害への対応や再発防止、SLO/SLIの改善、エンジニアのメンタリングを通じて、チーム全体の運用成熟度とサービスの信頼性を高めていただきます。 組織のミッション・展望 チームの技術的な中核メンバーとして参画し、重要なデータベース領域に責任を持つとともに、最小限の監督のもと、設計から実行までプロジェクトを主導するベストプラクティス、自動化、ランブック、運用プロセスを整備し、自律的かつ効率的に業務を遂行するための、チームの運用成熟度の向上チーム全体の能力を高める存在として、ジュニアおよびミドルレベルのエンジニアを指導・育成し、より大きな責任を担えるよう支援するSRE・DBRE、および開発チームとの部門横断的な連携の推進、ストレージ基盤の信頼性とパフォーマンスの向上アーキテクチャ提案やレビューを通じて、チームの技術方針およびロードマップの策定に貢献する 主な業務内容 複数のデータセンターにまたがる分散データベースシステムのデプロイ、アップグレード、スケーリング、データマイグレーション、キャパシティプランニング自動化、Infrastructure as Code(IaC)、CI/CDパイプライン、運用ツールの設計・実装による運用負荷の削減とデプロイ信頼性の向上オンコール対応、監視、トラブルシューティング、および複雑なデータベース障害に対するインシデント対応のリード根本原因分析、ポストモーテム、およびシステム全体の再発防止策の推進SRE・DBREチームと連携したSLO/SLIの定義・改善、および監視、アラート、オブザーバビリティの高度化データベース群全体のパフォーマンスチューニングとコスト最適化メジャーバージョンアップ、データマイグレーション、フェイルオーバー演習など、影響の高い運用変更の計画・実行開発、カスタマーサービス、QAなどの関連チームとの連携による、データベースの利用方法とシステムの耐障害性の改善 ※変更の範囲:会社の定める全ての業務への配置転換の可能性あり プロダクトを知る LINE Messaging PlatformLINE Developer Product Platform LINE Platform Server Function 開発チーム参考情報一覧 求める人物像 大規模な分散システムの運用に関する豊富な実務経験を持ち、本番環境で発生する複雑な障害を診断するための高い洞察力を備えている方システム全体を俯瞰して考えられる方。データベース、ネットワーク、OSカーネル、ハードウェアがどのように相互作用するかを理解し、スタックの各レイヤーを横断して問題を追跡できる方オペレーションの高度化に主体的に取り組める方。単に障害対応を行うだけでなく、障害を引き起こす根本的な要因そのものを解消できる方信頼性、パフォーマンス、または運用効率を改善するプロジェクトを主導した、もしくは重要な役割を担った経験があり、その際に行った設計上のトレードオフを明確に説明できる方使用する技術について、深く理解することに関心と探究心を持てる方他のメンバーに知識を伝え、その成長を支援することを楽しめる方。メンタリングを付随的な負担ではなく、自身の役割の中核と捉えられる方技術ドキュメントの作成やチーム横断の議論において、明確かつ簡潔にコミュニケーションを取れる方オンコール対応に責任を持ち、インシデント対応を主導することに抵抗がない方他のSREと連携し、システム監視、問題の検知、迅速な対応を通じて高い信頼性基準を確保するとともに、定義されたSLOの達成および見直しに貢献できる方 必要な経験/スキル DevOps、SRE、またはインフラ運用に関する5年以上の実務経験大規模な本番システムを長期にわたり運用した実績。特に、Cassandra、Hadoop、Kafka、Redis Cluster、MongoDB、Elasticsearch、TiDB、または同様のデータベース/分散システムの運用経験がある方は歓迎しますLinuxシステム管理に関する確かな知識と経験。特に、パフォーマンス分析、ストレージ、およびネットワークの内部構造に関する理解Python、Go、Shell、または同様の言語を使用した自動化・運用ツールの開発スキル、およびAnsible、Terraform、Kubernetesなどのオーケストレーションツールの利用経験レプリケーション、パーティショニング、整合性モデル、障害モードなど、分散システムの基礎に関する理解Prometheus、Grafana、ELK、Datadog、または同様のツールを使用した監視・オブザーバビリティ基盤の設計および運用経験インシデント対応を主導し、ポストモーテムを実施するとともに、システム全体の改善を推進した実績大規模インフラにおけるキャパシティプランニング、パフォーマンスチューニング、およびコスト最適化の経験エンジニアのメンタリング、または技術面で小規模なチームをリードした経験日本語での会話スキル(中級または上級程度必須)英語力(社内外の開発者に対する文書コミュニケーションや報告のスキル) あると望ましい経験/スキル 複数のデータセンターまたはリージョンにまたがるインフラの運用経験。DR(災害復旧)計画の策定およびフェイルオーバーの実施経験を含む大規模環境において、SREの考え方やベストプラクティスを適用した経験Kubernetesなどのコンテナオーケストレーション、およびサービスメッシュ技術に関する知識ストレージエンジン、コンパクション戦略、コンセンサスアルゴリズム、Write-Ahead Log、レプリケーションプロトコルなど、データベース内部構造に関する知識または経験カオスエンジニアリング、またはフォールトインジェクションを用いた検証の経験BCP/DRの計画策定および実行経験プロジェクトまたはチームのリーダー、もしくはマネジメントの経験データベース、インフラストラクチャ、またはオブザーバビリティに関連するオープンソースプロジェクトへのコントリビューション経験 報酬 想定年収:900万円~1,300万円 賃金形態:月給制(固定残業代含む) 基準給与:400,000円~667,000円 (基準給与の内訳) ―基礎給与 :309,000円~518,000円 ―固定時間外手当:90,000円~150,000円 ※時間外労働の有無に関わらず、35時間分の固定時間外手当を支給 ※固定時間の超過分は、超過勤務手当を別途支給 ※月給の各項目名はグレードにより異なります 賞与:年2回を上限に、会社や所属部署の業績を踏まえて支給 諸手当 時間外手当、通勤手当 ※1、LINEヤフー Working Style手当 ※2、など ※1所属オフィスに出社した日数に応じて実費を支給。月額上限150,000円。 ※2リモートワークにおいて働く環境を整備するための手当。月額11,000円。 雇用形態・雇用期間 雇用形態:正社員 ※雇用期間の定めなし 勤務地 赤坂オフィス(東京都港区赤坂2-17-22 赤坂トラストタワー)大阪御堂筋オフィス(大阪府大阪市北区曽根崎新地1−13−22 御堂筋フロンティア) ※業務上の指示により所属オフィスへの出社が必要になることがあります。 ※車いすの方でも勤務が可能なオフィスです。 ※受動喫煙対策の状況:屋内原則禁煙(喫煙室あり) ※セキュアルームでの業務が発生する場合があります。その際は、所属オフィスまで1時間以内に出社できることが必要です。 ※急遽出社が必要になる場合があるため、自宅からオフィスまで1時間以内の距離にお住まいの方を歓迎します。 就業時間 フレックスタイム制:標準労働時間7時間45分(コアタイムなし・休憩時間60分)始業および終業、休憩の時刻は個人に委ねます。ただし、標準時間として始業時刻は9:30、終業時刻は18:15となります。育児・介護による時短勤務制度あり。 ※部署により通常勤務(9:30〜18:15)、シフト勤務あり。 休日・休暇 休日:完全週休2日制(土日 ※1)、国民の祝日、年末年始(12月29日から1月4日まで)休暇:有給休暇、特別有給休暇(慶弔、マタニティ、子の看護、介護、法定伝染病など)、ハッピーフライデー ※2、サバティカル休暇制度 ※1 部署により異なります。 ※2 祝日が土曜日にあたった場合、前労働日を振り替え特別休日としています。 福利厚生 各種社会保険完備(健康保険、介護保険、厚生年金保険、雇用保険、労災保険)、選択型確定拠出年金制度、総合福祉団体定期保険、長期所得補償制度、財形貯蓄制度、株式累積投資制度、定期健康診断・人間ドック二次検査の費用補助、社内マッサージ室、サークル、懇親会費補助など ※制度の適用には条件があります。詳細は、福利厚生 をご確認ください。 人材育成・支援制度 社員向け研修制度、語学研修、マネジメント研修、LINEヤフー Job Challenge、サバティカル休暇、社会人ドクター進学支援など ※制度の適用には条件があります。詳細は、評価制度・成長支援 をご確認ください。 選考プロセス Step1 書類選考 Step2 課題選考/適性検査 Step3 面接(複数回)/リファレンス・バックグラウンドチェック Step4 内定 ※ただし、ポジションにより選考内容が変更となる可能性があります。 応募 応募フォームに必要事項をご入力のうえご応募ください。採用の適否を判断するために必要な個人情報を入力していただきます。これらは採用以外の目的には一切使用しません。なお、ご提出いただいた履歴書などは返却いたしません。あらかじめご了承ください。 書類選考 選考結果は合否にかかわらず2週間以内に、応募フォームに入力されたメールアドレスにご連絡いたします。ゴールデンウィークや年末年始等を挟む場合は、さらに1週間程度を要する場合があります。 面接、適性検査、技術試験、バックグラウンド・リファレンスチェック 書類選考に合格された方には、ポジションにより実施内容が異なりますが、複数回の面接と適性検査/技術試験、コンプライアンスチェック・リファレンスチェックを実施いたします。 選考結果は合否にかかわらず2週間以内に、応募フォームに入力されたメールアドレスにご連絡いたします。 面接などのスケジュールによって変わりますが、順調に進んだ場合、応募から1カ月〜1カ月半程度で内定となります。なお、選考の内容や基準、結果の理由に関してのお問い合わせには、合否にかかわらず回答いたしかねます