Summary
β¨ AIβGenerated
A platform-focused machine learning engineering role responsible for building and operating shared ML infrastructure. You will develop high-throughput API gateways, operate model-serving systems on Kubernetes, optimize LLM workloads on high-performance GPU clusters, and improve platform reliability and performance.
Highlights
Build and operate enterprise-scale ML infrastructure, design high-throughput LLM gateways and serving architectures, manage GPU clusters, and solve complex reliability and performance challenges.
Description
ν©λ₯νκ² λ νμ λν΄ μλ €λλ €μ
ν μ€μ¦κΆ ML Engineer(Platform)λ Product Division λ΄ ML Platform Teamμ μν΄ μμ΄μ.ML Platform Teamμ λͺ©νλ ν μ€μ¦κΆμ λ€μν AI/ML μλΉμ€λ€μ ν¨μ¨μ μ΄κ³ μμ μ μΌλ‘ κ°λ°νκ³ μ΄μν μ μλ μ΅μ μ λ¨Έμ λ¬λ νλ«νΌμ λ§λλ κ±°μμ.
ν©λ₯νλ©΄ ν¨κ» ν μ
무μμ
MLμλΉμ€μ κ΄λ¬ΈμΈ Gateway μμ€ν
μ κ°λ°νκ³ κ³ λνν΄μ.
μ μ¬ LLM API μμ²μ μ²λ¦¬νλ Gateway μμ€ν
μ FastAPI κΈ°λ°μΌλ‘ κ°λ°Β·μ΄μν΄μ.FastAPIλ‘ κ΅¬νλ Gateway μ ν리μΌμ΄μ
μμ μΈμ¦, λΌμ°ν
, νΈλν½ μ μ΄, μ₯μ 격리(Circuit Breaker, Fallback), λκ·λͺ¨ TPS μ²λ¦¬ λ° λΆν λΆμ° μ λ΅μ μ ν리μΌμ΄μ
,μΈνλΌ κ΄μ μμ μ€κ³Β·κ΅¬νν΄μ.ML μλΉμ€ μ΄μκ³Ό μλΉμ μ±
μμ Έμ.
Kubernetes νκ²½μμ λ¨Έμ λ¬λ λͺ¨λΈ μλΉ μμ€ν
μ μ§μ μ΄μν΄μ.λκ·λͺ¨ νΈλν½ μν©μμλ μμ μ μΌλ‘ λμν μ μλλ‘ LLM μλΉ μν€ν
μ²λ₯Ό μ€κ³Β·κ°μ ν΄μ.μλΉμ€ μ€μΈ λͺ¨λΈμ latency, μλ¬μ¨, 리μμ€ μ¬μ©λ λ±μ λͺ¨λν°λ§νκ³ , μ΄μ μ΄μλ₯Ό μ§μ λΆμΒ·ν΄κ²°ν΄μ.μ₯μ λ°μ μ κ·Όλ³Έ μμΈμ κ·λͺ
νκ³ , μ΄μ μ μ±
μ΄λ μν€ν
μ²λ₯Ό ν¬ν¨ν ꡬ쑰μ μΈ κ°μ κΉμ§ μνν΄μ.μ μ¬ κ³΅ν΅ ML νλ«νΌμ κ°λ°νκ³ μ΄μν΄μ.
Kubeflow κΈ°λ°μΌλ‘ μ¬λ΄ ML/LLM λͺ¨λΈμ νμ΅ λ° μλΉμ ν¨μ¨μ μΌλ‘ μ΄μν μ μλ κ³΅ν΅ νλ«νΌμ κ°λ°Β·μ΄μν΄μ.νλ«νΌμμ μ€νλλ μν¬λ‘λμ μ±λ₯κ³Ό 리μμ€λ₯Ό μ§μμ μΌλ‘ λͺ¨λν°λ§νκ³ μ΅μ νν΄μ.LLM κΈ°λ° μλΉμ€λ₯Ό μν μΈνλΌ νκ²½μ ꡬμΆν΄μ.
vLLM, SGLang, Triton λ± λ€μν μλΉ νλ μμν¬λ₯Ό νμ©ν΄ LLM μλΉμ€λ₯Ό μ΄μν΄μ.H100/B300 λ± κ³ μ±λ₯ GPU ν΄λ¬μ€ν°μμ νμ΅Β·μλΉ μν¬λ‘λκ° μμ μ μΌλ‘ λμνλλ‘ νκ²½μ κ΄λ¦¬ν΄μ.κΈμ΅ λλ©μΈ νΉν LLMμ μν λκ·λͺ¨ λ°μ΄ν° νμ΅ νκ²½μ ꡬμΆΒ·μ΄μν΄μ.
μ΄λ° λΆκ³Ό ν¨κ»νκ³ μΆμ΄μ
Python, Go, Java, Kotlin μ€ νλ μ΄μμ μΈμ΄μ λ₯μνλ©°, νλ‘λμ
νκ²½μ API μλ²λ₯Ό μ€κ³Β·κ°λ°ν΄ λ³Έ κ²½νμ΄ νμν΄μ.API Gateway(Nginx, Kong λ±) λλ LLM Router(LiteLLM, Envoy AI Gateway λ±)λ₯Ό κ°λ°νκ±°λ μ΄μνλ©°, λμ©λ νΈλν½ μ²λ¦¬ λ° μ₯μ λμ κ²½νμ΄ νμν΄μ.Kafka, Elasticsearch, Kibana λ±κ³Ό μ°λν΄ μλΉ λ‘κ·Έ λ° μ΄λ²€νΈ νμ΄νλΌμΈμ μ΄μν΄ λ³Έ κ²½νμ΄ νμν΄μ.Prometheus, Grafana λ±μ νμ©ν΄ λͺ¨λΈ μλΉ λͺ¨λν°λ§ μ§νλ₯Ό μ μνκ³ λμ보λλ₯Ό ꡬμ±Β·μ΄μν΄ λ³Έ κ²½νμ΄ νμν΄μ.KServe, BentoML, vLLM, SGLang λ±μ νμ©ν΄ ML/LLM λͺ¨λΈ μλΉμ μ΄μν΄ λ³Έ κ²½νμ΄ νμν΄μ.Kubernetes νκ²½μμ MLOps μ»΄ν¬λνΈ(Kubeflow, KServe, Airflow, Argo CD, MLflow λ±)λ₯Ό μ§μ μ΄μνλ©° μ₯μ λ₯Ό λλ²κΉ
νκ³ ν΄κ²°ν΄ λ³Έ κ²½νμ΄ νμν΄μ.μλΉμ€ μ΄μ μ€ λ°μν μ΄μμ λν΄ λ¨κΈ°μ μΈ λμμ λμ΄, κ·Όλ³Έ μμΈ λΆμμ ν΅ν΄ μ₯κΈ°μ μΈ κ°μ λ°©μμ μ€κ³Β·μ μ©ν΄ λ³Έ κ²½νμ΄ νμν΄μ.
μ΄λ° κ²½νμ΄ μλ€λ©΄ λ μ’μμ
MSA(Microservices Architecture) νκ²½μμ REST, gRPC APIλ₯Ό νμ©ν μλΉμ€ κ° ν΅μ λ° νΈλμμ
μ²λ¦¬μ λ₯μνλ©΄ μ’μμ.λ€μν λΆμ° μμ€ν
μ€κ³ μ λ΅μ νμ©ν΄ λκ·λͺ¨ νΈλν½ νκ²½μ μμ μ μΌλ‘ μ΄μν΄ λ³Έ κ²½νμ΄ μλ€λ©΄ μ’μμ.Azure AI Foundry, Azure AI Studio, AWS Bedrock, AWS SageMaker λ± Public Cloud νκ²½μμ MLOps λλ LLMOps μ»΄ν¬λνΈλ₯Ό μ΄μν΄ λ³Έ κ²½νμ΄ μλ€λ©΄ λ μ’μμ.vLLM, SGLang λ±μ νμ©ν΄ LLM μλΉ λ³λͺ©μ λΆμνκ³ μ±λ₯μ μ΅μ νν΄ λ³Έ κ²½ν(λλ κ΄λ ¨ μ€νμμ€ κΈ°μ¬ κ²½ν)μ΄ μλ€λ©΄ λ μ’μμ.disaggregated serving, prefix-aware routing, context caching λ± LLM κΈ°λ° μμ€ν
μ μ€κ³νκ³ μ΅μ νν΄ λ³Έ κ²½νμ΄ μλ€λ©΄ λ μ’μμ.Kubernetes Operator λλ Scheduler λ± Kubernetes νμ₯ μ»΄ν¬λνΈλ₯Ό μ€κ³Β·κ°λ°ν΄ λ³Έ κ²½νμ΄ μλ€λ©΄ λ μ’μμ.λ°μ΄ν° μ μ²λ¦¬λΆν° νμ΅, λ°°ν¬, νμ§ κ΄λ¦¬, μ¬νμ΅κΉμ§ λ¨Έμ λ¬λ νμ΄νλΌμΈμ μ€μ μλΉμ€ νκ²½μμ μ΄μν΄ λ³Έ κ²½νμ΄ μλ€λ©΄ λ μ’μμ.
μ΄λ ₯μλ μ΄λ κ² μμ±νμλ κ±Έ μΆμ²ν΄μ
μν©νΈ μμλ μ
무/νλ‘μ νΈμ κ·Έ κ²°κ³Όμ λν΄ κ΅¬μ²΄μ μΌλ‘ μ μ΄μ£ΌμΈμ.κΈ°μ μ μΌλ‘ μΈλΆ 곡κ°κ° λ―Όκ°ν μ¬νμΌ κ²½μ°, ν΄λΉ λΆλΆμ μ μΈν΄ μ£ΌμΈμ.ν΄κ²°ν λ¬Έμ λ€μ λν΄ μ΄λ€ λ°©λ²λ‘ λ€μ μ΄λ€ μ΄μ λ‘ μ μ©νλμ§ μμΈν μ μ΄μ£ΌμΈμ.
ν μ€μ¦κΆμμ μ¬μ©νλ κΈ°μ
Workflow & Platform: Kubernetes, Kubeflow, Argo CD, Argo Workflows, AirflowModel Serving & Optimization: vLLM, SGLang, KServe, BentoMLMonitoring & Logging: Prometheus, Grafana, Kafka, Elasticsearch, KibanaCloud & Infra: GPU Cluster (A40/A100/H100/H200/B300), Kubernetes κΈ°λ° ML μΈνλΌ
ν μ€μ¦κΆμΌλ‘μ ν©λ₯μ¬μ
μλ₯μ μ > ν리 μΈν°λ·° > μ§λ¬΄ μΈν°λ·° > λ¬Ένμ ν©μ± μΈν°λ·° > λ νΌλ°μ€ μ²΄ν¬ > μ²μ°νμ > μ΅μ’
ν©κ²© λ° μ
μ¬κΌ νμΈν΄ μ£ΌμΈμ
μ΄λ ₯μ λ° μ μΆ μλ₯μ νμ μ¬μ€μ΄ λ°κ²¬λκ±°λ 근무 μ΄λ ₯ μ€ μ§κ³μ¬νμ΄ νμΈλ κ²½μ°, μ±μ©μ΄ μ·¨μλ μ μμ΄μ.ν μ€μ¦κΆ λ΄κ·μ λ°λΌ μ±μ© κΈμ§μ λλ 결격μ¬μ ν΄λΉμλ μ±μ©μ΄ μ·¨μλ μ μμ΄μ.μ₯μ μΈ λ° κ΅κ°λ³΄νλμμλ μ§μ μ κ΄λ ¨λ²μ λ°λΌ μ°λνκ³ μμ΄μ.
ν¨κ» ν λλ£λ₯Ό μν νλ§λ
"AI/MLνλ«νΌμ λκ·λͺ¨λ‘ ꡬμΆ, νμ₯ ν΄ λκ°λ©΄μ ν¨κ» μ±μ₯ν λλ£λ₯Ό κΈ°λ€λ¦¬κ³ μμ΄μ!"
ν μ€μ¦κΆμ H100μ μμμΌλ‘ B300 λ± κ³ μ±λ₯ GPU μΈνλΌλ₯Ό νμ₯νκ³ μμ΄μ.
μ΄λ¬ν μΈνλΌλ₯Ό λ°νμΌλ‘ λ€μν MLμλΉμ€λ₯Ό μμ μ μΌλ‘ μ΄μν MLνλ«νΌμ ν¨κ» λ§λ€μ΄ κ° λΆμ μ°Ύκ³ μμ΄μ.μ§κΈκΉμ§λ νλ«νΌμ ν λλ₯Ό λ€μ Έμκ³ , μμΌλ‘λ λ λ§μ μλΉμ€μ νΈλν½μ ν¨μ¨μ μΌλ‘ κ°λΉνκΈ° μν μ€μΌμ€λ§Β·λ¦¬μμ€ μ΅μ νΒ·μ΄μμ± κ°μ μ 본격μ μΌλ‘ μ§ννλ €κ³ ν΄μ.
λκ·λͺ¨ GPU ν΄λ¬μ€ν° κΈ°λ° ML νλ«νΌμ μ΄κΈ° μ€κ³ λ¨κ³λΆν°, νμ₯λμ΄ κ°λ μ κ³Όμ μ ν¨κ»νλ©° μ±μ₯νκ³ μΆμ λΆμ κΈ°λ€λ¦¬κ³ μμ΄μ!