ML Engineer, Platform

Toss Securities β€” South Korea Β· Posted ~2 weeks ago

Senior Full-time

Skills

Python Go FastAPI Kubernetes ML platform engineering LLM serving distributed systems GPU infrastructure system monitoring Kubeflow vLLM SGLang Triton GPU LLM

πŸ”“ Log in to save this job, tailor your resume & track your apply process β€” 7 days free, no card needed.

Log in to add to target list

Summary ✨ AI‑Generated

A platform-focused machine learning engineering role responsible for building and operating shared ML infrastructure. You will develop high-throughput API gateways, operate model-serving systems on Kubernetes, optimize LLM workloads on high-performance GPU clusters, and improve platform reliability and performance.

Highlights

Build and operate enterprise-scale ML infrastructure, design high-throughput LLM gateways and serving architectures, manage GPU clusters, and solve complex reliability and performance challenges.

Description

ν•©λ₯˜ν•˜κ²Œ 될 νŒ€μ— λŒ€ν•΄ μ•Œλ €λ“œλ €μš” ν† μŠ€μ¦κΆŒ ML Engineer(Platform)λŠ” Product Division λ‚΄ ML Platform Team에 속해 μžˆμ–΄μš”.ML Platform Team의 λͺ©ν‘œλŠ” ν† μŠ€μ¦κΆŒμ˜ λ‹€μ–‘ν•œ AI/ML μ„œλΉ„μŠ€λ“€μ„ 효율적이고 μ•ˆμ •μ μœΌλ‘œ κ°œλ°œν•˜κ³  μš΄μ˜ν•  수 μžˆλŠ” 졜적의 λ¨Έμ‹ λŸ¬λ‹ ν”Œλž«νΌμ„ λ§Œλ“œλŠ” κ±°μ˜ˆμš”. ν•©λ₯˜ν•˜λ©΄ ν•¨κ»˜ ν•  μ—…λ¬΄μ—μš” MLμ„œλΉ„μŠ€μ˜ 관문인 Gateway μ‹œμŠ€ν…œμ„ κ°œλ°œν•˜κ³  κ³ λ„ν™”ν•΄μš”. 전사 LLM API μš”μ²­μ„ μ²˜λ¦¬ν•˜λŠ” Gateway μ‹œμŠ€ν…œμ„ FastAPI 기반으둜 κ°œλ°œΒ·μš΄μ˜ν•΄μš”.FastAPI둜 κ΅¬ν˜„λœ Gateway μ• ν”Œλ¦¬μΌ€μ΄μ…˜μ—μ„œ 인증, λΌμš°νŒ…, νŠΈλž˜ν”½ μ œμ–΄, μž₯μ•  격리(Circuit Breaker, Fallback), λŒ€κ·œλͺ¨ TPS 처리 및 λΆ€ν•˜ λΆ„μ‚° μ „λž΅μ„ μ• ν”Œλ¦¬μΌ€μ΄μ…˜,인프라 κ΄€μ μ—μ„œ μ„€κ³„Β·κ΅¬ν˜„ν•΄μš”.ML μ„œλΉ„μŠ€ 운영과 μ„œλΉ™μ„ μ±…μž„μ Έμš”. Kubernetes ν™˜κ²½μ—μ„œ λ¨Έμ‹ λŸ¬λ‹ λͺ¨λΈ μ„œλΉ™ μ‹œμŠ€ν…œμ„ 직접 μš΄μ˜ν•΄μš”.λŒ€κ·œλͺ¨ νŠΈλž˜ν”½ μƒν™©μ—μ„œλ„ μ•ˆμ •μ μœΌλ‘œ λ™μž‘ν•  수 μžˆλ„λ‘ LLM μ„œλΉ™ μ•„ν‚€ν…μ²˜λ₯Ό μ„€κ³„Β·κ°œμ„ ν•΄μš”.μ„œλΉ„μŠ€ 쀑인 λͺ¨λΈμ˜ latency, μ—λŸ¬μœ¨, λ¦¬μ†ŒμŠ€ μ‚¬μš©λŸ‰ 등을 λͺ¨λ‹ˆν„°λ§ν•˜κ³ , 운영 이슈λ₯Ό 직접 λΆ„μ„Β·ν•΄κ²°ν•΄μš”.μž₯μ•  λ°œμƒ μ‹œ κ·Όλ³Έ 원인을 규λͺ…ν•˜κ³ , 운영 μ •μ±…μ΄λ‚˜ μ•„ν‚€ν…μ²˜λ₯Ό ν¬ν•¨ν•œ ꡬ쑰적인 κ°œμ„ κΉŒμ§€ μˆ˜ν–‰ν•΄μš”.전사 곡톡 ML ν”Œλž«νΌμ„ κ°œλ°œν•˜κ³  μš΄μ˜ν•΄μš”. Kubeflow 기반으둜 사내 ML/LLM λͺ¨λΈμ˜ ν•™μŠ΅ 및 μ„œλΉ™μ„ 효율적으둜 μš΄μ˜ν•  수 μžˆλŠ” 곡톡 ν”Œλž«νΌμ„ κ°œλ°œΒ·μš΄μ˜ν•΄μš”.ν”Œλž«νΌμ—μ„œ μ‹€ν–‰λ˜λŠ” μ›Œν¬λ‘œλ“œμ˜ μ„±λŠ₯κ³Ό λ¦¬μ†ŒμŠ€λ₯Ό μ§€μ†μ μœΌλ‘œ λͺ¨λ‹ˆν„°λ§ν•˜κ³  μ΅œμ ν™”ν•΄μš”.LLM 기반 μ„œλΉ„μŠ€λ₯Ό μœ„ν•œ 인프라 ν™˜κ²½μ„ κ΅¬μΆ•ν•΄μš”. vLLM, SGLang, Triton λ“± λ‹€μ–‘ν•œ μ„œλΉ™ ν”„λ ˆμž„μ›Œν¬λ₯Ό ν™œμš©ν•΄ LLM μ„œλΉ„μŠ€λ₯Ό μš΄μ˜ν•΄μš”.H100/B300 λ“± κ³ μ„±λŠ₯ GPU ν΄λŸ¬μŠ€ν„°μ—μ„œ ν•™μŠ΅Β·μ„œλΉ™ μ›Œν¬λ‘œλ“œκ°€ μ•ˆμ •μ μœΌλ‘œ λ™μž‘ν•˜λ„λ‘ ν™˜κ²½μ„ κ΄€λ¦¬ν•΄μš”.금육 도메인 νŠΉν™” LLM을 μœ„ν•œ λŒ€κ·œλͺ¨ 데이터 ν•™μŠ΅ ν™˜κ²½μ„ κ΅¬μΆ•Β·μš΄μ˜ν•΄μš”. 이런 λΆ„κ³Ό ν•¨κ»˜ν•˜κ³  μ‹Άμ–΄μš” Python, Go, Java, Kotlin 쀑 ν•˜λ‚˜ μ΄μƒμ˜ 언어에 λŠ₯μˆ™ν•˜λ©°, ν”„λ‘œλ•μ…˜ ν™˜κ²½μ˜ API μ„œλ²„λ₯Ό μ„€κ³„Β·κ°œλ°œν•΄ λ³Έ κ²½ν—˜μ΄ ν•„μš”ν•΄μš”.API Gateway(Nginx, Kong λ“±) λ˜λŠ” LLM Router(LiteLLM, Envoy AI Gateway λ“±)λ₯Ό κ°œλ°œν•˜κ±°λ‚˜ μš΄μ˜ν•˜λ©°, λŒ€μš©λŸ‰ νŠΈλž˜ν”½ 처리 및 μž₯μ•  λŒ€μ‘ κ²½ν—˜μ΄ ν•„μš”ν•΄μš”.Kafka, Elasticsearch, Kibana λ“±κ³Ό 연동해 μ„œλΉ™ 둜그 및 이벀트 νŒŒμ΄ν”„λΌμΈμ„ μš΄μ˜ν•΄ λ³Έ κ²½ν—˜μ΄ ν•„μš”ν•΄μš”.Prometheus, Grafana 등을 ν™œμš©ν•΄ λͺ¨λΈ μ„œλΉ™ λͺ¨λ‹ˆν„°λ§ μ§€ν‘œλ₯Ό μ •μ˜ν•˜κ³  λŒ€μ‹œλ³΄λ“œλ₯Ό κ΅¬μ„±Β·μš΄μ˜ν•΄ λ³Έ κ²½ν—˜μ΄ ν•„μš”ν•΄μš”.KServe, BentoML, vLLM, SGLang 등을 ν™œμš©ν•΄ ML/LLM λͺ¨λΈ μ„œλΉ™μ„ μš΄μ˜ν•΄ λ³Έ κ²½ν—˜μ΄ ν•„μš”ν•΄μš”.Kubernetes ν™˜κ²½μ—μ„œ MLOps μ»΄ν¬λ„ŒνŠΈ(Kubeflow, KServe, Airflow, Argo CD, MLflow λ“±)λ₯Ό 직접 μš΄μ˜ν•˜λ©° μž₯μ• λ₯Ό λ””λ²„κΉ…ν•˜κ³  ν•΄κ²°ν•΄ λ³Έ κ²½ν—˜μ΄ ν•„μš”ν•΄μš”.μ„œλΉ„μŠ€ 운영 쀑 λ°œμƒν•œ μ΄μŠˆμ— λŒ€ν•΄ 단기적인 λŒ€μ‘μ„ λ„˜μ–΄, κ·Όλ³Έ 원인 뢄석을 톡해 μž₯기적인 κ°œμ„  λ°©μ•ˆμ„ μ„€κ³„Β·μ μš©ν•΄ λ³Έ κ²½ν—˜μ΄ ν•„μš”ν•΄μš”. 이런 κ²½ν—˜μ΄ μžˆλ‹€λ©΄ 더 μ’‹μ•„μš” MSA(Microservices Architecture) ν™˜κ²½μ—μ„œ REST, gRPC APIλ₯Ό ν™œμš©ν•œ μ„œλΉ„μŠ€ κ°„ 톡신 및 νŠΈλžœμž­μ…˜ μ²˜λ¦¬μ— λŠ₯μˆ™ν•˜λ©΄ μ’‹μ•„μš”.λ‹€μ–‘ν•œ λΆ„μ‚° μ‹œμŠ€ν…œ 섀계 μ „λž΅μ„ ν™œμš©ν•΄ λŒ€κ·œλͺ¨ νŠΈλž˜ν”½ ν™˜κ²½μ„ μ•ˆμ •μ μœΌλ‘œ μš΄μ˜ν•΄ λ³Έ κ²½ν—˜μ΄ μžˆλ‹€λ©΄ μ’‹μ•„μš”.Azure AI Foundry, Azure AI Studio, AWS Bedrock, AWS SageMaker λ“± Public Cloud ν™˜κ²½μ—μ„œ MLOps λ˜λŠ” LLMOps μ»΄ν¬λ„ŒνŠΈλ₯Ό μš΄μ˜ν•΄ λ³Έ κ²½ν—˜μ΄ μžˆλ‹€λ©΄ 더 μ’‹μ•„μš”.vLLM, SGLang 등을 ν™œμš©ν•΄ LLM μ„œλΉ™ 병λͺ©μ„ λΆ„μ„ν•˜κ³  μ„±λŠ₯을 μ΅œμ ν™”ν•΄ λ³Έ κ²½ν—˜(λ˜λŠ” κ΄€λ ¨ μ˜€ν”ˆμ†ŒμŠ€ κΈ°μ—¬ κ²½ν—˜)이 μžˆλ‹€λ©΄ 더 μ’‹μ•„μš”.disaggregated serving, prefix-aware routing, context caching λ“± LLM 기반 μ‹œμŠ€ν…œμ„ μ„€κ³„ν•˜κ³  μ΅œμ ν™”ν•΄ λ³Έ κ²½ν—˜μ΄ μžˆλ‹€λ©΄ 더 μ’‹μ•„μš”.Kubernetes Operator λ˜λŠ” Scheduler λ“± Kubernetes ν™•μž₯ μ»΄ν¬λ„ŒνŠΈλ₯Ό μ„€κ³„Β·κ°œλ°œν•΄ λ³Έ κ²½ν—˜μ΄ μžˆλ‹€λ©΄ 더 μ’‹μ•„μš”.데이터 μ „μ²˜λ¦¬λΆ€ν„° ν•™μŠ΅, 배포, ν’ˆμ§ˆ 관리, μž¬ν•™μŠ΅κΉŒμ§€ λ¨Έμ‹ λŸ¬λ‹ νŒŒμ΄ν”„λΌμΈμ„ μ‹€μ œ μ„œλΉ„μŠ€ ν™˜κ²½μ—μ„œ μš΄μ˜ν•΄ λ³Έ κ²½ν—˜μ΄ μžˆλ‹€λ©΄ 더 μ’‹μ•„μš”. 이λ ₯μ„œλŠ” μ΄λ ‡κ²Œ μž‘μ„±ν•˜μ‹œλŠ” κ±Έ μΆ”μ²œν•΄μš” μž„νŒ©νŠΈ μžˆμ—ˆλ˜ 업무/ν”„λ‘œμ νŠΈμ™€ κ·Έ 결과에 λŒ€ν•΄ ꡬ체적으둜 μ μ–΄μ£Όμ„Έμš”.기술적으둜 μ™ΈλΆ€ κ³΅κ°œκ°€ λ―Όκ°ν•œ 사항일 경우, ν•΄λ‹Ή 뢀뢄은 μ œμ™Έν•΄ μ£Όμ„Έμš”.ν•΄κ²°ν•œ λ¬Έμ œλ“€μ— λŒ€ν•΄ μ–΄λ–€ 방법둠듀을 μ–΄λ–€ 이유둜 μ μš©ν–ˆλŠ”μ§€ μžμ„Ένžˆ μ μ–΄μ£Όμ„Έμš”. ν† μŠ€μ¦κΆŒμ—μ„œ μ‚¬μš©ν•˜λŠ” 기술 Workflow & Platform: Kubernetes, Kubeflow, Argo CD, Argo Workflows, AirflowModel Serving & Optimization: vLLM, SGLang, KServe, BentoMLMonitoring & Logging: Prometheus, Grafana, Kafka, Elasticsearch, KibanaCloud & Infra: GPU Cluster (A40/A100/H100/H200/B300), Kubernetes 기반 ML 인프라 ν† μŠ€μ¦κΆŒμœΌλ‘œμ˜ ν•©λ₯˜μ—¬μ • μ„œλ₯˜μ ‘μˆ˜ > 프리 인터뷰 > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런슀 체크 > μ²˜μš°ν˜‘μ˜ > μ΅œμ’…ν•©κ²© 및 μž…μ‚¬κΌ­ 확인해 μ£Όμ„Έμš” 이λ ₯μ„œ 및 제좜 μ„œλ₯˜μ— ν—ˆμœ„ 사싀이 λ°œκ²¬λ˜κ±°λ‚˜ 근무 이λ ₯ 쀑 징계사항이 확인될 경우, μ±„μš©μ΄ μ·¨μ†Œλ  수 μžˆμ–΄μš”.ν† μŠ€μ¦κΆŒ λ‚΄κ·œμ— 따라 μ±„μš© κΈˆμ§€μž λ˜λŠ” κ²°κ²©μ‚¬μœ  ν•΄λ‹ΉμžλŠ” μ±„μš©μ΄ μ·¨μ†Œλ  수 μžˆμ–΄μš”.μž₯애인 및 κ΅­κ°€λ³΄ν›ˆλŒ€μƒμžλŠ” 지원 μ‹œ 관련법에 따라 μš°λŒ€ν•˜κ³  μžˆμ–΄μš”. ν•¨κ»˜ ν•  λ™λ£Œλ₯Ό μœ„ν•œ ν•œλ§ˆλ”” "AI/MLν”Œλž«νΌμ„ λŒ€κ·œλͺ¨λ‘œ ꡬ좕, ν™•μž₯ ν•΄ λ‚˜κ°€λ©΄μ„œ ν•¨κ»˜ μ„±μž₯ν•  λ™λ£Œλ₯Ό 기닀리고 μžˆμ–΄μš”!" ν† μŠ€μ¦κΆŒμ€ H100을 μ‹œμž‘μœΌλ‘œ B300 λ“± κ³ μ„±λŠ₯ GPU 인프라λ₯Ό ν™•μž₯ν•˜κ³  μžˆμ–΄μš”. μ΄λŸ¬ν•œ 인프라λ₯Ό λ°”νƒ•μœΌλ‘œ λ‹€μ–‘ν•œ MLμ„œλΉ„μŠ€λ₯Ό μ•ˆμ •μ μœΌλ‘œ μš΄μ˜ν•  MLν”Œλž«νΌμ„ ν•¨κ»˜ λ§Œλ“€μ–΄ 갈 뢄을 μ°Ύκ³  μžˆμ–΄μš”.μ§€κΈˆκΉŒμ§€λŠ” ν”Œλž«νΌμ˜ ν† λŒ€λ₯Ό λ‹€μ Έμ™”κ³ , μ•žμœΌλ‘œλŠ” 더 λ§Žμ€ μ„œλΉ„μŠ€μ™€ νŠΈλž˜ν”½μ„ 효율적으둜 κ°λ‹Ήν•˜κΈ° μœ„ν•œ μŠ€μΌ€μ€„λ§Β·λ¦¬μ†ŒμŠ€ μ΅œμ ν™”Β·μš΄μ˜μ„± κ°œμ„ μ„ 본격적으둜 μ§„ν–‰ν•˜λ €κ³  ν•΄μš”. λŒ€κ·œλͺ¨ GPU ν΄λŸ¬μŠ€ν„° 기반 ML ν”Œλž«νΌμ˜ 초기 섀계 단계뢀터, ν™•μž₯λ˜μ–΄ κ°€λŠ” μ „ 과정에 ν•¨κ»˜ν•˜λ©° μ„±μž₯ν•˜κ³  싢은 뢄을 기닀리고 μžˆμ–΄μš”!