Python/LLM engineer
Greencoreiv — Georgia · Posted ~2 hours ago
🔓 Log in to save this job, tailor your resume & track your apply process — 7 days free, no card needed.
Log in to add to target listDescription
Python/LLM engineer
Грейд: Senior
Период привлечения: ASAP, долгосрочно
Языки: разговорный английский
Общие сведения о должностиКлючевая цель — разработка backend-сервисов для оркестрации и выполнения end-to-end симулированных диалогов с развёрнутыми AI-агентами в корпоративном масштабе.
Речь идёт о взаимодействии LLM-персоны клиента с живым агентом через real-time каналы.
Домен направлен на обеспечение максимально реалистичного, надёжного и высококонкурентного тестирования агентов.
В зону ответственности входит provision инфраструктуры для каждого запуска (каналы, деплойменты, верификация окружения), управление тысячами одновременных симулированных диалогов через WebSocket-мост, мониторинг прогресса задач и уровня ошибок, сохранение транскриптов и результатов для движка оценки, а также отслеживание использования для биллинга и аудита.
Сервис является фундаментальным runtime для Evaluations, поэтому latency, throughput, graceful degradation и observability — это ключевые продуктовые требования, а не опциональные дополнения.
Успешный специалист на этой должности — это инженер с сильным продуктовым мышлением, способный работать автономно, брать на себя end-to-end ответственность за многомесячные deliverables и эффективно взаимодействовать с кросс-функциональными командами.
Роль предполагает техническое лидерство, наставничество и участие в проектировании систем на дорожных картах длительностью 9–18 месяцев.
Место в структуре организации: команда Evaluations / платформенная команда, тесное взаимодействие с продуктовыми, инфраструктурными и QA-командами.
Обязанности– Проектирование, разработка и поддержка высокопроизводительных низколатентных backend-сервисов на Python с использованием asyncio для оркестрации end-to-end симулированных диалогов с AI-агентами.
– Provisioning инфраструктуры для каждого запуска: каналы, деплойменты, верификация окружения.
– Управление тысячами одновременных симулированных диалогов через WebSocket-мост (python-socketio) с обеспечением устойчивости к переподключениям, backpressure и частичной доставке сообщений.
– Мониторинг прогресса задач и уровня ошибок, реализация retry-механизмов, идемпотентности и graceful degradation.
– Сохранение транскриптов и результатов для движка оценки, отслеживание использования для биллинга и аудита.
– Интеграция LLM через внутренний LLM gateway (OpenAI SDK), работа с prompt-driven customer personas, streaming ответов, управление недетерминированными выходами, оптимизация стоимости и latency.
– Проектирование API для масштабируемых потоков данных с contract-first подходом (OpenAPI/AsyncAPI) в распределённых сервисах.
– Обеспечение observability: OpenTelemetry + OTLP, Datadog, SLO, структурированное логирование.
– Написание и поддержка тестов: pytest (async, xdist), Testcontainers, respx, Pact contract tests, Locust load tests, staging E2E; соблюдение ruff, mypy strict, SonarQube.
– Участие в CI/CD: Docker, Helm, Kubernetes, GitHub Actions, Unleash feature flags, Renovate.
– Техническое лидерство на сложных проектах, наставничество, эффективное партнёрство с кросс-функциональными командами для достижения общих бизнес-целей.
– Вторичный фокус (nice-to-have): работа с frontend-стеком (TypeScript, React, TanStack Query, Zod, single-spa microfrontend, Vitest, Playwright).
Квалификационные требования– Подтверждённый опыт архитектуры, создания и поддержки высокопроизводительных низколатентных систем для real-time streaming данных.
– Знание WebSocket/Socket.IO, server-sent events, persistent connections и связанных edge cases (переподключения, backpressure, частичная доставка сообщений).
– Продвинутые навыки Python (особенно async/asyncio).
Владение TypeScript — сильное преимущество.
Фокус на проектировании scalable, testable и maintainable software.
– Твёрдое понимание design patterns, clean code и event-driven архитектур.
Опыт планирования задач, fan-out тысяч конкурентных job, retry-механизмов, идемпотентности и graceful degradation.
Знание message brokers (Kafka, NATS) — существенное преимущество.
– Практический опыт production-деплоя LLM: prompt engineering, streaming responses, управление недетерминированными выходами, оптимизация cost/latency, внедрение надёжного тестирования и observability для AI-компонентов.
– Опыт проектирования API для масштабируемых потоков данных, в частности с использованием contract-first методологий (OpenAPI/AsyncAPI) в распределённых сервисах.
– Чёткое понимание использования product analytics для генерации user-focused insights и влияния на бизнес-результаты.
– Опыт system design и технического лидерства на сложных проектах с дорожными картами 9–18 месяцев.
– Способность эффективно работать в динамичной agile-среде, писать высокомасштабируемый код и доводить высокоэффективные инициативы до завершения.
– Отличные навыки collaboration и лидерства, опыт эффективного партнёрства с кросс-функциональными командами.
– Высокая степень автономности и end-to-end ownership многомесячных deliverables: управление scope, execution и operational readiness (reliability, observability, quality assurance) с минимальным надзором.
– Сильное продуктовое мышление: способность ориентироваться в неоднозначных требованиях, предлагать обоснованные trade-offs, глубоко понимать problem space и совместно со стейкхолдерами строить оптимальные решения.
We have 143,549 jobs that might be an even better fit for you
DontApply's real value goes far beyond a single job link or company name. Just upload your resume — in under a minute we'll analyze all 143,549 jobs and tell you exactly which ones you should apply to right now.
Upload My Resume