Python/LLM engineer

Greencoreiv — Georgia · Posted ~2 hours ago

🔓 Log in to save this job, tailor your resume & track your apply process — 7 days free, no card needed.

Log in to add to target list

Description

Python/LLM engineer Грейд: Senior Период привлечения: ASAP, долгосрочно Языки: разговорный английский Общие сведения о должностиКлючевая цель — разработка backend-сервисов для оркестрации и выполнения end-to-end симулированных диалогов с развёрнутыми AI-агентами в корпоративном масштабе. Речь идёт о взаимодействии LLM-персоны клиента с живым агентом через real-time каналы. Домен направлен на обеспечение максимально реалистичного, надёжного и высококонкурентного тестирования агентов. В зону ответственности входит provision инфраструктуры для каждого запуска (каналы, деплойменты, верификация окружения), управление тысячами одновременных симулированных диалогов через WebSocket-мост, мониторинг прогресса задач и уровня ошибок, сохранение транскриптов и результатов для движка оценки, а также отслеживание использования для биллинга и аудита. Сервис является фундаментальным runtime для Evaluations, поэтому latency, throughput, graceful degradation и observability — это ключевые продуктовые требования, а не опциональные дополнения. Успешный специалист на этой должности — это инженер с сильным продуктовым мышлением, способный работать автономно, брать на себя end-to-end ответственность за многомесячные deliverables и эффективно взаимодействовать с кросс-функциональными командами. Роль предполагает техническое лидерство, наставничество и участие в проектировании систем на дорожных картах длительностью 9–18 месяцев. Место в структуре организации: команда Evaluations / платформенная команда, тесное взаимодействие с продуктовыми, инфраструктурными и QA-командами. Обязанности– Проектирование, разработка и поддержка высокопроизводительных низколатентных backend-сервисов на Python с использованием asyncio для оркестрации end-to-end симулированных диалогов с AI-агентами. – Provisioning инфраструктуры для каждого запуска: каналы, деплойменты, верификация окружения. – Управление тысячами одновременных симулированных диалогов через WebSocket-мост (python-socketio) с обеспечением устойчивости к переподключениям, backpressure и частичной доставке сообщений. – Мониторинг прогресса задач и уровня ошибок, реализация retry-механизмов, идемпотентности и graceful degradation. – Сохранение транскриптов и результатов для движка оценки, отслеживание использования для биллинга и аудита. – Интеграция LLM через внутренний LLM gateway (OpenAI SDK), работа с prompt-driven customer personas, streaming ответов, управление недетерминированными выходами, оптимизация стоимости и latency. – Проектирование API для масштабируемых потоков данных с contract-first подходом (OpenAPI/AsyncAPI) в распределённых сервисах. – Обеспечение observability: OpenTelemetry + OTLP, Datadog, SLO, структурированное логирование. – Написание и поддержка тестов: pytest (async, xdist), Testcontainers, respx, Pact contract tests, Locust load tests, staging E2E; соблюдение ruff, mypy strict, SonarQube. – Участие в CI/CD: Docker, Helm, Kubernetes, GitHub Actions, Unleash feature flags, Renovate. – Техническое лидерство на сложных проектах, наставничество, эффективное партнёрство с кросс-функциональными командами для достижения общих бизнес-целей. – Вторичный фокус (nice-to-have): работа с frontend-стеком (TypeScript, React, TanStack Query, Zod, single-spa microfrontend, Vitest, Playwright). Квалификационные требования– Подтверждённый опыт архитектуры, создания и поддержки высокопроизводительных низколатентных систем для real-time streaming данных. – Знание WebSocket/Socket.IO, server-sent events, persistent connections и связанных edge cases (переподключения, backpressure, частичная доставка сообщений). – Продвинутые навыки Python (особенно async/asyncio). Владение TypeScript — сильное преимущество. Фокус на проектировании scalable, testable и maintainable software. – Твёрдое понимание design patterns, clean code и event-driven архитектур. Опыт планирования задач, fan-out тысяч конкурентных job, retry-механизмов, идемпотентности и graceful degradation. Знание message brokers (Kafka, NATS) — существенное преимущество. – Практический опыт production-деплоя LLM: prompt engineering, streaming responses, управление недетерминированными выходами, оптимизация cost/latency, внедрение надёжного тестирования и observability для AI-компонентов. – Опыт проектирования API для масштабируемых потоков данных, в частности с использованием contract-first методологий (OpenAPI/AsyncAPI) в распределённых сервисах. – Чёткое понимание использования product analytics для генерации user-focused insights и влияния на бизнес-результаты. – Опыт system design и технического лидерства на сложных проектах с дорожными картами 9–18 месяцев. – Способность эффективно работать в динамичной agile-среде, писать высокомасштабируемый код и доводить высокоэффективные инициативы до завершения. – Отличные навыки collaboration и лидерства, опыт эффективного партнёрства с кросс-функциональными командами. – Высокая степень автономности и end-to-end ownership многомесячных deliverables: управление scope, execution и operational readiness (reliability, observability, quality assurance) с минимальным надзором. – Сильное продуктовое мышление: способность ориентироваться в неоднозначных требованиях, предлагать обоснованные trade-offs, глубоко понимать problem space и совместно со стейкхолдерами строить оптимальные решения.