Мы — команда «Пульс Магнит» — это кросс-платформенная информационная система, объединяющая несколько бизнес- и операционных направлений компании в единой платформе.
В поиске инженера, которому интересно не только поддерживать существующую инфраструктуру, но и влиять на то, как будет устроена MLOps-платформа, инженерные стандарты и процессы взаимодействия между DevOps, Data Science и бизнесом.
Что нужно делать
Проектировать и развивать отказоустойчивую MLOps-платформу: строить новые решения и масштабировать существующую инфраструктуру.
Развивать E2E ML-пайплайны: от подготовки и обучения модели до валидации, деплоя, мониторинга и переобучения.
Выстраивать CI/CD/CT-процессы для ML-решений, автоматизировать поставку сервисов и моделей в production.
Проектировать и развивать Kubernetes-кластеры для обучения моделей и высоконагруженного инференса, оптимизировать использование GPU- и CPU-ресурсов.
Развивать model serving и мониторинг ML-систем: контролировать качество моделей, Data и Model Drift, latency, производительность и ключевые бизнес-метрики.
Внедрять DevOps- и MLOps-практики, стандарты безопасности и управления данными в командах Data Science.
Проводить архитектурные ревью, работать с техническим долгом, менторить инженеров и помогать командам принимать технические решения.
Нам важно
От 4 лет опыта в DevOps, SRE или инфраструктурной инженерии и от 2–3 лет в роли MLOps Engineer.
Уверенный опыт работы с Kubernetes, Helm, Terraform и Ansible.
Опыт построения и эксплуатации MLOps-пайплайнов, CI/CD и GitOps-процессов для ML-продуктов.
Понимание ML-инженерии: distributed training, особенности production-инференса, оптимизация и квантование моделей.
Опыт проектирования распределенных систем и работы с интеграционными паттернами: микросервисы, очереди сообщений, gRPC.
Опыт настройки мониторинга и наблюдаемости: Prometheus, Grafana, Evidently AI или аналоги.
Уверенное владение Python и Bash для автоматизации и работы с инфраструктурой.
Практика работы с хранилищами и данными: S3-совместимые хранилища, ClickHouse, PostgreSQL, Feature Store.
Умение аргументированно защищать архитектурные решения, взаимодействовать с Data Scientists и оценивать инфраструктурные затраты.
Готовность брать техническое лидерство: проводить ревью, развивать инженерные стандарты и менторить коллег.