Build and optimize high-load Scala/Spark pipelines for NPL analytics, engineer clean features for ML teams, and integrate generative AI into data workflows.
Мы разрабатываем и внедряем DS-модели и AI-агентов в Департаменте по работе с проблемными активами (NPL). Мы понимаем, что их эффективность напрямую зависит от фундамента — качественно проанализированных, подготовленных и высокопроизводительных данных.
Обязанности
Разработка высоконагруженных пайплайнов обработки больших данных исключительно на Scala API DataFrame Apache Spark (без SQL), включая оптимизацию производительности (Performance Tuning) и устранение data skew.
Проектирование архитектуры хранения: моделирование данных с применением подходов Data Vault или Dimensional Modeling, участие в проектировании DWH.
Подготовка и предоставление чистых, структурированных фичей (feature engineering) для команд DS/ML, понимание жизненного цикла внедрения ML-моделей.
Обработка больших объемов неструктурированных данных и интеграция результатов работы генеративного ИИ в аналитические процессы.
Работа с ядром Spark: анализ планов выполнения запросов через Catalyst Optimizer, выявление и решение проблем производительности на уровне кода.
Участие в код-ревью, ведение разработки в Git, написание модульных тестов и поддержание высокого качества кодовой базы команды.
Трансляция бизнес-задач от стейкхолдеров в технические требования к данным и архитектуре потоков.
Требования
Релевантный опыт от 3 лет на позиции Data-аналитика/Аналитика DWH с фокусом на разработку production-ready решений.
Экспертное владение Scala API для работы с DataFrame Apache Spark. Опыт реализации проектов исключительно на Scala без использования SQL.
Глубокое понимание этапов оптимизации Catalyst, умение читать планы выполнения (Explain) и проводить Performance Tuning.
Практический опыт участия во внедрении ML-моделей и уверенное знание этапов их жизненного цикла (от подготовки данных до мониторинга).
Навыки проектирования высоконагруженных систем и знакомство с архитектурными подходами Data Vault или Dimensional Modeling.
Уверенная работа с большими объемами неструктурированных данных и применение инструментов генеративного ИИ для автоматизации задач.
Высшее техническое образование, владение Git и опыт прохождения код-ревью.
Будет плюсом:
Опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов.
Условия
Офисный формат работы: г. Москва, Кутузовский проспект, д. 32, к.1.
Ежегодный пересмотр зарплаты и годовая премия.
Более 400 образовательных программ в СберУниверситете для твоего развития.
Спортзал и зоны отдыха.
Расширенный ДМС, льготное страхование для семьи.
Гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ.
Подписка Прайм с возможностью совместного использования на трёх близких.
Вознаграждение за рекомендацию друзей в команду Сбера.