Разработчик в группу разработки ML-инфраструктуры YT
Yandex · Москва ·
- Category
- Software engineering
Developer on Yandex's ML infrastructure group for the YTsaurus platform in Moscow (remote possible), building distributed systems that make large-scale ML training reliable and efficient: automatic fault detection and recovery, GPU monitoring/profiling, and a unified distributed-training library. Work is mainly Python, with some C++ or Go.
Яндекс запускает большую часть обучений в опенсорсной платформе YTsaurus (github). Команда ML-инфраструктуры повышает надёжность и эффективность обучений. Откликайтесь, если хотите создавать распределённые системы, которые сами обнаруживают и исправляют ошибки, и работать с передовыми технологиями обучения ML-моделей.У нас есть разные направления работы, и вы можете как сфокусироваться на одном из них, так и принести пользу сразу в нескольких. Эксперты в команде помогут разобраться с тонкостями системы. Вы будете работать в основном с Python, но встречаются и задачи, связанные с C++ или Go.
Повышение надёжности и удобства обучений
Мы разрабатываем единую библиотеку распределённых обучений, которая будет интегрирована со всем спектром систем запуска обучений, анализа логов, профилирования, мониторинга и др. Мы хотим сократить количество ручных действий и нестабильностей, чтобы быстрее двигаться вперёд. Автоматизация обнаружения и устранения ошибок распределённых обучений
Одна из важных проблем состоит в том, что в случае ошибки обучения бывает сложно определить точную причину: выход из строя одного из серверов, сбой сети при передаче данных или ошибка в пользовательском коде. Мы работаем над тем, чтобы автоматически обнаруживать ошибку и принимать решение о необходимости перезапуска обучения на другом оборудовании, а также рекомендовать пользователю способы исправления ошибки. Мониторинг, профилирование и оптимизация использования GPU
Различные сбои и неэффективности могут приводить к тому, что GPU простаивают. Мы разрабатываем инструменты, позволяющие обнаруживать и анализировать неэффективное использование GPU. Больше о бэкенде в Яндексе — в канале Yandex for Backend* Уверенно владеете Python, Go или C++ * Умеете и хотите разбираться в распределённых системах и нетривиальном коде * Способны быстро погружаться в новые задачи и находить оптимальные решения — даже в незнакомых областях и при меняющихся приоритетах* Готовы взаимодействовать с пользователями и помогать им диагностировать проблемы * Понимаете, как устроено ML-обучение
Мы разрабатываем единую библиотеку распределённых обучений, которая будет интегрирована со всем спектром систем запуска обучений, анализа логов, профилирования, мониторинга и др. Мы хотим сократить количество ручных действий и нестабильностей, чтобы быстрее двигаться вперёд. Автоматизация обнаружения и устранения ошибок распределённых обучений
Одна из важных проблем состоит в том, что в случае ошибки обучения бывает сложно определить точную причину: выход из строя одного из серверов, сбой сети при передаче данных или ошибка в пользовательском коде. Мы работаем над тем, чтобы автоматически обнаруживать ошибку и принимать решение о необходимости перезапуска обучения на другом оборудовании, а также рекомендовать пользователю способы исправления ошибки. Мониторинг, профилирование и оптимизация использования GPU
Различные сбои и неэффективности могут приводить к тому, что GPU простаивают. Мы разрабатываем инструменты, позволяющие обнаруживать и анализировать неэффективное использование GPU. Больше о бэкенде в Яндексе — в канале Yandex for Backend* Уверенно владеете Python, Go или C++ * Умеете и хотите разбираться в распределённых системах и нетривиальном коде * Способны быстро погружаться в новые задачи и находить оптимальные решения — даже в незнакомых областях и при меняющихся приоритетах* Готовы взаимодействовать с пользователями и помогать им диагностировать проблемы * Понимаете, как устроено ML-обучение