Инженер данных в Путешествия
Yandex ·
- Category
- Data engineering
Яндекс Путешествия — сервис для планирования поездок по России и миру. Мы превращаем терабайты данных в понятные инсайты, которые используют аналитики и сервис. Ищем опытного инженера данных. Откликайтесь, если разбираетесь в SQL на уровне эксперта и пишете на одном из языков высокого уровня.Разработка, сопровождение и ревью ETL-процессов поставки данных
Вам предстоит создавать конвейеры для извлечения, трансформации и загрузки данных из различных источников, настраивать их расписание и мониторинг. Важно будет регулярно проверять и улучшать существующий код, оперативно исправлять возникающие ошибки, а также тщательно документировать все преобразования и потоки данных — как собственные, так и коллег, обеспечивая соответствие стандартам качества и производительности. Проектирование структуры хранения данных в разных слоях хранилища
Вы будете определять оптимальные схемы организации данных для каждого слоя, учитывая требования к скорости запросов и объёму хранения. Задача включает разработку моделей данных, настройку партиционирования, индексации и сжатия для повышения производительности, а также согласование структур с командами аналитики и разработки и адаптацию схем при изменении бизнес-процессов. Выявление и оптимизация неэффективных участков в процессах поставки данных
Вам нужно будет анализировать время выполнения ETL-задач, профилировать данные для обнаружения аномалий и избыточности, пересматривать алгоритмы трансформации для снижения нагрузки на систему. Погружение в данные прикладных бизнес-областей и становление в них экспертом
Вы будете детально изучать бизнес-процессы и ключевые метрики компании, разбираться в логике расчёта показателей и источниках их формирования. Больше о разработке в Вертикалях — в нашем телеграм канале* Проектировали DWH (слои, модели хранения данных, ETL-процессы) * Разрабатывали ETL-процессы на Apache Airflow или аналогах * Настраивали поставки данных по API * Разбираетесь в SQL на уровне эксперта * Пишете на одном из языков высокого уровня (Python, Go, Java и т. д.) * Понимаете устройство и архитектуру реляционных баз данных * Знаете основные алгоритмы и структуры данных, особенно используемые в работе с большими данными* Пользовались хотя бы одной MPP-СУБД (Greenplum, ClickHouse, Vertica, Teradata и т. д.) * Понимаете принципы работы технологий распределённой обработки данных (Hadoop, MapReduce и MPP)
Вам предстоит создавать конвейеры для извлечения, трансформации и загрузки данных из различных источников, настраивать их расписание и мониторинг. Важно будет регулярно проверять и улучшать существующий код, оперативно исправлять возникающие ошибки, а также тщательно документировать все преобразования и потоки данных — как собственные, так и коллег, обеспечивая соответствие стандартам качества и производительности. Проектирование структуры хранения данных в разных слоях хранилища
Вы будете определять оптимальные схемы организации данных для каждого слоя, учитывая требования к скорости запросов и объёму хранения. Задача включает разработку моделей данных, настройку партиционирования, индексации и сжатия для повышения производительности, а также согласование структур с командами аналитики и разработки и адаптацию схем при изменении бизнес-процессов. Выявление и оптимизация неэффективных участков в процессах поставки данных
Вам нужно будет анализировать время выполнения ETL-задач, профилировать данные для обнаружения аномалий и избыточности, пересматривать алгоритмы трансформации для снижения нагрузки на систему. Погружение в данные прикладных бизнес-областей и становление в них экспертом
Вы будете детально изучать бизнес-процессы и ключевые метрики компании, разбираться в логике расчёта показателей и источниках их формирования. Больше о разработке в Вертикалях — в нашем телеграм канале* Проектировали DWH (слои, модели хранения данных, ETL-процессы) * Разрабатывали ETL-процессы на Apache Airflow или аналогах * Настраивали поставки данных по API * Разбираетесь в SQL на уровне эксперта * Пишете на одном из языков высокого уровня (Python, Go, Java и т. д.) * Понимаете устройство и архитектуру реляционных баз данных * Знаете основные алгоритмы и структуры данных, особенно используемые в работе с большими данными* Пользовались хотя бы одной MPP-СУБД (Greenplum, ClickHouse, Vertica, Teradata и т. д.) * Понимаете принципы работы технологий распределённой обработки данных (Hadoop, MapReduce и MPP)