Data Engineer designing and maintaining data pipelines, ETL/ELT processes, and a modern data warehouse (DWH) for a large entertainment-industry tech company serving 100M+ users worldwide. Core stack is SQL and Python, with Airflow, dbt, Spark, ClickHouse and similar tools as pluses.
Одна из крупнейших компаний, разрабатывающих технологические решения для entertainment-индустрии, находится в поисках сильного Data Engineer для развития современной data-платформы и высоконагруженных систем обработки данных.
Проектировать, разрабатывать и поддерживать надежные data pipelines и DAG-процессы;
Готовить данные для аналитических, продуктовых и бизнес-задач;
Работать с большими объемами данных, оптимизировать SQL-запросы и производительность хранилищ;
Развивать процессы ETL/ELT и участвовать в проектировании DWH, моделей данных и витрин;
Интегрироваться с внешними источниками и сервисами через API, FTP и другие каналы передачи данных;
Проектировать и разрабатывать Python-сервисы, библиотеки и инструменты для обработки данных;
Участвовать в развитии архитектуры data-платформы и самостоятельно предлагать технические решения для повышения надежности, производительности и масштабируемости.
Сильное знание SQL: сложные запросы, работа с большими объемами данных, анализ и оптимизация производительности;
Уверенное владение Python: опыт написания production-кода, библиотек, сервисов и инструментов для работы с данными;
Понимание принципов построения DWH: слои данных, модели, витрины, ETL/ELT и контроль качества данных;
Практический опыт построения и поддержки data pipelines;
Самостоятельность в поиске и выборе технических решений;
Умение понимать бизнес-контекст задач и эффективно взаимодействовать с командой.
Будет преимуществом опыт работы с:
Airflow — разработка и поддержка DAG, scheduling, retries, backfill, monitoring;
dbt или аналогичными инструментами трансформации данных;
Spark и распределенной обработкой данных;
аналитическими СУБД и OLAP/MPP-системами: ClickHouse, Greenplum, Vertica и другими;
Kafka / RabbitMQ;
Iceberg, Trino;
Docker, Kubernetes, CI/CD;
подходами Data Mesh;
open-source проектами или собственными техническими проектами.
Работа с highload-продуктами, терабайтами данных и аудиторией 100M+ пользователей по всему миру;
Гибкий формат работы: удалённо, гибридно или из офиса;
Расширенный релокационный пакет, включающий релокацию специалиста и членов его семьи;
ДМС со стоматологией после испытательного срока;
Компенсация спорта, английского языка и сессий с психологом;
Компенсация профильного обучения и возможность обмениваться экспертизой внутри команды;
Корпоративная библиотека, командные мероприятия, мастер-классы и другие внутренние активности;
Высокий уровень самостоятельности и возможность напрямую влиять на технические решения и развитие data-платформы.