Data инженер
Employment type: Полный рабочий день
Grade: Middle
Skills: Python, SQL, Apache Airflow, Greenplum, Apache Superset, PostgreSQL
Description:
О компании и команде
Не будем повторять то, что написано о нас на страничке «О компании». Там ты найдешь ответы на вопросы "Кто мы?", "Почему сейчас ищем людей?" и "Что стратегически нами задумано?", букв немного, вся суть передана, цифры говорят сами за себя!
Ожидания от кандидата
Какой человек нам нужен?
Самостоятельный, убедительный, амбициозный, с лидерскими качествами (или умением сделать так, чтобы управлять не приходилось:) стремящийся к построению качественных процессов и, как следствие, качественному сбору, хранению и поставке данных.
Что мы предлагаем:
Заниматься созданием централизованной системы сбора и обработки данных
Работать в компании, где тебя слышат и ценят твой вклад
Влиять на технические решения и планомерно повышать качество сбора, хранения и поставки данных
Работать с командой людей, умеющих принимать решения, амбициозных, увлеченных своим делом и проектом
Разрабатывать востребованный продукт и получать четкий фидбэк от пользователей
Решать амбициозные задачи
Получить профессиональный рост (у нас есть тренинги, конференции, сильная команда, которая готова делиться знаниями и в которой можно быстро расти)
Немного о том, что уже сделали и что нам еще предстоит:)
На текущий момент мы подготовили инфраструктуру на базе Hadoop и GreenPlum для загрузки, обработки и построения витрин данных. Описали и загрузили данные нескольких продуктов холдинга и приступили к описанию и загрузке следующих. Дальше планируем развивать и масштабировать инфраструктуру, запускать потоковое получение данных, увеличивать количество подключенных источников, развивать ETL и Reverse ETL, работать с качеством данных и развивать Data Catalog и Data Lineage.
На практике это значит, что мы будем решать следующие задачи:
Разрабатывать и дорабатывать ETL-процессы в Airflow
Подключать новые источники данных
Создавать и дорабатывать витрины
Оптимизировать SQL-запросы в GreenPlum и PostgreSQL
Работать с большими объемами данных
Развивать процессы контроля качества данных
Что для нас важно в тебе:
От 1 года опыта работы с данными
Отличное знание SQL: JOIN, оконные функции, процедуры
Умение профилировать и оптимизировать запросы, понимать план выполнения
Понимание принципов работы реляционных БД и архитектуры DWH: ODS, DDS, DM
Практический опыт работы с Airflow и ETL-процессами
Python на базовом уровне
Знание Linux и умение работать с командной строкой
Опыт работы с Git
Понимание принципов работы Docker
Не обязательно, но будет очень здорово:
Опыт работы с большими данными (>100 GB)
Опыт работы с DataHub
Условия работы
Что есть у нас и чем готовы делиться:
Белая, своевременная и конкурентоспособная заработная плата
ДМС (включая стоматологию)
Удобное место для работы и современное “железо”
Гибкий график. Начало работы с 8 до 11
У нас не нужно приходить 5 дней в неделю в офис. Мы внутри команд сами определяем, когда туда приехать
Профессиональный рост (у нас есть внутреннее обучение, возможность посещать конференции и митапы, мы спонсируем))
P.S.: А если ты совсем не хочешь посещать офис, то удалённый формат работы у нас тоже есть)
Анонимная аналитика
Мы используем анонимную аналитику, чтобы улучшать поиск вакансий и работу сайта.