Ищем Data Engineer для работы с HR-данными в рамках корпоративного DWH.
Обязанности
Разработка и поддержка пайплайнов загрузки и трансформации HR-данных
Интеграция источников (API, Kafka, БД, файловые хранилища)
Построение витрин и обеспечение их консистентности
Оптимизация производительности и стоимости обработки данных
Обеспечение стабильности (обработка сбоев, ретраи, мониторинг)
Выстраивать архитектурные решения;
Требования
Python на уровне уверенной разработки:
ETL/ELT пайплайны
работа с API
обработка больших объемов данных
SQL на продвинутом уровне:
сложные join’ы, оконные функции
оптимизация запросов под большие объемы
понимание планов выполнения
Практический опыт работы с Greenplum (понимание MPP, распределение данных, оптимизация), ClickHouse (построение витрин, работа с большими таблицами), MS SQL Server
Kafka:
опыт работы с consumer/producer
понимание семантики доставки и обработки сообщений
Уверенная работа с REST API (пагинация, ретраи, обработка ошибок)
S3-совместимые хранилища: чтение/запись, организация данных, партиционирование
Знание и понимание архитектуры хранения данных: DWH, Data Lake, Lake House, Medallion, Federations и др.
Будет плюсом:
Опыт работы с Trino (федеративные запросы, работа с несколькими источниками)
Опыт построения DWH (staging / dds / marts)
Понимание data lineage и контроля качества данных
Опыт orchestration (Airflow или аналоги)
Условия
гибкая система премирования;
расширенный социальный пакет: ДМС со стоматологией с первого месяца работы, психолог и страхование жизни, компенсация питания и оплата мобильной связи;
работа в компании с развитой инженерной культурой;
автономность работы, возможность менять правила, ошибаться и создавать новое;
возможность профессионального роста, программы развития для сотрудников;
корпоративное обучение и доступ к базе знаний;
внутренние профессиональные сообщества и мероприятия;