OfferClaw
Вакансии
Шаблон пет-проекта
Телеграм
☀
← Назад
Data Platform Engineer
ivi
·
Russia
·
Офис
·
2 нед. назад
Чем предстоит заниматься:
Развивать платформу для расчёта ML-признаков в batch-, streaming- и nearline-сценариях
Строить и поддерживать пайплайны для исторических расчётов, backfill и обновления признаков
Собирать обучающие датасеты так, чтобы в них не попадали данные «из будущего»
Работать с потоковыми данными: окнами, опоздавшими событиями и разными типами времени
Следить за тем, чтобы признаки одинаково и корректно считались в offline- и online-контурах
Развивать единые и переиспользуемые подходы к описанию feature pipelines и датасетов
Обеспечивать воспроизводимость и качество данных: версионирование, lineage, проверки и контроль результатов расчётов
Оптимизировать Spark- и streaming-задачи по скорости, памяти и стоимости вычислений
Развивать incremental-расчёты, чтобы не пересчитывать большие объёмы данных без необходимости
Интегрировать платформу с Feature Store, Airflow/Kubeflow, Kafka, хранилищами и внутренними сервисами
Добавлять метрики, трассировку и инструменты диагностики, чтобы быстро находить проблемы в проде
Проверять систему под нагрузкой и в сценариях с отказами
Участвовать в сопровождении своего прод-контура и разборе инцидентов
Вместе с ML-инженерами превращать решения под конкретные задачи в общие возможности платформы
Оценивать готовые open-source решения и выбирать, где лучше интегрировать существующий инструмент, а где действительно нужна собственная разработка
Ожидания Иви от кандидата:
Уверенное знание Python и/или JVM-языка
Опыт разработки и поддержки конвейеров обработки данных
Глубокое понимание Spark или другой распределённую систему обработки данных
Опыт с Airflow, Kubeflow Pipelines или аналогами
Понимание partitioning, shuffle, skew, retry, backfill и идемпотентности
Опыт проектирования схемы данных и работы с большими объёмами
Опыт работы в batch- и streaming-обработке: event time, processing time, окна, watermark, late data
Понимание point-in-time joins, temporal leakage и гарантии at-least-once / exactly-once
Знание подходов к incremental computation, caching, state и пересчётам
Работае с Git, code review, тестированием, CI/CD и observabilit
Будет плюсом:
Опыт работы с хранилищами признаков и платформами машинного обучения
Опыт разработки потоковых систем и работы с Kafka
Опыт версионирования, отслеживания происхождения и проверки качества данных
Опыт оптимизации Spark-задач по скорости, памяти и стоимости вычислений
Опыт создания переиспользуемых решений для команд данных и машинного обучения
Похожие вакансии
MAGNIT TECH
2 нед. назад
Главный разработчик ML / MLOps
Удалённо
Russia
MAGNIT TECH
1 нед. назад
Инженер данных
Удалённо
Офис
Russia
Другие вакансии
ivi
ivi
2д. назад
Ведущий менеджер по рекламным спонсорствам и интеграциям
Офис
Russia
ivi
2д. назад
Менеджер по специальным проектам
Офис
Russia
ivi
2д. назад
Контент-менеджер (со знанием узбекского языка)
Офис
Russia
ivi
2д. назад
Контентный дата-аналитик внешних данных
Офис
Russia