Разрабатывать и совершенствовать лучшую на рынке платформу данных электронной коммерции нового поколения;
Проектировать и разрабатывать ETL пайплайны на Airflow для Spark (Batch, Streaming), Iceberg, Trino;
Оптимизировать действующие пайплайны и джобы на Spark - мониторить нагрузку на кластер и оптимальность затрачиваемых джобами ресурсов и если необходимо оптимизировать;
Взаимодействовать с аналитиками и ML специалистами для создания/развертывания инструментов и наборов данных, соответствующих их вариантам использования - поддерживать регулярные связи с data ops для развития дата-платформы;
Анализировать и внедрять инструменты инжиниринга данных (Lineage, DQ);
Проектировать хранилища данных на основе k8s, настраивать производительность, мониторинг, планировать емкости кластера и другой инфраструктуры - думать над тем что и как грузить и в каких партициях;
Решать задачи, связанные с внедрением облачной инфраструктуры - разрабатывать новую архитектуру хранилища
Проводить code review и принимать участие в архитектурных решениях по дата платформе в команде.
Kubernetes - понимание ресурсной модели, просмотр конфигураций, troubleshooting.
Опыт работы с Hadoop (HDFS, Hive Metastore)
Опыт работы со Spark (spark SQL, streaming, понимание ньюансов работы с pyspark);
Apache Icberg – владение процедурами, snapshots, maintenance
Глубокое понимание Airflow (2, 3) – идемпотентность, assets, backfills
Уверенное знание Git, CI/CD;
Python, Scala/Java – ООП, проектирование библиотек, интеграционные/юнит тесты;
Хорошее понимание СУБД, SQL;
Опыт работы с Docker (уверенное владение для поднятия локального окружения проекта);
Опыт работы с Kafka – понимание архитектуры и слабых мест;
Опыт с облачными технологиями: преимущественно Yandex Cloud;
Опыт с Clickhouse.
AI-native подход к разработке: активное использование Claude Code / Codex и подобных инструментов, опыт построения harness-систем — агентов с инструментами, автоматизации через LLM, RAG.