Наша команда отвечает за генерацию и редактирование изображений в Алисе. Мы ведём полный цикл: pretrain, SFT, RL, дистилляцию и подготовку к проду. Сейчас мы движемся от набора специализированных t2i/i2i-моделей к единой модели, которая покрывает и генерацию по тексту, и редактирование по инструкции, и работу с несколькими изображениями сразу. Задачи находятся на стыке research и продакшена: хорошие идеи не остаются в статьях, а доходят до продовой модели.
Генерация изображений — одна из самых заметных и быстро развивающихся областей современного ML: то, что вчера было демо из статей, сегодня работает в продукте, которым ежедневно пользуются миллионы людей. Мы отвечаем за весь этот путь — от исследовательской идеи до модели в Алисе.
Работа устроена на стыке research и инженерии: часть задач — про качество и возможности модели (генерация, редактирование, работа с несколькими изображениями), часть — про скорость и стоимость инференса (дистилляция, ускорение, вывод в прод). Вам не придётся выбирать между наукой и продуктом — у нас это один процесс.
Развивать модели генерации и редактирования
Мы движемся к единой модели, которая покрывает генерацию по тексту, редактирование по инструкции и работу с несколькими изображениями сразу, а не к набору отдельных t2i/i2i-моделей. Вы будете участвовать в обучении такой модели на всех стадиях — pretrain, SFT, RL и дистилляция: расширять её возможности — от multi-image-редактирования до генерации в высоком разрешении (2K/4K) — и искать компромисс между универсальностью и качеством.
Улучшать управляемость и понимание промптов
Чтобы модель точнее следовала запросу, важно, как в неё попадает контекст. Вы будете экспериментировать с кондишнингом и текстовыми энкодерами (в том числе reasoning-подходами), работать с эмбеддингами текста и изображения и снижать галлюцинации и игнорирование условий на сложных запросах.
Ускорять и дистиллировать модели
Продовой модели нужны низкий latency и малое число шагов генерации. Вы будете исследовать методы дистилляции диффузионных моделей (малошаговая генерация ≤ 8 шагов, CM/sCM, DMD и смежные подходы), оптимизировать работу GPU с помощью PyTorch Profiler, Nsight Systems и TensorRT и доводить решения до прода — чекпойнты, код, Docker.
Работать с данными и масштабировать обучение
Вы будете принимать решения о составе обучающих данных — домены, форматы, пропорции, приоритетные срезы для multi-image — и строить масштабируемый пайплайн. А ещё разгонять распределённое обучение: FSDP/ZeRO, профилирование bottleneck'ов, утилизация железа, стабильность и воспроизводимость экспериментов.
Больше об ML в Яндексе — в канале Yandex for ML