Наша команда занимается стадией алайнмента Alice AI LLM. Мы превращаем LLM, обученную предсказывать следующий токен в документах из интернета, в диалогового агента, способного выполнить широкий спектр запросов пользователя.
Обучение следованию инструкциям пользователя (Supervised Fine-tuning, SFT)
Чтобы превратить предобученную LLM в диалогового агента, нужно собрать множество демонстраций желаемого поведения модели на разнообразных задачах. Какие именно задачи важнее, насколько сложными могут быть демонстрации, каких навыков модели не хватает для решения конкретной задачи и как модель может выучить этот навык на стадии алайнмента? Это примеры вопросов, на которые мы ищем ответы с помощью ML-экспериментов.
Обучение модели на основе пользовательских предпочтений и верифицируемых наград (RLHF, RLVR)
После стадии SFT качество ответов модели даже на один и тот же запрос может очень сильно различаться. Мы собираем разметку относительного качества ответов модели и учим её генерировать ответы наилучшего качества. На этом этапе мы применяем алгоритмы online-RL (GRPO, GSPO) и используем комбинацию стадий RLHF и RLVR. Также мы занимаемся обучением с одновременным учётом нескольких аспектов качества.
Обучение модели наград (Reward Modeling)
Разметка качества ответов людьми — очень дорогой и небыстрый процесс, а алгоритмы online-RL требуют оценки в реальном времени. Мы развиваем свою линейку reward-моделей, которые могут быстро оценивать качество ответа модели на уровне человека. Кроме базового обучения моделей наград, мы применяем подходы с использованием рубрицированных оценок, а также используем LLM-as-a-Judge (LLMaJ) напрямую.
Объединение экспертных моделей
Мы занимаемся объединением экспертных моделей, обученных на разных доменах, в единую модель, которая сочетает в себе сильные качества каждой из них. Для этого мы активно исследуем и применяем такие методы, как On-Policy Distillation (OPD).
Больше об ML в Яндексе — в канале Yandex for ML