Наша команда занимается улучшением генеративных моделей Alice AI LLM для пользователей Алисы. Сейчас наша главная цель — сделать LLM-модель Alice AI ещё более умной, человечной и полезной для многомиллионной аудитории пользователей чата с Alice AI. Мы хотим, чтобы модель не только правильно решала задачи, но и общалась естественно: понимала контекст и настроение человека, подстраивалась под его стиль и избегала сухих и шаблонных ответов.
Кроме того, модель должна персонализировать ответы с учётом того, что она знает о пользователе, его интересах и предпочтениях. Для этого мы работаем с передовыми техниками alignment-а, например RL и мультиаспектными reward-функциями, дополняя и развивая LLM-модель новыми свойствами.
В июне 2026 года мы выпустили большое обновление Alice AI: сделали её общение более естественным и человечным, научили подстраиваться под стиль собеседника и персонализировать ответы. Теперь модель может запоминать важные факты из предыдущих диалогов и учитывать их в новых разговорах.
Чтобы делать продукт ещё круче, мы ищем ML-инженера, заинтересованного в прикладной работе с LLM-моделями и техниками RL. Кроме того, в нашей команде много пространства для роста: можно предлагать новые направления, доводить инициативы до продуктового результата и развиваться в сторону технического или командного лидерства.
Почему это круто?
Это шанс не просто работать с LLM, а создавать ИИ, который изменит правила игры. Присоединяйтесь!
Исследование подходов RL и борьба с reward hacking
Хороший ответ LLM обладает различными свойствами: полезностью, человечностью, фактологичностью, безопасностью, уместной структурой и другими. Для улучшения каждого из свойств мы используем методы RL, например GRPO, в основе которых лежат reward-модели, обученные оценивать отдельные аспекты ответа. При этом важно находить tradeoff-ы между аспектами и учитывать корреляцию и антикорреляцию разных reward-функций.
Одна из самых интересных задач здесь — борьба с reward hacking. В ходе обучения модель может найти «дешёвую» стратегию повышения reward-а: злоупотреблять определённой структурой, повторять одни и те же обороты или использовать формулировки, которые нравятся reward-модели, но делают ответы менее естественными. Так возникают узнаваемые паттерны, из-за которых разные ответы начинают выглядеть одинаково. Отдельное направление нашей работы — дешаблонизация: поиск таких паттернов, создание диагностик и срезов, улучшение reward-моделей и методов обучения так, чтобы рост метрик действительно означал рост качества.
Развитие человечности модели
Мы хотим, чтобы Alice AI была не просто системой, которая выдаёт правильный текст, а внимательным и естественным собеседником. Модель должна понимать, когда нужен короткий ответ, когда подробное объяснение, а когда — поддержка или участие. Здесь предстоит исследовать человечность как отдельный аспект качества и учить модель адаптироваться к собеседнику, не теряя полезности и точности.
Персонализация
Мы учим модель работать с долгосрочными фактами о пользователе, чтобы общение с Alice AI становилось более личным и последовательным. Здесь есть несколько сложных задач: находить релевантные воспоминания в истории диалогов, использовать их только тогда, когда они действительно помогают ответу, и выбирать, какая информация достаточно важна для сохранения в долгосрочной памяти.
При этом модель не должна запоминать случайный шум или навязчиво упоминать всё, что знает о человеке. Нужно находить баланс между персонализацией, естественностью и полезностью.
Обучение на пользовательском сигнале (RLUF)
Ещё одно направление — RLUF, или Reinforcement Learning from User Feedback. Мы учимся улучшать модель непосредственно по сигналам от пользователей, например отметкам «Нравится» и «Не нравится». Такой сигнал максимально близок к реальному продуктовому качеству, но при этом он шумный и неоднородный: одна и та же оценка может отражать полезность, стиль, фактологическую ошибку или просто несовпадение с ожиданиями конкретного человека.
Здесь предстоит исследовать, как очищать и интерпретировать пользовательский сигнал, превращать его в устойчивый обучающий reward и проверять, что модель становится действительно полезнее и человечнее, а не учится эксплуатировать поверхностные закономерности обратной связи.
Модели с tool calling и reasoning
Мы разрабатываем рассуждающие модели, умеющие делать tool calling в ходе рассуждений. Учим их раскладывать сложную задачу на шаги, выбирать подходящий инструмент, корректно формировать вызовы, анализировать результаты и восстанавливаться после ошибок. Важно научить модель понимать, когда инструмент действительно нужен, а когда лучше ответить самостоятельно, и фокусироваться не просто на генерации убедительного текста, а на достижении результата, которого ожидает пользователь.
Подробнее про Alice AI
Больше об ML в Яндексе — в канале Yandex for ML