ML Engineer / Research Engineer (агентские навыки в претрейне LLM)

Яндекс·Russia·Удалённо, Офис·5д. назад

Привет! Меня зовут Екатерина Редина, я руковожу командой исследования знаний, которая обучает с нуля базовые модели Alice AI LLM.

У нас вы сможете формировать агентские способности внутри базовой модели, а не только собирать оркестрацию поверх готовой LLM, сможете доводить идеи от небольшого эксперимента до полноценного претрейна, искать решения в области, где у индустрии ещё нет устоявшихся подходов. А также результаты вашей работы войдут в следующие поколения Alice AI LLM и продукты Яндекса. Таким образом, в одной роли соединяются исследования, обучение моделей с нуля и разработка масштабных ML-систем.

Если вам интересно не только собирать агентов из готовых компонентов, но и учить саму модель действовать, создавая новые возможности для реальных продуктов, — приходите к нам.

Можно ли научить модель пользоваться калькулятором, если до этого ей триллионы раз показывали, что всё нужно считать самой? Можно — но ценой больших усилий и вычислительных ресурсов. Сначала придётся преодолеть сильный prior, сформированный во время претрейна: «Увидел задачу — сразу сгенерируй ответ». А за пределами знакомых сценариев модель будет снова и снова возвращаться к привычной стратегии — пытаться угадать результат вместо обращения к инструменту. То же самое происходит с кодом, поиском, браузером и другими инструментами, которым пользователи хотят поручать всё больше работы.

Мы закладываем другой фундамент: уже во время претрейна учим модель понимать границы собственных знаний, обращаться к внешней среде и учитывать полученный результат. На масштабе триллионов токенов формируется не навык работы с конкретным API, а общий подход: ответ не всегда нужно угадывать — часто для него нужно совершить действие.

Для продукта разница принципиальна. Пользователю нужен не собеседник, который правдоподобно расскажет, как решить задачу, а агент, который действительно её решит: найдёт актуальную информацию, проверит расчёты, напишет и запустит код или выполнит действие в сервисе. Одна способность, заложенная в базовую модель, масштабируется на Алису и другие продукты Яндекса с миллионами пользователей.

Агентские возможности уже стали частью гонки претрейнов. Например, команды Kimi и Qwen целенаправленно развивают их в своих базовых моделях. Наша задача — определить, какие данные, среды и методы обучения позволят Alice AI LLM сделать следующий шаг.

Данные для будущих агентов
Главный исследовательский вопрос — какой опыт должна получить базовая модель, чтобы уверенно справляться не только со знакомыми сценариями, но и с новыми задачами и инструментами.
Предстоит:

  • создавать траектории взаимодействия с цифровой средой;
  • работать с search-, CRUD-, SWE-, computer-use- и другими многошаговыми сценариями;
  • включать в датасеты как успешные решения, так и ошибки с последующим исправлением;
  • находить форматы данных, которые развивают способность к обобщению;
  • изучать, как результат меняется с размером модели и объёмом обучения. Готовых рецептов здесь почти нет. Нужно будет предлагать свои гипотезы и проверять их в реальном обучении LLM.

Интерактивные среды
Для обучения и объективной оценки нужны среды, где агент может совершать действия, видеть их последствия и получать обратную связь.
Вы будете:

  • создавать автоматически проверяемые задачи и масштабировать их до больших объёмов;
  • воспроизводить взаимодействие с сайтами, API, кодом и приложениями;
  • регулировать сложность и разнообразие сценариев;
  • развивать инфраструктуру для параллельного запуска множества агентов;
  • проверять, переносятся ли результаты из симуляций в реальные условия.

Генерация синтетики
Реальных траекторий недостаточно, поэтому большую часть обучающего материала приходится создавать автоматически. Вам предстоит строить системы, в которых агенты:

  • придумывают новые задания и сценарии;
  • решают их и проверяют друг друга;
  • взаимодействуют через self-play и мультиагентные пайплайны;
  • находят ошибки и улучшают неудачные траектории;
  • выбирают наиболее ценные примеры для следующего цикла обучения. Отдельный вызов — сохранить разнообразие и качество синтетики, не позволив ошибкам и шаблонам накапливаться от поколения к поколению.

Эксперименты и оценка
Высокий результат на одном бенчмарке ещё не делает LLM хорошим агентом. Нам важно понимать, действительно ли она стала надёжнее в реальных сценариях. Мы оцениваем:

  • успешность в длинных многошаговых задачах;
  • устойчивость к ошибкам и неожиданным изменениям;
  • умение выбирать и сочетать инструменты;
  • обобщение на незнакомые условия;
  • зависимость результата от состава корпуса, размера LLM и вычислительного бюджета.

Вы пройдёте весь экспериментальный цикл: подготовите выборку, проведёте быстрые запуски на небольшом масштабе, разберёте результаты и перенесёте лучшие решения в претрейн крупных моделей.

  • Уверенно пишете на Python
  • Работали с ML, NLP, LLM или другими направлениями deep learning
  • Понимаете, как устроены и обучаются трансформеры
  • Умеете превращать идею в проверяемую гипотезу и корректный эксперимент
  • Не ограничиваетесь метриками, а ищете причины полученного результата
  • Способны довести исследовательский прототип до работающей системы
  • Следите за исследованиями и умеете оценивать, какие идеи стоит проверять на практике

Особенно пригодится опыт в одном или нескольких направлениях:

  • AI agents и tool use
  • претрейн или посттрейн LLM
  • synthetic data
  • reinforcement learning или imitation learning
  • SWE-, browser- или computer-use-агенты
  • интерактивные среды и симуляторы
  • автоматическая проверка решений
  • оценка агентских систем
  • распределённые ML-пайплайны

Необязательно подходить по всем пунктам. Нам важнее сильная база, исследовательское мышление и готовность разбираться в новых задачах.

Похожие вакансии

Другие вакансии Яндекс