Привет, я Данил, руковожу командой Alice AI VLM Agents. Мы превращаем мультимодальную модель в агента: она не просто отвечает по изображению, а действует — планирует шаги, вызывает инструменты, работает с внешними системами и решает визуальные задачи как в продовых, так и в непродовых средах. Там, где раньше нужен был человек, теперь должна справляться модель, предсказуемо и безошибочно пользуясь инструментами.
Это одна из самых интересных зон в современном ML: здесь нужно одновременно понимать, как устроены сильные VLM, как заставить модель планировать действия и безошибочно пользоваться инструментами, как выстроить агентские среды для обучения и оценки — и как превратить всё это в функции, которыми в продуктах Яндекса будут пользоваться миллионы людей.
У нас много настоящего ресёрча и быстрый цикл внедрения: хорошие идеи не остаются в презентациях, а доходят до реальной модели и пользовательских сценариев.
Учить модель вызывать инструменты (tool calling)
Мы хотим, чтобы модель умела не только отвечать по изображению, но и действовать: вызывать OCR, парсеры, браузер, поиск и внутренние API. Вы будете развивать сам навык надёжного tool use — чтобы модель выбирала подходящий под задачу инструмент, корректно передавала аргументы и разбирала результат, в том числе когда инструмент вернул ошибку или мусор.
Развивать агентское планирование и многошаговость
Одного вызова инструмента мало: агент должен декомпозировать задачу, планировать последовательность действий, удерживать контекст между шагами, восстанавливаться после ошибок и доводить сложные визуальные сценарии до результата. Вы будете учить VLM вести себя как агент, а не как одношаговый «вопрос-ответ», а также повышать устойчивость этого поведения на длинных траекториях.
Строить продовые и непродовые агентские среды
Вам предстоит проектировать окружения, в которых агент учится, оценивается и работает: песочницы, симуляторы и бенчмарки для обучения и офлайн-оценки — и реальные продуктовые сценарии Яндекса. Задача — сделать так, чтобы агент вёл себя надёжно и предсказуемо и в непродовых средах, и в продакшене под нагрузкой.
Больше об ML в Яндексе — в канале Yandex for ML