Наша команда развивает Alice AI LLM — технологию, которая лежит в основе разных продуктов Яндекса. Мы фокусируемся на агентских способностях модели: задачах, где она должна пользоваться инструментами, писать, рассуждать и самостоятельно доводить работу до результата.
Одна из ключевых нерешённых проблем в этой области — long-horizon tasks: сложные многошаговые задачи, над которыми агент может автономно работать несколько часов, удерживая состояние и восстанавливаясь после ошибок. Мы считаем способность автономно решать многоэтапные задачи одним из ключевых шагов на пути к AGI.
Ищем техлида, который возглавит направление long-horizon-агентности и соберёт команду. На старте в команде будет 1–2 человека, а в перспективе — до пяти.
Оценка и бенчмарки
Вы будете развивать внешние и внутренние бенчмарки, в том числе Terminal и SkillsBench. Вам предстоит разработать стратегию и план, которые помогут развивать систему оценки long-horizon-возможностей моделей, а также сформулировать требования к эталонным решениям и автоматическим верификаторам.
Анализ работы агентов
Нужно будет анализировать результаты и траектории работы агентов, выявлять системные ограничения и возможности для роста. Вместе с командами разработки и обучения вы будете устранять основные классы ошибок и добиваться измеримого улучшения моделей.
Подготовка обучающих данных
Одна из ваших задач — проектировать пайплайны, которые генерируют, размечают и проверяют обучающие данные.
Управление командой
Вам предстоит нанимать и развивать сотрудников, выстраивать процессы и распределять зоны ответственности в команде.
Больше об аналитике в Яндексе — в канале Yandex for Analytics