Привет! Я Толя, руководитель бригады сбора корзин Нейро. Я в Яндексе с 2023 года и с тех пор работаю над развитием больших языковых и визуальных моделей (LLM и VLM) в разных проектах компании.
Наша служба занимается качеством ответов моделей, работающих под капотом Алисы и Поиска. Мы ищем талантливых аналитиков-разработчиков, которые помогут нам растить качество ответов наших технологий и тем самым улучшать пользовательский опыт общения с Алисой и работы с Поиском.
Мы работаем над LLM- и VLM-агентами — системой построения ответов в Алисе и в Поиске, умеющей обращаться в разные сервисы Яндекса для составления ответа с опорой на источники.
Одна из важных задач нашей службы — научить агентов решать сложные пользовательские сценарии и отвечать на трудные запросы, которые требуют применения многих навыков, таких как общий интеллект, достоверность, умение несколько раз обращаться к Поиску (в том числе последовательно), делать вычисления и так далее.
Важным шагом при решении этой задачи становится сбор качественных датасетов, на которых будет проводиться обучение агентов. В частности, ключевое значение имеют датасеты запросов пользователей. Речь идёт о примерах запросов, на которых происходит развитие технологий внутри Алисы и Поиска, проверка качества получаемых ответов и исследование того, в каком направлении продукт должен развиваться в будущем. Существенно, чтобы с одной стороны датасеты запросов имели хорошую полноту покрытия реальных пользовательских сценариев, а с другой стороны — содержали в себе трудные для технологии примеры: именно это позволяет агентам последовательно улучшаться к каждому новому релизу.
Почему у нас классно:
Исследование пользовательских сценариев
Развитие агентов в Алисе и Поиске не может начаться без исследования типовых сценариев и задач, с которыми пользователи обращаются к этим продуктам, в том числе сценариев, при решении которых агенты дают ответы недостаточного качества. Вы будете проводить разбор, какие задачи волнуют пользователей, а выводы по итогам вашего анализа войдут в основу траектории развития агентов.
Сбор датасетов запросов
Для развития ключевых навыков агентов нужны примеры челенджевых запросов — таких, на которые трудно дать хороший ответ, не приложив усилия для изучения предметной области задачи, которую пользователь решает своим запросом. Вам предстоит проводить исследования, на каких запросах и пользовательских сценариях нужно продолжить развитие агентов, и воплотить результаты своих изысканий в реальных датасетах, которые пойдут в обучение моделей.
Работа с разнообразными источниками данных
Источников, из которых можно брать примеры запросов, в Яндексе и в открытом доступе существует много — они отличаются как по формату, так и по качеству данных внутри. Вам будет предложено погрузиться в специфику этих источников и придумать способы, как выделить из них самые интересные и полезные примеры для развития агентов.
Использование LLM и VLM для сбора датасетов запросов
При создании содержательных датасетов запросов часто нужно прибегать к нетривиальной характеризации пользовательских задач (насколько запрос сложный, требует ли он специальных навыков и т. д.), а иногда и вовсе создавать интересные запросы синтетически, то есть искусственно. Для решения этих задач вы будете активно работать с самыми передовыми LLM и VLM, составляя к ним промпты и даже системы промптов.
Больше об аналитике в Яндексе — в канале Yandex for Analytics