Привет! Меня зовут Рома. Я отвечаю за офлайн-метрики Поиска в Яндексе. Наши ключевые сервисы — Поиск с Алисой, Картинки, Видео — оценивают полезность и обучают модели с учётом метрик, которые мы разрабатываем на основе LLM вместе с экспертами и редакторами. Присоединяйтесь к нам — вместе создадим Поиск будущего! :)
AI-агент не может ограничиться просто списком ссылок. Ему необходимо искать сведения для решения конкретной задачи, проверять источники и собирать информацию для ответа — порой в несколько шагов. Мы совершенствуем поиск, который помогает Алисе отвечать на вопросы в чате и Поиске, а также развиваем Yandex Search API для внешних AI-продуктов.
Вам предстоит работать в небольшой команде аналитиков-разработчиков над аналитическим направлением Агентского Поиска. Нужно будет определять систему оценки качества, выбирать приоритеты исследований и совместно с ML-командами внедрять подтверждённые улучшения в релиз.
Ваша работа будет проходить на стыке трёх направлений: анализа данных, поисковых технологий и языковых моделей. Задачи разнообразны — от разбора ошибок и работы с исследовательским кодом до оценки изменений в продукте вместе с ML-инженерами и разработчиками.
Развитие системы оценки качества
Вам предстоит создавать метрики качества Агентского Поиска — их рост приведёт к улучшению качества ответов Алисы. Нужно будет проверять метрики на экспертных бенчмарках и наладить регулярную оценку качества в продакшене.
Анализ потерь в обработке запросов
Вы будете разбирать сложные запросы и цепочки поисковых действий агента. Ваша задача — выяснить, почему нужная информация не попала в ответ: например, страница отсутствует в поисковой базе, документ потерян при ранжировании или ключевой факт не включён в контекст. На основе анализа нужно предлагать эксперименты и помогать другим командам определять приоритеты.
Исследование методов поиска и ранжирования
Вам нужно будет изучать новые способы отбора документов для AI-агентов, создавать прототипы, сравнивать разные варианты и вместе с командой доводить перспективные решения до релиза.
Баланс контекста
Вы будете оценивать фрагменты документов, которые получает языковая модель, и искать способ сохранить нужные факты, уменьшить объём текста и не исказить смысл.
Улучшение качества Yandex Search API
Вам предстоит сравнивать Yandex Search API с другими поисковыми API — использовать открытые бенчмарки и сценарии команды, чтобы результаты были воспроизводимыми. Нужно выяснять, почему качество отличается, формулировать на этой основе проверяемые гипотезы и оценивать, как можно улучшить внешние AI-продукты. При этом важно учитывать условия эксперимента: используемые модели, доступный контекст, количество поисковых вызовов и время ответа.
Больше об аналитике в Яндексе — в канале Yandex for Analytics