Лид аналитики в Агентский Поиск

Яндекс·Russia·Удалённо, Офис·4д. назад

Привет! Меня зовут Рома. Я отвечаю за офлайн-метрики Поиска в Яндексе. Наши ключевые сервисы — Поиск с Алисой, Картинки, Видео — оценивают полезность и обучают модели с учётом метрик, которые мы разрабатываем на основе LLM вместе с экспертами и редакторами. Присоединяйтесь к нам — вместе создадим Поиск будущего! :)

AI-агент не может ограничиться просто списком ссылок. Ему необходимо искать сведения для решения конкретной задачи, проверять источники и собирать информацию для ответа — порой в несколько шагов. Мы совершенствуем поиск, который помогает Алисе отвечать на вопросы в чате и Поиске, а также развиваем Yandex Search API для внешних AI-продуктов.

Вам предстоит работать в небольшой команде аналитиков-разработчиков над аналитическим направлением Агентского Поиска. Нужно будет определять систему оценки качества, выбирать приоритеты исследований и совместно с ML-командами внедрять подтверждённые улучшения в релиз.

Ваша работа будет проходить на стыке трёх направлений: анализа данных, поисковых технологий и языковых моделей. Задачи разнообразны — от разбора ошибок и работы с исследовательским кодом до оценки изменений в продукте вместе с ML-инженерами и разработчиками.

Развитие системы оценки качества
Вам предстоит создавать метрики качества Агентского Поиска — их рост приведёт к улучшению качества ответов Алисы. Нужно будет проверять метрики на экспертных бенчмарках и наладить регулярную оценку качества в продакшене.

Анализ потерь в обработке запросов
Вы будете разбирать сложные запросы и цепочки поисковых действий агента. Ваша задача — выяснить, почему нужная информация не попала в ответ: например, страница отсутствует в поисковой базе, документ потерян при ранжировании или ключевой факт не включён в контекст. На основе анализа нужно предлагать эксперименты и помогать другим командам определять приоритеты.

Исследование методов поиска и ранжирования
Вам нужно будет изучать новые способы отбора документов для AI-агентов, создавать прототипы, сравнивать разные варианты и вместе с командой доводить перспективные решения до релиза.

Баланс контекста
Вы будете оценивать фрагменты документов, которые получает языковая модель, и искать способ сохранить нужные факты, уменьшить объём текста и не исказить смысл.

Улучшение качества Yandex Search API
Вам предстоит сравнивать Yandex Search API с другими поисковыми API — использовать открытые бенчмарки и сценарии команды, чтобы результаты были воспроизводимыми. Нужно выяснять, почему качество отличается, формулировать на этой основе проверяемые гипотезы и оценивать, как можно улучшить внешние AI-продукты. При этом важно учитывать условия эксперимента: используемые модели, доступный контекст, количество поисковых вызовов и время ответа.

Больше об аналитике в Яндексе — в канале Yandex for Analytics

  • Самостоятельно выстраивали оценку качества ML-системы или продукта
  • Уверенно пишете на Python: можете самостоятельно собрать эксперимент, обработать результаты и сделать расчёты воспроизводимыми
  • Владеете SQL для получения и анализа данных
  • Знаете теорию вероятностей и математическую статистику
  • Умеете спланировать эксперимент, оценить неопределённость результата и интерпретировать результаты A/B-теста
  • Понимаете основы оценки ML-моделей: зачем разделять данные, как возникают утечки и почему улучшение на тестовой выборке может не повториться в продукте
  • Умеете разбираться в задаче без готовой постановки: выделить проблему, сформулировать проверяемую гипотезу, выбрать метрики и реализовать проверку
  • Можете объяснить команде выводы и ограничения исследования, предложить следующий шаг и довести работу до решения, даже если первая гипотеза не подтвердилась
  • Работали с информационным поиском, ранжированием, семантическим поиском или RAG-системами, которые формируют ответ на основе найденных источников
  • Создавали бенчмарки и разметку, анализировали действия AI-агентов или использовали языковые модели для оценки качества с проверкой по человеческим оценкам
  • Работали с большими данными и превращали исследовательские прототипы в инструменты, которыми регулярно пользуется команда
  • Знакомы с агентными бенчмарками, например BrowseComp или NEEDLE, либо с оценкой полноты и достоверности контекста

Похожие вакансии

Другие вакансии Яндекс