Мы занимаемся поисковыми сигналами — сложными элементами, которые устроены гораздо глубже стандартных продуктовых метрик. Их улучшение напрямую влияет на итоговое качество ранжирования.
Наша миссия — ускорить эволюцию Поиска: заменить рутинную ручную разметку автоматикой, внедрить LLM в процессы оценки и сделать релизы моделей быстрее без потери качества.
Сейчас команда находится на стыке аналитики и разработки, решая сложные методологические задачи. Мы не просто считаем метрики, а проектируем системы оценки, где каждый аспект должен быть статистически значим.
В ближайшее время нас ждёт переход от офлайн-экспериментов к полноценным онлайн-тестам, где нам предстоит выявлять тонкие проблемы ранжирования и находить пути их решения.
Методология замены ручной разметки автоматикой
Вам предстоит разрабатывать подходы к замещению труда разметчиков AI-агентами и LLM. Необходимо не просто внедрить автоматизацию, а доказать, что качество сигнала при этом не ухудшилось (или улучшилось). Это требует создания сложных бенчмарков и методик валидации.
Оценка качества LLM-as-a-judge
Мы активно используем большие языковые модели как «судью» для оценки релевантности. Ваша задача — придумать, как объективно измерить качество самой LLM в этой роли, выявить её системные ошибки (биасы) и калибровать её выводы для задач ранжирования.
Исследование влияния изменений на ранжирование
Работа с поисковыми сигналами требует понимания казуальности: как изменения в разметке или сигнале трансформируют финальное ранжирование. Вы будете проектировать дизайн экспериментов (офлайн и онлайн), строить срезы данных и находить скрытые проблемы, которые могут повлиять на пользовательский опыт.
Подготовка и проведение онлайн-экспериментов
Через несколько месяцев фокус сместится на запуск A/B-тестов в реальном поисковом трафике. Вам предстоит определять, в каких срезах и аспектах ранжирования возникают проблемы, и предлагать инженерные способы их починки на основе данных эксперимента.
Больше об аналитике в Яндексе — в канале Yandex for Analytics