Привет! Меня зовут Кирилл, я руковожу группой аналитики качества ответов в Поиске. Наша команда занимается разработкой и анализом сигнала, который помогает оценивать качество ответов Поиска, в том числе генеративных, привносить в него новые полезные свойства, задавать вектор его развития и непосредственно влиять на работу этого сервиса, которым ежедневно пользуются миллионы людей. У нас сильная, целеустремлённая и дружная команда. Будем рады новым коллегам — присоединяйтесь!
Поиск с Алисой — один из крупнейших технологических продуктов Яндекса, которым ежемесячно пользуются более 110 миллионов человек. В нашей команде создаются метрики, определяющие развитие всего Поиска: мы решаем исследовательские задачи, разрабатываем собственные подходы к анализу качества и активно используем современные ИИ-инструменты, включая LLM-агентов, чтобы быстрее находить инсайты и улучшать продукт.
Мы тратим значительные ресурсы на получение качественных размеченных данных — основы для всех наших ML-моделей. На это уходит очень много денег и очень много времени. Наша команда реализовывает смелый проект по оптимизации этих расходов, заменяет ручную разметку автоматической с помощью актуальных ML-моделей. Мы стремимся значительно сократить затраты на ручную разметку данных и оставить профессиональных асессоров только для сложных случаев, которые требуют особого внимания. Считаем, что за счёт этого нового вектора развития мы сможем добиться прорыва в сокращении денежных затрат, ускорении всех наших ML-процессов и в повышении итогового качества продукта!
Разработка критериев внедрения ML-разметки
Вы будете формулировать количественные и качественные критерии, по которым мы будем определять возможность перехода от ручной разметки к моделям в действующем проекте. В тех случаях, когда полностью отказаться от краудсорсинга не получится, нужно будет разрабатывать принципы и условия частичного перехода на модели.
Внедрение LLM-разметки в пайплайны для обучения продакшен-моделей
Вам предстоит не только анализировать ML-разметку качества ответов, но и внедрять эту разметку в процессы обучения продакшен-моделей Поиска и Алисы в Поиске — для улучшения качества итогового продукта.
Улучшение качества разметки ответов Поиска с помощью ML-разметки
Нужно будет искать точки роста в разметке и искать способы улучшить её, например за счёт более продвинутого использования внешней информации (RAG) или привлечения экспертов для разбора сложных случаев.
Больше об аналитике в Яндексе — в канале Yandex for Analytics