Аналитик-разработчик в команду LLM-судей для Alice AI

Яндекс·Russia·Удалённо, Офис·сегодня

Наша команда развивает систему оценки Alice AI LLM — технологии, которая лежит в основе Алисы и других продуктов Яндекса. Нам важно понимать не только фактическую корректность ответов модели, но и то, насколько они полезны, естественны, уместно проявляют инициативу и учитывают контекст пользователя. Для оценки таких свойств мы создаём LLM-судей — модели, которые воспроизводят человеческие критерии качества.

Наши LLM-судьи уже используются для сбора обучающих данных и валидационных сравнений моделей. Сейчас мы строим единую систему их разработки и поддержки: следим за качеством существующих метрик, улучшаем их и добавляем новые аспекты оценки.

Почему у нас классно:

  • LLM-as-a-Judge — быстро развивающаяся область, в которой пока нет общепринятых решений и много пространства для собственных идей
  • Можно работать с самыми современными внутренними и внешними LLM, экспериментировать с разными схемами и ансамблями моделей
  • Вам предстоит читать свежие исследования, воспроизводить интересные подходы и проверять их на реальных задачах
  • Результаты работы напрямую влияют на развитие Alice AI: по нашим метрикам принимают эксперименты, а размеченные LLM-судьями данные используются для обучения моделей
  • Здесь сочетаются исследования, анализ данных и разработка инструментов для регулярного использования
  • Мы работаем не только с текстом: LLM-судьи также учитывают изображения и знания о пользователе

Создание и развитие LLM-судей
Вам предстоит проектировать схемы LLM-судей, экспериментировать с моделями и архитектурами, сравнивать подходы и проверять, насколько хорошо они воспроизводят человеческие критерии оценки.

Оценка и мониторинг качества
Вы будете проводить регулярные замеры на новых моделях и типах запросов, находить слабые места и систематические смещения, разбирать регрессии и проверять качество новых версий.

Развитие системы оценки
Вы начнёте добавлять новые аспекты и возможности оценки, превращать экспериментальные решения в воспроизводимые вычислительные графы для других команд.

Работа с исследованиями
Ждём, что вы будете следить за свежими статьями, разбираться в новых подходах к LLM-оценке и проверять их пользу на реальных задачах.

Больше об аналитике в Яндексе — в канале Yandex for Analytics

  • Уверенно владеете Python и SQL
  • Умеете анализировать данные и строить воспроизводимые процессы их обработки
  • Знаете теорию вероятностей и математическую статистику
  • Умеете проектировать метрики и интерпретировать результаты экспериментов
  • Понимаете, как устроены современные LLM, и уже экспериментировали с ними
  • Готовы разбираться в задачах, для которых нет готового решения
  • Самостоятельны и аккуратны в выводах
  • Разрабатывали LLM-судей или другие системы автоматической оценки моделей
  • Работали с метриками в NLP
  • Проектировали многошаговые LLM-пайплайны
  • Работали с агентными или мультимодальными системами
  • Свободно читаете технические статьи на английском

Похожие вакансии

Другие вакансии Яндекс