ML-разработчик в команду голосовой биометрии Алисы

Яндекс·Russia·Удалённо, Офис·1 нед. назад

Привет! Наша команда разрабатывает модели голосовой биометрии Алисы. Мы ставим множество экспериментов над качеством идентификации пользователя и проводим онлайн-аналитику работы моделей на миллионах колонок. Голосовому помощнику это нужно, чтобы правильно рекомендовать пользователям музыкальный контент и давать уникальные ответы каждому члену семьи.

Сложная акустика и требование низкой задержки в embedded-сценарии ставят перед нами особые ML-вызовы. В последнее время наиболее актуальные для нас направления — это новые носимые устройства Яндекса и персонализация общения Алисы.

Ищем ML-разработчика, который работал в сфере DL и готов как проводить эксперименты по улучшению базового качества моделей, так и доводить их до продакшена. Более бесшовное взаимодействие с колонкой и его персонализация сделают Алису ещё умнее и полезнее.

Необходимо будет погрузиться в домен работы со звуком, проводить онлайн-аналитику своих выкаток в реальных пользовательских сценариях, генерировать идеи исследований. В нашей команде уже есть устойчивая инфраструктура и много вычислительных ресурсов для масштабных экспериментов. Вы сможете видеть результаты своей работы в продуктах, которыми уже пользуются миллионы людей.

Улучшение качества голосовой идентификации
Вы будете разрабатывать и улучшать модели голосовой биометрии, повышать их точность и скорость, а также запускать и автоматизировать обучение моделей. Нужно будет проводить эксперименты и интерпретировать результаты (офлайн-метрики, онлайн-тесты, A/B-эксперименты), управлять полным циклом данных (сбор из логов, очистка или дедупликация, таргетные аугментации).

Контроль качества и сценариев
Вам предстоит исследовать поведение моделей в ключевых пользовательских сценариях (семьи, дети и взрослые, шумные комнаты, far field), строить метрики и дашборды, формулировать продуктовые рекомендации.

Оптимизация моделей для работы на embedded-устройствах
Нужно будет готовить модели к релизу (TFLite или ONNX), применять квантизацию и другие методы ускорения, контролировать задержку и качество в продакшене.

Больше об ML в Яндексе — в канале Yandex for ML

  • Обучали нейросетевые модели и внедряли DL-решения в продакшен
  • Уверенно ориентируетесь в DL и быстро разбираетесь в новых методах
  • Умеете программировать на Python, работали с PyTorch
  • Хорошо знаете классические структуры данных и алгоритмы
  • Умеете выдвигать гипотезы, строить эксперименты и делать корректные выводы
  • Читаете статьи про ML, следите за развитием этой области
  • Работали с задачами из смежных областей: CV, NLP, Speech (ASR, TTS, VAD)
  • Имеете опыт работы с моделями для аудио
  • Оптимизировали инференс на устройствах (C++, квантизация, дистилляция)
  • Работали с большими датасетами и строили пайплайны подготовки данных
  • Участвовали в ML-соревнованиях или опенсорс-проектах

Похожие вакансии

Другие вакансии Яндекс