ML-инженер в команду данных синтеза речи

Яндекс·Russia·Удалённо, Офис·5д. назад

Мы строим основу для следующего поколения технологий синтеза речи Яндекса. Здесь петабайты аудио становятся голосом Алисы, переводом видео и аудиокнигами, которыми пользуются миллионы людей. Ищем инженера, который поможет нам создать масштабную платформу данных для обучения речевых моделей и напрямую повлияет на их качество.

Команда синтеза речи делает такие продукты Яндекса, как перевод видео, аудиокниги, голос Алисы. В синтезе наступила эпоха перехода от low resource (даже для основных языков) к большим данным и претрейнам. Новые модели позволяют спеть известные песни вашим голосом и произнести любую фразу всего по нескольким секундам вашего голоса. Основа этих моделей — сотни тысяч часов качественных аудиоданных и текстов для них, которые нам предстоит собрать.

Работа с данными
Вам предстоит разрабатывать систему хранения действительно больших данных и доступа к ним для ML-разработчиков. В вашем распоряжении будут петабайты аудио, которые необходимо эффективно хранить и быстро обрабатывать.

Майнинг данных
Вы будете улучшать пропускную способность текущих пайплайнов сбора данных и масштабировать их для поддержки множества языков, работать с разнородными источниками и строить процессы майнинга аудиоданных.

Оценивание качества данных
Вам предстоит работать с процессами оценивания параметров данных, разрабатывать и применять ML-модели детекции шума, музыки, языка, нескольких голосов, синтетической речи, несовпадения текста и аудио. Эти оценки позволят отфильтровать данные и сделать наш синтез лучшим в мире.

Больше об ML в Яндексе — в канале Yandex for ML

  • Пишете на Python
  • Строили пайплайны сбора данных для ML
  • Понимаете, как работать с большими объёмами данных
  • Применяли на практике, а лучше — обучали ML-модели
  • Мотивированны и готовы глубоко погружаться в область

Похожие вакансии

Другие вакансии Яндекс