Привет! Наша команда разрабатывает модели голосовой биометрии Алисы. Мы ставим множество экспериментов над качеством идентификации пользователя и проводим онлайн-аналитику работы моделей на миллионах колонок. Голосовому помощнику это нужно, чтобы правильно рекомендовать пользователям музыкальный контент и давать уникальные ответы каждому члену семьи.
Сложная акустика и требование низкой задержки в embedded-сценарии ставят перед нами особые ML-вызовы. В последнее время наиболее актуальные для нас направления — это новые носимые устройства Яндекса и персонализация общения Алисы.
Ищем ML-разработчика, который работал в сфере DL и готов как проводить эксперименты по улучшению базового качества моделей, так и доводить их до продакшена. Более бесшовное взаимодействие с колонкой и его персонализация сделают Алису ещё умнее и полезнее.
Необходимо будет погрузиться в домен работы со звуком, проводить онлайн-аналитику своих выкаток в реальных пользовательских сценариях, генерировать идеи исследований. В нашей команде уже есть устойчивая инфраструктура и много вычислительных ресурсов для масштабных экспериментов. Вы сможете видеть результаты своей работы в продуктах, которыми уже пользуются миллионы людей.
Улучшение качества голосовой идентификации
Вы будете разрабатывать и улучшать модели голосовой биометрии, повышать их точность и скорость, а также запускать и автоматизировать обучение моделей. Нужно будет проводить эксперименты и интерпретировать результаты (офлайн-метрики, онлайн-тесты, A/B-эксперименты), управлять полным циклом данных (сбор из логов, очистка или дедупликация, таргетные аугментации).
Контроль качества и сценариев
Вам предстоит исследовать поведение моделей в ключевых пользовательских сценариях (семьи, дети и взрослые, шумные комнаты, far field), строить метрики и дашборды, формулировать продуктовые рекомендации.
Оптимизация моделей для работы на embedded-устройствах
Нужно будет готовить модели к релизу (TFLite или ONNX), применять квантизацию и другие методы ускорения, контролировать задержку и качество в продакшене.
Больше об ML в Яндексе — в канале Yandex for ML