Алиса помогает миллионам людей решать повседневные задачи. В команде Алисы AI мы строим Мою Память — единое место для того, что важно пользователю: заметок, дел, списков, планов и файлов. Но наша цель — не просто сделать ещё один заметочник. Мы создаём контекстный слой Алисы: пользователь сможет без лишних усилий сохранить важное, найти это обычными словами и получить нужный контекст в подходящий момент — в чате, с помощью колонки или на другом устройстве с Алисой.
Например:
«Запомни код домофона»
«Добавь молоко в список покупок»
«Что педиатр написал про витамин D?»
«Напомни записаться к врачу через две недели»
В основе сценария — LLM, которая понимает намерение пользователя, вызывает нужные инструменты для создания, поиска и изменения записей и формирует итоговый ответ. Здесь особенно важны точность и надёжность: Алиса не должна забывать сохранить обещанное, менять не ту запись или уверенно говорить о действии, которого не произошло.
Ищем ML-аналитика, который поможет нам измерять и системно улучшать качество Моей Памяти — от первого решения модели до результата, который увидит пользователь.
Создание системы оценки качества AI-продукта
Вы будете формировать целостную картину качества сценария: определять ключевые метрики и раскладывать их по этапам — роутинг, поиск контекста, вызов инструментов, итоговый ответ и доставка результата. Нужно будет связывать офлайн-оценку моделей с поведением продукта в реальном потоке, проектировать мониторинги и дашборды, которые помогают вовремя замечать деградации. Предстоит находить срезы, в которых общая метрика скрывает проблемы: разные устройства, интенты, типы записей и сложность диалога.
Приёмка новых моделей и изменений
Вместе с ML-разработчиками, продуктом и редакторами вы будете отвечать на практический вопрос: можно ли выпускать новую модель пользователям? Для этого предстоит: собирать репрезентативные eval-наборы и приёмочные корзинки, сравнивать версии моделей и разбирать регрессии, развивать LLM-as-a-judge и проверять его согласованность с человеческой оценкой. Нужно будет определять критерии готовности к эксперименту и запуску, проводить постанализ после выкладки и проверять, подтвердился ли ожидаемый эффект.
Разбор ошибок модели и поиск точек роста
Вам предстоит много работать с живыми пользовательскими сценариями и текстовыми логами. Ваши задачи — искать срабатывания false positive и false negative; разбирать DSAT и проблемные диалоги; кластеризовать ошибки и отделять проблемы намерения, retrieval, tool calling и генерации ответа. Нужно будет выявлять повторяющиеся паттерны через data mining и эвристики, превращать наблюдения в проверяемые продуктовые и ML-гипотезы, оценивать масштаб проблемы и ожидаемый эффект исправления.
Подготовка данных для улучшения моделей и проверка изменений онлайн
Вы будете участвовать во всём цикле улучшения качества: формировать выборки для обучения, валидации и независимой приёмки; следить за покрытием сценариев и смещениями в данных; помогать определять разметку и таксономию ошибок. Нужно будет оценивать качество датасетов и автоматической разметки, делать воспроизводимые исследования, которыми сможет пользоваться вся команда.
После офлайн-приёмки предстоит оценивать работу продукта на реальных пользователях: проектировать и анализировать A/B-эксперименты, интерпретировать изменения продуктовых и качественных метрик, отделять эффект модели от изменений состава трафика, находить новые проблемы и удачные сценарии, которые проявляются только в живом потоке.