Привет! Меня зовут Екатерина Редина, я руковожу командой исследования знаний. Наша команда обучает с нуля базовые модели Alice AI LLM. На них строятся Алиса и другие продукты Яндекса, которыми пользуются миллионы людей.
Мы работаем с претрейном — первым и самым масштабным этапом обучения LLM. Именно здесь формируется фундамент будущей модели: её знания, способность понимать язык, рассуждать, писать код и осваивать новые задачи.
Мы отвечаем за полный цикл создания претрейн-моделей: от формирования обучающего корпуса и проверки исследовательских гипотез до масштабных запусков на GPU-кластерах и анализа модели.
Вы будете создавать LLM с нуля, а не только использовать или дообучать готовые модели. Сможете влиять на фундаментальные знания и способности модели. Результаты вашей работы станут основой следующего поколения Alice AI LLM и всех продуктов Яндекса, построенных поверх неё. Вы получите редкий опыт на стыке исследований, обучения моделей и систем обработки больших данных — опыт, который сегодня определяет, кто задаёт направление развития LLM, а кто их только настраивает.
Если вам интересно понимать, почему модель приобретает новые способности и как сделать её сильнее с помощью данных и методов обучения, — будем рады познакомиться.
Исследование данных для претрейна
Современные LLM обучаются на триллионах токенов, но объём корпуса сам по себе не гарантирует качество. Важно понять, какие данные действительно развивают способности модели.
Вы будете исследовать:
Обучение моделей с нуля
Вы пройдёте полный цикл создания новой LLM:
Предстоит работать не только с финальными метриками, но и с динамикой обучения: исследовать, как разные способности возникают и развиваются по мере претрейна.
Scaling laws и раннее прогнозирование качества
Обучение большой модели требует значительных вычислительных ресурсов, поэтому особенно важно заранее понимать, какие решения стоит масштабировать.
Вы будете:
Работа с данными большого масштаба
Исследовательские идеи необходимо превращать в надёжные процессы, способные работать на web-scale.
Вам предстоит развивать обработку веб-корпусов, фильтрацию и ранжирование документов, дедупликацию, балансировку языков и доменов, автоматическое обновление датасетов, распределённые пайплайны обработки данных.
Роль сочетает research и engineering: нужно уметь как придумать и проверить гипотезу, так и довести успешный метод до масштаба реального претрейна.
Больше об ML в Яндексе — в канале Yandex for ML
Необязательно соответствовать всем пунктам: сильного опыта в нескольких из них уже достаточно.