Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLM) моделей. Эти модели используют в Алисе, Поиске, Рекламе и других сервисах Яндекса. Для обучения таких моделей нужны десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать систему максимально эффективной: рационально использовать вычислительные ресурсы и снизить риски сбоев.
Чем сложнее система, тем больше точек отказа. Чем больше ресурсов требуется для обучения, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры. Мы должны разбираться и в особенностях аппаратного обеспечения (GPU, сети, шины данных, диски, память), и в нюансах процесса обучения — например, понимать составные части, взаимодействие компонентов и узкие места.
Один из популярных подходов к обучению LLM — обучение с подкреплением (Reinforcement Learning, RL). Метод становится всё более востребованным, вместе с этим усложняются подходы, растёт потребность в вычислительных ресурсах — появляется необходимость строить специализированную инфраструктуру.
Оптимизация инфраструктуры RL-обучения
Вы будете улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, а также коммуникации между блоками обучения; повышать эффективность работы внутри блоков.
Развитие инструментов диагностики
Вы будете создавать и улучшать инструменты, чтобы быстро находить и решать инфраструктурные проблемы.
Обеспечение отказоустойчивости инфраструктуры
Вы будете реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к разным ошибкам и сбоям.
Исследование решений
Вы будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать, насколько они эффективны, и внедрять их в реальные проекты.
Больше об ML в Яндексе — в канале Yandex for ML