Наша команда разрабатывает и развивает бэкенды на основе LLM-моделей, интегрированных в продукты Яндекс Поиска с Алисой, а также широкий спектр инструментов для прототипирования и офлайн-процессов.
Одно из наших ключевых решений — платформа описания ML-пайплайнов RuntimeNodes. Она даёт возможность быстро создавать прототипы сложных приложений, связывать различные компоненты в единое приложение, обеспечивая скорость и удобство на разных стадиях цикла разработки проектов. Сейчас платформа используется в различных продуктах с LLM-моделями, например в Поиске и Алисе AI.
Вместе с нами вы сможете поработать над сложными и разнообразными задачами на стыке рантайма и ML.
Максимизация пропускной способности батч-контура
Одна из возможностей DSL, используемого в рантайме, — контроль сетевого уровня. Это позволяет гибко управлять циклом выполнения приложения. Так мы решаем сложную задачу совмещения сценария ответов в реальном времени (уменьшение задержек, внешнее обеспечение достаточности ресурсов) и батч-контура (максимизация пропускной способности без «переливания» любой из частей системы при околобесконечном спросе и конечной аллокации ресурсов).
Развитие платформы
Вы будете развивать DSL описания пайплайнов и сервиса их выполнения, анализировать потребности клиентов и продуктовые решения вместе с потребителями. Наша задача — иметь одновременно гибкую систему описания приложений и пренебрежимо малые накладные расходы, чтобы обеспечивать единую среду выполнения как для стадии прототипирования, так и для рантайма.
Совмещение этих подходов требует глубокого понимания сценариев использования и профиля потребления ресурсов. Нужно будет заботиться о низкоуровневых оптимизациях и объёме перекладываемых байт, а также о пайплайнах данных и объёме сетевого взаимодействия, о гибкости и выразительности средств с достаточно сильной системой ограничений, чтобы однажды написанная логика правильно работала в очень разных контекстах.
Инференс тяжёлых языковых генеративных моделей на GPU
Сердце LLM-продуктов — это непосредственное вычисление LLM-моделей. Вам предстоит решать задачи аллокации различных компонентов, настраивать их взаимодействие с LLM-моделями и релизные процессы, подбирать параметры для оптимизации.
Больше о бэкенде в Яндексе — в канале Yandex for Backend