Нирвана — облачная платформа для выполнения произвольных вычислений и процессов. Платформой активно пользуются аналитики, разработчики, ML-инженеры и другие сотрудники.
Важной частью платформы является Реактор — система автоматизированного запуска процессов по расписанию либо по внешним событиям, которая даёт возможность превратить ad-hoc-запуски в надёжные регулярные процессы.
Перезапуск процессов по событиям в прошлом
Регулярные процессы не всегда работают успешно, иногда они могут ломаться и завершаться с ошибками или производить некорректные данные. Мониторинг позволяет найти проблему, но не помогает её исправить. Мы собираемся дать инструменты для исправления ошибок в данных и конфигурациях, а также для массового перезапуска пострадавших процессов.
Горизонтальное масштабирование процессора очередей
Процессор очередей является узким местом, стоящим на критическом пути жизненного цикла запусков процессов. Текущая реализация процессора — это единый мастер, пропускающий через себя весь поток появляющихся запусков процессов. Такой подход имеет потолок пропускной способности, и чтобы выдерживать дальнейший рост нагрузки, мы хотим пересмотреть архитектуру процессора очередей и найти вариант, который можно будет горизонтально масштабировать без потери корректности приоритизации ожидающих запусков.
Экспорт событий для аналитики
Аналитические задачи, связанные со статистикой запусков процессов, часто возникают и у нашей команды, и у наших пользователей. Чтобы упростить аналитику, мы хотим начать экспортировать во внешнюю систему (YTsaurus) записи о появлении событий, запуске процессов, создании и редактировании других сущностей в системе. Здесь важно, во-первых, обеспечить надёжность поставки данных и их согласованность (при том, что разные сущности системы имеют разный жизненный цикл), а во-вторых, изолировать экспорт данных от основного процессинга, чтобы не снижать его надёжность и доступность.
Больше о бэкенде в Яндексе — в канале Yandex for Backend
Подписывайтесь на телеграм-канал Yandex Infrastructure, чтобы узнать больше о том, как мы делаем внутреннюю инфраструктуру Яндекса.