Команда Server Infrastructure занимается эксплуатацией быстро растущей инфраструктуры Yandex Cloud в рамках подразделения Cloud Foundation Services. Мы строим надёжную и масштабируемую инфраструктуру, поверх которой запускаются виртуальные машины пользователей и внутренние сервисы. В сервисах реализуем различные сценарии работы с железом: от процессов ввода, вывода, починки до бесшовного обновления ОС на всём кластере.
Наши сервисы работают с большим количеством облачных и общих яндексовых систем, собирают данные о хостах, метрики состояния железа и кластера в целом, чтобы планировать обслуживание серверов и распределять ресурсы. Мы предоставляем сервисы и инструменты, которые упрощают и автоматизируют внутренние процессы, делают инфраструктуру прозрачнее и стабильнее, снимают с инженеров рутинную работу.
Под нашим управлением уже более 20 тыс. серверов в трёх дата-центрах Яндекса, и их количество непрерывно растёт. Мы разрабатываем и постоянно совершенствуем способы мониторинга наших серверов и подходы к нему так, чтобы заранее и автоматически диагностировать неполадки и выполнять обслуживание, не дожидаясь выхода серверов из строя.
В работе мы используем:
Система эксплуатации инфраструктуры
Вам предстоит развивать систему, упрощающую эксплуатацию инфраструктуры Yandex Cloud, автоматизировать различные сценарии работы с серверами.
Система хранения железа
Вы будете проектировать и дорабатывать систему инвентаризации, позволяющую объединить как физическую, так и логическую информацию обо всём парке железа, упростить хранение и использование информации об инфраструктуре.
Мониторинг и сборы метрик
Нужно будет разрабатывать сервисы-агенты для мониторинга, сбора метрик и выполнения проверок на хостах.
Работа с инструментами
Вы будете поддерживать инструменты, которые помогают планировать и распределять ресурсы внутри облака.
Больше о бэкенде в Яндексе — в канале Yandex for Backend