Lead Product SRE в Скоринг [Big Data, МТС Веб Сервисы]

MWS·Russia·Удалённо, Офис·сегодня

Обязанности

Управлять сервисами и практиками надежности ИТ-продуктов: формировать бэклог, определять стратегию SRE для продуктов; Внедрять единую методологию управления надежностью (SLA/SLO/SLI) совместно со смежными Big Data продуктами, обеспечивая сквозную стабильность инфраструктуры и приложений кластера; Проектировать и развивать общие стандарты отказоустойчивости распределенных систем; Лидировать кросс-продуктовые рабочие группы по надежности: внедрять создание единых стандартов мониторинга, алертинга и распределенной трассировки для Big Data инфраструктуры; Управлять эффективностью использования ресурсов (Capacity Planning) высоконагруженных кластеров в масштабах всей экосистемы продуктов; Выстраивать общую культуру разбора инцидентов со смежными командами, превращая аварии на стыке систем в общие инженерные практики и системные улучшения; Менторить команды разработки и аналитики, помогая им проектировать сервисы с учетом нефункциональных требований и продуктовых SLO.

О проекте

Скоринг - это коммерческий B2B продукт для уменьшения рисков и затрат B2B-клиентов. Скоринг состоит из 2-х направлений: рисковый и антифрод.

Требования

Опыт работы в роли SRE / Infrastructure / Platform Lead или Technical Product Manager (Platform) от 3 лет в крупных высоконагруженных или Big Data проектах; Продуктовое мышление: умение собирать требования у внутренних клиентов (разработка, дата-инженеры), приоритизировать бэклог и оцифровывать надежность в бизнес-метрики; Практический опыт выстраивания общих технических стандартов и процессов в кросс-продуктовой среде; Отличное понимание специфики надежности Big Data решений и Highload-архитектуры: принципы работы аналитических БД (Hadoop, Clickhouse) распределенных брокеров (Apache Kafka), и микросервисов; Экспертные знания в области построения систем сквозного наблюдаемости (Observability: Prometheus, VictoriaMetrics, OpenTelemetry, Grafana) на стыке инфраструктуры и бизнес-метрик; Глубокое понимание архитектурных паттернов отказоустойчивости распределенных систем и жизненного цикла поставки ценности; Сильные коммуникативные навыки: умение договариваться, защищать продуктовые метрики перед стейкхолдерами и мягко внедрять инженерные изменения.

Условия

собственную платформу MTS Ocean для получения ИТ-ресурсов, а это значит, что деплой, мониторинг, observability — не будут для тебя проблемой, ты сможешь сосредоточиться на фичах; профессиональные гильдии инженеров, где мы поддерживаем друг друга и помогаем стать лучше; внутреннюю площадку TechTalks для обмена опытом, дискуссий, развития навыков самопрезентации; участие во внешних IT конференциях. Мы выступаем на HighLoad++, DataFest, Mobius, Test Driven Conf, Joker, DevOps, Матемаркетинг и даже проводим собственную конференцию по архитектуре True Tech Arch; полезные курсы и вебинары в корпоративном университете и электронную библиотеку. А еще: ДМС с первого месяца работы, включая стоматологию; страхование от несчастных случаев с 1 месяца работы. Материальную помощь в сложных жизненных ситуациях; отпуск 28 календарных дней; прием врачей общей практики и массаж в офисе; мобильная связь за счет компании и льготные тарифы для близких; подписка на онлайн-кинотеатр KION, сервис МТС Музыка, книжный сервис Строки от МТС, безлимитные мессенджеры и соцсети.

Похожие вакансии

Другие вакансии MWS