Мы поддерживаем высоконагруженную банковскую систему класса критичности Mission Critical+ (МС+). Это максимальный класс: система работает круглосуточно, и любой сбой сразу замечают клиенты банка.
Третья линия — последний рубеж перед разработкой. К нам приходят инциденты, которые не решились ранее, а от нас уходят задачи, после которых эти инциденты не повторяются. Мы ищем инженера, которому мало просто потушить пожар: важно понять, почему он начался, и сделать так, чтобы он не случился снова.
Обязанности
- Разбирать инциденты, эскалированные от бизнес пользователей, системы мониторинга и дежурной смены: не только сбои, но и деградацию производительности под нагрузкой. Находить причину по логам, метрикам, трассировкам и данным в БД.
- Вести управление критичными инцидентами (процесс управления инцидентами): собирать нужных людей, координировать работу, держать бизнес и смежные команды в курсе статуса (коммуникационный план). Для системы МС+ счёт идёт на минуты.
- Готовить справки по итогам инцидентов: хронология, влияние на клиентов и бизнес, первопричина, что уже сделано и что нужно сделать, чтобы инцидент не повторился.
- Находить дефекты в продуктиве и подтверждать их: шаги воспроизведения, логи, запросы, ожидаемое и фактическое поведение.
- Ставить задачи на исправление в разработку так, чтобы разработчику не пришлось ничего переспрашивать, и вести их до выката исправления.
- Искать закономерности и повторяющиеся причины в прошедших инцидентах.
- Предлагать и доводить до конца меры, которые снижают число инцидентов: исправления, изменения в процессах, автоматизацию.
- Описывать новые метрики и алерты, если инцидент показал, что мониторинг не заметил проблему или заметил её поздно.
- Разбирать метрики, которые срабатывают неверно (ложные срабатывания, пропуски, неверные пороги), и добиваться их исправления.
Требования
- Опыт от 3 лет во второй или третьей линии поддержки, в эксплуатации или SRE.
- Опыт поддержки высоконагруженных систем, работающих круглосуточно.
- Уверенные знания Linux: логи, процессы, сеть, базовый bash.
- SQL на уровне, достаточном, чтобы самостоятельно найти и проверить данные в продуктивной БД.
- Опыт работы с системами логирования и мониторинга: ELK / OpenSearch, Grafana, Prometheus, Zabbix
- Понимание устройства распределённых систем: микросервисы, HTTP/REST, очереди Kafka / RabbitMQ, интеграции.
- Знание процессов управления инцидентами и проблемами (ITIL или аналог).
- Аккуратность в работе с продуктивными данными в рамках требований информационной безопасности.
- Умение ясно писать: справка по инциденту и задача в разработку — ваш основной рабочий результат.
- Спокойствие и собранность во время критичного инцидента.
Будет плюсом
- Опыт работы в банке или финтехе, понимание банковских процессов: платежи, карты, расчёты.
- Опыт ведения крупных инцидентов и проведения разборов в формате blameless postmortem.
- Kubernetes, Docker.
- Умение читать код Java / Python настолько, чтобы найти место дефекта. Писать продуктовый код не требуется.
- Трассировка и APM: OpenTelemetry, Jaeger и аналоги.
- Понимание SLI/SLO и практик SRE.
- Скрипты автоматизации на Python или bash.
- Сертификат ITIL 3/4 Foundation.
Условия
- Комфортный современный офис (ст.м.Кутузовская)
- ежегодный пересмотр зарплаты, годовая премия
- корпоративный спортзал и зоны отдыха
- более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
- программа адаптации и помощь руководителя на старте
- расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
- гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
- бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
- вознаграждение за рекомендацию друзей в команду Сбера.