На этой позиции тебе предстоит:
- Отвечать за production
- Проектировать, разрабатывать, внедрять и поддерживать SLO/SLI, метрики, алерты, ранбуки и дашборды для продукта
- Повышать наблюдаемость и надежность продукта
- Участвовать в устранении аварий и последующей стабилизации продукта
- Участвовать в заполнении и разборе постмортемов
- Разрабатывать и выполнять меры, направленные на предотвращение повторных инцидентов
- Автоматизировать рутинную работу
- Разрабатывать DRP
- Участвовать в разработке процессов, используемых в работе
Что мы ждем от кандидата:
-
Свободно и на экспертном уровне работаете с Linux-системами и занимались их промышленной эксплуатацией
-
Понимаете, что такое load balancing, circuit breakers, disaster recovery и т.п.
-
Понимаете, что такое SLO и SLI и умеете применять их на практике
-
Имеете опыт работы с Grafana, Prometheus, k8s
-
Понимаете принципы IaC-подхода к описанию инфраструктуры; понимаете, как работают сети и умеете диагностировать и решать проблемы в их работе
Дополнительно
пишете на Go / Python / bash и т.п. в объеме, достаточном для автоматизации повседневной работы; имеете практический опыт работы SRE; знаете, как сделать отказоустойчивый масштабируемый сервис; умеете работать с системами управления