Строим on-premise Data Platform (Data Lakehouse) на Kubernetes.
Ищем инженера с full end-to-end ownership надёжности: от мониторинга и бэкапов до безопасности и CI/CD.
Задачи на испытательный срок:
-
Настроить и запустить CI/CD.
-
Поставить систему на полноценный мониторинг и алертинг.
Чем предстоит заниматься:
-
Развитие Grafana/Prometheus, устранение слепых зон, настройка алертинга и дашбордов.
-
Регулярное тестирование восстановления бэкапов, контроль capacity (диски, ресурсы), участие в DR-учениях.
-
Ротация секретов и сертификатов, RBAC, взаимодействие с ИБ.
-
Поддержка container registry, регламентные обновления, ведение runbook'ов и регламентов.
-
Daily ops, диагностика и устранение сбоев, эскалация вендорам, настройка on-call процесса по SLA.
Требования:
-
От 2 лет эксплуатации production на Kubernetes.
-
Высшее образование (бакалавриат).
-
Уверенное владение Linux (сеть, диски, systemd, troubleshooting).
-
Prometheus/Grafana, опыт работы с CI/CD, registry и управлением образами.
- Практический опыт настройки и реального тестирования восстановления бэкапов.
-
Секреты, сертификаты, RBAC, Git, Bash/Python.
-
Свободный русский.
Будет плюсом:
-
Эксплуатационное знакомство с Data-стеком (Lakehouse, Spark, Airflow).
-
Опыт работы с On-Premise / Bare-Metal.
-
SRE-практики (SLO/SLA, runbooks, postmortem, on-call).
-
Узбекский (опционально).