ForteBank

Middle-Senior DevOps Engineer

Не указана
  • Астана
  • От 3 до 6 лет

Обязанности:

  • Установка, настройка и поддержка GPU-серверов и Kubernetes-кластеров под AI-нагрузки.
  • Деплой и сопровождение сервисов инференса моделей (API-шлюзы, балансировка, TLS).
  • Мониторинг доступности и производительности; реагирование на инциденты 24/7.
  • Управление ресурсами: квоты, шедулинг GPU, планирование мощностей.
  • Обновление драйверов, CUDA, ОС и компонентов кластера без простоя сервисов.
  • Настройка и контроль резервного копирования, план DR.
  • Документирование конфигураций, runbook'и для типовых инцидентов.
  • Взаимодействие с ML-командой: помощь с окружениями, доступами, диагностикой проблем производительности.

Требования:

  • Операционные системы и виртуализация
  • Уверенное администрирование Linux (Ubuntu/Debian, RHEL/Rocky): systemd, сети, планирование ресурсов, диагностика производительности (perf, htop, iostat, dmesg).
  • Опыт работы с виртуализацией и контейнеризацией: Docker, containerd, желательно KVM/Proxmox/VMware. Kubernetes и оркестрация
  • Практический опыт эксплуатации Kubernetes в production: деплой, отладка, RBAC, NetworkPolicy, Ingress/Gateway API.
  • Понимание апстрим-сетевого стека: CNI (Calico/Cilium), LB, e — опыт с Envoy Gateway/NGINX Ingress как плюс. Helm, Kustomize; GitOps-подходы (ArgoCD/Flux) — желательно.
  • GPU-инфраструктура (ключевой блок)
  • Опыт администрирования серверов с NVIDIA GPU: установка драйверов, CUDA toolkit, NVIDIA Container Toolkit, диагностика (nvidia-smi, dcgm).
  • Понимание механизмов распределения GPU в Kubernetes: device plugin, MIG, time-slicing, GPU Operator.
  • Знание особенностей GPU-нагрузок: память VRAM, NVLink, RDMA/InfiniBand (для multi-node обучения) — как плюс.
  • Сети и хранение
  • Основы сетей: TCP/IP, DNS, TLS, балансировка, firewall.
  • Опыт с системами хранения: NFS, Ceph/Longhorn/local-path, S3-совместимые хранилища (MinIO).
  • Понимание требований ML-нагрузок к дискам и сети (пропускная способность при загрузке моделей и датасетов).
  • Автоматизация и IaC
  • Скриптинг: Bash, Python на уровне автоматизации рутинных задач.
    Infrastructure as Code: Ansible и/или Terraform.
  • Опыт работы с Git.
  • Мониторинг и надёжность
  • Стек наблюдаемости: Prometheus + Grafana (включая GPU-метрики DCGM Exporter), логирование (Loki/ELK), алертинг (Alertmanager).
  • Понимание SLO/SLA, практика работы с инцидентами, резервное копирование и восстановление.
  • Информационная безопасность
  • Базовый харденинг ОС, управление доступом (SSH-ключи, sudo, LDAP/SSO), secrets management (Vault, Sealed Secrets и аналоги).
  • Обновление ПО и управление уязвимостями.

Став частью команды Forte, ты получишь:

  • Конкурентную заработную плату и бонусы за персональную эффективность;
  • График работы 5/2 с 9:00-18:00 в комфортном офисе;
  • Жизнь внутри компании с ее корпоративными мероприятиями: тимбилдинги, челленджи, спортивные турниры, благотворительные акции;
  • Заботу о здоровье с медицинским страхованием, а также DayOff в честь дня рождения и за выслугу лет;
  • Выгодную рассрочку в крупные фитнес-клубы;
  • Доступ к корпоративной библиотеке для непрерывного обучения и саморазвития.