Обязанности:
- Установка, настройка и поддержка GPU-серверов и Kubernetes-кластеров под AI-нагрузки.
- Деплой и сопровождение сервисов инференса моделей (API-шлюзы, балансировка, TLS).
- Мониторинг доступности и производительности; реагирование на инциденты 24/7.
- Управление ресурсами: квоты, шедулинг GPU, планирование мощностей.
- Обновление драйверов, CUDA, ОС и компонентов кластера без простоя сервисов.
- Настройка и контроль резервного копирования, план DR.
- Документирование конфигураций, runbook'и для типовых инцидентов.
- Взаимодействие с ML-командой: помощь с окружениями, доступами, диагностикой проблем производительности.
Требования:
- Операционные системы и виртуализация
- Уверенное администрирование Linux (Ubuntu/Debian, RHEL/Rocky): systemd, сети, планирование ресурсов, диагностика производительности (perf, htop, iostat, dmesg).
- Опыт работы с виртуализацией и контейнеризацией: Docker, containerd, желательно KVM/Proxmox/VMware. Kubernetes и оркестрация
- Практический опыт эксплуатации Kubernetes в production: деплой, отладка, RBAC, NetworkPolicy, Ingress/Gateway API.
- Понимание апстрим-сетевого стека: CNI (Calico/Cilium), LB, e — опыт с Envoy Gateway/NGINX Ingress как плюс. Helm, Kustomize; GitOps-подходы (ArgoCD/Flux) — желательно.
- GPU-инфраструктура (ключевой блок)
- Опыт администрирования серверов с NVIDIA GPU: установка драйверов, CUDA toolkit, NVIDIA Container Toolkit, диагностика (nvidia-smi, dcgm).
- Понимание механизмов распределения GPU в Kubernetes: device plugin, MIG, time-slicing, GPU Operator.
- Знание особенностей GPU-нагрузок: память VRAM, NVLink, RDMA/InfiniBand (для multi-node обучения) — как плюс.
- Сети и хранение
- Основы сетей: TCP/IP, DNS, TLS, балансировка, firewall.
- Опыт с системами хранения: NFS, Ceph/Longhorn/local-path, S3-совместимые хранилища (MinIO).
- Понимание требований ML-нагрузок к дискам и сети (пропускная способность при загрузке моделей и датасетов).
- Автоматизация и IaC
- Скриптинг: Bash, Python на уровне автоматизации рутинных задач.
Infrastructure as Code: Ansible и/или Terraform. - Опыт работы с Git.
- Мониторинг и надёжность
- Стек наблюдаемости: Prometheus + Grafana (включая GPU-метрики DCGM Exporter), логирование (Loki/ELK), алертинг (Alertmanager).
- Понимание SLO/SLA, практика работы с инцидентами, резервное копирование и восстановление.
- Информационная безопасность
- Базовый харденинг ОС, управление доступом (SSH-ключи, sudo, LDAP/SSO), secrets management (Vault, Sealed Secrets и аналоги).
- Обновление ПО и управление уязвимостями.
Став частью команды Forte, ты получишь:
- Конкурентную заработную плату и бонусы за персональную эффективность;
- График работы 5/2 с 9:00-18:00 в комфортном офисе;
- Жизнь внутри компании с ее корпоративными мероприятиями: тимбилдинги, челленджи, спортивные турниры, благотворительные акции;
- Заботу о здоровье с медицинским страхованием, а также DayOff в честь дня рождения и за выслугу лет;
- Выгодную рассрочку в крупные фитнес-клубы;
- Доступ к корпоративной библиотеке для непрерывного обучения и саморазвития.