РНКО НОДА

Специалист по мониторингу ИТ-инфраструктуры

Не указана
  • Тбилиси
  • От 1 года до 3 лет
  • Windows Server
  • Linux
  • Zabbix
  • Grafana
  • Prometheus
  • Atlassian Jira
  • VMware vSphere / vCenter
  • Английский — B1 — Средний
О роли

Мы ищем Специалиста по мониторингу ИТ-инфраструктуры, который будет обеспечивать круглосуточный контроль доступности, производительности и стабильной работы ИТ-инфраструктуры и критически важных бизнес-сервисов компании в нерабочее время.

Основная задача роли — оперативно выявлять инциденты, проводить первичную техническую диагностику, выполнять стандартные действия по восстановлению сервисов в соответствии с утвержденными инструкциями и своевременно эскалировать сложные или критические инциденты профильным ИТ-командам.

Чем предстоит заниматься?

Мониторинг ИТ-инфраструктуры и выявление инцидентов:

  • Осуществлять непрерывный мониторинг ИТ-инфраструктуры, приложений и критически важных бизнес-сервисов с использованием централизованных систем мониторинга.

  • Контролировать доступность и производительность серверов, виртуальных машин, сетевого оборудования, баз данных, приложений, каналов связи и других ИТ-сервисов.

  • Отслеживать алерты, события, дашборды, уведомления и показатели состояния сервисов.

  • Выявлять деградацию сервисов, отказы, нестандартное поведение систем и инфраструктурные сбои.

  • Проверять поступающие уведомления системы мониторинга, отделять реальные инциденты от ложных срабатываний и информационных событий.

  • Выполнять базовую проверку доступности сервисов после получения уведомлений мониторинга.

Первичная диагностика и устранение типовых инцидентов:

  • Проводить первичный технический анализ обнаруженных инцидентов.

  • Самостоятельно устранять типовые и заранее определенные технические проблемы по утвержденным инструкциям, runbook'ам и стандартным операционным процедурам (SOP).

  • Выполнять разрешенные действия по восстановлению сервисов: перезапуск служб, проверку состояния сервисов, сетевой доступности, свободного места на дисках, выполнения плановых заданий и другие регламентированные операции.

  • Собирать диагностическую информацию: данные мониторинга, логи, временные метки, сообщения об ошибках, скриншоты и сведения о затронутых системах.

  • Проверять корректность восстановления сервиса после выполнения действий.

  • Документировать все выполненные действия в процессе расследования и устранения инцидента.

Эскалация инцидентов:

  • Эскалировать инциденты, которые невозможно устранить в рамках инструкций первой линии, профильным командам L2/L3.

  • При необходимости взаимодействовать с дежурными системными администраторами, сетевыми администраторами, администраторами баз данных, инженерами поддержки приложений и другими ответственными специалистами.

  • Немедленно эскалировать критические инциденты, влияющие на работу ключевых бизнес-сервисов.

  • Передавать командам сопровождения полную диагностическую информацию и перечень уже выполненных действий.

  • Контролировать статус эскалированных инцидентов до полного восстановления сервиса либо официальной передачи ответственности.

  • Соблюдать утвержденные процедуры классификации, приоритизации и эскалации инцидентов.

Работа с инцидентами и заявками (ITSM):

  • Создавать и сопровождать инциденты в системе управления ИТ-сервисами (ITSM / Service Desk).

  • Корректно классифицировать инциденты по сервису, категории, влиянию, срочности и приоритету.

  • Вести хронологию инцидентов и технические комментарии.

  • Обеспечивать регистрацию всех инцидентов, повлиявших на доступность сервисов.

  • Соблюдать требования SLA и регламенты эскалации.

  • Подготавливать информацию для передачи незавершенных инцидентов следующей смене.

Работа в сменном режиме:

  • Выполнять задачи по мониторингу ИТ-инфраструктуры в вечерние, ночные смены, выходные и праздничные дни согласно графику дежурств.

  • Проверять состояние критически важных систем в начале и в конце смены.

  • Поддерживать взаимодействие с дежурными техническими командами во время крупных инцидентов.

  • Выполнять плановые проверки инфраструктуры по утвержденным чек-листам.

  • Передавать следующей смене информацию об активных инцидентах, предупреждениях и выявленных рисках.

Зона ответственности и технологический стек

В рамках роли осуществляется мониторинг следующих компонентов инфраструктуры:

  • серверы Windows и Linux;

  • виртуальная инфраструктура VMware;

  • сетевое оборудование и каналы связи;

  • системы хранения данных (Storage);

  • базы данных;

  • инфраструктура Microsoft Active Directory;

  • сервисы Microsoft 365 / Exchange;

  • системы резервного копирования и репликации;

  • бизнес-приложения;

  • веб-сервисы и API;

  • интернет-каналы и внешние коммуникации;

  • инфраструктура центров обработки данных (Data Center);

  • облачные сервисы;

  • системы мониторинга безопасности и ИТ-инфраструктуры.

Наши ожидания
  • Базовое понимание принципов работы ИТ-инфраструктуры и процессов IT Operations.

  • Базовые знания операционных систем Windows и/или Linux.

  • Понимание сетевых технологий TCP/IP, включая IP-адресацию, DNS, маршрутизацию, сетевые порты и диагностику сетевой связности.

  • Навыки базовой диагностики с использованием утилит ping, tracert/traceroute, nslookup, Test-NetConnection и аналогичных инструментов.

  • Понимание основных компонентов ИТ-инфраструктуры: серверов, виртуализации, сетей, систем хранения данных, баз данных и прикладных сервисов.

  • Умение читать и анализировать алерты систем мониторинга, системные события и базовые журналы (logs).

  • Понимание принципов управления инцидентами и процесса эскалации.

  • Умение строго соблюдать технические инструкции, SOP, чек-листы и регламенты.

  • Способность самостоятельно работать в вечерние и ночные смены.

  • Хорошие навыки коммуникации и ведения технической документации.

  • Умение сохранять организованность и правильно расставлять приоритеты во время инцидентов и аварийных ситуаций.

Будет преимуществом

Опыт работы с одним или несколькими из следующих решений:

  • PRTG, Zabbix, Grafana, Prometheus или другими системами мониторинга.

  • VMware vSphere / vCenter.

  • Windows Server.

  • Linux.

  • Microsoft 365.

  • Active Directory.

  • Jira Service Management или другими ITSM-платформами.

  • Инструментами мониторинга и диагностики сетевой инфраструктуры.

  • Системами резервного копирования и восстановления данных (Backup Systems).

Мы предлагаем

  • Работу в финансовой, технологической компании с современными инструментами, технологиями и решения и возможности для роста и расширения профессионального опыта
  • Сотрудничество по ИП/ГПХ
  • Полная удаленка
  • Конкурентный и стабильный доход