USETECH

Data Engineer / ML Engineer (Контроль качества данных)

Не указана
  • Москва
  • От 3 до 6 лет
  • Python
  • Apache Airflow
  • SQL

Юзтех – группа аккредитованных ИТ-компаний полного цикла разработки с многолетней экспертизой в передовых технологиях: DWH, BigData, AI/ML, Blockchain, BI, предиктивная аналитика, цифровые двойники производства и рисков.

ГК Юзтех является технологическим партнером таких компаний, как Mail.ru, 2Gis, НЛМК, Еврохим, ГоИнвест, Альфа-Банк, Сбер, ВТБ, МКБ, Самолет, Х5 retail Group, Газпромнефть, Леруа Мерлен, Ситилинк, Ланит, IBS. Также, ГК разрабатывает собственные ИТ-продукты (Юзбас, Октопус, Тил Эйчар) и флагманские проекты, которыми пользуется 70% населения страны.

Сфера:

Ищем Data Engineer / ML Engineer для разработки интеллектуальной системы контроля качества данных. Предстоит создавать и внедрять ML- и статистические методы выявления аномалий, дрейфа данных и отклонений в метриках, а также интегрировать решения в production-пайплайны.

Формат работы: Москва, гибрид (офис 1 раз в неделю).

Мы ожидаем:

  • Опыт работы в ML / Data Science от 3 лет.

  • Уверенное знание Python (pandas, NumPy, scikit-learn) и SQL.

  • Обязательный опыт работы с Apache Airflow и машинным обучением (ML).

  • Практический опыт работы с PySpark, Hadoop/Hive, MLflow.

  • Хорошее понимание математической статистики и классических ML-алгоритмов (регрессии, деревья решений, бустинги).

  • Опыт выявления аномалий, анализа дрейфа данных и работы с временными рядами.

  • Опыт вывода ML-моделей в production, мониторинга и версионирования.

  • Понимание принципов Data Quality и методов контроля качества данных.

  • Умение выбирать оптимальный подход к решению задачи: SQL-проверки, статистические методы или ML.

Задачи:

  • Разрабатывать и внедрять ML- и статистические методы контроля качества данных (Data Quality).

  • Выявлять аномалии, дрейф распределений, нарушения сезонности и нетипичные изменения метрик.

  • Проектировать проверки качества данных: полнота, уникальность, актуальность, корректность.

  • Исследовать данные, тестировать гипотезы и прототипировать новые методы обнаружения отклонений.

  • Работать с временными рядами и моделями машинного обучения.

  • Валидировать решения на исторических данных, анализировать ложные срабатывания.

  • Интегрировать решения в production-пайплайны на Airflow, PySpark, Hadoop/Hive.

  • Настраивать мониторинг, алертинг и сопровождать разработанные решения.

Мы предлагаем:

  • Карьерную и профессиональную возможность в стабильной, аккредитованной ИТ-компании;
  • Расширенный полис ДМС со стоматологией, корпоративный психолог;
  • Необходимую технику для комфортной работы;
  • Обучение, сертификацию, клуб английского языка;
  • Доступ к Корпоративной библиотеке и к Корпоративному университету;
  • Внутрикорпоративные профильные коммьюнити;
  • Заботу о детях сотрудников: корпоративные скидки, подарки, детские дни;
  • Геймифицированную программу лояльности: поверь, ты будешь восторге от нашего корпоративного магазина;
  • Корпоративную жизнь: мы много работаем и классно отдыхаем.