Медиалогия

Data Quality Engineer

Не указана
  • Москва
  • От 3 до 6 лет
  • Python
  • Big Data
  • Data Governance
  • PostgreSQL
  • Clickhouse
  • SQL
  • Spark

Медиалогия занимается разработкой продуктов по сбору и анализу данных из СМИ и соцмедиа.

Мы разрабатываем высоконагруженные системы, которые в режиме реального времени сканируют весь текстовый сегмент Интернета (100+ млн. сообщений в сутки, 1.7 млрд. метрик) и, используя уникальные лингвистические технологии, позволяют осуществлять мгновенный анализ упоминаний наших клиентов в социальных сетях, блогах, форумах и управлять их репутацией.

Обязанности:

  • проектирование и внедрение DQ-фреймворков: разработка и поддержка автоматизированных процессов и инструментов для проверки качества данных (Data Quality) на всех этапах жизненного цикла;

  • автоматизация тестирования данных: написание unit- и integration-тестов для ETL/ELT пайплайнов, витрин данных и источников;

  • взаимодействие с командами: плотная работа с Data Engineers, Data Scientists, аналитиками и бизнес-заказчиками для сбора требований к качеству данных и перевода бизнес-правил в технические проверки;

  • профилирование сырых и целевых данных для выявления скрытых закономерностей, дубликатов, пропусков и несоответствий бизнес-логике;

  • расследование инцидентов: оперативное реагирование на проблемы с данными, поиск корневых причин (Root Cause Analysis), устранение инцидентов и предотвращение их повторения;

  • настройка мониторинга и алертинга качества данных, создание дашбордов с метриками (Data Quality Dashboards) и настройка алертов при возникновении аномалий или отклонений.

Требования:

  • опыт работы от 2-3 лет в сфере Data Engineering, Data QA или непосредственно Data Quality;

  • отличное знание SQL (написание сложных запросов, оконные функции, CTE, умение оптимизировать запросы для больших объемов данных);

  • языки программирования: знание Python (написание скриптов для автоматизации проверок, работа с библиотеками Pandas, PySpark или аналогами);

  • опыт работы с современными фреймворками для проверки данных (Great Expectations, dbt tests, Soda, Monte Carlo или написание кастомных решений);

  • понимание архитектуры данных: знание принципов построения хранилищ данных (DWH, Data Lake, Data Mesh) и опыт работы с современными СУБД (ClickHouse, PostgreSQL), Hive;

  • желательно оркестрация и ETL: понимание того, как работают пайплайны данных, опыт работы с оркестраторами (Airflow, Prefect) и инструментами трансформации (dbt, Spark);

  • владение теорией качества данных: понимание метрик качества данных (полнота, уникальность, консистентность, своевременность, валидность, точность) и концепций DataOps / Data Governance.

Условия:

  • удаленный или гибридный формат работы;

  • заработная плата обсуждается по итогам собеседования с успешным кандидатом;

  • ДМС после испытательного срока;

  • специальные условия для сотрудников на страхование для членов семьи;

  • скидки в компаниях-партнерах (фитнес-центры, обучающие курсы, изучение иностранных языков и многое другое);

  • бесплатное онлайн-обучение на корпоративном портале и корпоративная библиотека;

  • интересные проекты и возможность влиять на технологический стек;

  • офис в пешей доступности от ст. м. Дмитровская (БЦ «Савеловский Сити»).