Медиалогия
Data Quality Engineer
- Python
- Big Data
- Data Governance
- PostgreSQL
- Clickhouse
- SQL
- Spark
Медиалогия занимается разработкой продуктов по сбору и анализу данных из СМИ и соцмедиа.
Мы разрабатываем высоконагруженные системы, которые в режиме реального времени сканируют весь текстовый сегмент Интернета (100+ млн. сообщений в сутки, 1.7 млрд. метрик) и, используя уникальные лингвистические технологии, позволяют осуществлять мгновенный анализ упоминаний наших клиентов в социальных сетях, блогах, форумах и управлять их репутацией.
Обязанности:
-
проектирование и внедрение DQ-фреймворков: разработка и поддержка автоматизированных процессов и инструментов для проверки качества данных (Data Quality) на всех этапах жизненного цикла;
-
автоматизация тестирования данных: написание unit- и integration-тестов для ETL/ELT пайплайнов, витрин данных и источников;
-
взаимодействие с командами: плотная работа с Data Engineers, Data Scientists, аналитиками и бизнес-заказчиками для сбора требований к качеству данных и перевода бизнес-правил в технические проверки;
-
профилирование сырых и целевых данных для выявления скрытых закономерностей, дубликатов, пропусков и несоответствий бизнес-логике;
-
расследование инцидентов: оперативное реагирование на проблемы с данными, поиск корневых причин (Root Cause Analysis), устранение инцидентов и предотвращение их повторения;
-
настройка мониторинга и алертинга качества данных, создание дашбордов с метриками (Data Quality Dashboards) и настройка алертов при возникновении аномалий или отклонений.
Требования:
-
опыт работы от 2-3 лет в сфере Data Engineering, Data QA или непосредственно Data Quality;
-
отличное знание SQL (написание сложных запросов, оконные функции, CTE, умение оптимизировать запросы для больших объемов данных);
-
языки программирования: знание Python (написание скриптов для автоматизации проверок, работа с библиотеками Pandas, PySpark или аналогами);
-
опыт работы с современными фреймворками для проверки данных (Great Expectations, dbt tests, Soda, Monte Carlo или написание кастомных решений);
-
понимание архитектуры данных: знание принципов построения хранилищ данных (DWH, Data Lake, Data Mesh) и опыт работы с современными СУБД (ClickHouse, PostgreSQL), Hive;
-
желательно оркестрация и ETL: понимание того, как работают пайплайны данных, опыт работы с оркестраторами (Airflow, Prefect) и инструментами трансформации (dbt, Spark);
-
владение теорией качества данных: понимание метрик качества данных (полнота, уникальность, консистентность, своевременность, валидность, точность) и концепций DataOps / Data Governance.
Условия:
-
удаленный или гибридный формат работы;
-
заработная плата обсуждается по итогам собеседования с успешным кандидатом;
-
ДМС после испытательного срока;
-
специальные условия для сотрудников на страхование для членов семьи;
-
скидки в компаниях-партнерах (фитнес-центры, обучающие курсы, изучение иностранных языков и многое другое);
-
бесплатное онлайн-обучение на корпоративном портале и корпоративная библиотека;
-
интересные проекты и возможность влиять на технологический стек;
-
офис в пешей доступности от ст. м. Дмитровская (БЦ «Савеловский Сити»).