Data Quality Middle+/Senior (Антифрод-платформа)

Дата размещения вакансии: 06.10.2026
Работодатель: СБЕР
Уровень зарплаты:
з/п не указана
Город:
Москва
Требуемый опыт работы:
Более 6 лет

Мы развиваем продукт DataQuality - систему мониторинга качества данных, которая в реальном времени следит за потоком событий антифрод-платформы: согласованность полей, заполненность расчетов, стабильность скорингов и агрегатов, статистику срабатывания фрод-правил, пропажу типов событий.

Мы ищем аналитика данных, который возьмет на себя две связанные задачи: довести систему алертов до состояния, когда сигналов мало, но каждый по делу, и исследовать связанные с данными обращения пользователей антифрод-платформы, находя в них подсказки о том, что мы еще не умеем мониторить.

Это техническая роль. Поток платформы - тысячи событий в секунду, история в Hadoop - миллиарды строк. Поэтому нужно понимать, как Spark исполняет ваш запрос, и уверенно владеть статистикой: пороги алертов выводятся из распределений, а не подбираются на глаз.

Роль хорошо подойдет тем, кто работал с ML (обучал и оценивал модели, искал аномалии, следил за дрейфом признаков), но не хочет уходить в Data Science или MLOps. У нас статистика и ML-подходы применяются к прикладной задаче с быстрым результатом: настроенная вами проверка уже завтра ловит реальный инцидент на боевом потоке.

Обязанности

  • разбирать поток срабатываний проверок качества данных, отличая реальную деградацию от шума и ложных сигналов
  • настраивать проверки так, чтобы снижать долю ложных срабатываний: подбирать пороги по уровням severity, окно агрегации и базовый период на основе распределения метрики за исторический период, а не «на глаз»
  • копать до первопричины срабатываний: идти в сырые события, поднимать историю, сопоставлять с релизами и инцидентами
  • оценивать качество алертов: сколько сигналов были ложными и почему (строгий порог, короткое окно, сезонность, редкий тип события)
  • развивать методы детектирования: проверять статистические и ML-подходы к поиску аномалий и дрейфа на временных рядах и распределениях скорингов, оценивать их на истории инцидентов и предлагать, что включать в продукт
  • работать с полной историей событий в Hadoop: писать запросы и расчеты на Spark SQL и PySpark так, чтобы они укладывались в ресурсы общего кластера
  • исследовать обращения, которые пользователи антифрод-платформы пишут в поддержку, и вытаскивать из них реальную проблему с данными
  • соотносить обращения с текущим покрытием мониторинга: понимать, что уже отлавливается проверками, а где инструмента нет
  • доводить находку до понятного «полуфабриката»: проблема, подтвержденная на данных, и передавать ее системному аналитику, который оформит из нее требования для команды разработки.

Требования

  • опыт в аналитике данных или Data Science от трех лет, включая работу с потоковыми или near-real-time данными и с большими объемами в Hadoop / Spark
  • Spark SQL и PySpark на больших объемах - ежедневный инструмент: условия проверок в системе пишутся на Spark SQL. Важно понимать, как запрос исполняется. Нужно уметь прочитать план запроса и оценить его стоимость до запуска: кластер общий, и тяжелый запрос по полной истории мешает всем
  • SQL уверенно: оконные функции, многошаговые агрегации, джойны с контролем кардинальности, корректная работа с NULL и типами. Понимание, почему запрос деградирует, и чем колоночная СУБД отличается от строчной; опыт с ClickHouse будет плюсом
  • Python как основной рабочий инструмент, а не эпизодический. Способность быстро написать скрипт, который поднимет историю срабатываний и покажет, какие пороги дают ложные сигналы
  • теория вероятностей и математическая статистика на уровне уверенного применения: доверительные интервалы, проверка гипотез, ошибки первого и второго рода и тд
  • прикладная статистика для мониторинга: дрейф распределений (PSI), отклонение среднего и дисперсии от базовой линии, выбросы (z-score / IQR), сезонность; precision / recall применительно к алертам. Меры расхождения распределений и принятые для них пороговые значения, баланс ложноположительных и ложноотрицательных срабатываний
  • практический опыт с ML: потребуется понимать метрики качества, как работает переобучение, дрейф признаков и то, как качество данных влияет на модель. Выводить модели в продакшен не потребуется
  • понимание принципов мониторинга качества данных: типы проверок, уровни severity и то, что за ними стоят разные действия от информирования до инцидента
  • системный взгляд и исследовательская жилка: видеть картину целиком, не лечить симптом порогом, если корень в источнике данных, и копать до истины

Будет плюсом:

  • понимание работы фрод-правил и скорингов
  • опыт оптимизации расчетов на Spark
  • опыт ML-детектирования аномалий и дрейфа данных в промышленном мониторинге (это направление у нас в развитии)
  • опыт работы в поддержке / эксплуатации: разбор инцидентов, приоритизация обращений
  • опыт с инструментами контроля качества данных: Great Expectations, Soda, Evidently, Monte Carlo. Отдельно ценим понимание, где их настройки по умолчанию перестают работать на больших объемах
  • опыт с каталогами данных и lineage: Atlas, DataHub, OpenLineage
  • опыт работы с ИИ-ассистентами при разборе кода.

Условия

  • комфортный современный офис в Москве, Кутузовский, 32
  • график работы – офис
  • ежегодный пересмотр зарплаты, квартальная и годовая премия
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • программа адаптации и помощь руководителя на старте (для Junior позиций)
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких
  • вознаграждение за рекомендацию друзей в команду Сбер