Мы развиваем продукт DataQuality - систему мониторинга качества данных, которая в реальном времени следит за потоком событий антифрод-платформы: согласованность полей, заполненность расчетов, стабильность скорингов и агрегатов, статистику срабатывания фрод-правил, пропажу типов событий.
Мы ищем аналитика данных, который возьмет на себя две связанные задачи: довести систему алертов до состояния, когда сигналов мало, но каждый по делу, и исследовать связанные с данными обращения пользователей антифрод-платформы, находя в них подсказки о том, что мы еще не умеем мониторить.
Это техническая роль. Поток платформы - тысячи событий в секунду, история в Hadoop - миллиарды строк. Поэтому нужно понимать, как Spark исполняет ваш запрос, и уверенно владеть статистикой: пороги алертов выводятся из распределений, а не подбираются на глаз.
Роль хорошо подойдет тем, кто работал с ML (обучал и оценивал модели, искал аномалии, следил за дрейфом признаков), но не хочет уходить в Data Science или MLOps. У нас статистика и ML-подходы применяются к прикладной задаче с быстрым результатом: настроенная вами проверка уже завтра ловит реальный инцидент на боевом потоке.
Обязанности
- разбирать поток срабатываний проверок качества данных, отличая реальную деградацию от шума и ложных сигналов
- настраивать проверки так, чтобы снижать долю ложных срабатываний: подбирать пороги по уровням severity, окно агрегации и базовый период на основе распределения метрики за исторический период, а не «на глаз»
- копать до первопричины срабатываний: идти в сырые события, поднимать историю, сопоставлять с релизами и инцидентами
- оценивать качество алертов: сколько сигналов были ложными и почему (строгий порог, короткое окно, сезонность, редкий тип события)
- развивать методы детектирования: проверять статистические и ML-подходы к поиску аномалий и дрейфа на временных рядах и распределениях скорингов, оценивать их на истории инцидентов и предлагать, что включать в продукт
- работать с полной историей событий в Hadoop: писать запросы и расчеты на Spark SQL и PySpark так, чтобы они укладывались в ресурсы общего кластера
- исследовать обращения, которые пользователи антифрод-платформы пишут в поддержку, и вытаскивать из них реальную проблему с данными
- соотносить обращения с текущим покрытием мониторинга: понимать, что уже отлавливается проверками, а где инструмента нет
- доводить находку до понятного «полуфабриката»: проблема, подтвержденная на данных, и передавать ее системному аналитику, который оформит из нее требования для команды разработки.
Требования
- опыт в аналитике данных или Data Science от трех лет, включая работу с потоковыми или near-real-time данными и с большими объемами в Hadoop / Spark
- Spark SQL и PySpark на больших объемах - ежедневный инструмент: условия проверок в системе пишутся на Spark SQL. Важно понимать, как запрос исполняется. Нужно уметь прочитать план запроса и оценить его стоимость до запуска: кластер общий, и тяжелый запрос по полной истории мешает всем
- SQL уверенно: оконные функции, многошаговые агрегации, джойны с контролем кардинальности, корректная работа с NULL и типами. Понимание, почему запрос деградирует, и чем колоночная СУБД отличается от строчной; опыт с ClickHouse будет плюсом
- Python как основной рабочий инструмент, а не эпизодический. Способность быстро написать скрипт, который поднимет историю срабатываний и покажет, какие пороги дают ложные сигналы
- теория вероятностей и математическая статистика на уровне уверенного применения: доверительные интервалы, проверка гипотез, ошибки первого и второго рода и тд
- прикладная статистика для мониторинга: дрейф распределений (PSI), отклонение среднего и дисперсии от базовой линии, выбросы (z-score / IQR), сезонность; precision / recall применительно к алертам. Меры расхождения распределений и принятые для них пороговые значения, баланс ложноположительных и ложноотрицательных срабатываний
- практический опыт с ML: потребуется понимать метрики качества, как работает переобучение, дрейф признаков и то, как качество данных влияет на модель. Выводить модели в продакшен не потребуется
- понимание принципов мониторинга качества данных: типы проверок, уровни severity и то, что за ними стоят разные действия от информирования до инцидента
- системный взгляд и исследовательская жилка: видеть картину целиком, не лечить симптом порогом, если корень в источнике данных, и копать до истины
Будет плюсом:
- понимание работы фрод-правил и скорингов
- опыт оптимизации расчетов на Spark
- опыт ML-детектирования аномалий и дрейфа данных в промышленном мониторинге (это направление у нас в развитии)
- опыт работы в поддержке / эксплуатации: разбор инцидентов, приоритизация обращений
- опыт с инструментами контроля качества данных: Great Expectations, Soda, Evidently, Monte Carlo. Отдельно ценим понимание, где их настройки по умолчанию перестают работать на больших объемах
- опыт с каталогами данных и lineage: Atlas, DataHub, OpenLineage
- опыт работы с ИИ-ассистентами при разборе кода.
Условия
- комфортный современный офис в Москве, Кутузовский, 32
- график работы – офис
- ежегодный пересмотр зарплаты, квартальная и годовая премия
- корпоративный спортзал и зоны отдыха
- более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
- программа адаптации и помощь руководителя на старте (для Junior позиций)
- расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
- гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
- подписка Прайм с возможностью совместного использования на трёх близких
- вознаграждение за рекомендацию друзей в команду Сбер