Пресненская набережная 6с2
О нас
Мы работаем в сегменте RegTech. Это новый рынок, активно развивающийся во всем мире. Большинство игроков — SaaS сервисы, позволяющие компаниям выполнять требования регулирующих органов, анализировать партнеров и клиентов, наблюдать и анализировать конкурентов, совершать M&A сделки, отслеживать связи между компаниями и многое другое. Это быстро развивающаяся отрасль на пересечении финансов, аналитики, технологий обработки данных, включая AI, нормативных и регуляторных требований.
Rusprofile — быстрорастущая частная компания, один из лидеров российского рынка RegTech. Сервис помогает компаниям быстро и эффективно принимать критические для бизнеса решения на основе данных, собираемых ежедневно из десятков источников. Аудитория Rusprofile — это более 11 млн пользователей в месяц и 90 000+ платящих клиентов, от малого бизнеса до крупных корпораций. Наша миссия — помогать бизнесам в их развитии, делая данные простыми и полезными для принятия решений.
За последние 3 года мы выросли по выручке в 5 раз, в 10 раз по базе клиентов и мы не планируем останавливаться. Мы больше не стартап, но и не корпорация. Мы принимаем решения быстро, у нас нет сложной иерархии и бюрократии. Мы постоянно развиваемся и адаптируемся, чтобы иметь возможность создавать действительно ценные продукты для наших клиентов и развивать бизнес.
Как построена работа
Мы выстроили инженерную культуру, где ценится качественный код и техническая экспертиза команды. Разработчики активно участвуют в проектировании решений, а время на работу с техническим долгом и рефакторинг — это часть нашего процесса, а не "когда-нибудь потом". У нас опытная команда, готовая делиться знаниями, и мы открыты к новым технологиям, если они решают реальные проблемы.
Процессы у нас построены на принципах agile и постоянно оптимизируются под потребности команды. Работаем итерациями, проводим короткие и полезные синки, уделяем внимание проектированию и code review. При этом у нас нет лишней бюрократии — мы берем лучшее из гибких подходов и адаптируем процессы так, чтобы они помогали команде, а не создавали препятствия.
О команде
Команда Rusprofile — это 50+ человек:
-
основатель Дмитрий Стрелков, который когда-то заканчивал факультет вычислительной математики и кибернетики МГУ. Спустя 8 лет активного развития Rusprofile, все также управляет бизнесом;
-
наша команда разработки состоит из 27 человек: двух инженеров по инфраструктуре, 17 разработчиков, а также 6 тестировщиков и двух дата-инженеров;
-
бизнес-ориентированная команда продукта: продакт-менеджеры, продуктовый аналитик и дизайнеры продукта.
Сейчас в Data Engineering два человека. Мы усиливаем это направление, чтобы развивать платформу данных, на которой построен бизнес компании.
Важно: это роль про платформу данных, а не classic DevOps / SRE. Ключевое для нас — прод-опыт именно с дата-стеком (оркестрация пайплайнов, обработка на Spark, lakehouse, качество данных), а не только с Kubernetes и CI/CD. Если весь опыт — обычная прод-инфраструктура без работы с данными, это, скорее всего, не та вакансия.
Команда Data Engineering:
-
обеспечивает единый источник правды по данным в компании для аналитики;
- строит и развивает платформу данных, на которой работает обработка core-данных компании и аналитика;
-
проектирует и поддерживает архитектуру обработки и хранения данных;
-
отвечает за стабильность, воспроизводимость и масштабируемость пайплайнов;
-
выстраивает системный контроль качества данных.
Мы создаём прозрачную и масштабируемую систему данных, которая поддерживает рост продукта и позволяет бизнесу принимать решения на основе достоверной информации.
Про наш стэк: Spark, dbt, Dagster, DataHub, ClickHouse, MySQL, Kafka, Kubernetes, GitLab, Snowplow, GrowthBook.
Что ты будешь делать
Твоим руководителем будет Lead команды Data Engineering, а основными стейкхолдерами — команда Data Engineering и внутренние потребители платформы core-данных (продукт, бизнес, аналитика).
Наша цель — построение и развитие платформы внешних (core) данных компании — тех данных, на обработке которых построен бизнес.
Твоя зона ответственности — разработка и развитие платформы: пайплайны движения данных, слой хранения, надёжность, масштабирование и безопасность, чтобы данные проходили весь путь предсказуемо, а изменения катились безопасно
Твои задачи будут включать:
1. Разработка пайплайнов движения данных
-
Разработка пайплайнов движения данных: от загрузки внешних источников до записи готовых данных в базы фасада;
-
Оркестрация пайплайнов в Dagster;
-
Разработка трансформаций на dbt-spark, оптимизация Spark-джоб;
-
Развитие слоя хранения на S3 (Parquet / Iceberg);
-
Обеспечение надёжности и повторяемости обработки: ретраи, идемпотентность, консистентность данных.
2. Сопровождение и разработка платформы данных
-
Развитие платформы под новые источники, объёмы и требования потребителей;
-
Поддержка стабильной работы пайплайнов и дата-сервисов в продакшене;
-
Масштабирование платформы под растущую нагрузку;
-
Управление окружениями (dev / stage / prod);
-
Сопровождение и развитие компонентов платформы, развёрнутых в Kubernetes.
3. CI/CD и автоматизация для дата-стека
-
Построение и развитие CI/CD (GitLab) для dbt-spark, Dagster и data-сервисов;
-
Автоматизация деплоя и тестов;
-
Инфраструктура как код;
-
Обеспечение воспроизводимости и прозрачности выкатки изменений в дата-пайплайнах.
4. Надёжность, Observability и качество данных
-
Мониторинг дата-пайплайнов, Spark-джоб, ресурсов и ошибок;
-
Настройка метрик, логов и алертинга;
-
Разбор сбоев и повышение стабильности обработки данных;
-
Поддержка и развитие проверок качества данных (DQ).
Ты станешь частью команды Data Engineering, которая строит и развивает платформу core-данных, на которой работает бизнес компании. Предстоит плотное взаимодействие с инженерами и командами, чьи процессы завязаны на эти данные.
Как понять что ты подойдешь
-
Опыт работы от 3 лет в роли Data Platform Engineer / Data DevOps
-
Прод-опыт именно с платформой данных: ты разрабатывал и развивал дата-пайплайны и дата-стек, а не только веб- и бэкенд-сервисы;
-
Опыт разработки пайплайнов движения данных (ingestion → обработка → выдача потребителям);
-
Оркестрация дата-пайплайнов (Dagster, Airflow или аналог) и трансформации данных (dbt / dbt-spark или аналог);
-
Обработка больших объёмов данных на Spark;
-
Работа с объектным хранилищем как основным слоем данных (S3 или аналог, Parquet);
-
Надёжность пайплайнов: разбор инцидентов, ретраи, идемпотентность, консистентность данных;
-
Контроль качества данных (DQ): проверки, тесты, мониторинг корректности;
-
CI/CD для дата-пайплайнов и сервисов (GitLab CI) и инфраструктура как код (Helm или аналоги);
-
Observability пайплайнов данных: метрики, логи, алертинг;
-
Уверенный Python и SQL, уверенные навыки Linux;
-
Опыт эксплуатации дата-сервисов в Kubernetes;
-
Системное мышление, опыт рефакторинга legacy-решений.
Будет плюсом:
-
Iceberg или Delta Lake (табличные форматы озера данных);
-
Опыт с serving-слоем: запись готовых данных в разные БД под API и нагрузку (MySQL, MongoDB, Redis и др.);
-
Kafka и потоковые данные;
-
ClickHouse, DataHub;
-
Vault или аналоги для управления секретами.
Мы предлагаем
-
Работу в продукте с доказанной ценностью и понятной стратегией развития. Мы работаем спринтами, но с понятным горизонтом планирования — есть гибкость в задачах и при этом стратегическое направление не теряется;
-
Среду, где данные — ядро бизнеса. От качества, скорости и надёжности работы с ними напрямую зависит результат компании, поэтому Data Engineering здесь — стратегически важное направление;
-
Осознанное движение к зрелой архитектуре: оркестрация, воспроизводимость, контроль качества, прозрачность процессов и снижение технологического долга;
-
Высокий уровень ответственности и доверия. Мы ценим самостоятельность, системное мышление и инженерный подход к решению задач;
-
Гибкий график и возможность удаленной работы (можно также работать в нашем офисе в Москва-Сити с потрясающим видом на столицу);
-
Работу в аккредитованной ИТ компании с полным соблюдением ТК РФ;
-
ДМС, 7 Day Off, оплату обучения, семинаров и конференций.