Северный административный округ, улица 8 Марта 1с12
Мы проектируем и внедряем ключевые элементы архитектуры российского сегмента сети Интернет. Являемся разработчиком передовых программно-аппаратных комплексов для управления телеком-инфраструктурой.
Входим в контур группы компаний ПАО «Ростелеком» и являемся стратегическим активом АО «Градиент». Наши аппаратные платформы развернуты на сетях передачи данных ведущих федеральных операторов связи.
Разработка ведется в рамках стратегических государственных инициатив по цифровому суверенитету страны. Среди организаций, доверяющих нашим технологиям, — профильные ведомства федерального уровня: Роскомнадзор и Минцифры России.
О проекте:
Мы развиваем систему постанализа сетевого трафика, работающую с высоконагруженными потоками данных.
Система агрегирует данные из сотен источников, обрабатывает входной стриминг на уровне сотен тысяч событий в секунду и продолжает масштабироваться — в ближайшее время планируется подключение более 10 дополнительных источников данных.
Чем предстоит заниматься:
- Проектирование и реализация сложных batch и streaming пайплайнов в новом Lakehouse-стеке;
- Участие в построении новой data-платформы с нуля;
- Проектирование схем хранения и оптимизация Iceberg-таблиц;
- Оптимизация Spark и Trino под highload и near-real-time требования;
- Проектирование решений с учётом роста объёмов данных и нагрузки;
- Разбор и устранение сложных инцидентов производительности;
- Внедрение и развитие практик Data Quality;
- Проведение код-ревью;
- Менторинг старших инженеров и инженеров данных;
- Принятие технических решений в рамках архитектуры платформы.
Что мы ожидаем:
1. Глубокая инженерная экспертиза.
• 5+ лет опыта в Data Engineering;
• Продвинутый опыт работы со Spark (batch и streaming);
• Практический опыт построения потоковой обработки на Flink;
• Отличное знание SQL и опыт оптимизации под большие объёмы данных;
• Уверенное понимание брокеров сообщений: гарантии доставки, порядок, дубли, поведение при переполнении. Не привязано к продукту — у нас Kafka, но важен принцип;
• Уверенное владение Python, включая PySpark;
• Уверенное владение Java: потоковые джобы пишутся на ней;
• Опыт работы с Trino.
2. Работа с распределёнными системами.
• Опыт работы с distributed storage (S3 или аналоги);
• Понимание принципов Data Lake / Lakehouse;
• Опыт проектирования таблиц под большие объёмы данных (partitioning, compaction, storage layout);
• Опыт работы с Iceberg / Delta Lake или глубокое понимание их принципов;
• Понимание принципов построения отказоустойчивых и горизонтально
масштабируемых data-систем.
3. Проектирование и развитие новой платформы.
• Опыт проектирования и построения data-платформ или крупных подсистем с нуля;
• Понимание принципов построения Lakehouse-архитектуры;
• Опыт выбора и обоснования технических решений на уровне отдельных
компонентов и пайплайнов;
• Понимание подходов к масштабированию платформы при росте объёмов данных и нагрузки;
• Опыт проектирования решений с учётом отказоустойчивости, производительности и эксплуатационных требований.
4. Производительность и надёжность.
• Опыт оптимизации Spark-job'ов;
• Понимание причин деградации производительности в distributed-среде;
• Опыт работы с highload-потоками;
• Опыт внедрения и поддержки Data Quality механизмов;
• Понимание SLA витрин и требований к near-real-time обработке;
• Опыт работы с потоками, где задержка от источника до хранилища нормирована;
• Опыт инструментирования пайплайнов метриками и построения по ним
оповещений;
• Опыт разбора сложных проблем производительности и поиска bottleneck'ов в распределённых системах.
5. Техническое лидерство (execution-level).
• Опыт проектирования сложных пайплайнов;
• Опыт код-ревью;
• Способность самостоятельно принимать технические решения в рамках архитектуры;
• Умение декомпозировать сложные инженерные задачи.
Будет плюсом:
- Опыт работы с различными типами СУБД и хранилищ данных: RDBMS, columnoriented, Graph DB, Search / Full-text engines;
- Опыт работы с Kubernetes;
- Понимание практик Infrastructure as Code;
- Опыт работы с GitOps;
- Опыт работы с protobuf и Parquet;
- Опыт работы с ClickHouse;
- Опыт работы с каталогом данных: описания, происхождение данных, проверки качества;
- Опыт работы с BI-системами, в частности Apache Superset;
- Понимание различных моделей данных (Star / Snowflake, Data Vault, Anchor Modeling);
- Понимание предметной области: сетевой трафик, потоки и сессии, SNI / IP.
Условия работы:
- Работа в аккредитованной IT компании;
- Трудоустройство в соответствии с ТК РФ;
-
Белая заработная плата (оклад обсуждаем с успешным кандидатом после прохождения технического интервью);
- График работы: 5/2;
- Возможность работать удаленно;
- Офис находится в БЦ "Трио" на метро Динамо (или мцд Гражданская);
- И плюшки ниже :) ↴