Проект банка ТОП-3! Команда создает и развивает корпоративный движок потоковой обработки данных на основе Apache Flink, который используется разработчиками банка для построения приложений обработки данных в реальном времени (фрод-мониторинг, скоринг, обогащение транзакций, расчеты). Вы будете работать в команде, которая отвечает за фреймворк и платформенные возможности Flink!
Твои задачи:
-
Разрабатывать и поддерживать коннекторы для интеграции Flink с корпоративными системами хранения данных (Kafka, S3-совместимые объектные хранилища, HBase, возможно Fluss) и аналитическими СУБД
-
Реализовывать механизмы Stateful обработки: настраивать и оптимизировать State Backends (RocksDB, Heap), интегрировать с внешними хранилищами состояний для сценариев соединения с большими справочниками
-
Разрабатывать инфраструктурные решения для повышения отказоустойчивости: реализовывать механизмы checkpointing, savepoints, автоскейлинга, восстановления после сбоев, поддерживать High Availability кластеров
-
Интегрировать Flink-приложения с корпоративными системами: обеспечивать аутентификацию, работать с секрет-менеджерами, системами логирования (ELK), метриками (Prometheus/Grafana), Единым аудитом
-
Настраивать и поддерживать систему мониторинга Flink-кластеров и джобов: отслеживать метрики JVM, backpressure, checkpoint durations, consumer lag, watermarks
-
Разрабатывать и внедрять процессы управления жизненным циклом приложений (деплой, апгрейд, остановка, откат) через CI/CD и специализированный корпоративный портал управления сервисами
-
Проводить нагрузочное тестирование, анализировать узкие места производительности, оптимизировать latency и throughput потоковых конвейеров
-
Реализовывать и поддерживать Flink History Server для анализа завершенных заданий и диагностики
Что мы ждем от тебя:
- Опыт работы Data Engineer или разработчиком от 3 лет, из них не менее 2 лет в области потоковой обработки данных (Apache Flink, Kafka Streams, Spark Streaming) или Big Data
- Уверенное знание Java (или Scala) и опыт разработки production-ready приложений в распределенных системах
- Практический опыт работы с Apache Flink: понимание концепций операторов, state, checkpointing, savepoints, exactly-once семантики, роли JobManager/TaskManager
- Опыт работы с Kafka: продюсеры, консьюмеры, топологии, управление offset'ами, обработка ошибок
- Опыт работы с системами контейнеризации и оркестрации: Docker, Kubernetes (Pods, Deployments, Services, ConfigMaps, Operators)
- Знание принципов работы систем мониторинга: Prometheus, Grafana. Умение настраивать алерты и интерпретировать метрики
- Продвинутый уровень SQL, опыт оптимизации запросов и работы с технической документацией (RFC, официальная docs)
- Навыки декомпозиции сложных задач, отличные коммуникационные навыки для работы с техническими командами (разработчики, DevOps) и потребителями (data-инженеры)
Будет плюсом:
- Опыт разработки собственных коннекторов или форматов данных для Flink.
- Знание экосистемы Hadoop/Big Data: HDFS, HBase, Hive. Понимание принципов работы с объектными хранилищами (S3)
- Опыт работы с системами логирования и трассировки: ELK (Elasticsearch, Logstash, Kibana), Jaeger/Zipkin
- Понимание принципов Data Lineage и опыт интеграции с инструментами линии происхождения данных
- Опыт работы с SQL-интерфейсами Flink (Table API/SQL) и интеграцией с корпоративными BI-системами
- Знакомство с проектами Apache Paimon, Apache Iceberg, Fluss или аналогичными технологиями Lakehouse
Что мы обеспечиваем:
- Внутренние семинары, митапы, мы очень любим учиться новому
- ДМС со стоматологией для сотрудников и скидку на покупку ДМС для ближайших членов семьи
- Технику для комфортной работы
- Сессии профессионального развития персонала, результатом которой является план индивидуального развития каждого сотрудника