SRE & DevOps Lead / Руководитель группы автоматизации и управления инфраструктуры

Дата размещения вакансии: 06.10.2026
Работодатель: Ventra
Уровень зарплаты:
з/п не указана
Город:
Москва
Мира проспект 42
Требуемый опыт работы:
Более 6 лет

Мы в Ventra Go! создаём маркетплейс подработок, где люди находят задания, выполняют их и получают быстрые выплаты. Наш сервис помогает компаниям оперативно закрывать кадровые потребности, а исполнителям — зарабатывать удобным способом. Сейчас мы находимся в поиске SRE / DevOps Lead, который возглавит команду платформенной инженерии, выстроит системный SRE-подход и обеспечит надежность, масштабируемость и наблюдаемость продуктовой платформы Ventra Go! в условиях активного роста бизнеса и развития Data/ML-направлений.

Чем предстоит заниматься:

  • Лидировать команду SRE / DevOps инженеров (2–5 человек, подрядчики): постановка целей, 1:1, performance review, найм, онбординг и развитие технических компетенций;

  • Формировать и развивать SRE-практики: внедрение SLI / SLO / SLA, управление error budgets, мониторинг сквозных бизнес-процессов (BPO);

  • Проектировать и развивать observability-платформу (метрики, логи, трейсинг, алерты, дашборды, плейбуки) для сервисов, инфраструктуры и Data/ML-контуров;

  • Организовывать процессы Incident Management: on-call дежурства, координация war-rooms, проведение blameless postmortem, контроль выполнения action items;

  • Выявлять и устранять скрытые деградации систем без явных аварий (рост latency, saturation, узкие места емкости);

  • Развивать и поддерживать Kubernetes-платформу: кластеры, сетевая связность, RBAC, ingress, autoscaling, secrets management, multi-environment (dev / stage / prod);

  • Разрабатывать и развивать Infrastructure as Code и GitOps (Terraform, Helm), внедрять единые platform guardrails и стандарты деплоя для продуктовых команд;

  • Выстраивать надежные CI/CD и релизные пайплайны (canary, blue-green, zero-downtime, feature flags) для backend, mobile, frontend и data/ML;

  • Обеспечивать стабильную эксплуатацию платформенных решений: Kafka, PostgreSQL, Redis, ClickHouse, OpenSearch, Trino, Spark, Iceberg;

  • Проводить capacity planning с учетом роста нагрузки и сезонности, оптимизировать инфраструктурные расходы (FinOps);

  • Проектировать и тестировать сценарии Disaster Recovery и Business Continuity (RTO / RPO);

  • Участвовать в архитектурных комитетах и ADR с правом вето на решения с неприемлемым операционным риском;

  • Взаимодействовать с продуктовыми и функциональными командами как партнер по надежности.

Наш стек: Kubernetes, Docker, Helm, Terraform, GitOps, Linux, PostgreSQL, Redis, Apache Kafka, ClickHouse, OpenSearch, Trino, Apache Spark, Apache Iceberg, Prometheus, Grafana, OpenTelemetry, CI/CD.

Что мы ожидаем:

  • 5+ лет опыта в сфере DevOps / SRE / Platform Engineering и 2+ года в роли Team Lead / Tech Lead;

  • Практический опыт промышленной эксплуатации Kubernetes под высокими нагрузками (сеть, ingress, autoscaling, RBAC, управление секретами);

  • Глубокое понимание Linux, сетевого стека (TCP/IP, DNS, маршрутизация, балансировка нагрузки) и микросервисной архитектуры;

  • Опыт построения комплексных систем мониторинга и трейсинга, практическое понимание SRE-методологии (SLI/SLO, error budgets, postmortem);

  • Опыт администрирования и обеспечения отказоустойчивости хранилищ и брокеров: Kafka, PostgreSQL, Redis, ClickHouse, OpenSearch;

  • Уверенное владение IaC (Terraform) и GitOps-инструментами, опыт выстраивания релизных пайплайнов со стратегиями безаварийного деплоя;

  • Опыт управления инцидентами, построения дежурств (on-call) и проведения анализа первопричин (RCA);

  • Понимание принципов FinOps (учет и оптимизация TCO инфраструктуры), практик DevSecOps и обеспечения Disaster Recovery (RTO/RPO);

  • Будет плюсом: опыт поддержки и оптимизации data/streaming/ML-стека (Spark, Trino, Iceberg).

Что мы предлагаем:

  • Достойную заработную плату и прозрачную систему мотивации.

  • Мягкий гибридный формат работы (3 дня офис, 2 дня дома).

  • Официальное оформление по ТК РФ.

  • Социальные программы (ДМС, оплата больничного, программы матпомощи, обучения и др.).

  • Корпоративный доступ к образовательным платформам.

  • Программу корпоративных привилегий PrimeZone.

  • Возможность выстраивать архитектуру надежности и инженерную культуру платформы с прямым влиянием на бизнес.

Понравилась наша вакансия? Оставляйте отклик, будем рады рассказать о нашем продукте подробнее :)