Site Reliability Engineer в группу эксплуатации YT

Дата размещения вакансии: 22.09.2026
Работодатель: VK
Уровень зарплаты:
з/п не указана
Город:
Москва
Садовническая улица 82с2
Требуемый опыт работы:
От 3 до 6 лет

YTsaurus — опенсорс-платформа для хранения и обработки данных, которую в VK активно развивают и используют как основу единого дата-лейка. Система обрабатывает миллионы событий в секунду на динамических таблицах, работает с сотнями петабайт данных и обслуживает тысячи пользователей. У нас большие кластеры, сложная инфраструктура и высокие требования к надёжности. И мы ищем SRE, который поможет поддерживать и развивать всё это.

Задачи

  • Автоматизировать эксплуатацию YTsaurus
  • Интегрировать платформу с внутренними системами VK
  • Следить за стабильностью и производительностью
  • Разбираться с проблемами на уровне кода (в основном C++)
  • Решать задачи, которые не гуглятся
  • Разбираться с инцидентами в рамках дежурств
  • Масштабировать кластер YTsaurus до 500ПБ
  • Заниматься оптимизацией использования железа (CPU, диски)

Требования

  • Опыт работы с распределёнными системами
  • Знания в области сетей (TCP/IP, DNS, балансировка, ACL) и ОС Linux
  • Способность работать самостоятельно: формулировать цели, предлагать решения

Будет плюсом

  • Опыт работы с высоконагруженными системами или большими объёмами данных
  • Владение C++ на уровне чтения и отладки сложного кода