-
Проектированием и развитием cloud‑first инфраструктуры, которая одинаково надёжно работает как для ML‑задач (GPU‑кластеры, инференс), так и для микросервисного окружения.
-
Построением и оптимизацией CI/CD пайплайнов в GitLab CI — кэширование, управление артефактами, параллелизация, сокращение времени сборки.
-
Деплоем, отладкой и масштабированием кластеров Kubernetes (kubeadm/k0s), включая настройку Ingress, HPA/VPA, Network Policies, работу с Helm-чартами.
-
Управлением частными облаками на базе OpenStack — развёртывание, конфигурация, мониторинг ресурсов, работа с проектами и квотами.
-
Настройкой систем мониторинга и наблюдаемости: Prometheus + Grafana (дашборды, алертинг), Loki для логов, внедрение SLO/SLI и отслеживание их выполнения.
-
Реализацией инфраструктуры как кода (IaC) с помощью Terraform/Terragrunt — разработка модулей, управление состоянием (state), удалённые бэкенды, интеграция с Ansible для конфигурации.
-
Обеспечением безопасности на всех уровнях: управление секретами (Vault / Sealed Secrets), настройка RBAC, сетевых политик, hardening ОС и кластера.
-
Администрированием Linux-серверов, диагностикой производительности, написанием скриптов на Bash и Python для автоматизации рутинных задач.
-
Участием в on‑call-ротации (при этом мы стремимся к нулевым инцидентам благодаря проактивному мониторингу и автовосстановлению).
Чего ожидаем от тебя:
-
Опыт коммерческой работы от 5 лет в роли DevOps / SRE / Platform Engineer.
-
Глубокое знание GitLab CI: построение сложных пайплайнов, стратегии кэширования, работа с артефактами и зависимостями.
-
Экспертное владение Kubernetes: установка и конфигурация кластеров (kubeadm/k0s), отладка подов, горизонтальное и вертикальное масштабирование, работа с Ingress-контроллерами, сетевыми политиками.
-
Опыт работы с OpenStack: управление проектами, инстансами, сетями, хранилищами.
-
Настройка мониторинга на базе Prometheus + Grafana: разработка дашбордов, настройка алертов, работа с Loki, понимание SLO/SLI.
-
Практика с Terraform/Terragrunt: модульная структура, управление state, использование remote backends, и Ansible для конфигурации серверов.
-
Знание инструментов безопасности: Vault / Sealed Secrets для секретов, тонкая настройка RBAC, Network Policies, hardening Linux и Kubernetes.
-
Уверенное администрирование Linux, умение диагностировать проблемы (нагрузка, сеть, диски), писать скрипты на Bash и Python.
-
Самостоятельность в постановке задач, проактивный поиск узких мест, отличная коммуникация с разработчиками и коллегами.
-
Опыт с GitOps (ArgoCD / FluxCD) — управление декларативными состояниями.
-
Углублённые навыки в безопасности: работа с Vault, SOPS, политики OPA/Gatekeeper.
-
Мультипроектность — умение вести инфраструктуру для нескольких продуктов одновременно.
- Опыт в MLOps: инференс-серверов, оптимизация моделей, оркестрация и мониторинг GPU; работа с S3-совместимыми хранилищами (MinIO, AWS) и Model Registry (например, ClearML).
Что готовы предложить:
-
Реальные задачи на стыке DevOps и MLOps — редкое сочетание для профессионального роста.
- Вклад в развитие сложного высоконагруженного продукта: все решения принимаются командой, ты можешь на них влиять и будешь видеть результаты своего труда.
-
Развитие и обучение: предсказуемый онбординг, помощь наставника; оплата тренингов, семинаров и конференций, корпоративная библиотека.
-
Стабильность и прозрачность: оформление по ТК, пересмотры зарплаты по итогам performance review.
- Неформальная рабочая атмосфера: отсутствие бюрократии, гибкость процессов.
- ДМС после испытательного; другие "плюшки" в виде классного мерча, заботы о сотрудниках и т.д.
- возможность посетить Владивосток и насладиться красотой региона :)