з/п не указана
Москва
Старопетровский проезд 11к1
Старопетровский проезд 11к1
От 1 года до 3 лет
Обязанности:
- Обеспечение надежности, доступности и производительности распределенных систем через внедрение метрик SLI/SLO/SLA;
- Проектирование, развертывание и поддержка облачной инфраструктуры и on premise решений;
- Автоматизация операционных процессов: деплоймент, масштабирование, резервное копирование и восстановление;
- Настройка и развитие систем мониторинга, логирования и алертинга (Prometheus, Grafana, ELK, Loki, Alerta);
- Управление инцидентами: участие в дежурствах, реагирование на сбои, проведение постмортемов и внедрение превентивных мер;
- Развитие и поддержка CI/CD-конвейеров с фокусом на безопасность и надежность доставки GitLab CI;
- Администрирование и оптимизация кластеров оркестрации контейнеров (Kubernetes) и связанных сервисов;
- Внедрение практик «инфраструктура как код» (Ansible и etc) для управления конфигурациями и окружениями;
- Коллаборация с разработкой для повышения отказоустойчивости приложений (хаос-инженерия, capacity planning);
- Обеспечение безопасности инфраструктуры: управление секретами (Vault), сетевыми политиками, аудит доступа и соответствием стандартам
Требования:
- Высшее профессиональное (техническое) образование;
- Опыт работы в роли SRE/DevOps/системного инженера от 2 лет с фокусом на эксплуатацию распределенных систем;
- Глубокое понимание принципов проектирования отказоустойчивых систем и работы с метриками надежности (SLI/SLO);
- Практический опыт администрирования Kubernetes: настройка кластеров, operators, service mesh (Istio/Linkerd), управление ресурсами;
- Уверенное владение инструментами IaC: Ansible, Packer для управления инфраструктурой;
- Опыт работы с облачными платформами (AWS, GCP, Azure) будет плюсом;
- Навыки программирования/скриптинга для автоматизации (Go, Python или Bash) с пониманием асинхронных паттернов;
- Практический опыт настройки систем мониторинга и алертинга с фокусом на снижение шума и повышение actionable-метрик;
- Знание сетевых технологий (TCP/IP, DNS, HTTP/S, балансировщики) и умение проводить траблшутинг на всех уровнях стека;
- Понимание принципов безопасности: управление секретами, принцип минимальных привилегий, аудит и соответствие стандартам (ISO 27001, SOC 2);
- Опыт работы в командной среде с применением методологий ITIL/ITSM для управления инцидентами и изменениями;
Условия:
- Работа в динамично развивающейся компании с известным именем
- Конкурентная заработная плата
- Ежегодная премия по результатам работы
- Работа по ТК РФ
- Соц. пакет (питание, ДМС, страхование жизни)
- Гибридный график работы