Руководитель ИТ инфраструктуры и эксплуатации

Дата размещения вакансии: 22.07.2026
Работодатель: Банки.ру
Уровень зарплаты:
з/п не указана
Город:
Москва
Одесская улица 2кА
Требуемый опыт работы:
не требуется

Чем предстоит заниматься:

Стратегия и управление

  • Разработка и внедрение стратегии развития ИТ-эксплуатации и инфраструктуры;
  • Формирование и управление бюджетом отдела (CAPEX/OPEX), контроль затрат на облачные сервисы, оборудование, лицензии;
  • Планирование мощностей, модернизация и вывод инфраструктуры из эксплуатации.

Команда и процессы

  • Руководство командой из 23 инженеров: найм, онбординг, развитие, мотивация, оценка эффективности;
  • Построение и оптимизация процессов эксплуатации: мониторинг, инцидент- и проблем-менеджмент, change management, автоматизация CI/CD для инфраструктуры;
  • Внедрение и развитие практик SRE и DevOps-культуры совместно с командой разработки;
  • Выстраивание процессов поддержки (L0–L2) и клиентского сервиса.

Техническая эксплуатация и безопасность

  • Обеспечение SLA/SLO бизнес-критичных сервисов;
  • Резервное копирование, disaster recovery, отказоустойчивость систем;
  • Информационная безопасность инфраструктуры (патчинг, конфигурация, соответствие политикам);
  • Управление облачной и физической инфраструктурой.

Взаимодействие

  • Тесная работа с руководителями разработки, продукта, информационной безопасности и бизнес-подразделений.
  • Отчётность перед руководством по ключевым метрикам, инцидентам и исполнению бюджета.

AI-платформа (будет плюсом)

  • Эксплуатация и развитие внутренней AI-инфраструктуры: LiteLLM, LibreChat, MCP-серверы, n8n;
  • Обеспечение доступности и безопасности компонентов AI-платформы;
  • Управление доступом к языковым моделям: маршрутизация запросов, контроль расходов, квоты.

Требования:

  • Опыт в эксплуатации ИТ-инфраструктуры от 10 лет, из них от 5 лет — на руководящей позиции;
  • Глубокие технические знания: облачные платформы, Linux/Windows-серверы, сети, виртуализация, контейнеризация (Docker, Kubernetes);
  • Опыт построения процессов эксплуатации с нуля или их существенного развития: инцидент-менеджмент, мониторинг (Prometheus, Grafana, Zabbix), CI/CD;
  • Понимание принципов DevOps, SRE и Infrastructure as Code (Terraform, Ansible);
  • Навыки управления бюджетом и планирования;
  • Опыт найма, развития и оценки сотрудников
  • Знание Python/Bash для скриптинга и автоматизации;
  • Готовность к работе в условиях неопределённости и высокой нагрузки (в моменты инцидентов);
  • Будет плюсом: практический опыт с AI/LLM-инструментами (создание AI-агентов, работа с LLM-шлюзами, автоматизация через AI).