DevOps-инженер (Observability / GPU & AI Infrastructure) / Middle–Senior

Дата размещения вакансии: 03.08.2026
Работодатель: Центр информационных технологий Республики Татарстан
Уровень зарплаты:
з/п не указана
Город:
Казань
Спартаковская улица 2
Требуемый опыт работы:
От 3 до 6 лет

Обязанности: Развитие стека observability: Prometheus/VictoriaMetrics (long-term storage, vmagent/vminsert/vmselect), Loki + Promtail, Grafana Alloy, OpenTelemetry Collector, Tempo, Alertmanager.

– Настройка алертинга: SLO/SLI, разумные пороги, эскалации (без «шумных» алертов), интеграция с on-call (PagerDuty/Opsgenie/Telegram).

– Разворачивание и оптимизация vLLM на серверах с GPU A100/H100/B200 — NVLink, multi-GPU inference, батчинг, KV-cache tuning.

– Работа с AI-агентами: мониторинг их работы, логирование вызовов, трейсинг через OTel/Tempo, изоляция workload'ов через gVisor/runc RuntimeClass (безопасное исполнение недоверенного/агентского кода).

– Поддержка сетевого слоя: Cilium (CNI, Hubble, network policies), Traefik + Gateway API, желательно знание Istio (service mesh, mTLS, traffic shaping).

– Автоматизация через Ansible, управление Proxmox-виртуализацией (VM lifecycle, GPU passthrough, NUMA-тюнинг, шаблоны, HA).

– Диагностика инцидентов на всех уровнях стека: от control-plane Kubernetes до python/node.js-приложений.

Требования: Опыт работы в DevOps/SRE от 3 лет.

– Опыт с Kubernetes в production, развёртывание кластеров на bare-metal серверах.

– Глубокое знание Prometheus/VictoriaMetrics/Grafana/Loki, умение писать PromQL/LogQL.

– Опыт настройки алертинга без «alert fatigue» — приоритизация, дедупликация, роутинг.

– Понимание GPU-инфраструктуры: драйверы NVIDIA, GPU Operator, MIG/passthrough.

– Опыт деплоя LLM inference серверов (vLLM, TGI, Triton).

– Ansible на уровне идемпотентных playbook'ов, Proxmox API.

– Понимание Cilium/eBPF, Gateway API; Istio Service Mesh.

– Уверенный Linux (systemd, cgroups, iptables/nftables, дисковая и сетевая подсистема).

– Docker/containerd: сборка образов, дебаг контейнеров, работа с runtime-классами (runc, gVisor, kata).

– Умение дебажить Python-приложения (трейсбеки, py-spy, cProfile, asyncio/GIL-специфика).

– Умение дебажить Node.js-приложения (heap dump, CPU profile, event loop lag, memory leaks).

– Навыки низкоуровневой диагностики: strace/ltrace/tcpdump/perf.

– Понимание сетевых протоколов и инструментов для отладки проблем в кластерах.

Будет плюсом:

– Опыт с AI-агентами (LangChain,

LlamaIndex, кастомные оркестраторы) в

контексте инфраструктуры

– Опыт troubleshooting reliability проблем в

etcd/control-plane

– Опыт миграции с чистого Prometheus на

VictoriaMetrics

– Опыт работы с песочницами/sandbox-

исполнением кода (gVisor, Firecracker, Kata

Containers)

Условия: Официальное трудоустройство в соответствии с ТК РФ;

Стабильная «белая» заработная плата, выплаты два раза в месяц (5 и 20 число), уровень зарплаты обсуждается по итогам интервью;

Комфортный офис в центре города (новый айти-парк);

График работы, 5/2;

Поддержка профессионального развития;

Участие в конференциях и обучающих мероприятиях за счет компании;

Демократичный, молодой коллектив.

Неформальные встречи и корпоративные мероприятия.

Бронирование через военкомат при наличии военного билета (для военнообязанных) и айти-отсрочка.

Дресс-код casual