з/п не указана
Альметьевск
улица Ленина 2
улица Ленина 2
От 1 года до 3 лет
Мы находимся на пике роста и прямо сейчас в поиске системного администратора.
Чем предстоит заниматься:
- Установка, настройка и обслуживание серверного оборудования (x86, GPU-серверы), систем хранения данных и сетевого оборудования.
- Администрирование сред виртуализации: VMware vSphere (ESXi, vCenter) и zVirt (платформа на базе oVirt).
- Управление ресурсами ВМ, настройка высокой доступности (HA), миграция (vMotion/Live Migration), работа со снапшотами и бэкапами.
- Проброс аппаратных ускорителей (PCIe Passthrough, SR-IOV, vGPU) в виртуальные машины.
- Развертывание, масштабирование и траблшутинг кластеров Kubernetes (On-premise).
- Подготовка и поддержка GPU-узлов в K8s: установка драйверов, настройка NVIDIA Container Toolkit / NVIDIA Device Plugin.
- Управление системами хранения для ML-задач: подключение высокоскоростных хранилищ (NFS, Ceph, Lustre или блочные СХД) к подам Kubernetes (CSI) для хранения тяжелых датасетов и чекпоинтов моделей.
- Обеспечение сетевой связности в кластере (Ingress, Network Policies, балансировка).
- Мониторинг инфраструктуры и ML-ворклоадов: настройка стека Prometheus + Grafana, сбор логов (ELK/EFK/Loki), контроль утилизации GPU (DCGM Exporter).
- Взаимодействие с командами Data Science и MLOps: помощь в упаковке моделей в контейнеры, выделение квот, решение проблем с нехваткой ресурсов.
Чтобы у нас все получилось, тебе нужны:
-
Наличие высшего образования (желательно в области информационных технологий).
- Опыт администрирования Linux-систем.
- Умение писать скрипты для автоматизации рутины (Bash, Python).
- Понимание сетевых технологий (TCP/IP, VLAN, Routing, DNS, DHCP).
- Готовность к быстрому освоению новых архитектурных решений.
- Опыт администрирования серверного оборудования и работы с IPMI / iLO / iDRAC.
- Понимание архитектуры и опыт коммерческого администрирования продуктов виртуализации.
- Понимание принципов работы аппаратных ускорителей (GPU), работы стека CUDA/cuDNN, опыт установки драйверов NVIDIA (Datacenter/Teslin).
- Опыт работы с системами хранения данных (СХД): iSCSI, Fibre Channel, NFS, SMB.
- Опыт администрирования K8s.
- Понимание архитектуры K8s (etcd, kubelet, API server, scheduler, control-plane).
- Опыт работы с Docker.
- Понимание принципов планировщика K8s (выделение ресурсов: requests/limits, node affinity, taints/tolerations) для распределения GPU-ресурсов между ML-задачами.
- Наличие профильных сертификатов.
- Опыт работы с отечественными операционными системами и системами виртуализации.
- Опыт работы с oVirt-системами, KVM.
- Опыт работы с распределенными файловыми системами (Ceph, GlusterFS).
- Опыт работы с системами управления конфигурациями (Ansible, Terraform).
- Понимание основ CI/CD (GitLab CI) для деплоя ML-моделей.