MLOps Engineer (Devops)

Дата размещения вакансии: 23.09.2026
Работодатель: RWB (Wildberries & Russ)
Уровень зарплаты:
з/п не указана
Город:
Москва
Требуемый опыт работы:
От 3 до 6 лет

Направление работы:

ML Platform – платформенная команда в отделе Trust & Safety Wildberries. Мы отвечаем за ML-инфраструктуру модерации контента и карточек товаров. Ежедневно через наши системы проходят десятки миллионов карточек – это сотни миллионов предсказаний по 100+ ML-моделям. Модели крутятся в Nvidia Triton Inference Server на GPU-кластере в нескольких дата-центрах; пиковая нагрузка на инференс – порядка 400–500K RPS, десятки инстансов Triton.

Исторически платформа выросла из модерации, сейчас становится самостоятельным юнитом и расширяется на все направления T&S. В отделе работают 50+ DS, и единой платформы для них пока нет. Мы это меняем – строим общую мультитенантную ML-платформу для всего отдела.

Ищем ML Infrastructure Engineer (MLOps) на инфраструктурный слой платформы: GPU-кластер, разделение ресурсов между командами, ML-тулинг, среда обучения, стандартизация пайплайнов.

Стань частью команды!

Вам предстоит:

  • Отвечать за GPU-кластер целиком: драйверы, GPU Operator, DCGM-мониторинг, утилизация, планирование ёмкости;

  • Выстроить стратегию разделения GPU между командами в гетерогенной среде, квоты и приоритеты;

  • Поднять единый Kubeflow и ClearML как стандарт для DS-команд отдела;

  • Оптимизировать inference-инфраструктуру - автоскейлинг GPU-нод, bin-packing, утилизация;

  • Строить инфраструктуру Embedding Store (pgvector, FAISS, qdrant);

  • Общаться с DS-командами, понимать их потребности и переводить в инфраструктурные решения;

  • Раскатать платформу на остальные команды Trust & Safety с полноценной мультитенантностью.

Формат работы - гибридный или удаленный по договоренности с руководителем.

Вы нам подходите, если:

  • Имеете глубокое понимание Kubernetes: операторы, scheduling, resource management, GPU в K8s (device plugin, GPU Operator);

  • Имеете практический опыт с NVIDIA GPU: драйверы и CUDA-стек, DCGM, MIG или time-slicing;

  • Имеете опыт развёртывания и поддержки MLOps-платформ для DS-команд (ClearML, MLflow, Kubeflow, Airflow или аналоги);

  • Владеете Linux и bare-metal, IaC (Ansible или Terraform), Helm;

  • Имеете опыт разработки на Python или Go: операторы, экспортеры, внутренний тулинг;

  • Умеете взаимодействовать с DS-командами и переводить потребности в технические решения;

Будет плюсом:

  • Опыт с Triton Inference Server, vLLM, KServe или аналогами;

  • Опыт разделения и виртуализации GPU в Kubernetes для multi-tenant окружений;

  • Понимание векторных БД и их оптимизации (pgvector, FAISS, Milvus);

  • Сторадж под данные обучения: S3, Ceph, NFS;

  • Multi-node training: NCCL, InfiniBand, RDMA.