AI / LLM Inference Engineer

Дата размещения вакансии: 06.08.2026
Работодатель: Ключевые ИТ Решения
Уровень зарплаты:
з/п не указана
Город:
Москва
Садовая-Каретная улица
Требуемый опыт работы:
Более 6 лет

ITKey разрабатывает инфраструктурные решения для крупных корпоративных заказчиков. Основной технологический контур компании: OpenStack, Kubernetes, Linux и инструменты автоматизации инфраструктуры.

Сейчас мы создаём новый продукт для запуска и эксплуатации AI-моделей на GPU-инфраструктуре заказчиков.

Ищем инженера с практическим опытом запуска готовых моделей на GPU. Основной фокус роли: подобрать конфигурацию, проверить её под нагрузкой, найти ограничения и настроить инференс под требования к скорости, стабильности и потреблению ресурсов.

Что предстоит делать:

  • запускать LLM и другие модели на GPU-инфраструктуре;
  • подбирать конфигурацию под модель, оборудование и профиль нагрузки;
  • работать с vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогичными решениями;
  • проводить бенчмарки и нагрузочное тестирование;
  • анализировать latency, throughput, TTFT, потребление GPU-памяти и загрузку ускорителей;
  • разбираться с OOM, низкой производительностью и нестабильной работой моделей;
  • настраивать batching, длину контекста, KV-cache, precision, quantization и parallelism;
  • участвовать в проработке продукта: определять необходимые параметры запуска, метрики и сценарии управления AI-нагрузками;
  • вместе с командами разработки и инфраструктуры запускать решение в контуре заказчика.

Что для нас важно:

  • практический опыт запуска и оптимизации моделей на GPU;
  • опыт работы хотя бы с одним inference engine: vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогом;
  • понимание влияния настроек инференса на latency, throughput и потребление GPU-памяти;
  • опыт проведения бенчмарков и анализа производительности;
  • умение диагностировать OOM, низкую загрузку GPU и деградацию производительности;
  • уверенная работа с Linux, Docker и Python;
  • понимание архитектуры современных LLM;
  • умение анализировать проблему по логам, метрикам и результатам тестов.

Будет плюсом:

  • опыт запуска Qwen, Llama, Mistral или других открытых моделей;
  • знание CUDA и инструментов профилирования GPU;
  • опыт работы с Kubernetes и GPU-операторами;
  • понимание MIG, MPS и других механизмов распределения GPU-ресурсов;
  • опыт построения ML- или AI-платформ;
  • опыт работы с OpenStack;
  • опыт в MLOps: model serving, CI/CD, мониторинг и autoscaling;
  • знание Prometheus, Grafana, GitLab CI, Terraform или Ansible.

Технологический контур:

OpenStack, Kubernetes, Docker, Linux, NVIDIA GPU, Python, Prometheus, Grafana, GitLab CI, Terraform, Ansible.

Условия:

— график работы 5/2 с возможностью удалённого участия( офис у м. Цветной бульвар)

— бессрочный трудовой договор.

— бонусная система, включая проектные премии.

— ДМС, программы психологической поддержки.

— компания оплачивает обучение и сертификацию.

— преимущества работы в IT-компании.