з/п не указана
Москва
От 3 до 6 лет
Ключевые задачи:
- Поддержка кластеров (GPU/TPU), контейнеризации и оркестрации (Docker, Kubernetes);
- Аудит, оптимизация инфраструктуры и затрат (batch vs real-time inference, разграничение проблем железа и кода);
- Настройка мониторинга, алертинга и менеджмент железа между потребителями;
- Развертывание и поддержка ML-сервисов (MLflow, Airflow, CVAT, Doccano) в production;
- Настройка CI/CD для ML-пайплайнов и управление полным ML lifecycle (training -> serving).
Требования:
- Опыт DevOps от 3х лет или MLOps от 1 года, с эксплуатацией продакшен-систем;
- Уверенный Linux: администрирование, отладка, права доступа;
- Коммерческий опыт с Kubernetes и Docker на уровне эксплуатации: deployments, ресурсные лимиты, autoscaling, оптимизация образов;
- GPU-инфраструктура: NVIDIA stack, CUDA, драйверы, профилирование;
- Написание скриптов на Python и Bash на уровне автоматизации и интеграций;
- Понимание жизненного цикла ML-моделей: как их обучают и как применяют;
- Понимание процессов построения и эксплуатации ML pipelines: этапов обучения, вывода в продакшн и дальнейшего сопровождения моделей;
- Опыт работы с системами ML Serving: Triton, vLLM, Airflow (или аналоги), batch и async/sync model serving;
- Опыт работы с Postgres, Redis, Kafka;
- Навыки настройки и эксплуатации стека для ML и Data Science: MLflow, DVC и аналоги.
Будет плюсом, если есть опыт с:
- Знание инструментов: Argo, Helm, Terraform, Ansible, S3;
- Опыт работы с RBAC, Keycloak, LDAP/OAuth, работа с сертификатами;
- Опыт работы с Prometheus, Grafana, ELK или аналоги, настройка алертинга.