Стажёр в команду NLP / RL (GigaChat )

Дата размещения вакансии: 20.08.2026
Работодатель: СБЕР
Уровень зарплаты:
з/п не указана
Город:
Москва
Требуемый опыт работы:
От 3 до 6 лет

Привет! Это GigaChat Reasoning — команда, которая даёт модели суперсилу размышлять. Мы придумываем среды, тренируем через online RL, ускоряем обучение и доводим решения до продакшна.

Направления

Улучшение GigaChat Reasoning: полный цикл обучения от холодного старта до вывода модели продакшн. Добавление новых доменов, создание датасетов и функций оценки ответов.

Развитие агентских навыков и tool calling с помощью Online RL: создание сред для обучения LLM, обучение и тестирование моделей.

Улучшение продукта Deep Research

На эти роли мы ищем талантливого NLP Engineer со знанием и опытом в Reinforcement Learning. Для всех этих экспериментов у нас есть кластер с большим числом A/H 100'ых.

Обязанности

  • Улучшать качество работы GigaChat Reasoning на русском и английском языках
  • Ускорять пайплайн обучения: профилирование узких мест, эффективный сэмплинг.
  • Тестировать новые Loss-функции и подходы к обучению
  • Помогать выводить в прод всё, что мы обучим.
  • Постоянно держаться up-to-date со свежими статьями.

Требования

  • Опыт в online RL и хорошие теоретические знания
  • Уверенное владение Python, PyTorch.
  • Знание базовых алгоритмов и математики.
  • Знания в DL, опыт обучения простых и больших моделей.
  • Опыт обучения моделей для продакшена.
  • Понимание текущего состояния эволюции больших LLM'ов.
  • Будет плюсом наличие публикаций.

Условия

  • Погружение в разработку самых современных NLP-систем.
  • Возможность совмещать учёбу и работу над реальными проектами.
  • По итогам стажировки — приглашение на Junior+ или Middle позиции.
  • Полная удалёнка: работай из любой точки России, где есть интернет.