Привет! Это GigaChat Reasoning — команда, которая даёт модели суперсилу размышлять. Мы придумываем среды, тренируем через online RL, ускоряем обучение и доводим решения до продакшна.
Направления
Улучшение GigaChat Reasoning: полный цикл обучения от холодного старта до вывода модели продакшн. Добавление новых доменов, создание датасетов и функций оценки ответов.
Развитие агентских навыков и tool calling с помощью Online RL: создание сред для обучения LLM, обучение и тестирование моделей.
Улучшение продукта Deep Research
На эти роли мы ищем талантливого NLP Engineer со знанием и опытом в Reinforcement Learning. Для всех этих экспериментов у нас есть кластер с большим числом A/H 100'ых.
Обязанности
- Улучшать качество работы GigaChat Reasoning на русском и английском языках
- Ускорять пайплайн обучения: профилирование узких мест, эффективный сэмплинг.
- Тестировать новые Loss-функции и подходы к обучению
- Помогать выводить в прод всё, что мы обучим.
- Постоянно держаться up-to-date со свежими статьями.
Требования
- Опыт в online RL и хорошие теоретические знания
- Уверенное владение Python, PyTorch.
- Знание базовых алгоритмов и математики.
- Знания в DL, опыт обучения простых и больших моделей.
- Опыт обучения моделей для продакшена.
- Понимание текущего состояния эволюции больших LLM'ов.
- Будет плюсом наличие публикаций.
Условия
- Погружение в разработку самых современных NLP-систем.
- Возможность совмещать учёбу и работу над реальными проектами.
- По итогам стажировки — приглашение на Junior+ или Middle позиции.
- Полная удалёнка: работай из любой точки России, где есть интернет.