ИИ-помощник умеет отвечать на вопросы, пользоваться инструментами и выполнять задачи. Но как понять, что новая версия действительно стала лучше? Почему один сценарий работает хорошо, а в другом помощник ошибается? И что нужно изменить в модели или продукте, чтобы это исправить?
Ищем ML-аналитика, которому интересно разбираться в этих вопросах: исследовать поведение ИИ, придумывать способы измерения качества и помогать команде делать помощника полезнее.
Нам нужен ai-native специалист. Человек, для которого работа с ИИ - привычная часть решения задач. Вы умеете поручить агенту написание кода, собрать с его помощью исследовательский пайплайн, быстро проверить несколько гипотез и разобраться, где результату можно доверять. При этом постановка задачи, выбор метода и ответственность за вывод остаются за вами.
Обязанности
- Исследовать, как помощник справляется с реальными задачами пользователей: где ошибается, чего ему не хватает и какие улучшения дадут эффект.
- Создавать eval-наборы и бенчмарки, на которых можно проверить новые модели, промпты, скиллы и работу с инструментами.
- Развивать SBS и LLM-as-judge: учить автоматическую оценку замечать существенные различия и проверять её на человеческой разметке.
- Превращать найденные проблемы в гипотезы, данные для дообучения и понятные критерии приёмки.
- Связывать качество модели с качеством продукта: выяснять, какие изменения помогают пользователю решить свою задачу.
- Строить инструменты, которые позволяют команде быстрее исследовать качество и замечать регрессии.
Требования
- Вам интересно докопаться до причины ошибки и придумать эксперимент, который поможет её проверить.
- Вы умеете работать с неопределённостью: понимаете ограничения данных, замечаете слабые места в методе и можете объяснить, что следует из результата.
- У вас сильная база в статистике и анализе данных.
- Вы уверенно работаете с Python и SQL, можете прочитать, проверить и исправить код, созданный ИИ.
- Понимаете принципы работы LLM и хотите глубже разобраться в том, как оценивать модели и агентов.
- Вы уже используете кодинговых агентов в своей работе.
- Можете показать, как с их помощью решили исследовательскую задачу, автоматизировали процесс или собрали собственный инструмент.
- Нам интересен ваш подход: что вы поручили ИИ, как проверили результат и что получилось.
Условия
- комфортный современный офис рядом с м. Кутузовская
- гибридный формат работы
- ежегодный пересмотр зарплаты, годовая премия
- корпоративный спортзал и зоны отдыха
- система обучения для профессионального и карьерного развития
- расширенный полис ДМС с первого дня работы и страхование для семьи
- программа ипотеки для сотрудников
- вознаграждение за рекомендацию друзей в команду Сбер.