Московское центральное кольцо станция Москва-Сити
Bitmanager.ai - AI-стартап в одной из самых быстрорастущих категорий conversational AI agents.
Мы создаёт платформу для голосовых и текстовых AI-агентов в клиентских коммуникациях: продажах, поддержке, консультациях и debt collection.
Наши агенты работают с данными, обращаются к внутренним системам компаний, вызывают инструменты и ведут диалог в рамках заданных бизнес-сценариев.
Мы развиваем мультиязычные голосовые решения и самостоятельно дообучаем модели, чтобы расширять количество поддерживаемых языков и повышать качество работы продукта.
Сейчас нам нужен человек, который возьмёт на себя одно из ключевых направлений - всю систему подготовки данных для AI/ML-моделей
Главный результат работы - стабильно качественные данные и масштабируемая методология их подготовки для разных моделей, языков и проектов.
Это не роль классического project manager. Нам нужен человек, который понимает, как состав, объём и качество данных влияют на результат работы модели, умеет самостоятельно проектировать процессы и отвечать за конечный результат.
Чем предстоит заниматься
- Отвечать за качество данных и методологию их подготовки для AI/ML-проектов;
- Выстроить полный цикл работы с данными: сбор, поиск, закупку, подготовку, разметку, верификацию и приёмку;
- Совместно с ML-инженерами определять требования к составу, объёму и качеству датасетов;
- Выбирать оптимальную модель работы: внутренняя команда, подрядчики, краудсорсинг, фриланс или гибридный подход;
- Формировать команду, привлекать аннотаторов, языковых и предметных экспертов;
- Ставить задачи внешним исполнителям и контролировать сроки, качество и результат;
- Разрабатывать инструкции, стандарты разметки, критерии оценки и правила приёмки данных;
- Внедрять механизмы контроля качества и регулярно улучшать их;
- Проверять приобретаемые и получаемые от партнёров датасеты до их использования в обучении моделей;
- Анализировать ошибки в данных и результатах моделей, находить системные причины проблем и корректировать подход;
- Автоматизировать ручные этапы разметки, проверки и приёмки;
- Координировать работу по разным языкам и направлениям;
- Переносить успешные процессы между проектами и расставлять приоритеты с учётом качества, сроков и доступных ресурсов;
- Работать вместе с ML-инженерами, языковыми специалистами и продуктовыми командами.
Что для нас важно
- Опыт построения или существенной перестройки процессов подготовки и разметки данных для AI/ML-проектов;
- Опыт работы с несколькими этапами data lifecycle: сбором, закупкой, разметкой, верификацией и приёмкой датасетов;
- Умение самостоятельно проектировать процесс и выбирать модель работы с учётом качества, скорости, стоимости и доступных ресурсов;
- Практическое понимание того, как состав, объём и качество данных влияют на обучение и результат AI/ML-моделей;
- Опыт построения систем контроля качества, разработки инструкций и обучения исполнителей;
- Опыт управления аннотаторами, подрядчиками, экспертами или распределёнными командами;
- Умение находить системные причины проблем и улучшать процесс, а не только исправлять отдельные ошибки;
- Способность самостоятельно вести направление, принимать решения в условиях неопределённости и отвечать за конечный результат;
- Умение работать на стыке data operations, ML и people management;
- Знакомство с Label Studio, Toloka, Scale AI или другими платформами разметки;
- Хороший русский и английский язык для работы с командой, документацией и подрядчиками;
- Готовность работать из офиса в Москве.
Опыт с конкретным языком или речевыми данными не обязателен. Для нас важнее умение выстраивать процессы, глубоко разбираться в методологии и быстро осваивать новые типы данных.
Будет плюсом
- Опыт подготовки речевых и аудиоданных для ASR, TTS и других Speech AI-задач;
- Опыт работы с данными для LLM, conversational AI и AI-агентов;
- Опыт подготовки мультиязычных датасетов;
- Опыт закупки и приёмки внешних данных, выбора подрядчиков и управления их работой;
- Опыт автоматизации разметки и построения human-in-the-loop или model-assisted labeling процессов;
- Понимание метрик качества аннотации, включая inter-annotator agreement и acceptance rate;
- Опыт работы с golden sets, honeypot-задачами, double annotation и выборочными проверками;
- Опыт внедрения современных инструментов подготовки и контроля качества данных.
Если тебе нравится скорость, короткие циклы и возможность напрямую влиять на продукт, тебе у нас будет комфортно.