Добрый день!
Мы — Sasha AI, пионеры в разработке голосовых AI-агентов. Наша платформа позволяет запустить искусственный интеллект, который общается с клиентами по телефону и приносит выручку без операторов.
Мы выросли в 5 раз за год, а наша цель на 2026-й — оборот 400 млн ₽.
Наша маленькая цель: сделать передовую AI-технологию простой, окупаемой и доступной каждому крупному бизнесу.
Наша большая цель — за 10 лет построить монополиста, ассоциирующегося с искусственным интеллектом в России.
Каждый звонок проходит через речевой пайплайн: распознавание речи, определение автоответчика, синтез голоса. От качества и скорости этих моделей зависит, будет ли разговор звучать естественно. В эту команду мы ищем junior ML-инженера.
Чем предстоит заниматься
- Владеть направлением TTS: определять техническую стратегию и роадмап, решать, что строим сами, а что берём из open-source, и защищать эти решения перед командой и бизнесом.
- Проектировать и обучать собственную модель синтеза под наши требования: диалоговая русская речь, стриминг, телефонный канал, масштаб в тысячи одновременных звонков.
- Добиваться человеческого звучания:
- просодия и управление интонацией с учётом контекста диалога;
- эмоции, паузы, филлеры, разговорный стиль.
- Отвечать за latency и стоимость: time-to-first-audio в десятки миллисекунд, высокая плотность потоков на GPU, архитектура инференса вместе с backend- и MLOps-командами.
- Строить data-стратегию: сбор и разметка данных, работа с дикторами, пайплайны фильтрации и выравнивания на больших объёмах, использование данных из реальных звонков.
- Развивать voice cloning и кастомные голоса для клиентов, включая юридические и этические рамки.
- Выстроить систему оценки качества, связанную с продуктовыми метриками: MOS/CMOS, автоматические метрики, A/B-тесты на живых звонках, влияние голоса на доходимость и конверсию.
- Нанимать и развивать команду: менторить middle и junior-инженеров, проводить код-ревью и задавать инженерные стандарты.
Что мы ждём
- Опыт от 5 лет в ML, из них от 3 лет в TTS или генерации речи.
- TTS-системы, которые вы вывели в продакшен под реальной нагрузкой и за качество и latency которых отвечали.
- Глубокое понимание современных подходов:
- LLM-based TTS и нейрокодеки: EnCodec, DAC, Mimi, SNAC;
- flow matching и диффузионные модели;
- non-autoregressive архитектуры и вокодеры.
- Опыт обучения моделей с нуля, а не только fine-tuning: дизайн архитектуры, масштабирование данных и вычислений, отладка нестабильного обучения.
- Опыт оптимизации инференса: стриминг, батчинг, квантизация, TensorRT, Triton, vLLM или аналоги, профилирование на GPU.
- Сильная экспертиза в русском языке для синтеза: нормализация, ударения, омографы, G2P.
- Умение формулировать исследовательские гипотезы, быстро их проверять и принимать решения на основе метрик.
- Опыт технического лидерства или менторства.
Будет плюсом
- Опыт speech-to-speech и full-duplex моделей, а также диалоговых систем реального времени.
- Опыт с zero-shot voice cloning и контролем стиля и эмоций.
- Публикации (Interspeech, ICASSP, NeurIPS и др.) или заметные open-source проекты в области TTS.
- Опыт с телефонией и кодеками.
- Опыт мультиязычного синтеза.
- Опыт построения ML-команды с нуля.
Что мы предлагаем
- Роль технического лидера TTS с реальным влиянием на продукт и архитектуру.
- Возможность создать собственную модель синтеза, а не только интегрировать чужие.
- Прямую связь вашей работы с бизнес-метриками и выручкой.
- Вычислительные ресурсы и данные под амбициозные эксперименты.
- Возможность собрать и вырастить свою команду.