Senior ML Engineer (TTS)

Дата размещения вакансии: 17.09.2026
Работодатель: Sasha AI
Уровень зарплаты:
з/п не указана
Город:
Москва
Требуемый опыт работы:
От 3 до 6 лет

Добрый день!

Мы — Sasha AI, пионеры в разработке голосовых AI-агентов. Наша платформа позволяет запустить искусственный интеллект, который общается с клиентами по телефону и приносит выручку без операторов.

Мы выросли в 5 раз за год, а наша цель на 2026-й — оборот 400 млн ₽.

Наша маленькая цель: сделать передовую AI-технологию простой, окупаемой и доступной каждому крупному бизнесу.

Наша большая цель — за 10 лет построить монополиста, ассоциирующегося с искусственным интеллектом в России.

Каждый звонок проходит через речевой пайплайн: распознавание речи, определение автоответчика, синтез голоса. От качества и скорости этих моделей зависит, будет ли разговор звучать естественно. В эту команду мы ищем junior ML-инженера.

Чем предстоит заниматься

  • Владеть направлением TTS: определять техническую стратегию и роадмап, решать, что строим сами, а что берём из open-source, и защищать эти решения перед командой и бизнесом.
  • Проектировать и обучать собственную модель синтеза под наши требования: диалоговая русская речь, стриминг, телефонный канал, масштаб в тысячи одновременных звонков.
  • Добиваться человеческого звучания:
    • просодия и управление интонацией с учётом контекста диалога;
    • эмоции, паузы, филлеры, разговорный стиль.
  • Отвечать за latency и стоимость: time-to-first-audio в десятки миллисекунд, высокая плотность потоков на GPU, архитектура инференса вместе с backend- и MLOps-командами.
  • Строить data-стратегию: сбор и разметка данных, работа с дикторами, пайплайны фильтрации и выравнивания на больших объёмах, использование данных из реальных звонков.
  • Развивать voice cloning и кастомные голоса для клиентов, включая юридические и этические рамки.
  • Выстроить систему оценки качества, связанную с продуктовыми метриками: MOS/CMOS, автоматические метрики, A/B-тесты на живых звонках, влияние голоса на доходимость и конверсию.
  • Нанимать и развивать команду: менторить middle и junior-инженеров, проводить код-ревью и задавать инженерные стандарты.

Что мы ждём

  • Опыт от 5 лет в ML, из них от 3 лет в TTS или генерации речи.
  • TTS-системы, которые вы вывели в продакшен под реальной нагрузкой и за качество и latency которых отвечали.
  • Глубокое понимание современных подходов:
    • LLM-based TTS и нейрокодеки: EnCodec, DAC, Mimi, SNAC;
    • flow matching и диффузионные модели;
    • non-autoregressive архитектуры и вокодеры.
  • Опыт обучения моделей с нуля, а не только fine-tuning: дизайн архитектуры, масштабирование данных и вычислений, отладка нестабильного обучения.
  • Опыт оптимизации инференса: стриминг, батчинг, квантизация, TensorRT, Triton, vLLM или аналоги, профилирование на GPU.
  • Сильная экспертиза в русском языке для синтеза: нормализация, ударения, омографы, G2P.
  • Умение формулировать исследовательские гипотезы, быстро их проверять и принимать решения на основе метрик.
  • Опыт технического лидерства или менторства.

Будет плюсом

  • Опыт speech-to-speech и full-duplex моделей, а также диалоговых систем реального времени.
  • Опыт с zero-shot voice cloning и контролем стиля и эмоций.
  • Публикации (Interspeech, ICASSP, NeurIPS и др.) или заметные open-source проекты в области TTS.
  • Опыт с телефонией и кодеками.
  • Опыт мультиязычного синтеза.
  • Опыт построения ML-команды с нуля.

Что мы предлагаем

  • Роль технического лидера TTS с реальным влиянием на продукт и архитектуру.
  • Возможность создать собственную модель синтеза, а не только интегрировать чужие.
  • Прямую связь вашей работы с бизнес-метриками и выручкой.
  • Вычислительные ресурсы и данные под амбициозные эксперименты.
  • Возможность собрать и вырастить свою команду.