Inworld выпустила Realtime TTS-2

Модель вышла из исследовательского превью и заняла первое место в рейтинге Artificial Analysis. Задержка до начала генерации речи составляет около 100 мс.

Главная фишка Realtime TTS-2 в управлении голосом обычным текстом. Можно буквально написать, как именно произнести фразу, например говорить тепло, раздраженно, шепотом или сквозь зубы. Модель сама подстроит интонацию и подачу.

Поддерживается один и тот же голос более чем на 200 языках, профессиональное клонирование голоса, создание новых голосов по описанию и контекст нескольких реплик.

Параллельно вышла Realtime TTS-2 Flash. У нее задержка всего 25 мс до первого байта, а цена вдвое ниже основной модели.

По данным Inworld, Realtime TTS-2 уже используется в приложениях с сотнями миллионов пользователей, включая обучение языкам, игры, голосовых компаньонов, фитнес и поддержку клиентов.

11