Cartesia выпустила синтезатор речи, вышедший на первое место у Artificial Analysis

Стартап из Стэнфорда представил Sonic-3.6 - модель синтеза речи реального времени на архитектуре моделей пространства состояний (SSM).

Sonic-3.6 возглавила (https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice) сразу два рейтинга Artificial Analysis. В категории Controlled Voice, где синтезаторы гоняют на восьми одинаковых эталонных голосах, она обошла Eleven v3 от ElevenLabs.

Задержка до первого аудиокадра, по заявлению компании, меньше 90 мс. Есть управление темпом, громкостью и эмоциями, теги экспрессии внутри запроса и свои словари произношения с транскрипцией IPA. Голос клонируется по десятисекундному фрагменту.

Модель работает через API и в Cartesia Playground (https://play.cartesia.ai/). Для проб есть бесплатный тариф, платные подписки (https://www.cartesia.ai/pricing) начинаются от 5 долларов в месяц. cartesia.ai (https://www.cartesia.ai/launch)

Этот выпуск был озвучен моделью Sonic-3.6 в сервисе Cartesia.

2