Meta выпустила Muse Voice Transcribe

Это первая модель для распознавания аудио от Meta Superintelligence Labs. Она превращает речь в текст прямо во время разговора, определяет, кто именно говорит и понимает момент, когда человек закончил фразу.

Модель обучена более чем на 70 языках, 25 из них тщательно протестированы. Она понимает смешивание нескольких языков даже внутри одного предложения и может учитывать имена, термины и другой контекст, чтобы реже ошибаться.

Muse Voice Transcribe поддерживает записи длиной больше часа и более 20 собеседников без дополнительной обработки. По данным Meta, модель заняла первое место в рейтинге Artificial Analysis среди систем потокового распознавания речи и лидирует на открытых тестах по определению говорящих.

Модель уже доступна через Meta Model API, Meta AI для Mac и Muse Code. Голосовой ввод в последних двух сервисах теперь работает именно на ней.