Meta* представила модель для распознавания аудио в реальном времени — она способна расшифровывать речь 20 человек одновременно
Стоимость — $0,18 за час аудио.
Источник: скриншот vc.ru
- Компания рассказала про Muse Voice Transcribe — свою первую модель для расшифровки аудио в реальном времени, пишет 9To5Mac.
- Модель обучили на более чем 70 языках, из них на момент запуска расширенную проверку прошли 25. Среди них — английский, французский, немецкий, иврит, хинди, итальянский, японский, польский, тайский, турецкий и вьетнамский. Русского в списке нет.
- Muse Voice Transcribe поддерживает аудиозаписи длиной до часа, понимает, когда человек переключается между языками, умеет разделять голоса говорящих и определять, когда каждый из них закончил разговаривать. Всего она может расшифровывать речь до 20 человек одновременно.
- Модель обрабатывает звук блоками, и при каждом аудиофрагменте сама решает — преобразовать его в текст или продолжить «слушать». В компании называют это «адаптивной задержкой».
- Muse Voice Transcribe доступна через API. Стоиомость — $0,18 за час аудио или $3 за 1000 минут.
*Meta признана экстремистской и запрещена на территории России.