Meta* представила модель для распознавания аудио в реальном времени — она способна расшифровывать речь 20 человек одновременно

Стоимость — $0,18 за час аудио.

Источник: скриншот vc.ru 
Источник: скриншот vc.ru 
  • Компания рассказала про Muse Voice Transcribe — свою первую модель для расшифровки аудио в реальном времени, пишет 9To5Mac.
  • Модель обучили на более чем 70 языках, из них на момент запуска расширенную проверку прошли 25. Среди них — английский, французский, немецкий, иврит, хинди, итальянский, японский, польский, тайский, турецкий и вьетнамский. Русского в списке нет.
  • Muse Voice Transcribe поддерживает аудиозаписи длиной до часа, понимает, когда человек переключается между языками, умеет разделять голоса говорящих и определять, когда каждый из них закончил разговаривать. Всего она может расшифровывать речь до 20 человек одновременно.
  • Модель обрабатывает звук блоками, и при каждом аудиофрагменте сама решает — преобразовать его в текст или продолжить «слушать». В компании называют это «адаптивной задержкой».
  • Muse Voice Transcribe доступна через API. Стоиомость — $0,18 за час аудио или $3 за 1000 минут.

*Meta признана экстремистской и запрещена на территории России.

6
3
2