✔ OpenAI представила новые модели распознавания речи
GPT Transcribe (https://developers.openai.com/api/docs/models/gpt-transcribe) предназначена для работы с аудиофайлами и обрабатывает их примерно в 34 раза быстрее реального времени.
GPT Live Transcribe (https://developers.openai.com/api/docs/models/gpt-live-transcribe) оптимизирована для потоковой расшифровки звука с минимальной задержкой.
Оба решения доступны через API, умеют учитывать текстовый контекст и заданные ключевые слова, а также поддерживают мультиязычный ввод.
По данным тестов Artificial Analysis на бенчмарке AA-WER, GPT Transcribe демонстрирует (https://artificialanalysis.ai/speech-to-text/non-streaming#error-rate-tabs) уровень ошибок в словах (WER) на отметке 3,3%. Это на 0,7 пп лучше результата ее предшественницы - GPT-4o Transcribe.
Несмотря на улучшенные метрики, изделие OpenAI пока не дотягивает до лидеров.
В рейтинге AA-WER первое место у Fun-Realtime-ASR-Preview от Alibaba Group с показателем 1,7% второе - у ElevenLabs Scribe v2 (2,2%), за ней следуют MAI-Transcribe-1.5 (2,4%), Mistral Voxtral Small (2,8%) и Gemini 3.1 Pro (2,8%).
Вместе с релизом OpenAI снизила тарифы - минута обработки аудио обойдется в $0,0045, а для GPT Live Transcribe - $0.017.