Google представила Gemini 3.5 Transcribe — свою «самую точную» модель для преобразования речи в текст

И открыла её для разработчиков.

Результаты в бенчмарке, который оценивает способности моделей для распознавания речи и аудио на нескольких языках. Чем меньше показатель, тем лучше. Источник: Google
Результаты в бенчмарке, который оценивает способности моделей для распознавания речи и аудио на нескольких языках. Чем меньше показатель, тем лучше. Источник: Google
  • Модель уже используют в приложении Gemini для macOS (на английском языке) и в функции Rambler на клавиатуре Gboard на Android (в некоторых странах, поддерживает русский), рассказала компания.
  • Теперь доступ открыли для разработчиков в режиме публичного превью через Gemini API в Google AI Studio и на платформе Google Antigravity. Для компаний — на Gemini Enterprise Agent Platform. «Скоро» компания планирует добавить модель в браузер Chrome — пользователь сможет надиктовывать текст в «любом веб-поле».
  • Gemini 3.5 Transcribe поддерживает «умную» транскрибацию: понимает, когда пользователь корректирует сам себя, удаляет слова-паразиты и автоматически форматирует текст.
  • Модель распознаёт жаргон и уникальные варианты написания благодаря словарю пользователя, поддерживает более 85 языков и может определить речь до трёх говорящих в предзаписанных аудио (поддержку распознавания большего количества говорящих тестируют).
Gemini 3.5 Transcribe в Rambler на Android. Источник: Google
15
2
1