Google выпустила Gemini 3.8 Flash TTS — ИИ-модель для синтеза речи, которая умеет клонировать голос пользователя
Можно создать голос и сгенерировать речь, а потом редактировать каждую реплику.
Источник: Shutterstock
- Всего Google представила две модели — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Обе позволяют создавать собственные голоса, настраивать отдельные реплики и генерировать диалоги для подкастов, игр, аудиокниг и других проектов.
- Gemini 3.8 Flash TTS предназначена для создания голосов персонажей и управления ими. С помощью текстовых запросов можно задать акцент и характеристики голоса более чем для 100 языков и диалектов, в том числе русского.
- Также в библиотеке доступно более 2000 готовых голосов, включая региональные варианты, — например, мексиканский испанский, квебекский французский и шотландский английский.
Источник здесь и далее: Google
- Google добавила возможность клонировать голос по 30-секундной аудиозаписи. Функция предназначена для собственного голоса или голоса, на использование которого получено право. Перед созданием копии система проверяет согласие владельца.
- Gemini 3.8 Flash-Lite TTS создана для «массового производства с минимальными затратами» — например, для дубляжа в больших объёмах или озвучки книг.
- После выбора голоса пользователь может управлять каждой репликой. Gemini может менять темп и характер исполнения, использовать шёпот и другие способы звуковой подачи, а также добавлять реакции — например, смех и вздохи.
- Модели доступны бесплатно, но с ограничениями, в Google AI Studio, где появился отдельный интерфейс для создания голосовых сценариев, а также через Gemini API.