Google выкатила революционные Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking

Первая — для скорости и масштаба. Вторая — для сложных задач, где нужно думать и говорить одновременно. Gemini 3.8 Live - здесь

Google выкатила революционные Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking

В чём разница, если убрать маркетинг

Gemini 3.8 Live — это разговорный интерфейс. Она обрабатывает визуальный ввод почти в реальном времени, переключается между 97 языками прямо посреди разговора, и — вот это важно — выполняет вызовы инструментов и API в фоне, не прерывая беседу. Вы просите что-то проверить, модель говорит «сейчас посмотрю» и продолжает болтать, пока задача выполняется. Цена: $0,84 за час входящего аудио (или $0.005 за минуту на входе, $0.018 на выходе).

Gemini 3.8 Live Extended Thinking — это reasoning-система, которая умеет говорить. Она рассуждает и говорит одновременно. Пока идёт многошаговая задача, модель комментирует прогресс: «Так, проверяю…», «Осталось ещё два шага». Тишины в трубке нет. Но за это удовольствие вы платите $3,50 за час — в четыре с лишним раза больше.

Почему это важнее, чем кажется

Gemini 3.8 Live - здесь

Раньше голосовые агенты падали в одной и той же точке: пользователь задаёт сложный вопрос, агент замолкает на 20 секунд, уходит думать, потом возвращается с ответом — или с ошибкой. Разговор разваливался.

Extended Thinking решает это не тем, что «думает быстрее», а тем, что не замолкает. Она выдаёт короткие вербальные сигналы, пока работает. Это не косметика. Это разница между «агент сломался» и «агент работает» в голове пользователя.

Но есть инженерная цена. С turnComplete: true больше не означает, что модель закончила. Сервер может продолжать фоновое рассуждение или вызов инструментов. Клиент обязан слушать interaction_status: IN_PROGRESS или IDLE. Синхронные блокирующие вызовы функций не поддерживаются — только асинхронные. Если ваш бэкенд не умеет жить с этим — Extended Thinking сломает вам продакшн.

Цифры, которые Google не прячет

На Artificial Analysis Speech-to-Speech Quality Index Extended Thinking заняла первое место с 82.6, обойдя GPT-Live-1-Astra и Grok Voice Think Fast 2.0. Базовая 3.8 Live — пятая с 76.0.

Разрыв — 6.6 пункта. Цена — в четыре раза выше. Это и есть всё решение: вы платите за то, чтобы агент не замолкал на сложных задачах.

На τ-Voice Extended Thinking набрала 68.6%, на τ-Voice-banking — 35.1%, на Big Bench Audio — 97.7%. Базовая 3.8 Live — второе место на Speech Agent Arena и первое на EVA-Bench от ServiceNow.

Где это можно потрогать

Обычные пользователи получают 3.8 Live в Search Live — голосовой поиск. Extended Thinking — в Gemini Live (приложение Gemini). Подписчики AI Pro и Ultra — в Gmail, Google Docs и Keep. Разработчики — в Gemini API и AI Studio. Корпоративные клиенты — через Gemini Enterprise.

Весь генерируемый звук получает водяной знак SynthID.

Google не выпустила «одну модель получше». Она выпустила две, и выбор между ними — не про качество. Он про то, какой у вас продукт: быстрый разговорный интерфейс или агент, который берёт сложную задачу и не заставляет пользователя сомневаться, жив ли он ещё.

Gemini 3.8 Live - здесь

22