Gemini 3.8 Live умеет говорить и выполнять действия параллельно: что проверить до запуска голосового агента

15 сентября Google анонсировала две голосовые модели Gemini 3.8 Live, а 17 сентября обновила материал. Они могут продолжать разговор, пока в фоне выполняются вызовы инструментов и API. Для бизнеса это не означает «подключил — и получил оператора». Ниже — различия моделей, честные границы доступности и учебный сценарий приёмки оборудования с семью проверками перед запуском.

Gemini 3.8 Live умеет говорить и выполнять действия параллельно: что проверить до запуска голосового агента

Это разбор официального анонса Google, а не мой тест моделей. Учебный осмотр ниже вымышлен и нужен, чтобы показать, какие условия стоит задать до подключения модели к реальному процессу. Источник: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/

◆ Две модели для разных типов работы

Google представила не одну универсальную Gemini, а две модели с разными приоритетами.

Gemini 3.8 Live рассчитана на масштаб и экономичность. В официальном анонсе Google ей приписаны плавный диалог, визуальный контекст, обработка визуальных входов почти в реальном времени и автоматическое переключение между 97 поддерживаемыми языками прямо во время разговора. Модель также может запускать инструменты и вызовы API в фоне, не прерывая общение.

Gemini 3.8 Live Extended Thinking предназначена для более сложных многошаговых задач. По описанию Google, она может рассуждать и говорить параллельно: сначала коротко подтвердить запрос, затем голосом сообщать о ходе фоновых шагов, пока выполняются инструменты и асинхронные вызовы.

Это различие важно на практике. Если голосовой агент должен прочитать метку, найти карточку и подготовить один акт, более сложная модель сама по себе не делает процесс надёжнее. Сначала нужны строгие границы задачи, проверяемые инструменты и понятный момент подтверждения. Extended Thinking стоит оценивать там, где действительно есть несколько связанных шагов и исключений, а не выбирать автоматически из-за слова Thinking.

◆ Что означают заявленные цифры — и чего они не означают

Для Extended Thinking Google приводит такие результаты:

Показатель Значение в анонсе Что можно из него заключить
Speech to Speech Quality Index 82,6 Модель заняла первое место в указанной версии индекса по данным, которые приводит Google
τ-Voice 68,6% Результат на бенчмарке выполнения агентских голосовых задач
τ-Voice-banking 35,1% Результат на банковском наборе задач Sierra
Big Bench Audio 97,7% Результат на аудиозадачах этого бенчмарка

Это опубликованные Google показатели со ссылками на соответствующие бенчмарки. Я их не воспроизводил. Они не говорят, сколько реальных осмотров закончатся правильным актом, как модель справится с шумом и бликами или сколько ошибочных действий совершит интеграция.

Для решения о запуске полезнее собственная сквозная проверка: услышала ли система нужные данные, вызвала ли правильный инструмент, получила ли подтверждение человека, записала ли один результат и честно ли обработала тайм-аут.

◆ Доступность зависит от сценария и аккаунта

Фразы «анонсирована» и «уже доступна всем» здесь не равны. В разделе о доступности Google разделяет разработчиков, предприятия и обычных пользователей:

Для разработчиков обе модели заявлены в Gemini API и Google AI Studio.
Для предприятий Google указывает private preview в Gemini Enterprise и будущую доступность в Gemini Enterprise for Customer Experience.
Для Extended Thinking отдельно упомянут будущий выпуск для бизнес-клиентов Google Workspace.
Для обычных пользователей 3.8 Live заявлена в Search Live.
Extended Thinking раскатывается в Gemini Live. Доступ в Workspace зависит от продукта и тарифа: в анонсе Docs указан для подписчиков Google AI Pro и Ultra, а Gmail и Keep — для подписчиков Google AI.

Перед проектированием процесса стоит открыть нужный продукт и проверить конкретный аккаунт, регион и модель. Планируемая доступность не заменяет фактическую.

Google также пишет, что всё аудио, создаваемое её ИИ-продуктами, получает незаметный водяной знак SynthID. Это полезная техническая метка, но она не заменяет уведомление участника, правила записи аудио, защиту персональных данных и контроль действий агента.

◆ Учебный сценарий: приёмка оборудования голосом и камерой

Представим вымышленный сервисный центр «Контур-Техника». Сотрудник принимает оборудование на ремонт с телефоном в руках: показывает шильдик и повреждение камерой, а голосовой агент помогает найти карточку устройства и подготовить акт осмотра. Это проектный пример, а не запись реальной работы Gemini.

Агенту доступны четыре учебных инструмента:

lookup_asset — найти карточку по подтверждённому серийному номеру;
check_warranty — вернуть статус гарантии и правила приёмки;
create_inspection — создать акт с подтверждёнными полями и приложенными кадрами;
notify_supervisor — передать человеку сводку, если номер не найден или правила противоречат друг другу.

Агенту нельзя самому устанавливать причину поломки, одобрять гарантийный ремонт или списание, снимать документы и лица без необходимости либо создавать акт до подтверждения сотрудника.

Учебный диалог мог бы выглядеть так:

Сотрудник: Принимаю ноутбук. На шильдике номер похож на SN-84B7, но последняя цифра бликует.

Агент: Не буду угадывать. Наклоните камеру и прочитайте последние четыре символа вслух.

Сотрудник: 84B7.

Агент: Ищу карточку SN-84B7. Пока идёт проверка, покажите повреждение корпуса общим планом и крупно.

Сотрудник: Трещина у левой петли, экран включается.

Агент: Карточка найдена. Перед созданием акта сверим: серийный номер SN-84B7, трещина у левой петли, экран включается, приложены два кадра. Создать акт с этой формулировкой?

Сотрудник: Подтверждаю.

В этом сценарии разговор и сбор наблюдений продолжаются, пока выполняются lookup_asset и check_warranty. Необратимый для процесса шаг create_inspection запускается только после сводки и явного подтверждения. Если ответ инструмента задержался, агент сообщает, что результата ещё нет, сохраняет один ключ операции и передаёт случай руководителю. Успехом считается полученный номер акта, а не фраза модели «готово».

Семь проверок перед запуском
1. Ограничьте роль и назначьте владельца решения

Запишите, что агент может наблюдать, читать и предлагать, а что решает сотрудник или руководитель. Для приёмки оборудования агент готовит данные, но не определяет причину поломки, гарантийность или списание.

Критерий приёмки: для каждого результата есть разрешённое действие, уточняющий вопрос или эскалация. Решения с материальными последствиями закреплены за человеком.

◆ 2. Проверьте фактическую доступность модели

Убедитесь, что нужная версия видна в вашем аккаунте и продукте, а выбранный способ доступа подходит для предполагаемой нагрузки. Private preview и coming soon нельзя записывать в готовую архитектуру как уже работающую функцию.

Критерий приёмки: команда может открыть нужную модель именно тем способом, который будет использоваться в пилоте.

◆ 3. Испытайте голос и изображение на своих условиях

Поддержка 97 языков и визуального контекста не означает одинаковое качество при шуме, бликах, движении камеры и мелком шрифте. Соберите набор с серийными номерами, похожими символами, повреждениями при разном свете, быстрым произношением и перебиваниями.

Критерий приёмки: критические поля человек читает или подтверждает явно; при неясном кадре агент просит другой ракурс, а не угадывает.

◆ 4. Отделите фоновый поиск от изменения учётной системы

Пока агент ищет карточку или правила гарантии, сотрудник может описывать повреждение. Создание акта требует отдельного состояния операции. Для каждого вызова нужны уникальный ключ, тайм-аут и правило повторения.

Критерий приёмки: один осмотр не создаёт два акта даже после обрыва связи или повторного вызова API.

◆ 5. Поставьте подтверждение перед необратимым шагом

Перед созданием или изменением акта агент повторяет серийный номер, наблюдение, статус включения и список вложений, затем просит явное подтверждение. Согласие продолжить осмотр ещё не подтверждает запись в системе.

Критерий приёмки: в журнале видно, какую сводку услышал сотрудник и после какой реплики было выполнено действие.

◆ 6. Ограничьте данные и честно сообщите о формате работы

Собирайте только то, что нужно для акта. Заранее определите, попадают ли в кадр люди и документы, сколько хранится аудио, изображения и текст, кто имеет доступ и как удалить ошибочно снятый кадр.

Критерий приёмки: агент не просит лишние документы и не сохраняет лица без необходимости; правила уведомления и хранения проверены владельцем процесса.

◆ 7. Оценивайте завершённую задачу и держите откат

Средняя задержка и приятный голос важны, но не показывают, создан ли правильный акт. Для пилота считайте долю корректно подтверждённых полей, ошибочных записей, дублей, эскалаций и кадров, которые пришлось переснять. Начинайте с одного типа оборудования и сохраняйте обычную ручную приёмку.

Критерий приёмки: известен порог остановки пилота, а отключение агента не останавливает приёмку.

◆ Как выбрать между Live и Extended Thinking

Начните с карты процесса, а не с таблицы бенчмарков.

Короткий маршрут «прочитать метку → найти карточку → подтвердить один акт» сначала стоит проверять на 3.8 Live.
Осмотр с несколькими инструментами, зависимостями и необходимостью объяснять ход фоновой работы — кандидат для сравнения с Extended Thinking.
Если задача не укладывается в явные состояния и правила подтверждения, более сильное рассуждение не исправит сам процесс.

Обе модели стоит сравнивать на одном наборе осмотров и по одинаковым критериям. Победитель — не тот, кто звучит увереннее, а тот, кто чаще выполняет разрешённую задачу без лишних действий и честно передаёт исключения человеку.

Фоновая работа во время разговора делает голосового агента удобнее. Надёжным его делает другое: узкая роль, проверяемые инструменты, подтверждение перед действием и понятный выход к ответственному сотруднику.

Какое действие в вашем процессе вы бы никогда не разрешили голосовому агенту без отдельного подтверждения человека? В следующем практическом разборе покажу, как составить небольшой набор реальных условий для приёмки без выдуманных «идеальных сценариев».

22