OpenAI выпустила GPT‑Live‑1 в API: теперь голосовой агент может слушать во время собственного ответа

OpenAI выпустила GPT‑Live‑1 в API: теперь голосовой агент может слушать во время собственного ответа

OpenAI открыла разработчикам GPT‑Live‑1 — модель, которая ведёт разговор без жёсткой очереди реплик. Она слышит человека, пока сама говорит, умеет спокойно реагировать на паузы и передаёт сложную работу отдельной модели или агенту.

В ChatGPT этот голос появился ещё 8 июля. А теперь компании могут встроить ту же механику в свои приложения, сайты и телефонные сервисы.

Почему прежние голосовые боты звучат неестественно

Большинство систем собрано из трёх частей: распознавание речи переводит звук в текст, языковая модель готовит ответ, синтезатор снова превращает его в звук. Такая схема работает, но каждый переход добавляет задержку и плохо переносит живую беседу.

Человек замолчал на секунду — бот уже отвечает. Человек уточнил вопрос — система продолжает старую фразу. GPT‑Live‑1 обрабатывает входящий и исходящий звук одним голосовым слоем и принимает такие решения прямо во время разговора.

Она может дать собеседнику подумать, пропустить короткое «ага», остановиться после настоящего перебивания или продолжить, если на фоне заговорил другой человек. OpenAI сообщает о приросте на 30 процентных пунктов в Full Duplex Bench относительно GPT‑Realtime‑2.1. Независимой проверки этого результата пока мало.

Одна система, два разных уровня работы

Сам GPT‑Live‑1 отвечает за живую беседу. Если запросу нужны поиск, расчёт, документы или действие в сервисе, он передаёт задачу backend-модели: например, быстрой Luna для простых операций или Astra для сложного разбора.

Пока вторая модель работает, голосовой слой может продолжать разговор. Пользователь не обязан молча ждать, пока закончится поиск или обращение к CRM.

Из этого получается понятная продуктовая схема: один интерфейс отвечает за темп и контакт с человеком, другой — за интеллект и инструменты. Её можно менять под задачу, не переделывая весь голосовой продукт.

Где это пригодится

Поддержка и телефония — самый готовый сценарий. Агент может принять звонок, уточнить детали, найти заказ, записать человека на услугу и передать сложный случай сотруднику. SIP поддерживается прямо в Live API.

В обучении важнее паузы. Сервис Speak сообщил, что в ранней оценке GPT‑Live‑1 почти на 80% реже перебивала учеников, когда они думали над ответом, чем прежняя система с отдельными репликами.

Ещё один класс продуктов — голосовой доступ к рабочим инструментам. Можно обсуждать код, документы или план, а подключённый агент выполняет задачу в фоне. В анонсе один из клиентов OpenAI сообщил, что переход с каскадной архитектуры сократил его кодовую базу на 80% и убрал 23 тысячи строк. Это результат конкретного проекта, не обещание для каждого внедрения.

Что получает разработчик

Тон, скорость и стиль речи задаются системной инструкцией. Есть встроенные транскрипты, текст ответа, подсказки для важных терминов и определение границ реплики. Для браузера можно использовать WebRTC, для серверной связи — WebSocket, для звонков — SIP.

Модель доступна как gpt-live-1 через v1/live/sessions. Она работает с текстом и аудио, поддерживает вызов функций, но не принимает изображения и видео. Структурированный вывод и дообучение сейчас недоступны.

Сколько это стоит

Голосовой слой стоит 0,05 доллара за минуту, причём время считается посекундно. Это 3 доллара за час непрерывной сессии.

Но 3 доллара — не цена готового агента. Backend-модель, поиск, другие инструменты и инфраструктура оплачиваются отдельно. Поэтому дешёвую модель имеет смысл оставлять на расписание и статусы заказов, а дорогую подключать только к задачам, где действительно нужно рассуждение.

Бесплатный API-уровень не поддерживается. На первом платном уровне разрешено до 25 одновременных сессий, дальше лимиты растут до 500.

Что я думаю

Главный продуктовый сдвиг не в том, что голос стал приятнее. OpenAI разделила естественный разговор и сложную работу на два слоя. Благодаря этому один голосовой интерфейс можно соединять с разными моделями, инструментами и даже сторонними системами.

Это делает голос полезнее обычного чата там, где человек занят, идёт, звонит или не хочет заполнять форму. Но хороший голос не исправит плохую базу знаний и неверные действия backend-агента. Проверять придётся всю цепочку.

📌 Итоги: главное за 1 минуту

• GPT‑Live‑1 теперь доступна через API для приложений, сайтов и телефонов.

• Модель слушает и говорит одновременно, поэтому естественнее реагирует на паузы и перебивания.

• Сложное рассуждение и действия выполняет отдельная backend-модель; голосовой слой поддерживает беседу.

• Цена — 0,05 доллара за минуту только за голос. Backend, поиск и инструменты оплачиваются отдельно.

• API не принимает изображения и видео, бесплатного уровня нет.

Про другие новые модели и практичные способы их подключения пишу в Telegram-канале PromtHubru + бесплатные способы пользоваться ИИ

11