Архитектура GPT-Live: как OpenAI реализовала непрерывное голосовое взаимодействие

Разбор новой полнодуплексной архитектуры голосового ИИ от OpenAI, которая устраняет задержки благодаря отказу от поочередного общения и асинхронному делегированию задач.

Обновлено:
3 мин чтения
1 просмотров
Архитектура GPT-Live: как OpenAI реализовала непрерывное голосовое взаимодействие

OpenAI представила архитектуру своей системы третьего поколения — GPT-Live. Главное нововведение заключается в переходе от поочередного общения к непрерывному потоковому взаимодействию. Модель теперь работает в полнодуплексном режиме: она способна одновременно слушать пользователя и генерировать ответ. Это устраняет неестественные паузы и делает общение с искусственным интеллектом максимально похожим на диалог двух людей.

Долгое время голосовые ИИ-системы строились на базе текстовых архитектур. Они работали по принципу строгой очереди: пользователь говорит, система ждет паузы, фиксирует конец реплики с помощью специального детектора, переводит речь в текст, генерирует ответ и только затем озвучивает его. Детектор окончания реплики был слабым звеном. Если он срабатывал слишком рано, ИИ перебивал человека. Если слишком поздно — возникала раздражающая пауза. GPT-Live полностью исключает этот детектор из цепочки обработки звука.

Diagram showing GPT-Live's realtime frontend voice model, asynchronous delegation to a backend reasoning model, tool use, and bidirectional audio with the user.

Diagram showing GPT-Live's realtime frontend voice model, asynchronous delegation to a backend reasoning model, tool use, and bidirectional audio with the user.

Чтобы добиться мгновенной реакции, инженерам пришлось кардинально перестроить архитектуру системы. Был создан четкий водораздел между медиа-потоком и бизнес-логикой. Аудио передается между клиентом и голосовой моделью по выделенному быстрому пути. Для этого сетевая часть была переписана с Python на язык Go, а в качестве транспорта выбран протокол WebRTC, который устойчив к потерям пакетов и изменениям сети.

Самое интересное техническое решение касается управления контекстом. Голосовые сессии могут длиться долго, и контекст неизбежно переполняется. Очистка и сжатие контекста требуют времени и сбрасывают кэш модели, что неминуемо привело бы к паузе в разговоре. OpenAI решила эту проблему изящно: система запускает новую копию модели в фоновом режиме, загружает в нее сжатый контекст, параллельно обрабатывает данные и бесшовно переключает аудиопоток на новую копию, когда та полностью готова.

Diagram showing a compact snapshot moving from inference server A to inference server B, where it is prefetched and caught up before the handoff.

Diagram showing a compact snapshot moving from inference server A to inference server B, where it is prefetched and caught up before the handoff.

Кроме того, архитектура GPT-Live разделяет процессы «говорения» и «глубокого мышления». Пока быстрая голосовая модель поддерживает легкую беседу, сложные задачи и использование инструментов асинхронно делегируются более мощным моделям, таким как GPT-5.5. Чтобы минимизировать задержки при таком делегировании, фоновая модель запускается и загружает базовый контекст еще в начале звонка. Таким образом, к моменту, когда потребуется сложный ответ, система уже готова к работе.

Этот релиз знаменует важный сдвиг в индустрии. Голосовой интерфейс перестает быть просто надстройкой над текстовым чатом. Разделение потоковой передачи звука и тяжелых вычислений открывает путь к созданию автономных ИИ-агентов, которые смогут управлять компьютером и выполнять длительные задачи в реальном времени, постоянно оставаясь на связи с пользователем. Время покажет, насколько легко эту архитектуру удастся масштабировать для миллионов одновременных сессий, но фундамент для нового поколения интерфейсов уже заложен.

Comparison of the vanilla WebRTC handshake and WebRTC with WARP, showing WARP making media and data ready in fewer round trips.

Comparison of the vanilla WebRTC handshake and WebRTC with WARP, showing WARP making media and data ready in fewer round trips.

GPT-5.6 efficiency article — art card

GPT-5.6 efficiency article — art card

Rockset > Art Card

Rockset > Art Card

Tax Agent > Art Card

Tax Agent > Art Card

TL;DR

Главное

Отказ от поочередного общения в пользу потоковой передачи данных позволил создать голосовой ИИ, который звучит естественно и реагирует без задержек.

Ключевые факты

  • /Модель работает в полнодуплексном режиме: слушает и говорит одновременно.
  • /Медиа-поток и сложная логика (обращение к GPT-5.5) разделены на независимые процессы.
  • /Сжатие контекста происходит без пауз за счет параллельного запуска резервной копии модели.
  • /Сетевая часть переписана с Python на Go с использованием протокола WebRTC.

Инсайт

Разделение процессов 'говорения' и 'мышления' позволяет ИИ поддерживать беседу, пока более мощная модель ищет ответ в фоновом режиме, маскируя технические задержки.

Источник:Openai

Читайте также

Гайды по теме