Архитектура GPT-Live: как OpenAI реализовала непрерывное голосовое взаимодействие
Разбор новой полнодуплексной архитектуры голосового ИИ от OpenAI, которая устраняет задержки благодаря отказу от поочередного общения и асинхронному делегированию задач.

OpenAI представила архитектуру своей системы третьего поколения — GPT-Live. Главное нововведение заключается в переходе от поочередного общения к непрерывному потоковому взаимодействию. Модель теперь работает в полнодуплексном режиме: она способна одновременно слушать пользователя и генерировать ответ. Это устраняет неестественные паузы и делает общение с искусственным интеллектом максимально похожим на диалог двух людей.
Долгое время голосовые ИИ-системы строились на базе текстовых архитектур. Они работали по принципу строгой очереди: пользователь говорит, система ждет паузы, фиксирует конец реплики с помощью специального детектора, переводит речь в текст, генерирует ответ и только затем озвучивает его. Детектор окончания реплики был слабым звеном. Если он срабатывал слишком рано, ИИ перебивал человека. Если слишком поздно — возникала раздражающая пауза. GPT-Live полностью исключает этот детектор из цепочки обработки звука.

Diagram showing GPT-Live's realtime frontend voice model, asynchronous delegation to a backend reasoning model, tool use, and bidirectional audio with the user.
Чтобы добиться мгновенной реакции, инженерам пришлось кардинально перестроить архитектуру системы. Был создан четкий водораздел между медиа-потоком и бизнес-логикой. Аудио передается между клиентом и голосовой моделью по выделенному быстрому пути. Для этого сетевая часть была переписана с Python на язык Go, а в качестве транспорта выбран протокол WebRTC, который устойчив к потерям пакетов и изменениям сети.
Самое интересное техническое решение касается управления контекстом. Голосовые сессии могут длиться долго, и контекст неизбежно переполняется. Очистка и сжатие контекста требуют времени и сбрасывают кэш модели, что неминуемо привело бы к паузе в разговоре. OpenAI решила эту проблему изящно: система запускает новую копию модели в фоновом режиме, загружает в нее сжатый контекст, параллельно обрабатывает данные и бесшовно переключает аудиопоток на новую копию, когда та полностью готова.

Diagram showing a compact snapshot moving from inference server A to inference server B, where it is prefetched and caught up before the handoff.
Кроме того, архитектура GPT-Live разделяет процессы «говорения» и «глубокого мышления». Пока быстрая голосовая модель поддерживает легкую беседу, сложные задачи и использование инструментов асинхронно делегируются более мощным моделям, таким как GPT-5.5. Чтобы минимизировать задержки при таком делегировании, фоновая модель запускается и загружает базовый контекст еще в начале звонка. Таким образом, к моменту, когда потребуется сложный ответ, система уже готова к работе.
Этот релиз знаменует важный сдвиг в индустрии. Голосовой интерфейс перестает быть просто надстройкой над текстовым чатом. Разделение потоковой передачи звука и тяжелых вычислений открывает путь к созданию автономных ИИ-агентов, которые смогут управлять компьютером и выполнять длительные задачи в реальном времени, постоянно оставаясь на связи с пользователем. Время покажет, насколько легко эту архитектуру удастся масштабировать для миллионов одновременных сессий, но фундамент для нового поколения интерфейсов уже заложен.
TL;DR
Главное
Отказ от поочередного общения в пользу потоковой передачи данных позволил создать голосовой ИИ, который звучит естественно и реагирует без задержек.
Ключевые факты
- /Модель работает в полнодуплексном режиме: слушает и говорит одновременно.
- /Медиа-поток и сложная логика (обращение к GPT-5.5) разделены на независимые процессы.
- /Сжатие контекста происходит без пауз за счет параллельного запуска резервной копии модели.
- /Сетевая часть переписана с Python на Go с использованием протокола WebRTC.
Инсайт
Разделение процессов 'говорения' и 'мышления' позволяет ИИ поддерживать беседу, пока более мощная модель ищет ответ в фоновом режиме, маскируя технические задержки.







