OpenAI представила архитектуру своей системы третьего поколения — GPT-Live. Главное нововведение заключается в переходе от поочередного общения к непрерывному потоковому взаимодействию. Модель теперь работает в полнодуплексном режиме: она способна одновременно слушать пользователя и генерировать ответ. Это устраняет неестественные паузы и делает общение с искусственным интеллектом максимально похожим на диалог двух людей.
Долгое время голосовые ИИ-системы строились на базе текстовых архитектур. Они работали по принципу строгой очереди: пользователь говорит, система ждет паузы, фиксирует конец реплики с помощью специального детектора, переводит речь в текст, генерирует ответ и только затем озвучивает его. Детектор окончания реплики был слабым звеном. Если он срабатывал слишком рано, ИИ перебивал человека. Если слишком поздно — возникала раздражающая пауза. GPT-Live полностью исключает этот детектор из цепочки обработки звука.
Diagram showing GPT-Live's realtime frontend voice model, asynchronous delegation to a backend reasoning model, tool use, and bidirectional audio with the user.
Чтобы добиться мгновенной реакции, инженерам пришлось кардинально перестроить архитектуру системы. Был создан четкий водораздел между медиа-потоком и бизнес-логикой. Аудио передается между клиентом и голосовой моделью по выделенному быстрому пути. Для этого сетевая часть была переписана с Python на язык Go, а в качестве транспорта выбран протокол WebRTC, который устойчив к потерям пакетов и изменениям сети.
Самое интересное техническое решение касается управления контекстом. Голосовые сессии могут длиться долго, и контекст неизбежно переполняется. Очистка и сжатие контекста требуют времени и сбрасывают кэш модели, что неминуемо привело бы к паузе в разговоре. OpenAI решила эту проблему изящно: система запускает новую копию модели в фоновом режиме, загружает в нее сжатый контекст, параллельно обрабатывает данные и бесшовно переключает аудиопоток на новую копию, когда та полностью готова.
Diagram showing a compact snapshot moving from inference server A to inference server B, where it is prefetched and caught up before the handoff.
Кроме того, архитектура GPT-Live разделяет процессы «говорения» и «глубокого мышления». Пока быстрая голосовая модель поддерживает легкую беседу, сложные задачи и использование инструментов асинхронно делегируются более мощным моделям, таким как GPT-5.5. Чтобы минимизировать задержки при таком делегировании, фоновая модель запускается и загружает базовый контекст еще в начале звонка. Таким образом, к моменту, когда потребуется сложный ответ, система уже готова к работе.
Этот релиз знаменует важный сдвиг в индустрии. Голосовой интерфейс перестает быть просто надстройкой над текстовым чатом. Разделение потоковой передачи звука и тяжелых вычислений открывает путь к созданию автономных ИИ-агентов, которые смогут управлять компьютером и выполнять длительные задачи в реальном времени, постоянно оставаясь на связи с пользователем. Время покажет, насколько легко эту архитектуру удастся масштабировать для миллионов одновременных сессий, но фундамент для нового поколения интерфейсов уже заложен.