OpenAI представила GPT-Live: полнодуплексная голосовая модель с делегированием задач

Новое поколение голосовых моделей ChatGPT получило архитектуру полного дуплекса и способность делегировать сложные вычисления модели GPT-5.5 в фоновом режиме.

Обновлено:
3 мин чтения
OpenAI представила GPT-Live: полнодуплексная голосовая модель с делегированием задач

Компания OpenAI анонсировала запуск GPT-Live — нового поколения голосовых моделей для ChatGPT. Главное нововведение заключается в переходе на полнодуплексную архитектуру (full-duplex), которая позволяет искусственному интеллекту одновременно слушать и говорить, делая взаимодействие максимально похожим на естественный человеческий диалог.

Долгое время голосовые интерфейсы страдали от технических ограничений. Первые версии голосового режима ChatGPT использовали каскадную систему: аудио переводилось в текст (STT), затем большая языковая модель (LLM) генерировала текстовый ответ, который снова переводился в аудио (TTS). Это приводило к задержкам и потере интонаций. Позже появился продвинутый голосовой режим (Advanced Voice Mode), который обрабатывал звук напрямую, но работал по принципу строгой очередности. Модель ждала тишины, чтобы начать говорить, и часто ошибочно прерывала пользователя из-за фонового шума или пауз на обдумывание.

GPT-Live решает эти проблемы с помощью двух ключевых архитектурных изменений.

ChatGPT Voice displaying a weather forecast for Denver, Colorado.

ChatGPT Voice displaying a weather forecast for Denver, Colorado.

Во-первых, модель обрабатывает входящий поток непрерывно, генерируя ответ в реальном времени. GPT-Live принимает решения несколько раз в секунду: продолжать слушать, вставить поддерживающее междометие, остановиться, если пользователь перебил, или начать полноценный ответ. Это устраняет жесткую поочередность диалога. ИИ теперь умеет ждать, если собеседник делает паузу, чтобы собраться с мыслями, и лучше фильтрует фоновый шум.

Во-вторых, OpenAI разделила задачи взаимодействия и глубокого мышления. GPT-Live отвечает исключительно за поддержание непрерывного и естественного разговора. Если запрос пользователя требует поиска в интернете, сложных рассуждений или выполнения многошаговых действий, GPT-Live делегирует эту задачу более мощной модели — GPT-5.5. Пока GPT-5.5 ищет информацию или решает задачу в фоновом режиме, GPT-Live продолжает поддерживать диалог с пользователем, не обрывая контекст. Доступны различные уровни рассуждений: от мгновенного (Instant) до среднего и высокого (Medium и High), когда системе требуется больше времени на анализ.

Помимо улучшенного звука, новый голосовой интерфейс получил визуальные элементы. В процессе разговора ChatGPT может отображать информационные карточки с погодой, котировками акций или спортивными результатами, дополняя голосовой ответ наглядными данными.

ChatGPT Voice displaying upcoming international football matches.

ChatGPT Voice displaying upcoming international football matches.

Особое внимание разработчики уделили безопасности. Поскольку генерация ответов происходит в реальном времени, встроенные защитные механизмы могут корректировать модель прямо во время ее речи. Если система фиксирует потенциально опасный вывод, она способна направить диалог в безопасное русло, вывести дополнительные предупреждения или завершить разговор в случаях высокого риска. Также внедрены специальные настройки родительского контроля для подростков.

Переход к архитектуре делегирования — важный шаг для всей индустрии. Это означает, что голосовой ИИ перестает быть просто интерфейсом для текстовой модели и становится самостоятельным диспетчером. В будущем такой подход позволит использовать голос для управления сложными автономными агентами (agentic work), которые будут выполнять длительные задачи, пока пользователь просто обсуждает с системой промежуточные результаты.

Развертывание моделей GPT-Live-1 и GPT-Live-1 mini для пользователей ChatGPT по всему миру уже началось. В ближайшее время OpenAI планирует открыть доступ к новинкам через программный интерфейс (API) для разработчиков и корпоративных клиентов.

ChatGPT Voice displaying a map with nearby soccer pubs.

ChatGPT Voice displaying a map with nearby soccer pubs.

Art Card 1x1

Art Card 1x1

Spend Controls_Artcard.png

Spend Controls_Artcard.png

TL;DR

Главное

OpenAI выпустила GPT-Live — голосовую модель, которая умеет одновременно слушать и говорить, а также делегировать сложные задачи GPT-5.5 без прерывания диалога.

Ключевые факты

  • /Архитектура полного дуплекса позволяет перебивать ИИ и делать паузы в речи.
  • /Разделение задач: GPT-Live ведет диалог, GPT-5.5 выполняет поиск и логические вычисления.
  • /Модель поддерживает визуальные карточки для отображения данных во время разговора.
  • /Внедрена модерация в реальном времени, способная корректировать ответ прямо во время генерации звука.

Инсайт

Разделение голосового интерфейса и логического движка (делегирование) превращает ИИ не просто в собеседника, а во фронтенд-менеджера, который управляет фоновыми агентами, пока развлекает пользователя беседой.

Источник:Openai

Читайте также

Гайды по теме