OpenAI открыла доступ к GPT-Live-1 через программный интерфейс (API). Это модель, которая способна одновременно слушать и говорить, обеспечивая так называемую полнодуплексную связь (full-duplex). Разработчики теперь могут создавать голосовых агентов, которые ведут себя естественно в диалоге: их можно перебивать, они адекватно реагируют на паузы пользователя и игнорируют фоновый шум.
Традиционно голосовые помощники строились по каскадной архитектуре. Сначала речь пользователя переводилась в текст (STT), затем большая языковая модель (LLM) генерировала ответ, который после этого озвучивался системой синтеза речи (TTS). Каждая передача данных между этими этапами добавляла задержку. Разработчикам приходилось писать сложный и хрупкий код для обработки ситуаций, когда человек перебивает бота или меняет тему разговора на лету.
Now everyone can put data to work — card image
GPT-Live-1 решает эту проблему, обрабатывая входящее и исходящее аудио в рамках единой системы. По заявлениям первых тестировщиков, это позволяет радикально упростить архитектуру. Например, один из медицинских стартапов сообщил о сокращении кодовой базы на 80%. Стоимость использования переднего голосового слоя составляет 0.05 доллара за минуту разговора. Важной технической особенностью стала возможность модели делегировать сложные логические задачи фоновым текстовым моделям, таким как новая GPT-6 Astra или более быстрым и дешевым аналогам.
Переход к такой архитектуре меняет экономику разработки голосового искусственного интеллекта. Разделение системы на универсальный голосовой «фронтенд» (GPT-Live-1) и вариативный «бэкенд» (модель для логики) позволяет гибко оптимизировать затраты. Для простых рутинных задач, вроде подтверждения записи или бронирования столика, разработчик может подключить к голосовому слою легкую и дешевую модель. Для сложных технических консультаций — мощную. При этом качество самого голосового интерфейса, интонации и скорость реакции остаются стабильно высокими. Встроенная поддержка телефонии указывает на прямой прицел компании на рынок корпоративных колл-центров.
В ближайшие годы мы, вероятно, увидим массовый отказ от классических пошаговых голосовых ботов, которые заставляют пользователя ждать звукового сигнала перед ответом. Интерфейсы станут более плавными, а граница между разговором с человеком и алгоритмом по телефону продолжит стираться. Успех этой технологии на практике будет зависеть от того, насколько стабильно связка из нескольких моделей сможет удерживать контекст в длинных сессиях и справляться с интеграцией во внутренние базы данных компаний.