OpenAI анонсировала режим Ultrafast для своей передовой модели GPT-5.6 Sol. Благодаря партнерству с производителем специализированных чипов Cerebras, скорость генерации достигает 750 токенов в секунду, что до 14 раз быстрее стандартной обработки. Это важное событие для индустрии, так как оно устраняет фундаментальный компромисс между высоким интеллектом модели и скоростью ее ответа.
OAI AdsTest Blog ArtCard 1x1
Долгое время в разработке приложений на базе больших языковых моделей (LLM) существовало негласное правило: если нужна скорость и низкая задержка, приходится выбирать компактные или узкоспециализированные модели. Передовые системы работали медленно из-за колоссального объема вычислений при выводе (inference). Это жестко ограничивало их применение в сценариях реального времени, таких как синхронные голосовые помощники, высокочастотный трейдинг или экстренное реагирование на системные сбои.
Новый сервис доступен через API OpenAI в рамках ограниченного предварительного тестирования. Ключевым технологическим фактором стала интеграция решений от компании Cerebras, чьи процессоры архитектурно отличаются от традиционных графических ускорителей и созданы специально для минимизации задержек при работе с нейросетями. Достигнутая скорость в 750 выходных токенов в секунду позволяет модели генерировать текст быстрее, чем человек способен его читать, что критически важно для машинного взаимодействия. Первые корпоративные клиенты, такие как Jane Street и Podium, уже тестируют технологию в финансовом анализе и голосовых интерфейсах.
Партнерство OpenAI и Cerebras — это сильный сигнал для всего рынка аппаратного обеспечения, где традиционно доминирует NVIDIA. Использование альтернативных архитектур для специфических задач доказывает, что диверсификация инфраструктуры может приносить ощутимые продуктовые результаты. Для бизнеса появление режима Ultrafast означает возможность внедрять самый сложный ИИ в процессы, чувствительные ко времени. Например, при сбое серверов инженеры могут мгновенно анализировать гигабайты логов, а в электронной коммерции — удерживать клиента персонализированными ответами до того, как он покинет страницу.
По мере масштабирования мощностей Cerebras доступ к режиму Ultrafast будет расширяться. В долгосрочной перспективе мы наблюдаем формирование новой бизнес-модели на рынке API: тарификация не только за объем знаний (размер модели), но и за скорость их доставки. Это неизбежно подтолкнет разработчиков к созданию совершенно новых классов программного обеспечения, где искусственный интеллект работает не как асинхронный консультант, а как полноправный и мгновенный участник рабочих процессов.