OpenAI представила GPT-5.6: как оптимизация инфраструктуры снизила стоимость ИИ
OpenAI выпустила семейство моделей GPT-5.6, сфокусировавшись на радикальном снижении стоимости вычислений за счет оптимизации инференса и работы агентов.
OpenAI выпустила семейство моделей GPT-5.6, сфокусировавшись на радикальном снижении стоимости вычислений за счет оптимизации инференса и работы агентов.
3 мин

Компания OpenAI представила новое семейство больших языковых моделей (LLM) — GPT-5.6. В этот раз фокус разработчиков сместился с простого наращивания вычислительной мощности на достижение максимальной эффективности. Главная цель обновления — предоставить больше полезного интеллекта на каждый потраченный доллар.
В условиях, когда спрос на вычислительные мощности растет быстрее, чем их предложение, эффективность становится ключевым фактором выживания для ИИ-компаний. Обслуживание миллиарда активных пользователей требует не только умных, но и экономичных моделей. OpenAI подошла к решению этой задачи комплексно, оптимизировав каждый уровень своей инфраструктуры: от архитектуры моделей до инференса (процесса генерации ответов) и систем управления агентами.
Линейка GPT-5.6 включает три модели. Флагманская GPT-5.6 Sol превосходит конкурентов в задачах программирования более чем в два раза дешевле. Модель Terra показывает результаты на уровне GPT-5.5 за половину стоимости, а самая быстрая версия Luna обходится на 80% дешевле флагмана.

Diagram showing GPT-5.6 efficiency across the agent harness, API orchestration, and model inference, producing less network data, less CPU work, and more GPU output.
Наиболее интересная часть обновления касается того, как именно были достигнуты эти показатели. OpenAI использовала саму модель GPT-5.6 Sol для автономной оптимизации собственного кода. Модель анализировала производственный трафик, тестировала новые стратегии балансировки нагрузки и переписывала ядра (низкоуровневое программное обеспечение для GPU) на языках Triton и Gluon. Только эти изменения позволили снизить затраты на обслуживание на 20%.
Еще один важный метод оптимизации — спекулятивное декодирование (speculative decoding). Этот подход использует небольшую «черновую» модель, которая быстро предлагает варианты следующих токенов, а основная, более крупная модель, лишь проверяет их. GPT-5.6 Sol самостоятельно провела сотни экспериментов над архитектурой своей черновой модели, что увеличило эффективность генерации токенов более чем на 15%.
Разработчики также переработали систему управления агентами (agentic harness) для продуктов Codex и ChatGPT Work. При выполнении сложных задач агенты часто совершают десятки запросов, передавая один и тот же контекст. Чтобы избежать раздувания контекста (context bloat), система теперь использует отложенное обнаружение инструментов — они загружаются только тогда, когда действительно нужны.

Rockset > Art Card
Для экономии вычислений OpenAI оптимизировала кэширование промптов (prompt caching). Теперь вся история взаимодействия с моделью работает только на добавление (append-only). Это позволяет системе не пересчитывать уже обработанный текст при каждом новом запросе агента, что критически важно для многошаговых задач.
Релиз GPT-5.6 показывает важный сдвиг в индустрии. Гонка за размером моделей сменяется гонкой за эффективностью систем в целом. Интеллект ИИ теперь измеряется не только качеством ответов, но и тем, сколько вычислительных ресурсов требуется для их получения.
В перспективе такие оптимизации откроют путь к созданию по-настоящему автономных агентов. Когда стоимость одного шага рассуждений снижается в несколько раз, разработчики могут позволить ИИ совершать сотни и тысячи итераций для решения одной сложной задачи, не разоряясь на оплате облачных вычислений.
OpenAI выпустила GPT-5.6 с акцентом на снижение стоимости вычислений, оптимизировав всю инфраструктуру — от ядер GPU до кэширования контекста агентов.
Самый впечатляющий аспект релиза — использование самой модели GPT-5.6 для оптимизации собственного программного обеспечения и архитектуры, что замыкает цикл самосовершенствования ИИ-инфраструктуры.