Суть
Компания OpenAI опубликовала первые результаты тестирования своего специализированного чипа для логического вывода (inference) под названием Jalapeño. Данные показывают, что новая архитектура позволяет выполнять больше полезной работы на единицу потребляемой энергии, одновременно возвращая ответы быстрее. Чип успешно решает классическую проблему компромисса между высокой пропускной способностью и низкой задержкой, что критически важно для современных интерактивных систем.
Контекст
Исторически индустрия искусственного интеллекта полагалась на универсальные графические процессоры, которые отлично подходят для обучения моделей, но могут быть избыточными или недостаточно оптимизированными для их повседневного использования. По мере роста популярности автономных агентов, которым требуется выполнять множество последовательных шагов без задержек, потребность в специализированном оборудовании стала очевидной. Разработка собственного чипа позволяет OpenAI контролировать весь стек технологий — от алгоритмов до кремния.
Our commitment to Zero Data Retention as AI advances — card
Детали
Jalapeño тестировался не только на внутренних моделях OpenAI, но и на крупных открытых решениях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Результаты оказались впечатляющими:
- Чип обеспечивает от 1,5 до 1,9 раза больше выполненной работы на ватт при пиковой пропускной способности.
- Сквозная задержка (end-to-end latency) снизилась в 1,7–3,6 раза по сравнению с существующими коммерческими системами.
- Номинальное энергопотребление чипа составляет 700 ватт, однако в ходе тестов оно не превышало 550 ватт.
Примечательно, что в процессе создания чипа активно использовался сам искусственный интеллект. Модели OpenAI помогали проектировать арифметические цепи, писать код и оптимизировать работу ядра. Это позволило команде пройти путь от начального дизайна до выпуска тестового образца (tapeout) всего за девять месяцев.
Close-up of the Jalapeño inference chip mounted on a teal circuit board.
Анализ
Эти результаты подтверждают жизнеспособность стратегии вертикальной интеграции. Создавая оборудование, специально заточенное под особенности работы больших языковых моделей (LLM) — в частности, под фазы обработки промпта (prefill) и генерации токенов (decode) — OpenAI минимизирует задержки при передаче данных внутри системы.
Важно отметить, что компания не планирует полностью отказываться от оборудования партнеров, таких как NVIDIA. Однако наличие собственного высокоэффективного решения для логического вывода дает OpenAI мощный рычаг для снижения операционных расходов и масштабирования своих сервисов.
Перспектива
Развертывание Jalapeño в вычислительной инфраструктуре OpenAI должно начаться до конца текущего года. Это лишь первый шаг в долгосрочной стратегии: второе поколение чипов уже находится в активной разработке, а третье формируется на уровне концепции. Успешное внедрение таких специализированных решений неизбежно приведет к снижению стоимости использования передовых моделей для конечных пользователей и ускорит появление более сложных, многошаговых ИИ-агентов.