Jalapeño: первый чип OpenAI обходит NVIDIA на бумаге и молчит о сроках

OpenAI показала бенчмарки Jalapeño — inference-чипа на 700 Вт, который в 1.9 раз эффективнее Blackwell на ватт. Деплой — к концу 2026 года «в очень малых объёмах».

Источник: OpenAI


An engineer proudly holds a benchmark report beneath a giant green chip labeled Jalapeno.

Перец, который не жжёт. Пока

На конференции Hot Chips во вторник Ричард Хо, глава аппаратного направления OpenAI, произнёс фразу, от которой у NVIDIA должно было дёрнуться веко: «Результаты показывают очень, очень значительный прирост производительности по сравнению с state of the art».

State of the art, к которому Хо относится с таким пренебрежением, — это NVIDIA Blackwell. Конкретно GB200 на GPT-OSS 120B и GB300 на DeepSeek R1 и Kimi K2.5. Чип, который стоит $1 200 на ватт TDP, против Jalapeño, потребляющего 700 Вт (а по замерам — и вовсе 550 Вт при устойчивой нагрузке).

Если верить цифрам OpenAI, разница впечатляющая. На GPT-OSS 120B Jalapeño выдаёт 1,9-кратный прирост пиковой пропускной способности на киловатт и в 1,7 раза снижает end-to-end латентность. На Kimi K2.5 1T — в 3,4 раза быстрее ответ. На DeepSeek R1 — в 3,6 раза. На интерактивных нагрузках — до 4,1 раза.

Только есть одна деталь, которую Хо произнёс тем же спокойным тоном, — «in very small volumes» к концу 2026 года. Значительный деплой — 2027-й. То есть чип, который на бумаге громит всё существующее, появится в дата-центрах OpenAI в количестве, близком к статистической погрешности.

Четыре числа, которые стоит запомнить

Разберём бенчмарки по-честному, без маркетинговых слайдов.

GPT-OSS 120B (InferenceX, номинал 8K/1K): Jalapeño — 85 448 mixed TPS/kW против 44 960 у GB200. Латентность — 1,03 секунды против 1,80. На скорости 535 токенов в секунду на пользователя — 22 935 mixed/kW против 427. Разница — 53,7 раза. Это не «лучше». Это другая планета, если измерять в одной системе координат.

DeepSeek R1 670B (MXFP4): 19 641 против 11 781 mixed TPS/kW. Латентность — 1,65 против 5,99 секунды. На скорости 169 токенов/с/юзер — 12 258 против 118. Разница — 104,3 раза.

Kimi K2.5 1T (MXFP4): 18 195 против 11 862 mixed TPS/kW. Латентность — 1,56 против 5,31 секунды. На скорости 182 токенов/с/юзер — 6 744 против 120. Разница — 56,1 раза.

Все три модели — не openai-proprietary. Jalapeño одинаково хорошо работает и на своих, и на чужих моделях. Это важно: чип проектировали не под конкретную архитекру, а под инференс как таковой.

Семь сотен ватт, которые измерились в пятьсот пятьдесят

Одна из самых любопытных деталей — не сами бенчмарки, а методология замера. OpenAI утверждает, что оценивает производительность не «на чип», а «на ватт». Это другое измерение разговора.

Номинальный TDP Jalapeño — 700 Вт. Но при замерах чип стабильно потреблял 550 Вт или меньше на тестовых нагрузках. Это значит одно из двух: либо чип спроектирован с большим запасом по мощности, либо тесты не нагрузили его достаточно, чтобы выйти на паспортное потребление. Вероятно — и то, и другое.

Сравнение, напомним, идёт с GB200 (1 200 Вт TDP) и GB300 (1 400 Вт TDP). Если пересчитать на равное потребление, преимущество Jalapeño выглядит ещё более внушительно. Но именно поэтому NVIDIA не будет сидеть сложа руки: к моменту массового деплоя Jalapeño у Blackwell появятся наследники.

Чип, который проектировал чип

Одна из деталей, которую OpenAI упоминает почти вскользь, но которая стоит отдельного абзаца: Jalapeño проектировали с помощью AI. Предыдущие поколения моделей помогали команде пройти путь от первичного дизайна до tapeout за девять месяцев. AI оптимизировал арифметические схемы. А потом, после tapeout, этот же чип начали использовать для программирования самого чипа.

Для некоторых блоков внимания и MoE-слоёв в GPT-OSS AI-сгенерированные реализации работали в 1,5–1,8 раза быстрее написанных человеком экспертами. Команда использовала Codex с GPT-Astra и подняла три open-weight модели, которые изначально не входили в план производства Jalapeño, до высокой производительности за два месяца.

Это не просто красивая история про «AI помогает AI». Это рекурсия: чип, спроектированный при участии AI, программируется при помощи AI, чтобы обслуживать AI-модели. Если это не петля, то что тогда петля.

Full-stack и его подводные камни

Ричард Хо и Сара Фрайер (автор стратегического блога «The full stack behind abundant intelligence») настаивают на одном и том тезисе: Jalapeño — не просто чип, а часть full-stack системы, где модели, софт для инференса, память, сеть и железо проектируются вместе.

Звучит как маркетинговый лозунг, но за ним стоит конкретика. Jalapeño минимизирует перемещение данных и задержки коммуникации. KV-кэш можно явно размещать и удерживать локально, пока система комбинирует вычислительные, memory и сетевые ресурсы для каждой фазы инференса. Префилл упирается в вычисления, декод — в memory bandwidth, коммуникация добавляет латентность. Jalapeño пытается устранить все три узких места одновременно.

Но full-stack подход означает и full-stack зависимость. Если NVIDIA — это «купи лучшие чипы», то full-stack — это «спроектируй всё сам, неси ответственность за всё сам, чини всё сам». Google делает то же самое с TPU уже десятилетие. Amazon — с Graviton и Trainium. OpenAI входит в эту лигу впервые.

Что это значит для всех остальных

Прямо сейчас — практически ничего. Jalapeño появится в инфраструктуре OpenAI к концу 2026 года «в очень малых объёмах». Значимый деплой — 2027 год. Gen 2 уже в глубокой разработке, Gen 3 — «проявляется».

Для NVIDIA это сигнал, но не приговор. К моменту, когда Jalapeño достигнет массового масштаба, Blackwell уступит место следующему поколению. Гонка чипов — это не спринт, а марафон, в котором лидеры меняются каждые два-три цикла.

Для клиентов OpenAI это обещание: быстрее ответы, отзывчивее агенты, надёжнее доступ при растущем спросе. Обещание, подкреплённое цифрами, но не подкреплённое дата-центрами.

Для индустрии в целом — подтверждение тренда. Три крупнейших AI-компании (Google, Amazon, OpenAI) проектируют собственные чипы. NVIDIA по-прежнему доминирует, но её монополия на инференс впервые получает конкретную цифру на бенчмарке. И эта цифра — 53,7 раза быстрее на ватт в определённых задачах.

Краткий ответ

OpenAI представила первые бенчмарки Jalapeño — inference-чипа, разработанного совместно с Broadcom. На тесте InferenceX чип показывает 1,5–1,9× больше AI-работы на ватт и 1,7–3,6× ниже латентность по сравнению с системами на NVIDIA Blackwell. Чип спроектирован с помощью AI за девять месяцев, потребляет 550–700 Вт и поддерживает GPT-OSS, DeepSeek R1 и Kimi K2.5. Деплой в инфраструктуре OpenAI начнётся к концу 2026 года «в очень малых объёмах», значимый rollout — 2027 год.

← Все новости