OpenAI、自社推論チップ「Jalapeño」の初ベンチマーク公開――電力当たり最大1.9倍と発表
※本記事は2026/08/26時点での情報を基にしており、閲覧時点では内容や状況が変わっている可能性があります。
OpenAIは8月25日(現地時間)、自社で設計した初の推論用チップ「Jalapeño」の性能測定結果を公開した。
3種類の公開モデルを走らせたところ、比較対象としたNVIDIA製システムに対して電力当たりのAI処理量が1.5~1.9倍に達し、応答が返り切るまでのエンドツーエンド遅延が1.7~3.6分の1になったとしている。
Jalapeñoは、OpenAIが半導体大手のBroadcomと共同で開発し、6月24日に発表したチップだ。発表の時点では最終的な性能を測定中としており、実機の数値が示されたのは今回が初めてとなる。TechCrunchによると、結果は半導体分野の技術会議Hot Chipsで公表された。
ただし、公開された数値はOpenAI自身による測定である。ベンチマークを開発した調査会社SemiAnalysisは、計測の実行をラボで直接確認したとしながらも、数値は全てOpenAIから提供されたものだと明記した。
OpenAIは年末までに自社の計算インフラにJalapeñoを展開し始める計画を示した。同時に、NVIDIAをはじめとするパートナーのアクセラレータについても、訓練と推論の両方で広く使い続けると発表文に明記している。
3モデルで測った電力当たり性能と遅延
測定に使われたのは、GPT-OSS 120B・DeepSeek R1 670B・Kimi K2.5 1Tの3モデルだ。OpenAI以外が開発したモデルを含めることで、特定のモデル専用の設計ではないことを示す構成になっている。
InferenceXで測った3つの公開モデル
ベンチマークにはInferenceXが使われた。これはSemiAnalysisが公開しているベンチマークで、AIへのリクエストを処理する一連の流れ全体を測る設計になっている。個々の演算の速さではなく、利用者に応答を返し切るまでの実務的な処理能力を対象とする点が特徴だ。
OpenAIによると、3モデルの全てでピークスループット時の電力当たり処理量が1.5~1.9倍に達し、エンドツーエンド遅延は1.7~3.6分の1になった。対話性の高い負荷に絞ると、性能差は2.1~4.1倍まで開いたという。
| モデル | 比較対象システム | 電力当たり処理量 | エンドツーエンド遅延 |
|---|---|---|---|
| GPT-OSS 120B | GB200(定格1,200W) | 約1.9倍(85,448対44,960) | 約1.7分の1(1.03秒対1.80秒) |
| DeepSeek R1 670B | GB300(定格1,400W) | 約1.7倍(19,641対11,781) | 約3.6分の1(1.65秒対5.99秒) |
| Kimi K2.5 1T | GB300(定格1,400W) | 約1.5倍(18,195対11,862) | 約3.4分の1(1.56秒対5.31秒) |
数値はOpenAIが公開した付録による。電力当たり処理量は1キロワット当たりの混合トークン毎秒で示されている。テストした3モデルのうち最大となるKimi K2.5 1Tでは、電力当たりのピーク性能が約1.5倍・エンドツーエンド遅延が約3.4分の1だった。
OpenAIは、社内テストで自社のフロンティアモデルを走らせた際には優位がさらに広がったとも述べている。ただし、その具体的な数値は公開されていない。
700Wと1,200~1,400Wという電力枠の前提
倍率の読み方には、正規化の方法が関わってくる。OpenAIは各アクセラレータの公表電力定格を使って結果をそろえたと説明した。Jalapeñoの定格は700Wで、測定した負荷での持続電力は550W以下にとどまったという。
比較対象となったNVIDIA製システムの定格は、GPT-OSS 120BがGB200の1,200W・DeepSeek R1とKimi K2.5がGB300の1,400Wである。つまり示された倍率の一部は、消費電力の枠が小さいチップを分母にそろえた結果として現れている。
OpenAIはこの点について、性能はチップ単位で報告されることもあるものの、電力単位当たりの性能のほうが有用な基準だと考えていると説明した。データセンターの制約が電力量に移りつつある現状を踏まえた主張といえる。
対話型の用途で広がった差
エージェント型の処理では、複数の手順を順番にこなすため、1ステップごとの遅れがタスク全体に積み上がる。OpenAIが対話性の高い負荷を重視して測定したのは、こうした用途を想定してのことだ。
より細かい指標では、トークンとトークンの間隔を示すTBTの最小値がGPT-OSS 120Bで約2.7分の1・DeepSeek R1で約4.1分の1になった。GPT-OSS 120Bを1人のユーザーへの生成速度に直すと、比較対象の毎秒535トークンに対してJalapeñoは毎秒1,459トークンに当たる。
比較対象が達成できた最良のTBTと同じ水準にそろえて測ると、スループットの差は53.7倍から104.3倍に達したという数字も示された。これは同じ応答速度を保ったまま何人を同時にさばけるかを示す比較であり、ピーク性能の倍率とは意味が違う。
推論専用に設計されたアーキテクチャ
Jalapeñoは、既存のAIアクセラレータを推論向けに調整したものではなく、白紙から設計したチップだとOpenAIは説明している。汎用性よりも、大規模言語モデルの推論という一点に絞った構造を採った。
もっとも、特定のモデル専用に焼き固めたチップではない。OpenAIは、モデル構造の変化に対応できることをアクセラレータの要件として挙げており、その柔軟性を設計に織り込んだと説明している。
プリフィルとデコードで異なるボトルネック
言語モデルの推論は、性質の異なる複数の段階を通る。入力されたプロンプトを処理するプリフィルは計算量が多く、応答を1トークンずつ生成するデコードはメモリー帯域の制約を強く受ける。
さらに、コアやチップの間でデータを動かす通信も遅延を生む。片方の段階に強いシステムでも、データの到着やモデル状態の受け渡しを待つ間に演算装置が遊び、優位を失うことがある。OpenAIはこの偏りをJalapeñoの設計課題として挙げた。
エージェント型の処理では、プリフィルとデコードの比重そのものが動く。OpenAIは、両方の段階で高い性能を出しつつ、その配分の変化に追随できる構成を狙ったと説明した。用途に合わせて演算・メモリー・ネットワークの組み合わせを切り替えられる点を、設計上の要点として挙げている。
KVキャッシュを手元に置く設計
対策として採られたのは、データの移動と通信の遅れを減らす構造だ。応答の生成中に使うKVキャッシュを含むモデル状態を、明示的に配置して手元に保持できるようにした。
KVキャッシュは、それまでに処理したトークンの中間結果を保存しておく仕組みである。これを遠いメモリーに置くと、1トークン生成するたびに読み出しが発生して遅延の原因になってしまう。The Registerは、Jalapeñoが大容量のSRAMキャッシュを備える可能性があると推測している。
ネットワークもアーキテクチャの一部として設計された。接続範囲を大きく取り、処理の全体を一つのつながったシステムの中に収めることで、データの移動そのものを減らす構成だ。
The Registerが伝えた仕様では、1ラックに128基のアクセラレータを搭載し、4ビット演算で1.7エクサFLOPS・HBM4を27.5テラバイト積む。チップ1基当たりではMXFP4形式で13.4ペタFLOPS・HBM4を216ギガバイト備えるという。
9カ月でテープアウトした開発工程
開発の工程にもAIが関わった。OpenAIは、初期設計から製造用のテープアウトまでを9カ月で終えたとし、実装案の探索と設計・測定・検証のループをAIで短縮した結果だと説明している。演算回路の最適化にもAIを使い、予定どおりの日程で演算性能を積み増せたという。
6月の発表の時点で両社は、この9カ月を高性能半導体で達成された最速のASIC開発サイクルだと位置づけていた。Broadcomのシリコン実装の知見とOpenAIのソフトウェア側の知見を並行して動かした体制が、その根拠として挙げられている。
AIが書きやすい構造を狙った設計
プログラミングの面でも、人間とAIの双方が扱いやすい構造を狙った。エンジニアが処理の内容を記述し、その配置やスケジューリングの最適化をAIに任せる分担だ。並列プログラミングの難しさに、AIが取り組みやすい形を与える意図がある。
CodexとGPT-Astraを使い、当初の生産計画に入っていなかったオープンウェイトモデル3本を2カ月で高い性能まで引き上げた事例も示された。GPT-OSSのアテンションとMixture of Expertsの一部ブロックでは、AIが生成した実装が人間の専門家による既存実装より1.5~1.8倍速く動いたという。
ただし、この数字は選んだブロックに限った話でありモデル全体の性能ではないと、OpenAI自身が注記している。新しいモデル系列に対応するには、依然として個別のカーネルと最適化が要るとも述べた。
測定条件をめぐる三つの留保
公開された数値を読む上では、いくつかの前提を押さえておく必要がある。ベンチマークを提供したSemiAnalysis自身も、Blackwellとの比較は不完全で公平とはいえない面があると自社の分析記事で認めた。
数値の出どころはOpenAI自身
SemiAnalysisは、InferenceXの実行をラボで直接確認したとしながらも、全ての数値はOpenAIから提供されたものだと明記した。第三者が立ち会った測定ではあるものの、完全に独立した検証という位置づけではない。
測定範囲にも限りがある。InferenceXの全項目を通したわけではなく、複数ターン・長文脈の負荷を対象とする「AgentX」の結果はまだ出ていないという。今回の条件は入力8,192トークン・出力1,024トークンという比較的軽い負荷であり、実運用で使われるルーターやプレフィックスキャッシュの仕組みは測定の対象外だ。
投機的デコードを外した比較
条件の非対称も残っている。Jalapeñoの結果は投機的デコード(speculative decoding)を使わない単一トークン予測で取得された一方、比較対象のNVIDIA製システムには複数トークン予測を使う構成の数値が当てられた。
投機的デコードは、先に複数のトークンをまとめて予測し、後から検証して確定させる高速化の手法だ。OpenAI側は、これを導入すればJalapeñoはさらに低コストでトークンを提供できるようになるとの見方を示した。裏を返せば、現時点の数値は同じ土俵での比較にはなっていない。
比較相手が現行世代にとどまる
比較対象はNVIDIAのGB200とGB300である。The Registerは、これらが2024年から2025年にかけての製品であり、想定される後継機ではない点を指摘した。SemiAnalysisも、同じHBM4を採用するVera Rubinのほうが適切な比較相手だと述べている。
同社の分析によると、Vera RubinとJalapeñoは1ドル当たりの出力トークン数がほぼ同水準になる。Jalapeñoが投機的デコードなしでその水準に届いている点は重く見られているものの、Rubin搭載システムはすでに顧客への出荷が始まっているのに対し、Jalapeñoはまだエンジニアリングサンプルの段階だ。
NVIDIAとの関係は切れていない
自社チップの性能公開は、NVIDIAからの離脱を意味するわけではない。OpenAIは発表文の中で、増え続けるAI需要には利用可能なあらゆる供給源からの計算資源が要るとして、NVIDIAほかパートナーのアクセラレータを訓練と推論の双方で広く展開し続けると明記した。
訓練用のGPU調達は続く
The Registerによると、Jalapeñoは推論に用途を絞ったチップであり、訓練には使われない。訓練と推論の両方を担うNVIDIAのRubinやAMDのMI455Xとは、設計の狙いそのものが異なる。用途を絞った分だけ推論では有利になる一方、訓練の負荷は引き続きGPUが引き受ける形だ。
推論だけでも計算需要は大きいため、自社チップの導入が進めば、NVIDIA製品が担う推論処理の一部を置き換える可能性はある。ただし訓練用のGPU需要が残る限り、調達関係そのものは維持される構図だ。
汎用性の面でも差は残っている。The Registerは、GPUが持つプログラミングの柔軟性を利点として挙げた上で、専用チップがその代わりを全面的に務められるかは別の問題だと指摘した。
オハイオの案件と1,050億ドルの与信支援
CNBCは、今回の発表をNVIDIAとの提携の終わりの始まりと見るべきではないと論じた。NVIDIAは8月17日の発表で、オハイオ州で進むデータセンター計画の土地・電力・建物に与信支援を提供すると表明している。
支援額については、CNBCが最大1,050億ドルと報じた。この計画の顧客はOpenAIで、NVIDIAが独占的な計算基盤の提供者となる。
自社設計のチップと、NVIDIAの資金を伴う大型調達が並行して進む。垂直統合を進めながらも、供給元としてのNVIDIAへの依存が当面続くという二重の構造が現れている。
Broadcomの2027会計年度見通しに与える意味
Jalapeñoの製造にはBroadcomが関わっており、同社にとっては受注の裏付けとなる。CNBCは、今回の結果がBroadcomの2027会計年度におけるAI関連売上高1,000億ドル超という見通しに、必要とされていた信頼性を加えるとの見方を示した。
6月の発表では、BroadcomのHock Tan最高経営責任者(CEO)が、OpenAIとの協業を今後10年のAIに必要な物理インフラを支える取り組みと位置づけ、多世代にわたるロードマップの始まりだと述べていた。
同氏は、2026年からMicrosoftほかのパートナーとギガワット規模のデータセンター展開を可能にするともしている。
第2世代が控えるロードマップと未検証の領域
OpenAIはJalapeñoを、多世代にわたるプラットフォームの第1世代と位置づけた。第2世代はすでに開発が深く進み、第3世代も形になりつつあるという。各世代で学んだことを積み上げ、効率と速度の両方を伸ばす計画だ。
量産までに残っている作業
展開に向けて、OpenAIは量産品質の確認・ソフトウェアの成熟・大規模運用の準備・より多くのモデルでの性能検証を続けているとした。TechCrunchによると、2026年末はごく少量の導入にとどまり、本格的な展開は2027年になる見通しだ。The Registerも量産の立ち上がりを2027年と伝えている。
OpenAIのハードウェア責任者Richard Ho氏は記者会見で、結果は最先端と比べて非常に大きな性能向上を示すと述べた。一方、TechCrunchは、Jalapeñoが本格展開される頃には競争環境が大きく進んでいる可能性を指摘した。
自社チップに挑んだ先例
SemiAnalysisは、コスト優位の一部がNVIDIAの高い利益率をBroadcomのより低い利益率に置き換えたことに由来すると分析した。その上で、MetaとMicrosoftのAI向けASIC計画が十分な立ち上がりに至っていない例を挙げ、コストだけで成功が決まるわけではないとの見方を示した。
ソフトウェアの成熟度についても、テンソル並列の構成を8日間で8分割から32分割に広げ、単一システムからラック規模へ拡張した速さを評価した。ただし、同社はソフトウェアがまだ最適化の途上にあるとも記している。設計したチップを大規模に運用し続けられるかどうかは、ベンチマークの数値とは別の問題として残る。
SemiAnalysisは、Jalapeñoが成功すれば、汎用的なコンパイラと洗練されたプログラミングモデルを重んじてきた業界の常識が問い直されるとも書いた。裏を返せば、その判定はまだ下っていない。
次に確かめられる論点
CNBCは、Broadcomの9月2日の決算発表で、Tan氏が売上の立ち上がりについて問われると予想した。カスタムチップとの競争は、NVIDIAの決算説明でも繰り返し取り上げられてきた論点である。
Jalapeñoが示した数値は、エンジニアリングサンプルの段階で、限られた条件のもとに測られたものだ。この優位が量産と大規模運用を経てどこまで残るのか、そして測定されていないエージェント型の長文脈負荷で何が起きるのかが、次に確かめられる点となる。
※出典:Jalapeño’s first results show industry-leading speed and efficiency in AI inference(OpenAI) / OpenAI and Broadcom unveil LLM-optimized inference chip(OpenAI) / NVIDIA Guarantees SB Energy’s PORTS-Pike Technology Campus in Ohio to Exclusively Host NVIDIA AI Compute(NVIDIA) / OpenAI’s Jalapeño chip is built for fast inference at scale, benchmarks show(TechCrunch) / OpenAI’s upcoming Jalapeño chip looks like it’ll be an inference beast(The Register) / OpenAI Jalapeño: Better Than Nvidia Blackwell(SemiAnalysis) / OpenAI says its Broadcom custom chip is a winner. What does that mean for Nvidia?(CNBC)