OpenAIが自社設計の推論チップ「Jalapeño」の初回ベンチマーク結果を公開した。既存のNvidia GB200/GB300システム比でワットあたり最大1.9倍のAI処理量、エンドツーエンドのレイテンシは最大3.6倍低減——ここまでなら「モデル企業がまた一つ専用シリコンを作った」という話で終わる。だが本当に注目すべきは、そのチップの設計・カーネル最適化そのものをOpenAI自身のAI(Codex with GPT-Astra)にやらせた点だ。2か月足らずで3つのオープンウェイトモデルを高性能化し、一部のブロックでは人手による実装より1.5〜1.8倍速いコードをAIが生成したとOpenAIは説明している。
推論インフラを運用する側にとっての効き目は単純だ。ワットあたりの処理効率が上がれば、同じ電力・同じ設置面積でさばけるリクエスト数が増え、トークンあたりの原価は下がる方向に働く。OpenAIは年内にこのチップを自社インフラへ投入する計画で、GPT-5.6ファミリーの値下げ余地や新しい高速プラン(Ultrafast Mode等)を支える供給側の裏付けが一つ増えたことになる。だがそれ以上に効くのは、モデル企業の「自己改善ループ」がソフトウェア層(推論システムのGPUカーネル自律最適化)からハードウェア設計工程そのものへと広がった、という構造の変化だ。フロンティアAIラボの競争優位は、モデルの賢さだけでなく、自社AIを使ってインフラの最下層=シリコン設計まで垂直統合できるかどうかにも及び始めている。チップ設計にAIが実用レベルで使えるのだとすれば、本当の問いは「潤沢な計算資源とパートナーさえ確保できれば、同じ垂直統合はどのラボでも再現可能になるのか」という点に移る。
何が起きたか
OpenAIはJalapeñoの性能を、SemiAnalysisが提供する公開ベンチマーク「InferenceX」(AIリクエストの処理プロセス全体を測定する仕組み)上で計測した。対象モデルはGPT-OSS 120B・DeepSeek R1 670B・Kimi K2.5 1Tの3種。比較対象はNvidiaのGB200(定格1,200W)・GB300(定格1,400W)システムで、Jalapeño自体は定格700Wだが、テストしたワークロードでの実測持続消費電力は550W以下にとどまったという。
結果として、ピークスループット時にワットあたり1.5〜1.9倍のAI処理量を達成。エンドツーエンドのレイテンシは比較システム比1.7〜3.6倍低減し、高インタラクティブ性が求められるワークロードでは2.1〜4.1倍高い性能を記録したとOpenAIは公表している。さらに、自社のフロンティアモデルを使った社内テストでは、この優位性が公開ベンチマークよりもさらに広がったと説明しているが、具体的な数値は公開していない。
仕組み・詳細
Jalapeñoは、低レイテンシかつエージェント的なワークロード(連続的な対話・ツール呼び出しを伴う処理)向けに設計されたとOpenAIは位置づけている。狙いはprefill処理とトークン生成の間のデータ移動・通信遅延の最小化で、応答生成中に使うKVキャッシュを含むモデル状態を、単一の広域接続ドメイン内にローカルで保持できるアーキテクチャを採る。
開発はBroadcomとの共同作業で、初期設計からテープアウトまで9か月。Celesticaがボード・ラック・システム面を担当した。Jalapeñoは多世代ロードマップの第1世代と位置づけられ、第2世代(Gen2)は開発が進行中、第3世代(Gen3)も形成されつつあるという。OpenAIは同時に、Nvidiaなど第三者アクセラレータも訓練・推論の両方で引き続き幅広く使用する方針を明言しており、自社チップへの全面移行ではない。
このチップの設計・カーネル最適化作業そのものに、OpenAI自身のモデル「Codex with GPT-Astra」を活用した点がもう一つの柱だ。2か月以内に3つの追加オープンウェイトモデルを高性能化し、一部のブロックでは既存の人手による実装より1.5〜1.8倍速いコードをAIが生成したとOpenAIは説明している。
数字で見る
- ピークスループット: 既存ハードウェア比でワットあたり1.5〜1.9倍
- エンドツーエンドレイテンシ: 1.7〜3.6倍低減(高インタラクティブ性ワークロードでは2.1〜4.1倍の性能差)
- 消費電力: 定格700Wに対し、実測持続消費電力はテストワークロードで550W以下
- 比較対象: Nvidia GB200(定格1,200W)・GB300(定格1,400W)
- 開発期間: Broadcomとの初期設計からテープアウトまで9か月
- AIによるチップ設計・カーネル最適化: 2か月で3モデルを高性能化、一部ブロックで人手比1.5〜1.8倍高速なコード生成
- 投入時期: 2026年内にOpenAI自社インフラへの投入を計画
これらの数値はいずれもOpenAI自身が発表・実行したベンチマークの自己申告値であり、SemiAnalysis(InferenceXの提供元)による独立の完全再現・検証があったことはOpenAIの発表からは確認できない。公式発表という点で根拠は堅いが、第三者による独立検証を伴う数値ではない前提で読む必要がある。
背景
推論特化シリコンをめぐっては、Nvidia自身がエージェント向け自社設計CPU「Vera」を投入し、AMDは重みをシリコンに焼き込む推論チップスタートアップTaalasを買収するなど、GPUベンダー側でも専用化・垂直統合の動きが並行している。OpenAIのJalapeñoは、この流れにモデル企業自身が参入した事例にあたる。モデル提供元が推論スタックの最下層(シリコン)まで自ら手を伸ばす動きが、具体的な性能数値とともに示された点が今回の特徴だ。
なぜ重要か
OpenAIはGPT-5.6 SolがCodex上で本番GPUカーネル(Triton/Gluon)を自律的に書き換え、サービングコストを20%削減した実績を既に公表している。Jalapeñoの設計・カーネル最適化にCodex with GPT-Astraを使った今回の事例は、その延長線上にあり、AIによる自己改善の対象が「ソフトウェアで動くインフラの最適化」から「ハードウェアそのものの設計工程」へ広がったことを示す。効率化による恩恵は、電力・設置面積あたりの処理量向上を通じてトークン単価の低下という形で推論を使う側に還元されていく一方、フロンティアAIラボの競争軸に「自社AIを使ってどこまで自前でインフラを設計できるか」という新しい次元が加わりつつある。