関連記事
【分析】OpenAI独自チップ「ハラペーニョ」はNVIDIAの脅威か―推論特化ASICが示した効率と残る検証課題

(Openai.com)[写真拡大]
OpenAIは2026年8月25日、独自の推論用アクセラレーター「Jalapeño(ハラペーニョ)」の初の測定結果を公開した。SemiAnalysisの公開ベンチマーク「InferenceX」を使ったOpenAIの測定では、NVIDIAのGB200およびGB300システムに対し、ピーク時のワットあたり処理量が1.5~1.9倍、エンドツーエンドのレイテンシが1.7~3.6分の1になったという。
一方、NVIDIAは翌26日に発表した2027会計年度第2四半期決算で、売上高が前年同期比106%増の962億ドル(約15兆2,958億円、1ドル=159円換算)に達したと発表した。OpenAIは独自チップを開発しながら、NVIDIA製コンピュートについても2030年までに約12ギガワット(GW)の既存および計画中のコミットメントを抱えている。推論に特化した自社ASICと、学習から推論までを支える汎用プラットフォームを並行して利用する構図が鮮明になっている。
■OpenAI測定でBlackwell比の高い電力効率
Jalapeñoの性能測定には、AI推論システムの公開ベンチマークであるInferenceXが使われた。対象モデルはGPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1Tの3つで、Jalapeñoは比較対象のNVIDIAシステムより、ピーク時に1.5~1.9倍多くの処理を電力1ワット当たりで実行したとOpenAIは説明している。
応答の開始から完了までを測るエンドツーエンドのレイテンシは1.7~3.6分の1となり、対話性を重視する低遅延の動作条件では2.1~4.1倍の性能を記録したという。ここで示された倍率は、モデルや動作条件によって異なる測定結果の範囲であり、すべての処理で一律に得られる性能差ではない。
InferenceXの方法や比較基準は公開されており、SemiAnalysisのエンジニアもOpenAIの施設で測定に立ち会った。ただし、数値はOpenAIが自社設備で取得したもので、第三者が入手したJalapeñoを独立して再測定した結果ではない。公開された方法に基づく比較可能性を備える一方、実運用時の性能を含めた外部検証は今後の課題となる。
■推論処理に合わせてデータ移動を抑制
Jalapeñoは、学習済みの大規模言語モデルが利用者の入力に応答する「推論」に重点を置いたASICである。OpenAIは、フロンティアモデルや製品の運用から得た知見を基に、演算、メモリ、ネットワーク、推論ソフトウェアを一体的に設計したとしている。
設計上の中心となるのは、演算装置とメモリの間のデータ移動や通信待ちを減らすことだ。応答生成中に使うKVキャッシュなどのモデル状態を適切な場所に保持し、推論の各段階に応じて必要な演算、メモリ、ネットワーク資源を組み合わせる。理論上の演算性能を増やすだけでなく、既存の資源を実際の処理にどれだけ使えるかを重視した設計である。
チップの定格電力は700Wで、OpenAIによると、今回テストした負荷での持続消費電力は550W以下だった。比較対象のGB200は1,200W、GB300は1,400Wの定格値を用いている。電力供給がAIデータセンターの主要な制約となるなか、OpenAIはチップ単体の性能よりも、一定の電力で処理できるAIワークロードの量を重視している。
Jalapeñoは1チップ当たり216GiBのHBM4を搭載し、メモリ帯域幅は毎秒15.4TB、MXFP4形式での行列演算性能は13.4PFLOP/sとされる。128基のアクセラレーターを収容するシステムでは、合計1.7EFLOP/sのMXFP4演算性能と27.5TBのHBM4を備える。
ラックシステムは、CPUを収容するホストラックとASICアクセラレーターラックを組み合わせる構成で、Celesticaがシステム統合に協力している。OpenAIとBroadcomは、アクセラレーターとイーサネットベースのネットワークを含むシステムを共同開発しており、10GW規模のカスタムAIアクセラレーターを2026年後半から2029年末にかけて段階的に展開する計画を示している。
■比較対象はBlackwell、Rubinとは条件差も
今回の主要な比較対象は、NVIDIAのBlackwell世代に属するGB200およびGB300システムである。NVIDIAが量産を進めている次世代プラットフォーム「Vera Rubin」と同一条件で直接比較した結果ではない。
SemiAnalysisは、2026年7月に公表されたVera Rubinの結果との比較も示している。メガワット当たりの出力トークン数ではJalapeñoが僅差で上回ったが、Vera Rubin側は1回の推論処理で複数のトークンを予測するマルチトークン予測を使用し、Jalapeño側は単一トークン予測を使っているため、条件は対称ではない。トークン当たりの総所有コストでは、両者はおおむね同等と分析されている。
また、今回使用されたInferenceXの測定条件は、8,000トークンの入力から1,000トークンを生成する固定シーケンスの推論処理である。長いコンテキストを維持し、複数回の対話やツール呼び出し、並列のサブエージェント処理を伴うAgentXの結果は、Jalapeñoについて公表されていない。こうした処理では、KVキャッシュ、スケジューラー、ルーターなどの違いが性能に影響するため、用途別の評価が必要になる。
Yole Groupのアナリスト、アドリアン・サンチェスは、Jalapeñoの結果について、ハイパースケーラーが設計したチップがBlackwellクラスのGPUに推論効率で匹敵または上回り得ることを示したと評価した。その一方で、NVIDIAはAIコンピュートの大半を供給し、CUDAを中心とするソフトウェア基盤も維持していると指摘している。
■NVIDIAはチップではなくプラットフォームを訴求
NVIDIAのジェンスン・ファンCEOは決算説明会で、クラウド事業者やAI企業が開発するXPUの多くは、1つのクラウドまたはサービス向けの推論専用チップだと説明した。そのうえでNVIDIAについて、あらゆるクラウドで利用でき、AIのライフサイクル全体をカバーするAIファクトリープラットフォームだと位置付けた。
推論に軸足を置くJalapeñoと、学習、事後学習、ファインチューニング、推論を幅広く扱うNVIDIAのシステムでは、設計目的が異なる。特定の処理に合わせてハードウェアとソフトウェアを最適化できることがJalapeñoの効率につながる一方、NVIDIAは多様なモデルやクラウド、開発環境で利用できる汎用性を競争力としている。
OpenAIの計算基盤も、自社チップだけに置き換わる計画ではない。同社は、MicrosoftやNVIDIAの基盤がこれまでの成長を支えてきたと説明し、Broadcomを含む複数のハードウェア、クラウド、データセンターパートナーを用途や経済性に応じて使い分ける方針を示している。
OpenAIが独自アクセラレーターを展開する一方で、約12GWのNVIDIA製コンピュートを計画していることは、両者が単純な代替関係にないことを示す。大量かつ予測しやすい推論処理では専用ASICの効率を生かし、学習や新しいモデル、幅広い処理には外部の汎用基盤を利用する組み合わせが想定される。
■9カ月の開発とAIによるカーネル最適化
OpenAIが説明する「9カ月」という開発期間は、チップ全体の構想開始からではなく、RTL設計から製造準備段階までの期間を指す。同社はBroadcomのシリコン実装技術を利用するとともに、自社のAIモデルを設計案の探索、検証、演算回路の最適化に活用した。
ソフトウェア面では、OpenAIが開発したGPUカーネル用コンパイラ「Triton」の技術を基に、Jalapeñoのハードウェアを制御するカーネルプログラミング環境「Gluon」を構築した。推論エンジン「Teacup」は、その上でモデルを実行する。
OpenAIによると、Codexなどを使って生成したカーネルは、選定したアテンションおよびMixture-of-Expertsの計算ブロックで、人間の専門家による実装より1.5~1.8倍高速だった。この数値は特定の計算ブロックに関するもので、モデル全体の処理速度を示すものではない。
専用チップは、ハードウェアを製造するだけでは機能せず、モデルごとに効率の高いカーネルや実行環境を整える必要がある。OpenAIがAIを利用してこの作業を短縮できれば、大規模な開発チームを持つAI企業にとって、カスタムシリコンを実用化するまでのソフトウェア上の負担を軽減できる可能性がある。
一方、NVIDIAのCUDAは、多数の開発者、ライブラリ、フレームワーク、最適化ツールによって構成される広範なエコシステムである。GluonはOpenAI内部の特定システムを効率よく動かすための環境であり、市場全体を対象とするCUDAとは役割が異なる。Jalapeñoの結果は、組織内でモデル、チップ、ソフトウェアを一体開発できる企業が、特定用途でCUDAとの差を縮められる可能性を示したものといえる。
■電力効率とHBM供給が量産時の焦点
Jalapeñoの価値は、同じ電力容量からどれだけ多くの推論処理を引き出せるかにある。700Wという定格値だけを見れば、1,400WのGB300に比べて同じ電力枠に多くのチップを収容できる。ただし、データセンター全体の効率は、アクセラレーターだけでなくCPU、ネットワーク、冷却設備、電力変換、稼働率にも左右される。
OpenAIが示した効率差が量産構成と実際のサービス運用でも維持されれば、電力容量当たりの処理量を増やせる。今後は、ラック全体の消費電力、長時間稼働時の性能、障害時の挙動、運用コストなどを含む本番データが重要になる。
量産にはHBMの確保も欠かせない。JalapeñoはHBM4を採用しており、NVIDIAなどのAIアクセラレーターと共通するメモリ供給網に依存する。SKハイニックスのクァク・ノジョンCEOは、メモリ業界が2027年に供給面で最も厳しい状況を迎えるとの見通しを示している。カスタムASICが電力効率を高めても、先端メモリや製造、実装の供給能力が配備規模を左右する構図は変わらない。
■API価格への影響は配備後に
OpenAIは、Jalapeñoによる効率向上をChatGPTやAPIの料金引き下げに反映すると確約していない。効率向上は推論コストを抑える選択肢を広げるが、価格はモデルの開発費、需要、サービス戦略、他のインフラ費用にも左右される。
OpenAIのハードウェア責任者リチャード・ホーによると、Jalapeñoは2026年末にごく少量で配備を始め、2027年により本格的な展開へ移る予定だ。したがって、当面はOpenAIの推論処理の多くが既存の外部アクセラレーター上で続くとみられる。
調査会社Omdiaは、データセンター向けカスタムAI ASICの年間出荷数量が2028年にGPUを上回ると予測している。一方、売上高ではGPUが2032年まで上回るとの見通しであり、数量の逆転が直ちにGPU市場の縮小を意味するわけではない。
Jalapeñoは、推論用途に合わせて設計された自社チップが、公開された測定方法の下で主要なGPUシステムを電力効率と応答速度の両面で上回り得ることを示した。次の焦点は、第三者による再測定、AgentXを含む幅広いワークロード、本番環境での性能、量産規模、そして効率向上が利用者向けの価格やサービス品質にどう反映されるかである。
■注目ポイントQ&A
●JalapeñoはNVIDIAの最新チップを上回ったのですか?
主要な公開結果は、Blackwell世代のGB200およびGB300システムとの比較です。OpenAIの測定ではワット当たり処理量が最大1.9倍となりましたが、Vera Rubinとの同一条件による直接比較ではありません。SemiAnalysisによる公表結果同士の比較では、トークン当たりの総所有コストはおおむね同等と分析されています。
●測定結果は第三者による独立検証ですか?
InferenceXはSemiAnalysisが公開するベンチマークで、同社のエンジニアもOpenAIの施設で測定に立ち会いました。ただし、数値はOpenAIが自社設備で取得したもので、第三者がチップを入手して独立に再測定した結果ではありません。
●OpenAIのAPIやChatGPTの料金は安くなりますか?
OpenAIは、効率向上を利用料金の引き下げに反映すると確約していません。初期の配備量も限られるため、本番展開の規模や運用時のコストが明らかになるまで、料金への影響は判断できません。
●独自チップを開発しながら、なぜNVIDIA製システムも調達するのですか?
Jalapeñoは推論を中心に最適化されたチップですが、OpenAIにはモデルの学習、事後学習、新しいワークロード、世界各地でのサービス提供など、異なる要件があります。OpenAIは自社チップと複数企業の計算基盤を、用途やコストに応じて使い分ける方針です。
●GluonはCUDAの脅威になりますか?
GluonはJalapeñoを効率よく動かすためのOpenAIのカーネルプログラミング環境です。幅広い企業や開発者を対象とするCUDAとは規模も目的も異なりますが、AIを使ったカーネル開発によって、大規模なAI研究所が専用チップ向けソフトウェアを短期間で整備できる可能性を示しています。
元記事: OpenAI Jalapeño Chip Posts 1.9x Efficiency Lead Over Nvidia; Huang Answers With $96B Quarter
※この記事はTech Timesから提供を受けた記事を日本向けに翻訳・編集したものです。
スポンサードリンク
