ベンチマークのハイライト
Hot Chipsカンファレンスにおいて、独立系企業がInferenceXスイートを用いて検証した数値が公開されました。OpenAIはJalapeñoを汎用推論アクセラレータと呼んでいます。これはモデルを実行するためのものであり、学習用ではありません。テストにおいて、このチップは以下の成果を上げました:
- ピークスループット時において、現在のリーダー的存在よりもワットあたりの処理量を1.5倍から1.9倍向上させました。
- レイテンシを1.7倍から3.6倍削減し、インタラクティブな利得では2.1倍から4.1倍を実現しました。
モデル別の結果:
- GPT-OSS 120B: 約1,400 tokens/second/user。
- Deepseek R1 670B: 単一の同時リクエストで約700 tokens/second。
- Kimi K2.5 1T: ハイパフォーマンス・スイートでテスト済み(正確な数値は非公開)。
OpenAIは、これらの数値が投機的デコーディング(speculative decoding)やマルチトークン予測といった、多くの競合他社がカタログスペックを底上げするために使用する手法を用いずに達成されたものであることを強調しました。
Jalapeñoの設計プロセス
OpenAIはBroadcomと提携し、わずか9ヶ月でチップの設計を完了させました。同社は設計ループに自社モデルを組み込むことで、設計図作成、プログラミング、最適化を加速させました。これは「AI支援型シリコン設計(AI-assisted silicon design)」と呼ばれる手法です。この短期間での開発は、かつて高性能シリコンの常識であった数年単位の開発サイクルからの転換を浮き彫りにしています。
Nvidiaの優位性への影響
Nvidiaは、生のパフォーマンスとCUDAエコシステムを武器にしています。今回の新しいデータは、そのパフォーマンスの優位性が揺らぎ得ることを示しています。アナリストは、もし他のAI企業が同様の効率を持つカスタム推論シリコンを導入すれば、開発者がCUDAから離れ、代替スタックの台頭や市場の断片化を招く可能性があると警告しています。
OpenAIの複合的な戦略
最高財務責任者(CFO)のKelly Huang氏は、Jalapeñoを既存パートナーの全面的な置き換えではなく、より広範なコンピューティング計画の一環として位置づけています。OpenAIは依然として、さまざまなワークロードにおいてNvidia、AMD、AWS、Cerebrasと協力しています。Jalapeñoはまだエンジニアリングサンプル段階であり、Deepseek V4 Proのような今後登場する最大規模のモデルに直面してはいません。Huang氏の発言は、OpenAIが自社シリコンとサードパーティ製アクセラレータを組み合わせ、各タスクに対して最適なコストパフォーマンスを追求していくことを示唆しています。
反論・留意点
初期段階のサンプルでは、量産、歩留まり、長期的な信頼性は保証されていません。そのため、過度な期待は禁物です。
今後の注目点
- 量産体制: OpenAIはJalapeñoを量産品へと転換できるか、またその価格はいくらになるか?
- ソフトウェアスタック: 開発者向けのプログラミングモデルやツールチェーンはどの程度成熟するか?
- 競合他社の反応: Nvidiaやその他のベンダーは、市場シェアを守るためにロードマップや価格設定をどのように調整するか?
- モデルのスケーリング: Jalapeñoは、次世代の数兆パラメータ規模のモデルに対しても優位性を維持できるか?
要点: カスタム推論シリコンは、ニッチな実験段階から、Nvidiaのハードウェア支配に対する現実的な挑戦へと移行しつつあります。
