AI Infra Summit では、AMD と NVIDIA の MLPerf 推論の結果、および NVIDIA の 2026 Vera Rubin ロードマップ (具体的には Rubin CPX) が取り上げられます。
AI Infra Summit 2025 で、NVIDIA は 2026 つの分野で勢いを見せました。Blackwell Ultra システムによる新しい MLPerf 推論の素晴らしい結果と、さらに重要な点として、大規模コンテキスト推論専用に構築された新しいクラスの GPU である Rubin CPX を含む XNUMX 年の Vera Rubin 世代の詳細なロードマップです。
ブラックウェル・ウルトラが新たなパフォーマンス基準を設定
NVIDIAのGB300 NVL72ラックスケールシステムは、MLPerf Inference v5.1で既に驚異的なパフォーマンスを達成しており、ソフトウェアによってその潜在能力が最大限に発揮され続けている中でも、Blackwell Ultraプラットフォームのアーキテクチャの成熟度を示しています。このパワーはLlama 2 70Bベンチマークで明確に示されており、オフラインシナリオではGPUあたり12,934秒あたり12,701トークンという驚異的なパフォーマンスを達成しました。オンラインサービングテストでもほぼ同等のXNUMX秒あたりXNUMXトークンというパフォーマンスを記録し、このアーキテクチャが様々なワークロードにおいて卓越した効率性を発揮していることを物語っています。
このプラットフォームの実世界アプリケーションへの対応力は、新たに導入されたインタラクティブカテゴリにおいてさらに実証されました。このカテゴリでは、最初のトークン生成までの時間500ミリ秒未満、ユーザーあたり毎秒33トークンという、より厳格なレイテンシ制約が課せられます。こうした厳しいサービス品質要求下でも、Blackwell Ultraは高いスループットを維持し、GPUあたり毎秒7,856トークンを実現しました。DeepSeek-R1推論ベンチマークでは、このプラットフォームはGPUあたり毎秒5,842トークンという新たな明確な基準を確立しました。
結局のところ、これらの結果は、ハードウェアの能力が現在のソフトウェアスタックの能力を超えていることを示しています。TensorRT-LLMやNVIDIA Dynamoなどのフレームワークが進化し、Blackwell Ultraのアーキテクチャ上の利点(強化されたNVFP4コンピューティングパスやGPUあたり288GBのHBM3eという大容量など)を最大限に活用できるようになることで、まだ大きなパフォーマンスの余裕が生まれます。
イノベーションのリズムを加速する:Vera Rubinプラットフォーム
NVIDIAは、AIコンピューティング需要の急激な増加への戦略的対応として、年間アーキテクチャ更新サイクルを導入しました。この積極的なタイムラインに従い、NVIDIAはVera Rubin世代が既にテープアウトされており、2026年後半にエンタープライズ展開が予定されていることを発表しました。
Vera Rubinアーキテクチャは、新しいVera CPUとRubin GPUの統合を中心とした包括的なプラットフォーム刷新を導入しています。Vera CPUは、過去88世代のGrace NVIDIAシステムから大幅に進化しています。Vera CPUは、176スレッドをサポートする2個のARMコアを搭載しています。また、これらのプロセッサはチップ間(C1,800C)リンク帯域幅をXNUMXGB/秒に倍増させ、CPU、GPU、そしてそれらの共有メモリリソース間のリンク速度を向上させています。
インターコネクト層では、第3,600世代NVLinkが5GB/秒の双方向帯域幅を実現し、現行の第XNUMX世代NVLinkスイッチの帯域幅のXNUMX倍を実現しています。モデルが個々のデバイスのメモリ容量を超えて拡張し続ける中で、この強化された接続性は特に重要になります。ノード間の通信レイテンシを最小限に抑え、スループットを最大化する高度な並列実行戦略が求められるためです。
NVLinkの進歩を補完するSpectrum-6スイッチは、Co-Packaged Optics(CPO)テクノロジーを採用し、102TB/sのスイッチング容量を実現します。光コンポーネントをスイッチパッケージに直接統合することで、従来の電気から光への変換ボトルネックが解消され、レイテンシが低減するとともに電力効率が劇的に向上します。これは、AIファクトリーがギガワットレベルの電力消費へと拡大していく中で、極めて重要な考慮事項です。
VR NVL144 システムは、現在 Grace Hopper、Grace Blackwell、および Grace Blackwell Ultra の導入を支えている実績のある Oberon ラック プラットフォームを引き続き利用します。
建築用語の進化:パッケージから金型まで
NVIDIAは、命名規則をパッケージベースからダイベースに変更します。この変更は物議を醸す可能性がありますが、特に2026年後半に発売が予定されているレチクルサイズのダイをXNUMXつ搭載するRubin Ultra GPUの発売を控えていることを考えると、より明確な情報を提供する前向きな動きと言えるでしょう。
Rubin世代では、NVIDIAは利用可能な計算リソースを直接反映するダイカウント命名法を採用しています。NVL144という名称は、144パッケージの物理構成を維持しながら72個のGPUダイを明示的に示し、計算能力をより正確に表します。これは、200個のGPUパッケージ(それぞれに300個のGPUダイを搭載)を備え、合計72個の計算ダイを持つ現行世代のGB72およびGB144 NVLXNUMXシステムと類似しています。
コンテキスト処理の課題への取り組み
2026年後半に提供開始予定のRubin CPXの発表は、LLM推論における最も差し迫った課題の一つである、トークン生成の異なるフェーズにおける計算パターン間の根本的な不一致に対するNVIDIAのアーキテクチャ的対応です。このイノベーションを理解するには、LLM推論ワークロード特有の特性と、これらの多様な計算需要への対応における現在の均質GPUアーキテクチャの限界を検証する必要があります。
大規模言語モデル推論は、根本的に異なる2つの計算フェーズを経て実行されます。これらのフェーズは、ハードウェアリソースへの要求が著しく異なります。プリフィルステージでは、最初の入力プロンプトを処理し、後続の生成に必要なキーと値の行列を計算します。このフェーズは計算負荷が高く、最新のGPUの膨大な浮動小数点スループットを効率的に活用します。
デコード段階では、全く異なる計算上の課題が生じます。デコード中、モデルは自己回帰的に出力トークンを生成し、前のコンテキストに注意を払いながら、一度に1つのトークンを生成します。新しいトークンごとに、アテンションメカニズムがシーケンス履歴全体を処理して、以前のすべてのトークンとの関係を計算する必要があります。これにより、計算スループットではなくメモリ帯域幅が主要なボトルネックとなる、独特の計算パターンが形成されます。コンテキストを維持するために必要な中間表現を格納するKVキャッシュが、メモリを最も多く消費することになります。
KVキャッシュのスケーリング特性は、実稼働環境において特に大きな課題となります。Llama 3.1 405Bのような拡張コンテキストを処理するモデルの場合、KVキャッシュは72シーケンスあたり数十ギガバイトを消費する可能性があります。実稼働環境で高いスループットを実現するために不可欠なバッチ推論シナリオでは、KVキャッシュの合計サイズがモデルの重み自体のサイズを超えることがよくあります。大規模なNVLXNUMX展開ではバッチサイズが大きくなるため、KVキャッシュのサイズは数テラバイトに達する可能性があります。このデータは適切なレイテンシでアクセス可能である必要がありますが、すべてのKVキャッシュアクセスにHBMメモリの極めて広い帯域幅が必要なわけではありません。多くのアテンション操作は、階層型メモリアーキテクチャに適したアクセスパターンを示します。
Rubin CPX: コンテキスト処理に特化したアーキテクチャ
Rubin CPXは、ロングコンテキストLLM推論専用の設計により、これらのアーキテクチャの不一致に対処します。このアーキテクチャは128GBのGDDR7メモリを中心としており、KVキャッシュ操作のための大規模かつ費用対効果の高いメモリプールを提供します。GDDR7の帯域幅特性はHBM4よりも低いものの、特にインテリジェントなキャッシュ戦略と組み合わせることで、ほとんどのアテンション操作に十分です。
VR NVL144 CPXラックでは、ConnectX-9 NICとスイッチチップを介したPCIeリンクを介して、より広範なVera Rubinプラットフォームとの統合が実現されます。これにより、従来のGPUで演算負荷の高い処理を実行するハイブリッド実行モデルが実現します。メモリ負荷の高いコンテキスト管理はCPXプロセッサに移行します。
柔軟な導入アーキテクチャと構成オプション
Vera Rubinプラットフォームのモジュラーアーキテクチャは、導入の柔軟性を高め、組織が特定のワークロード特性に合わせて構成を最適化できるようにします。標準のVR NVL144ラック構成は、9つのConnectX-3.6 NICを備えたVera Rubin GPUを搭載し、多様なAIワークロードに適したバランスの取れたアーキテクチャを提供します。この構成は、NVFP4コンピューティングで3.3エクサフロップス(現行のGB300 NVL72システム比1.4倍)の性能向上に加え、4PB/sのHBM2.5帯域幅(現世代の75倍)、4TBのHBM2メモリ容量(現世代のXNUMX倍)を実現します。
推論と学習後のロングコンテキスト強化学習(RL)を最適化する組織向けに、超高密度VR NVL144 CPXコンピュートトレイをご用意しています。各トレイには、それぞれ9個のGPUダイを搭載したXNUMX個のVR GPUパッケージが搭載されており、標準構成の計算密度を維持しながら、Rubin CPX GPUをXNUMX個追加できます。XNUMX個のConnectX-XNUMX NIC/スイッチチップは、分散推論に不可欠なシームレスなデータフローを実現します。
モジュール型のアーキテクチャにより、非常に柔軟な導入戦略が可能になります。組織はまず標準のVR NVL144ラックを導入し、その後、コンテキスト処理の要件の増大に合わせて専用のRubin CPXラックを追加することができます。このアプローチにより、モデルの機能に合わせてインフラストラクチャを進化させることができ、過剰なプロビジョニングを回避できます。
VR NVL144 CPXの完全な構成は、計算能力の新たな基準を確立します。このシステムは、NVFP8演算で4エクサフロップスを実現し、現世代のGB7.5 NVL300システムと比較して72倍の性能向上を実現します。この圧倒的な計算能力は、HBM1.7とGDDR4の両方を活用した7PB/sの総メモリ帯域幅と相まって、現行システムの100倍のメモリスループットを実現します。総メモリ容量は2.5TBに達し、現世代プラットフォームのXNUMX倍のメモリリソースを提供します。
NVIDIAは2026年末の提供開始を目指しています。これにより、新たなカテゴリーのAIアプリケーションが実現し、数百万トークンのコンテキストウィンドウが実稼働環境で実用化されます。これにより、AIシステムはコードベース全体や長大なドキュメントをXNUMX回のパスで処理できるようになります。また、これらのイノベーションにより、組織はより大きなバッチサイズをサポートできるようになり、推論コストを削減し、より有利な運用コスト計算が可能になります。
ギガワット規模のインフラブループリント
NVIDIAは、個々のシステムイノベーションに加え、ギガワット規模のAIファクトリー向けリファレンスアーキテクチャも発表しました。Jacobs、Schneider Electric、Siemens Energy、Vertivといったインフラパートナーと共同で開発されたこれらのブループリントは、発電からコンピューティングの提供まで、インフラスタック全体を網羅しています。これらのリファレンスデザインは、次世代AIの導入には、コンピューティングコンポーネントそのものをはるかに超えた包括的な最適化が必要であることを認識しています。
これらの建築設計図は、NVIDIA Omniverse デジタルツインを活用し、物理的な導入前に包括的な施設シミュレーションを容易にします。組織は、統合シミュレーションで電力配分、冷却システム、計算ワークロードをモデル化し、物理インフラストラクチャの導入前にボトルネックを特定して対処できます。
結論
NVIDIAは、組織やAIラボが直面する課題に直接取り組む、先進的で開発者中心のアプローチにより、AIインフラストラクチャ分野をリードし続けています。Rubin CPXのコンテキスト処理へのターゲット型アプローチに代表される、汎用アクセラレーションからワークロード固有のアーキテクチャへの移行は、将来のAIシステムがAIワークフローのあらゆるフェーズに最適化された異種コンピューティングリソースで構成されるようになることを示しています。このアーキテクチャの進化により、複数年にわたるAIインフラストラクチャへの投資を計画している組織は、単なる計算スループットだけでなく、ハードウェア機能と進化するモデルアーキテクチャとの整合性も考慮する必要があります。
Blackwell Ultra から Vera Rubin、そして Rubin CPX へと、短期間で加速するイノベーションのリズムは実に印象的です。このような急速なペースを実現するには、組織は新しいアーキテクチャパラダイムが登場するたびにそれを統合し、前世代のデータセンターインフラストラクチャの特徴であったロックインを回避できるシステムを設計する必要があります。この課題に対処するため、NVIDIA の AI Factory リファレンスデザインと Omniverse デジタルツインは、これらの重要な投資を将来にわたって確実に活用するための重要な設計図とシミュレーションツールを提供します。AI モデルが兆単位のパラメータスケールと数百万トークンのコンテキストへと進化を続ける中、AI Infrastructure Summit で発表されたアーキテクチャのイノベーションは、このコンピューティングの未来に不可欠な基盤を提供します。これらは、今後 10 年間のエンタープライズ AI 機能を定義づけるフレームワークとテクノロジを確立するものです。
参照記事: Nvidia GTC25 ニュース
すべてのスライドと画像はNvidiaから提供されています




Amazon