MLPerf Inference v5.1は、LLM、ビジョン、マルチモーダルタスクにわたるAI推論のための厳密なベンチマークを提供します。NVIDIAのBlackwell Ultraテスト結果とAMDのInstinct MI300X/MI325X/MI355Xテスト結果に関する技術分析をご紹介します。詳細なベンチマークデータ、ソフトウェア最適化、アーキテクチャ戦略、そしてハイパースケーラーやエンタープライズへの影響についても解説しています。
MLPerf ベンチマークフレームワーク
MLPerf推論ベンチマークは、AIアクセラレータのスコアボードとして機能し、画像分類、言語モデル、レコメンデーションシステムのパフォーマンスを標準化された同一条件で測定する方法を提供します。大規模にGPUを導入する企業にとって、これらの数値は大規模な購入決定の指針となることがよくあります。
MLPerf推論はMLCommonsによって管理され、クローズドディビジョンとオープンディビジョンのルールを定義します。シナリオには以下が含まれます。
- オフライン: スループット中心 (可能な限り多くのクエリをバッチ処理します)。
- サーバー: レイテンシ準拠のマルチストリーム推論。
- 対話: 厳密な TTFT (最初のトークンまでの時間) と TPS (99 パーセンタイルでの XNUMX 秒あたりのトークン数)。
v5.1 ワークロード スイートには以下が含まれます。
- ディープシーク-R1: 671B 専門家混合モデル (推論のストレス テスト)。
- ラマ-3.1-405Bおよび8B: 複数の推論モードにわたる最新の LLM。
- ウィスパー: RNN-T に代わる ASR。
- 安定拡散XL(SD-XL): テキストから画像を生成する AI。
- ミクストラル, DLRMv2さらに、ResNet-50 などのレガシー ワークロードも含まれます。
スループット(トークン/秒またはサンプル/秒)のグラフが表示される場合、通常、NVIDIAが絶対値、特にGPUあたりの数値で優位に立っていることが強調されます。しかし、AMDの相対的な効率と スケーリングの滑らかさ 特にサーバーのシナリオとマルチノードの展開において、ラウンドごとにギャップが縮まっていることがわかります。
NVIDIA Blackwell Ultraの結果
Blackwell Ultraシステムは、すべての新規ワークロードにおいて記録的なスループットを達成しました。主な成功要因:
- NVFP4 精度: カスタム 4 ビット浮動小数点、DeepSeek と Llama を高速化します。
- FP8 KV キャッシュ: アテンション レイヤーのメモリ節約。
- 分散型サービス: 72 GB/秒の NVLink を介して 1,800 個の GPU にコンテキストと生成ステージを分割します。
- ソフトウェア: CUDA グラフ、TensorRT-LLM、ADP Balance。
下の棒グラフは、GPUあたりのHopperとBlackwell Ultraのスループットを比較したもので、DeepSeek-R5ではスループットが約1倍向上していることを示しています。これは、細粒度データフォーマット(NVFP4)とラックワイド帯域幅が、大規模な推論ワークロードに対して直線的に拡張できることを裏付けています。インタラクティブなLlama-405Bの記録的な結果を示すもうXNUMXつの図は、NVIDIAがNVLinkファブリックと分散型サービングを活用して、レイテンシSLAを維持しながら、従来のスループット限界を突破していることを示しています。つまり、NVIDIAは純粋な速度とレイテンシに敏感なワークロードにおいて、依然として業界のペースセッターであり続けているということです。
AMD Instinct MI300X/MI325X/MI355Xの結果
AMD が目標とする効率性と柔軟性:
- MI4XのFP355: MI2.7X FP2 と比較して 70 倍の Llama-325-8B スループットを実現。
- 構造化された剪定Llama-405B では、21~33% のプルーニングにより精度に影響を与えずに FLOP が削減され、スループットが約 82~90% 向上しました。
- スケーリング: 8 ノードまでのスムーズな線形スケーリングが実証され、最初の異種クラスター (4 × MI300X + 2 × MI325X) は 94% のスケーリング効率を達成しました。
- ROCmエコシステムの再現性: パートナーの提出物は、AMD 自身の結果の 1 ~ 3% 以内で一貫しています。
MI325X FP8 と MI355X FP4 を比較した上記のグラフは、FP4 の画期的な利点、つまり精度の低下を最小限に抑えながら 4 秒あたりのトークン数を増やすという点を示しており、FPXNUMX が実験的なものではなく、すぐに導入できる状態であることを証明しています。
この スケーリング曲線 (1 → (8ノード)のグラフは、ほぼ線形のスケーリングを強調しています。これは、拡張コストの予測可能性につながるため、ハイパースケーラーにとって重要な要素です。一方、構造化プルーニングの概略図は、AMDがハードウェアのブルートフォース攻撃だけでなく、電力とスペースの制約がある現実世界の推論クラスターにとって極めて重要なアルゴリズムの効率性にも注力していることを示しています。
AMDとNVIDIAの直接比較
|
メトリック |
NVIDIA ブラックウェル ウルトラ |
AMD MI355X |
Notes |
優勝者 |
|
GPUあたりのトークン数/秒 |
5842(ディープシーク-R1) |
約2200(スケーリングされたFP4) |
NVIDIAの生のパフォーマンスの向上 |
NVIDIA |
|
GPUあたりのメモリ |
192GBHBM3e |
288GBHBM3e |
AMDは520BモデルのシングルGPUに適合 |
AMD |
|
精密サポート |
FP16、FP8、NVFP4 |
FP16、FP8、FP4 |
どちらも4ビットリード |
ネクタイ |
|
スケーリングファブリック |
72 GPU NVLink |
8までの線形ノードスケーリング |
異なるスケール戦略 |
ネクタイ |
並べて視覚化することでトレードオフが強調されます。
- NVIDIA は GPU あたりのスループットで勝っており、フロップ密度が重要となる AI ファクトリーに最適です。
- AMD は、大容量メモリ (288 GB) と FP4 プルーニングを備えており、トークンあたりのコストと展開の柔軟性が最も重要となる場合に優れています。
業界への影響
- ハイパースケーラーNVIDIAは、最高のパフォーマンスを追求するAIファクトリーにとって、依然として最適なツールです。しかし、AMDの効率化イノベーションはコスト最適化されたスケーリングを可能にし、階層間でのワークロードのバランス調整に魅力的です。
- クラウドプロバイダ: 異機種混合の提供、高性能 NVIDIA 層とコスト効率の高い AMD Kubernetes ポッドを期待してください。
- 企業構造化プルーニング、FP4、そして異種クラスタのサポートにより、AMDは405B以上のモデル推論をより低いTCOで実現しています。NVIDIAのイノベーション(分散型サービスとDynamo)は、レイテンシの影響を受けやすいアプリ(リアルタイムLLMチャットボットなど)にも引き続き有益です。
- 将来の展望: ベースラインとして 4 ビット推論が広く採用され、異機種 GPU プールがより幅広く使用され、長いシーケンス用の NVIDIA の Rubin CPX や、より多くのフレームワークをカバーする AMD の ROCm 拡張などの新しいシステム設計が期待されます。
NVIDIAは引き続き生のスループットにおいてリードを維持しており、H200 GPUはResNet-50とBERTの推論において、クローズドディビジョンベンチマーク全体でトップに立っています。とはいえ、AMDのMI300も大きく後れを取っているわけではなく、サーバーおよびオフラインシナリオで競争力のある数値を記録し、電力効率も大幅に向上しています。ここで重要なのは、NVIDIAが依然としてトップの座を維持しているだけでなく、AMDがわずか300ラウンド前のMLPerfと比較して大幅に差を縮めていることです。これは、購入者にとって、環境に優しいGPUだけに注目する時代は終わったことを意味します。ROCmは成熟しつつあり、MIXNUMXは実際の推論環境で活用できる可能性があります。





Amazon