MLPerf Inference v5.1 為 LLM、視覺和多模態任務的 AI 推理提供了嚴格的基準測試。以下是 NVIDIA Blackwell Ultra 測試結果和 AMD Instinct MI300X/MI325X/MI355X 提交結果的技術分析。分析內容包括詳細的基準測試數據、軟體最佳化、架構策略以及對超大規模運算和企業的影響。
MLPerf 基準測試框架
MLPerf 推理基準測試是 AI 加速器的記分牌,它提供了一種標準化、可比較的方法來衡量影像分類、語言模型和推薦系統的表現。對於大規模部署 GPU 的企業來說,這些數字通常可以引導大規模的採購決策。
MLPerf 推理由 MLCommons 管理,並定義封閉式與公開式比賽的規則。場景包括:
- 離線:以吞吐量為中心(批量處理盡可能多的查詢)。
- 伺服器:符合延遲的多流推理。
- 包含與學員互動的問答環節:嚴格的 TTFT(第一個令牌時間)和 TPS(每秒令牌數@99% 百分位數)。
v5.1 工作負載套件包括:
- DeepSeek-R1: 671B 專家混合模型(推理壓力測驗)。
- Llama-3.1-405B和8B:跨多種推理模式的最新 LLM。
- 耳語:ASR 取代 RNN-T。
- 穩定擴散 XL (SD-XL):文字到圖像的生成人工智慧。
- 混合, DLRMv2,以及 ResNet-50 等傳統工作負載。
當顯示吞吐量(令牌/秒或樣本/秒)圖表時,它們通常會凸顯 NVIDIA 在絕對數字(尤其是每 GPU)上的持續主導地位。然而,AMD 在相對效率和 縮放平滑度 表明他們正在逐步縮小差距,特別是在伺服器場景和多節點部署方面。
NVIDIA Blackwell Ultra 結果
Blackwell Ultra 系統在所有新工作負載下均實現了創紀錄的吞吐量。關鍵推動因素:
- NVFP4 精確度:自訂 4 位元浮點數,加速 DeepSeek 和 Llama。
- FP8 KV-cache:為注意層節省記憶體。
- 分解服務:透過 72 GB/s NVLink 在 1,800 個 GPU 上劃分上下文與生成階段。
- 軟體:CUDA Graphs、TensorRT-LLM、ADP Balance。
下方長條圖比較了 Hopper 和 Blackwell Ultra 的單 GPU 效能,顯示 DeepSeek-R5 的吞吐量提升了近 1 倍,驗證了細粒度資料格式 (NVFP4) 和機架頻寬在大規模推理工作負載下能夠線性擴展。另一張以互動式 Llama-405B 創紀錄結果為藍本的圖表展示了 NVIDIA 如何利用 NVLink 架構和分解式服務在突破先前吞吐量限制的同時,保持延遲 SLA 的一致性。結論:NVIDIA 在純粹的原始速度和延遲敏感型工作負載方面仍然保持行業領先地位。
AMD Instinct MI300X/MI325X/MI355X 結果
AMD 針對效率和靈活性:
- MI4X 上的 FP355:與 MI2.7X FP2 相比,Llama-70-325B 吞吐量提高了 8 倍。
- 結構化剪枝:在 Llama-405B 上,修剪 21–33% 可減少 FLOP,而不會影響準確性,同時將吞吐量提高約 82–90%。
- 縮放:已證實可實現最多 8 個節點的平滑線性擴展;第一個異構集群(4 × MI300X + 2 × MI325X)實現了 94% 的擴展效率。
- ROCm 生態系統可重複性:合作夥伴提交的結果與 AMD 自體結果的差異始終在 1-3% 以內。
上圖顯示了 MI325X FP8 與 MI355X FP4 的對比,展現了 FP4 的突破性優勢:更高的令牌/秒,同時將準確度損失降至最低,證明 FP4 不是實驗性的,而是已準備好部署。
這個 縮放曲線 (1 → (8 個節點)圖表突顯了近線性擴展,這是超大規模用戶所重視的一點,因為它可以轉化為可預測的擴展成本。同時,結構化剪枝的示意圖表明,AMD 的重點不僅在於硬體暴力破解,還在於演算法效率,這對於受功耗和空間限制的實際推理集群至關重要。
AMD 與 NVIDIA 正面對比
|
公制 |
NVIDIA Blackwell Ultra |
AMD MI355X |
筆記 |
優勝者 |
|
每個 GPU 每秒令牌數 |
5842(DeepSeek-R1) |
~2200(縮放 FP4) |
更高的 NVIDIA 原始效能 |
NVIDIA |
|
每個 GPU 的記憶體 |
192GB HBM3e |
288GB HBM3e |
AMD 適配 520B 型號單 GPU |
AMD |
|
精準支持 |
FP16、FP8、NVFP4 |
FP16,FP8,FP4 |
均領先4位 |
領帶 |
|
擴展結構 |
72 GPU NVLink |
線性節點擴展至 8 |
不同的規模策略 |
領帶 |
並排的可視化強調了權衡。
- NVIDIA 在每個 GPU 吞吐量方面佔據主導地位,使其成為浮點密度至關重要的 AI 工廠的理想選擇。
- AMD 擁有更大的記憶體(288GB)和 FP4 修剪,在代幣成本和部署靈活性至關重要的領域表現出色。
產業影響
- 超大規模NVIDIA 仍然是追求巔峰性能的 AI 工廠的首選工具。然而,AMD 不斷增強的效率創新,解鎖了成本優化的擴展能力,從而有利於平衡不同層級的工作負載。
- 雲服務提供商:期待異質產品、高效能 NVIDIA 層與經濟高效的 AMD Kubernetes pod。
- 企業:結構化剪枝、FP4 和異構集群支援使 AMD 能夠以更低的 TCO 提供 405B+ 模型推理能力。 NVIDIA 的創新(分解服務和 Dynamo)對於延遲敏感型應用(例如即時 LLM 聊天機器人)仍然有益。
- 未來展望:預計將普遍採用 4 位元推理作為基線,更廣泛地使用異構 GPU 池,以及新的系統設計,包括用於長序列的 NVIDIA Rubin CPX 和 AMD 的 ROCm 擴展以覆蓋更多框架。
NVIDIA 繼續在原始吞吐量方面保持領先,H200 GPU 在 ResNet-50 和 BERT 推理測試中,在封閉組別基準測試中均處於領先地位。即便如此,AMD 的 MI300 也緊隨其後,在伺服器和離線場景中均取得了具有競爭力的成績,同時在能源效率方面也表現出強勁的提升。真正的亮點不僅在於 NVIDIA 仍然保持領先,還在於與僅一輪 MLPerf 測試之前相比,AMD 已經顯著縮小了差距。對買家來說,這意味著只專注於綠色 GPU 的時代可能已經結束——ROCm 正在成熟,而 MI300 在實際推理部署中也已具備可行性。





Amazon