英偉達已公佈結果 針對 MLPerf Inference v6.0,重點介紹了硬體、軟體和模型之間緊密協作設計所帶來的系統級效能提升。該公司將推理吞吐量和令牌經濟性作為衡量 AI 工廠性能的主要指標,超越了峰值加速器規格,轉向實際工作負載下的實際輸出。
在本輪評測中,基於 NVIDIA Blackwell Ultra GPU 建構的系統在所有提交的模型和場景中均實現了最高的吞吐量。該平台的生態系統也得到了擴展,共有 14 家合作夥伴提交了測試結果,其中包括華碩、思科、CoreWeave、戴爾科技、GigaComputing、谷歌雲端、HPE、聯想、Nebius、Netweb Technology、QCT、紅帽、Supermicro 和 Lambda 等主要 OEM 廠商、雲端服務供應商和系統整合商。
擴大基準測試覆蓋範圍反映了新興的工作負載
MLPerf Inference v6.0 引入了多項新的基準測試,以更好地反映目前的 AI 部署情況。 NVIDIA 是唯一一家提交了所有新測試結果的廠商,這些測試涵蓋大型語言模型、多模態系統、生成式影片和推薦引擎。
新增的關鍵模型包括 DeepSeek-R1 Interactive,與先前的伺服器場景相比,該模型能夠評估更高的互動性,實現更快的令牌傳遞速度和更短的首次令牌獲取時間。此外,該套件還新增了 Qwen3-VL-235B-A22B,這是首個在 MLPerf 推理中引入的多模態視覺語言模型;以及 GPT-OSS-120B,這是一個混合專家推理模型,已在離線、伺服器和互動式場景下進行了測試。
| <span class="notranslate">EventXtra 6大解決方案</span> | DeepSeek-R1 | GPT-OSS-120B | Qwen3-VL | 萬2.2 | DLRMv3 |
|---|---|---|---|---|---|
| 離線 | 2,494,310 個代幣/秒* | 1,046,150 個令牌/秒 | 79 個樣本/秒 | 0.059 個樣本/秒 | 104,637 個樣本/秒 |
| 伺服器 | 1,555,110 個代幣/秒* | 1,096,770 個令牌/秒 | 每秒 68 次查詢 | 21秒** (單流) |
每秒 99,997 次查詢 |
| 包含與學員互動的問答環節 | 250,634 個令牌/秒 | 677,199 個令牌/秒 | *** | *** | *** |
* 這並非 MLPerf 推理 v6.0 中的新情況
**WAN 2.2 採用單流場景,測量端對端請求延遲,而不是伺服器場景。延遲越低越好。
*** 未經 MLPerf 推理 v6.0 測試
現在新增了生成式媒體和推薦工作負載。 Wan 2.2 文字轉視訊模型同時包含對延遲敏感和對吞吐量敏感的測試,而 DLRMv3 則用基於 Transformer 的架構取代了先前的推薦基準測試,從而提升了計算強度和模型複雜度。
軟體優化帶來可衡量的效益
此提交方案的一大亮點在於透過軟體更新顯著提升了現有硬體的效能。 NVIDIA 報告稱,在 DeepSeek-R1 伺服器場景下,GB300 NVL72 平台上的令牌吞吐量比六個月前的結果提高了 2.7 倍。這項改進意味著每個代幣的成本大幅降低,並且已部署基礎架構的利用率也更高。
這些效能提升歸功於TensorRT-LLM技術堆疊及其相關框架的更新。核心級最佳化和融合技術降低了執行開銷,而改進的注意力機制資料並行性則能更有效地平衡GPU之間的工作負載。 Dynamo分散式推理框架的進一步增強實作了解耦式服務,從而可以獨立優化預填和解碼階段。
對於混合專家模型,諸如 Wide Expert Parallel 之類的技術將專家權重分佈到多個 GPU 上,以減少記憶體瓶頸。多標記預測透過同時產生和驗證多個標記,提高了低批次、對延遲敏感場景下的運算效率。 KV 感知路由則根據預估的計算成本來定向推理請求,從而進一步優化調度。
| 基準 | GB300 NVL72 v5.1 |
GB300 NVL72 v6.0 |
提速 |
|---|---|---|---|
| DeepSeek-R1 (伺服器) |
2,907 個令牌/秒/GPU | 8,064 個令牌/秒/GPU | 2.77x |
| DeepSeek-R1 (離線) |
5,842 個令牌/秒/GPU | 9,821 個令牌/秒/GPU | 1.68x |
| 羊駝 3.1 405B (伺服器) |
170 個令牌/秒/GPU | 259 個令牌/秒/GPU | 1.52x |
| 羊駝 3.1 405B (離線) |
224 個令牌/秒/GPU | 271 個令牌/秒/GPU | 1.21x |
NVIDIA 也展示了其在現有型號上的持續擴展能力。在 Llama 3.1 405B 版本中,GB300 NVL72 平台在伺服器場景下的效能提升了 1.5 倍,這表明 NVIDIA 正在持續優化高密度 LLM 以及更新的架構。
開放生態系統和框架集成
針對新工作負載提交的測試結果整合了 NVIDIA 和開源框架。 Qwen3-VL 基準測試使用了 vLLM 框架,反映了多模態推理最佳化技術的快速發展。 Wan 2.2 文字轉視訊測試結果則由 TensorRT-LLM VisualGen 提供支持,該框架針對 GPU 上的基於擴散的管線。
為了因應基於Transformer的建議模型日益增長的效能需求,NVIDIA將自身的recsys-example框架與GPU加速的嵌入查找技術結合,以支援DLRMv3的開發。這些整合凸顯了更廣泛的軟體生態系統在從底層硬體中挖掘效能方面的重要作用。
利用 InfiniBand 實現橫向擴展效能
NVIDIA 也展示了使用四套透過 Quantum-X800 InfiniBand 連接的 GB300 NVL72 系統進行的大規模推理效能。這套配置共包含 288 個 Blackwell Ultra GPU,是迄今為止規模最大的 MLPerf 推理提交,並在 DeepSeek-R1 上實現了每秒數百萬個 token 的系統級吞吐量。
| DeepSeek-R1 | 4x GB300 NVL72 | 每秒代幣數 |
|---|---|
| 離線 | 2,494,310 |
| 伺服器 | 1,555,110 |
研究結果凸顯了高效能互連在擴展推理工作負載方面的重要性,特別是對於分散式 LLM 服務和高吞吐量批次而言。
邁向服務水準基準測試
展望未來,NVIDIA 正在協助 MLCommons 聯盟開發 MLPerf Endpoints。這項即將推出的基準測試旨在利用真實的 API 流量來衡量已部署的推理服務,從而深入了解服務層面的延遲、吞吐量和效率,而不僅僅是組件層面。
隨著 AI 工作負載發展成為具有更長上下文視窗的智慧型系統,衡量端到端服務效能的基準對於雲端供應商和企業部署來說預計將變得更加重要。




Amazon