AMD發布了MLPerf推理v6.0的測試結果,排名靠前。 Instinct MI355X GPU 作為一個可擴展的推理平台,它能夠跨單節點、多節點和異質部署運行。此次提交的成果不僅體現在效能的逐步提升上,還增加了新的工作負載,展示了超過每秒 1 萬個令牌的叢集級吞吐量,並在不斷壯大的合作夥伴生態系統中驗證了其可複現性。
CDNA 4架構旨在實現高容量推斷
Instinct MI355X GPU 基於 AMD 的 CDNA 4 該架構基於台積電 3nm | 6nm FinFET 工藝(採用雙工藝晶片設計:計算晶片 (XCD) 採用台積電 3nm 工藝,I/O 晶片採用 6nm 工藝),集成 185 億個晶體管,並支援 FP4 和 FP6 數據格式。值得注意的是,這是整個多晶片封裝,而非單晶片。每個 GPU 包含高達 288GB 的 HBM3E 顯存,使單一裝置能夠支援高達 520 億個參數的模型。 AMD 認為,這種計算密度和記憶體容量的組合對於在不進行過多模型劃分的情況下進行大型模型推理至關重要。
該平台提供 UBB8 配置,並有風冷和直接液冷兩種選擇,符合資料中心部署要求。
多節點吞吐量超過每秒 1 萬個代幣
本輪測試的一項關鍵成果是AMD在叢集規模下實現了每秒處理超過1萬個令牌的目標。 AMD使用Instinct MI355X GPU,在Llama 2 70B的伺服器和離線場景下均達到了這一閾值,並在GPT-OSS-120B的離線場景下也實現了這一目標。
這些結果反映出評估推理表現的趨勢正從單一加速器轉向集群層面。聚合吞吐量和服務時間正日益被用來判斷大規模人工智慧部署的生產就緒程度。
AMD 也展現了高效的擴充能力。在 Llama 2 70B 平台上,一個由 11 個節點和 87 個 GPU 組成的叢集在離線、伺服器和互動式場景下均實現了每秒超過 1 萬個令牌的處理能力,橫向擴展效率在 93% 到 98% 之間。在 GPT-OSS-120B 平台上,一個由 12 個節點和 94 個 GPU 組成的叢集也實現了類似的吞吐量,擴展效率超過 90%。這些結果表明,效能提升能夠有效地擴展到多個系統,而不僅僅是單一系統。
代際收益和具競爭力的單節點性能
AMD 報告稱,Llama 2 70B 伺服器的效能相比上一代 Instinct MI325X 提升了 3.1 倍,達到每秒 100,282 個代幣。這項提升得益於架構改進和 ROCm 軟體優化。離線效能提升了 4.4 倍,伺服器效能提升了 4.8 倍。這些提升主要歸功於 FP4 量化技術。
在單節點比較測試中,MI355X 展現了與 NVIDIA 平台相匹敵的實力。在 Llama 2 70B 平台上,AMD 的離線吞吐量與 NVIDIA B200 持平,伺服器效能接近,互動式效能則更勝一籌。與 NVIDIA B300 相比,AMD 的 GPU 在離線模式下效能達到 92%,伺服器模式下達到 93%,互動模式下更是高達 104%,遠超後者。
首次啟用新機型擴大覆蓋範圍
MLPerf Inference v6.0 包含多個新的工作負載,AMD 在本輪測試中展示了快速模型啟用能力。 GPT-OSS-120B 是一款混合專家模型,首次亮相,並在離線和伺服器場景下均取得了與 NVIDIA 系統相媲美的效能。
AMD 也提交了 WAN-2.2 文字轉視訊產生的測試結果,標誌著其正式進軍多模態和生成式視訊推理領域。雖然官方提交的測試結果側重於單流延遲,但其性能已與現有平台相媲美。提交後的最佳化調優進一步提升了效能,顯示隨著軟體的成熟,仍有很大的最佳化空間。
這些新增功能凸顯了 AMD 致力於超越傳統的 LLM 基準測試,以支援新興的 AI 工作負載。
ROCm軟體支援擴展和異構推理
AMD 將效能和可擴展性的大部分提升歸功於其 ROCm 軟體堆疊。增強功能包括最佳化的 FP4 執行、改進的 GPU 間通訊以支援分散式推理,以及支援跨異質環境的動態工作負載分配。
最初的 MLPerf 異質提交使用了三款 AMD Instinct GPU 型號:MI300X、MI325X 和 MI355X。該配置由戴爾和 MangoBoost 提交,在 Llama 2 70B Server 上實現了每秒 141,521 個令牌,在 Llama 2 70B Offline 上實現了每秒 151,843 個令牌。
值得注意的是,AMD Instinct MI355X 平台位於戴爾位於美國的實驗室,而 Instinct MI300X 和 MI325X 平台則位於韓國。這體現了跨地域系統協調的能力。
生態系增長和可複製性
在本次 MLPerf 測試中,AMD 的合作夥伴生態系統進一步擴展,共有九家公司提交了涵蓋多代 Instinct GPU 的測試結果。參與測試的廠商包括 Cisco、Dell、Giga Computing、HPE、MangoBoost、MiTAC、Oracle、Supermicro 和 Red Hat。
合作夥伴提交的測試結果與AMD內部測試結果高度吻合,通常在4%以內,某些情況甚至在1%以內。這種一致性表明,效能在OEM和雲端平台上均可複現,從而降低了部署風險,並增強了對實際應用效果的信心。




Amazon