存儲評論網

AMD Instinct MI350P:企業級 PCIe AI 推理重返標準伺服器

AI  ◇  企業

AMD 發布了 Instinct MI350P,這是一款針對企業用戶的 PCIe 加速卡,旨在幫助他們在無需重建資料中心的情況下實現本地 AI 推理。此卡採用雙槽、全高、全長設計,專為標準風冷伺服器打造。這也是近四年來 AMD 首次將新一代 Instinct 晶片整合到可直接安裝到普通伺服器中的小型顯示卡中。

AMD Instinct MI350P

自 2022 年初 MI210 上市後,PCIe Instinct 產品線實際上就陷入了沉默。此後的每一代產品(MI300X、MI325X 和 OAM MI350X)都是採用 OAM 插槽的通用基板模組,需要專門設計的機箱,該機箱必須具備足夠的供電和散熱能力,才能在一個托架內容納八個 1,000W 級加速器。這對於按機架採購 GPU 的超大規模資料中心來說很合適。但對於想要在本地進行推理但又無法或不願投入客製化 AI 機架的企業來說,這種方式並不適用。 MI350P 正好填補了這一空白,而且目前 NVIDIA 還沒有同級別的旗艦級伺服器 PCIe 顯示卡,因此 AMD 暫時獨佔了這一細分市場。

硬體:MI350P 與 MI350X OAM 對比

MI350P 並非 MI350X 的縮小版。 AMD 為其設計了一款尺寸較小的晶片。 MI350X 擁有兩個 I/O 晶片,每個晶片包含四個加速器複合體晶片 (XCD),總共八個 XCD 和 256 個計算單元。 MI350P 只有一個 I/O 晶片,包含四個 XCD 和 128 個運算單元,晶片尺寸只有 MI350X 的一半,但其峰值頻率與 MI350X 相同,均為 2.2 GHz。記憶體配置也類似:四個 HBM3E 顯示堆疊(而非八個);4,096 位元匯流排(而非 8,192 位元匯流排);144GB 容量,傳輸速率為 4 TB/s(而非 288GB 容量,傳輸速率為 8 TB/s)。

AMD Instinct MI350P架構

峰值計算能力也減半。 MI350P 在 MXFP4 下的峰值運算能力為 4,600 TFLOPS,而 MI350X 為 9.2 PFLOPS;在 FP8 下的峰值運算能力為 2,300 TFLOPS,而 MI350X 為 4.6 PFLOPS。 BF16、FP16 以及其他精度堆疊的效能也呈現相同的下降趨勢。令人欣慰的是,AMD 同時公佈了實際效能和峰值運算能力。實際性能分別為:MXFP4 下 2,299 TFLOPS,FP8 下 1,529 TFLOPS,BF16 下 713 TFLOPS。這些數值反映了顯示卡在 600W 功耗下的實際效能,因為實際功耗會受到電力和記憶體頻寬的限制,從而影響理論峰值效能。

我們透過 Supermicro 的 Jumpstart 專案體驗了 MI350X 平台,其在推理工作負載方面的出色表現給我們留下了深刻的印象。我們迫不及待想要拿到 MI350P 來測試,看看這款 PCIe 版本在它所設計的傳統伺服器機箱中表現如何。

AMD Instinct MI350P PCIe 卡
規格 已交付(FLOPS) 峰值(TFLOPS)
性能
BF16 713 1150
FP16 672 1150
FP8 1529 2300
MXFP8 1327 2300
MXFP6 1804 4600
MXFP4 2299 4600
記憶體和分區
內存容量 144 GB HBM3E 144 GB HBM3E
記憶體頻寬 3.6 TB / s 4.0 TB / s
GPU實例 最多 4 個,每個 36GB 最多 4 個,每個 36GB
系統平台
影片和JPEG解碼
GPU 擴充互連 不支持 不支持
產品 FF FHFL雙槽風冷 FHFL雙槽風冷
最大總電路板功率 (TBP) 600W
(可配置450W)
600W
(可配置450W)
PCIe主機 x16 PCIe Gen 5,速度為 128GB/s x16 PCIe Gen 5,速度為 128GB/s

功耗並沒有完全減半。 MI350P 的額定功耗為 600W TBP,約為 MI350X 1,000W 的 60%。 600W 是 PCIe CEM 規格規定的上限,因此該顯示卡的運作溫度已達到插槽允許的最高值。對於無法提供全功率或散熱的機箱,MI350P 提供 450W 模式,但效能會降低。 600W 的額定功耗也使 MI350P 與 NVIDIA 的 H200 NVL 和 RTX Pro 6000 Server 處於同一價位,它們將在該細分市場中成為 MI350P 的主要競爭對手。

與 NVIDIA 的 H200 的 NVL4 不同,AMD 沒有在 MI350P 上暴露 GPU 的 Infinity Fabric 連結;所有集體通訊都透過 PCIe Gen5 x16 (128 GB/s) 連結進行。

八GPU風冷的故事

由於 MI350P 是一款標準的雙槽全高全長 PCIe 卡,因此它可以安裝在企業已部署和營運的伺服器中,包括目前主流 OEM 廠商推出的配備八 GPU 的緊湊型風冷平台。我們之前評測過的戴爾 PowerEdge XE7740 和 HPE ProLiant DL380a Gen12 顯然是其目標平台。這兩款伺服器均採用風冷機箱,專為容納八張雙槽全高全長加速卡而設計,其供電和氣流設計均已針對 600W 級顯示卡進行了優化。無需客製化機架、液冷系統或 OAM 底板。

在這些系統中,八卡 MI350P 配置將 1,152GB 的 HBM3E 記憶體和 32 TB/s 的總記憶體頻寬整合到一個風冷機箱中。對於大型開放權重模型的推理,這足以在單一機箱中運行一個基於 MXFP4 的萬億參數模型。但正如我們之前提到的,這種配置的缺點是缺乏可擴展的架構。在 OAM MI350X 上,GPU 透過通用基板上的 Infinity Fabric 進行通訊。而在 MI350P 上,每個 GPU 之間的通訊都透過 PCIe Gen5 x16 以 128 GB/s 的頻寬進行,與連接到主機的路徑相同。對於推理工作負載,尤其是在節點內部進行張量並行分片以及跨節點進行管線或資料並行處理的情況下,這種方式是可行的。對於緊密耦合訓練(其中所有歸約頻寬主導步長),OAM 平台仍然是最佳選擇。

精確格式

儘管MI350P支援的所有格式都不是新的,但精確度仍然值得一提。 MI350X也支援相同的格式集。之所以精確度仍然重要,是因為OCP區塊縮放資料類型(MXFP8、MXFP6、MXFP4)已成為前沿模型實驗室訓練和發布模型的標準。這些格式允許實驗室以較低的精度進行訓練,而品質損失幾乎可以忽略不計,並且推理性能的提升會立即顯現。

低精度速度更快。 MXFP4 的運行速度是 FP8 的兩倍多,峰值速度約為 BF16 的四倍。這種速度提昇在實際工作負載中顯而易見。 OpenAI 的 gpt-oss 版本使吞吐量的提升更加顯著,像 Kimi K2.6 這樣的前沿模型從一開始就使用 INT4 進行原生量化感知訓練,而不是事後進行量化。另一方面,記憶體也是一大優勢。 INT4 和 MXFP4 的權重佔用的空間僅為 BF16 的四分之一。這意味著,擁有萬億參數的模型可以裝進一台配備八個 GPU 的伺服器。對於希望在本地部署大型開放權重模型的企業而言,差異僅僅在於一個機架與一個包含所有網路和編排所需的多節點叢集之間的差異。

底線

大多數評估本地部署AI的企業,在運算能力不足之前,往往已經面臨電力、散熱、機架密度或預算的限制。而AMD的PCIe Instinct顯示卡可以直接整合到他們現有的伺服器環境中,從而規避了這些限制中最嚴重的問題。 NVIDIA目前還沒有旗艦級的伺服器PCIe顯示卡與之競爭,這意味著在這種情況持續下去之前,AMD在這個細分市場將佔據絕對優勢。

更多資訊請造訪AMD Instinct頁面。

參與 StorageReview

電子報| YouTube | PodcastiTunes / Spotify | Instagram | Twitter | TikTok | RSS訂閱

哈羅德弗里茨

自 IBM 創建 Selectric 以來,我一直在科技行業工作。 不過,我的背景是寫作。 因此,我決定退出售前業務,回歸本源,從事一些寫作工作,但仍從事技術工作。