存儲評論網

AMD 第六代 EPYC Venice 處理器:256 個核心,1.6TB/s 讀寫速度,以及首款 PCIe Gen 6 伺服器 CPU

企業  ◇  伺服器

AMD 2026人工智慧大會是迄今為止規模最大的發表會,內容之豐富,以至於我們不得不將其分為兩篇進行報導。第一篇文章介紹了Instinct MI455X伺服器和72GPU的Helios機架式伺服器;而這篇姊妹篇則著重介紹那些無法與它們一同刊登的內容:代號為Venice的第六代EPYC伺服器處理器和Verano主機處理器。這款CPU值得單獨成篇。 Venice每個插槽最多可擁有256個核心和512個線程,記憶體頻寬高達1.6TB/s,是首款支援PCIe Gen 6的伺服器處理器,其吞吐量更是2017年第一代EPYC的18倍。

Venice 也不是一顆晶片,而是產品組合,AMD 在每次發表會上都一再強調這一點:沒有一種 CPU 能滿足所有需求。同一代 Zen 6 架構衍生出了高密度處理器、企業級處理器、堆疊快取高效能運算處理器以及低功耗 LPDDR 主機處理器。因此,在討論速度和效能之前,讓我們先來看看這個產品線。

威尼斯和維拉諾陣容

AMD 將現代資料中心伺服器分為三類,其產品組合旨在滿足所有這些需求。通用 CPU 伺服器運行著 Web 網關、快取、應用層、資料庫和儲存等所有元件,其他所有元件都依賴這些元件。 GPU 伺服器需要一個主機 CPU 來為加速器提供數據,在這個過程中,單執行緒速度和 I/O 頻寬比核心數量更重要。第三類是高密度 CPU 伺服器,用於運行圍繞 AI 服務發展的編排和工具執行程式碼;這類程式碼分支頻繁且容易出現停頓,因此對執行緒的需求尤其迫切。

AMD EPYC Venice

該產品線包含四款產品,平台分批推出:Venice SP7 將於 2026 年第四季發布,Venice SP8 將於 2027 年上半年發布,Venice-X 和 Verano 將於下半年發布。 AMD 將同一款晶片細分為六種不同的版本,更細緻的劃分直接對應三個層級。通用型處理器包括 Venice SP7、SP8 和 Venice-X。主機級處理器則將高頻 Venice 晶片與 Verano 及其 LPDDR 記憶體結合。高密度運算型處理器則稱為 Venice 256c:它擁有高核心數和低功耗,旨在盡可能在有限的功耗下將更多執行緒整合到機架中。 Verano 也兼具多種功能:AMD 表示,部分客戶將在每瓦效能是關鍵限制因素的場景下部署為通用處理器。

AMD EPYC Venice路線圖

透過腳註,我們可以事先了解各款處理器的具體型號。 256 核心的 EPYC 9996 是該系列的主打產品,9956 擁有相同的核心數,功耗為 400W,而 96 核心的 9686F 則是高頻主機晶片。 Helios 的每個運算托架都配備了自家版本的主機晶片—EPYC 9G76。

不妥協層

在介紹規格表之前,先簡單說說這款大尺寸插槽的定位。 Venice SP7 專為 AMD 最高階、效能毫不妥協的系列產品而設計:資料中心、超大規模資料中心和高效能運算 (HPC) 部署,在這些應用中,機架吞吐量是決定性因素,廠商不惜一切代價。伺服器廠商已經開始圍繞它重新調整產品線。戴爾為了騰出空間,對其沿用多年的 PowerEdge 命名體系進行了拆分,並將這一級別的計算產品歸入全新的 9000 系列,其中旗艦產品 PowerEdge R9825 和 Rack Scale M9825 均採用 3U 機箱,並搭載兩顆 Venice 晶片。

PowerEdge M9825 俯視圖

主要規格

整個家族都建立在一個平台上,而且自都靈以來,幾乎每個角落都是新的。

AMD EPYC Venice 創新

首先來看核心。 Zen 6 有兩種版本:緊湊型 Zen 6c 在一個插槽中整合了 256 個核心和 512 個線程,功耗最高可達 600W;而標準版的核心數為 96 個,但最高頻率可達 5GHz。 AMD 聲稱,在核心數量相同的情況下,Zen 6 的單核心效能比競爭對手高出 20% 以上,而且高密度設計並沒有減少快取:即使是 256 核心的晶片,每個核心也保留了約 4MB 的 L3 緩存,旗艦版更是高達 1GB。 AVX-512 指令集用於處理標記器和參數量在 30 億到 80 億之間的各種模型,這些模型越來越多地在 CPU 本身上運行。

為了滿足這些核心的需求,需要更大的內存系統:16 通道 DDR5 內存,速度為 8,000MT/s,或者 MRDIMM 內存,速度為 12,800MT/s,每個插槽可提供 1.6TB/s 的頻寬,而 Turin 僅使用 12 通道即可達到 614/GB 的頻寬。 I/O 效能也實現了同樣的飛躍。 Venice 是首款採用 PCIe Gen 6 的伺服器 CPU,擁有 128 條 PCIe 通道,每條通道的頻寬高達 64 GT/s,是目前連接到加速器的其他任何產品的兩倍,這也是我們稍後將詳細闡述的主機節點概念的基礎。 CXL 3.1 利用這些通道進行記憶體擴展,而部分雙路 AI 主機平台則犧牲了插槽間的 xGMI 頻寬來換取 I/O 效能,從而達到 160 個可用通道。兩個更安靜的新增功能可在不佔用核心的情況下移動資料:SDXI 卸載記憶體複製和相當於 30 到 50 個核心的加密任務,而智慧型資料快取注入則將網路資料包直接放入緩存,而不是透過 DRAM 進行路由。

電源管理新增了三個控制選項,它們至關重要,因為AMD之後進行的所有機架式處理器效能比較都基於一定的功耗預算。 UPP將SoC和DIMM的功耗預算合併為一個,因此,記憶體密集型工作負載會將部分功耗轉移到DIMM,而計算密集型工作負載則會減少部分功耗,從而在固定預算內提升性能,或者釋放機架電源以支援更多節點。 UBPS在低負載時限制功耗,以犧牲通常的輕負載效能提升為代價,換取平穩、可預測的負載曲線;喜歡效能提升的使用者可以將其關閉。 FAST將一個SoC拆分為兩個獨立工作模式,保持優先核心的高頻運行,同時降低後台核心的運行速度,從而避免與批次作業共享相同插槽的延遲敏感型任務受到影響。

在安全性方面,Venice 延續了 AMD 機密運算技術的傳統,其技術基礎可追溯至 EPYC 7002 上的 SEV,並融合了加密狀態、安全嵌套分頁以及 Turin 架構引入的可信任 I/O 等技術。本代產品新增了多項功能:採用 RSA-4K 和後量子演算法的增強型信任根、物理攻擊和側通道攻擊緩解措施、FIPS 140-3 1 級認證,以及設備溯源(Device Provenance)功能——Venice 將成為首批具備此功能的 AMD 產品之一,該功能可提供可驗證的製造歷史記錄。

投資組合內部

這四個部分之間的差異比它們共同的名稱所暗示的要大得多。

規格 9006 SP7 9006 SP8 9006X SP7 9006 LP “Verano”
核心 最多 256(512 個線程) 8年到128年 截至到96 截至到72
峰值頻率 5.0GHz,96 核(HF) 高頻選項 ~5.15GHz 高達5.0GHz
記憶體應用 16通道,最高可達1.6TB/秒 8 頻道,每個頻道 2 個 DIMM 插槽 16通道MRDIMM,傳輸速率12,800 MT/s 24頻道LPDDR5X,SOCAMM2
L3緩存 最高1024MB 核心數依賴性 1152MB(3D V-Cache) 核心數依賴性
的I / O PCIe Gen 6,128 頻道 1P 128 條 PCIe 頻道,1P 和 2P PCIe 第 6 代 增強型 xGMI 為 112 GT/s
目的是 超大規模密度,人工智慧主機 企業級、邊緣運算、NEBS友善型 高效能運算、人工智慧預處理 機架級人工智慧主機

EPYC 9006 SP7

SP7是旗艦插槽,也是目前量產的插槽;合作夥伴平台將於第四季跟進。其高頻產品取代了AMD所說的Turin HF系列產品,後者是其產能爬坡最快的SKU之一,而其最大的應用場景是Helios伺服器。在Helios中,每個計算托架上的主機CPU都透過Infinity Fabric連接到機架的統一記憶體域,並配備1TB的DDR5記憶體。由於該插槽是標準插槽,因此任何SP7 SKU,包括256核心的旗艦產品,都可以直接使用,這一點我們在先前的文章中已經介紹過。

EPYC 9006 SP8

SP8處理器以犧牲大型插槽為代價,換取了系統經濟性。它支援8到128個核心,採用8通道記憶體設計,每個通道配備2個DIMM插槽,保留了128個PCIe通道,並提供單路和雙路兩種版本,以及適用於電信和邊緣部署的高頻和NEBS相容選項。 AMD的賣點是為企業提供適配效能的解決方案,在企業級應用中,決定交易成敗的指標是每套系統每美元的效能,而不是每個機架的效能。

EPYC 9006X “威尼斯-X”

Venice-X 在 96 核心高頻配置上堆疊了 3D 垂直緩存,並將 L3 快取提升至 1152MB,約為標準 SP7 處理器每個核心快取容量的 3 倍。其時脈頻率可達約 5.15GHz,並沿用了完整的 16 頻道、12,800 MT/s 記憶體系統。其目標應用包括模擬和建模、大規模分析、記憶體資料庫以及為訓練管線提供資料的 AI 預處理——在這些工作負載中,快取中的工作集比額外的核心數更為重要。

EPYC 9006 LP “Verano”

Verano是該系列中最專注的產品:首先,它是一款AI主機節點,擁有高達72個5GHz的核心、24通道LPDDR5X內存,以及用於CPU到GPU通信的增強型112 GT/s xGMI鏈路。 LPDDR記憶體採用SOCAMM2模組,可在現場更換,這在大型系統中至關重要,因為如果記憶體條焊接在主機板上發生故障,則整個主機板都將報廢。它也是AMD直接對抗NVIDIA Vera的產品,我們稍後會再次討論這場對決,因為AMD確實進行了深入分析。

威尼斯排名如何

AMD分兩輪證明了自己的實力,先在都靈站展示了其已經取得的領先優勢,然後在威尼斯站展示了其正在拉開的差距。

都靈隊今天領先

AMD 的大部分對比測試都以 NVIDIA 的 Vera(Vera Rubin 平台上的 Arm CPU)為基準,並首先比較了其已上市的一代產品。根據 AMD 的機架級建模,Turin 機架的通用吞吐量是 Vera 的 2.4 倍,每瓦代理數是 Vera 的兩倍。該模型將兩個機架的功耗預算都設定為 100kW,將擁有 384 個核心的雙路 EPYC 9965 與擁有 176 個核心的雙路 Vera 主機板進行對比,並對六種工作負載的結果取平均值:SPECrate 2017 預估效能、RedPC-Red Java、NGINX、Redcli、Mak-MPC-MPC-Red-Aak Java、NGINX、Redc-MPC-TPC-B5-B5-B5 端 Java、NGINX、RedC、MPCC 產品。

本文及後續內容需注意兩點。 Vera 尚未正式發售,因此文中所有關於 Vera 的數據均為 AMD 對 NVIDIA 公開資料中所述的 88 核心 450W 處理器的估算。此外,由於目前尚無針對代理工作負載的標準基準測試,AMD 在計算每瓦代理數時,會將硬體執行緒數作為代理數量的近似值。

與英特爾的比較更有說服力,因為雙方都在出貨AMD可以直接進行基準測試的產品。 Turin的主機CPU最高頻率可達5.0GHz,而同等級的至強處理器最高頻率僅為3.9GHz,28%的頻率優勢在單執行緒驅動GPU時至關重要。在同插槽配置下,AMD測試Turin與128核心至強6980P的效能比較結果顯示,Turin在SPEC CPU測試中最高可達1.4倍,企業級Java測試最高可達1.4倍,HPC測試最高可達1.8倍,基於CPU的AI測試最高可達1.7倍。

威尼斯擴大了每一個縫隙

Venice 進一步擴大了這些優勢。在相同的 100kW 機架車型下,Venice 擁有 512 個核心,而 Vera 只有 176 個,AMD 聲稱 Venice 的通用性能是 Vera 的 3.3 倍。 Venice 的每瓦代理數是 136 核心 Arm AGI 的 2.8 倍,並且在 Venice 搭載 GPU 的情況下,其在 frontier 模型上的每秒令牌數是 Vera 的 1.8 倍。需要注意的是,這 1.8 倍的倍數所衡量的應用場景比標題所暗示的要窄,我們將在下文的主機節點部分對此進行詳細討論。

與維拉正面交鋒

在 SPECrate 2026 測試中,AMD 預計 2P Venice 9996 的效能將達到 2070 分,而 Vera 僅為 925 分,吞吐量優勢高達 2.2 倍;此外,這款 96 核心高頻處理器的單核心效能也比 Vera 高出約 1.2 倍。以上結果皆使用 GCC 15.2 編譯,NVIDIA 也曾使用相同的工具鏈測試 Vera 的效能。

在發布週期間,AMD 宣稱的單核心效能優勢實際上有所提升。 AMD CPU 工程負責人 Ravi Kuppuswamy 告訴媒體,AMD 最初聲稱單核心效能優勢為 10%。本週早些時候,NVIDIA 公佈了其 Vera 測試數據後,NVIDIA 團隊使用相同的編譯器和設定重新進行了對比,測得領先優勢為 20%,而此時調優工作尚未完成。 Kuppuswamy 表示,2.2 倍的吞吐量差距與 AMD 內部的預期一直相符。此外,AMD 還使用其自家的 AOCC 編譯器,在 SPECrate 2017 測試中重新計算了單核心效能,結果為 1.7 倍,因此 20% 的差距更為保守。

英特爾和Arm

AMD 也公佈了更廣泛的 SPECrate 2017 排名。 Venice 9996 以 4900 分位居榜首(256 核心,600W,1K 售價 14,904 美元),其次是 Turin 9965(3240 分)、Intel Xeon 6980P(2510 分,128 核心,500W,售價 1.3, Arm核心,300W)和 Vera(1459 分)。 9996、AGI 和 Vera 的數據為 AMD 預估值;Turin 和 Intel 的得分為已發表的測試結果。與 Intel 相比,在價格相近的情況下,Venice 13,955 的吞吐量大約是 Intel 的兩倍,或者說每美元的性能是 Intel 的兩倍。以單核心計算,128 核心、500W 的 Venice 配置的得分是 6980P 的 13 倍,而 Arm AGI 的得分是 1944P 的 0.7 倍。與上面的 Vera 對比不同,這裡每個廠商的得分都是用他們自己的最佳工具鏈產生的:AMD 使用 AOCC,Intel 使用 OneAPI,Arm 使用 GCC 136。

雲端原生和高效能運算

AMD 也按工作負載細分了對比結果,所有結果均以 Intel 6980P 為基準,設定為 1.0 倍。在雲端原生應用程式方面,擁有 256 核心的 Venice 9996 在 MongoDB 測試中效能提升 3.5 倍,在 Redis 測試中提升 2.9 倍,在 NGINX 測試中提升 3.7 倍,在 MySQL 測試中提升 2.6 倍。 Turin 在相同測試中效能提昇在 1.6 倍到 2.4 倍之間,Graviton5 的效能提昇在 1.2 倍到 1.5 倍之間。

在高效能運算 (HPC) 領域,Venice 在 GROMACS 和 NAMD 測試中得分是 Xeon 的 3.1 倍,在 WRF 測試中是 2.9 倍,在 Quantum Espresso 測試中是 1.8 倍。記憶體配置對這些得分的影響非常顯著。使用標準的 8,000 MT/s RDIMM 記憶體時,Venice 在 GROMACS 測試中的得分是 Xeon 基準測試的 2.81 倍;使用 12,800 MT/s MRDIMM 內存後,得分提升至 3.13 倍,同樣的升級也使 WRF 測試的得分從 2.250 倍。 AMD 將其在 HPC 領域的領先優勢總結為 1.8 倍到 3.5 倍不等,具體取決於工作負載和記憶體配置。 Intel 基準測試使用的是 8,800 MT/s MRDIMM 內存,因此差距並非源自於 AMD 升級後的內存與 Intel 低速內存的比較。

主機節點和 1.8 倍聲明

這就引出了每秒 1.8 倍令牌數的說法。背後的硬體改進很容易列舉:5GHz 的主機部分現在擁有 96 個核心而不是 64 個,主機記憶體頻寬從 614GB/s 提升到 1.6TB/s,PCIe Gen 6 將 CPU 到 GPU 鏈路的頻寬提高了一倍。

首先要檢查的是基準線。 AMD 將此圖表的基準線設定為 Turin 1.0,而非 Intel,並將第六代至強處理器的基準線設定為 0.9,因此,當以至強 6960P 為基準線重新計算時,同樣的效能提升接近 2 倍。預計的效能提升幾乎完全來自 I/O 頻寬。 AMD 進行了 CPU 卸載測試,將 Qwen3-30B 的 BF16 權重資料從主機記憶體傳輸到 GPU,結果發現 PCIe Gen 5 x16 接收路徑的運行速度達到了其理論上限的 89% 到 95%,而主機 DRAM 讀取速度則低於其理論上限的 10%。解碼速度受限於傳輸速度,因此,使用 PCIe Gen 6 將連結速度提升一倍,在此測試中可獲得 1.8 倍到 1.9 倍的效能提升。 Venice 目前是唯一一款為加速器提供 PCIe Gen 6 的伺服器 CPU,因此這項優勢是真實存在的,目前是獨有的。不過,其適用範圍有限:1.8 倍的效能提升僅描述了一種頻寬受限的卸載模式,並不代表在 Venice 主機上,GPU 處理所有模型的速度都能提升 1.8 倍。就目前出貨的硬體而言,在同一台 8 核心 B200 系統上,Turin 主機在 vLLM 和 NIM 工作負載的首次令牌處理時間方面,幾何平均值比 Xeon 6960P 快 13%,最佳情況下提升幅度可達 36%。

機架密度

最後一項數據是密度:威尼斯捲軸每架有 49,152 個捲軸芯,而都靈捲軸為 36,864 個,維拉捲軸為 22,528 個,而且每部分捲軸的線數是捲軸芯數的兩倍。在所有數據中,應用尾註後,這項數據的變化最大。

標題是核心數量是 Vera 的 2.2 倍,但 Venice 機架達到這一數字時功耗為 269kW,而 Vera 的功耗為 185kW,因此兩款機架並非在相同功耗下進行比較。 AMD 的註釋提供了標準化版本。如果兩款機架的功耗都控制在 100kW 以內,9996 的核心數量是 Vera 的 2.08 倍,是 Turin 的 1.86 倍,是 Intel 6980P 的 1.24 倍。如果用 400W 的 EPYC 9956 取代旗艦級處理器,AMD 估計其核心數是 Vera 的 1.91 倍,功耗降低 26%,因此每機架瓦特核心數是 Vera 的 2.57 倍。根據固定的功耗預算,領先優勢在 1.9 倍到 2.2 倍之間。與本文中所有 Vera 的數據一樣,NVIDIA 機架的數據是根據已公佈的規格而非實際硬體測量數據估算的。密度優勢在標準化後仍然存在;它只是比 2.2 倍的峰值要小。

大惡霸

暫且不談個別數據:在伺服器CPU市場的高階領域,AMD目前沒有直接競爭對手。英特爾最好的產品落後於Turin,而AMD已經開始著手替換Turin這一代產品。在AMD公佈的所有圖表中,Arm的競爭對手都排在Turin之後。 Vera尚未出貨,AMD估計其吞吐量不到Turin 9965的一半(Turin 9965已經上市一年半了),而Venice的吞吐量大約是Turin的兩倍。根據Mercury Research的數據,這一地位使AMD佔據了伺服器CPU收入的46%。市場證據也指向同樣的方向。目前,高階EPYC處理器的需求超過了供應,導致交貨週期延長。

我們也可以補充一點數據。我們創造的314兆位數π的世界紀錄是在一台戴爾PowerEdge R7725伺服器上完成的,該伺服器配備兩顆192核心的EPYC 9965處理器和1.5TB的DDR5內存,與AMD Turin機架所採用的384核雙路配置相同。在計算過程中,所有核心都保持滿載運行了110天,並且沒有出現任何停機時間;任何記憶體錯誤或崩潰都會導致挑戰失敗。平均功耗約為1,600瓦,整個運行過程消耗了4,305千瓦時,即每萬億位數耗電13.7千瓦時,而此前300萬億位數的紀錄估計耗電33,600千瓦時,運行時間約為225天。

結語

Venice 是 AMD 迄今為止最強大的伺服器 CPU 發布會,其真正的亮點在於其產品覆蓋面之廣。 Zen 6 架構涵蓋了從 256 核心密度的處理器,到企業級插槽、配備 1152MB 堆疊快取的高效能運算晶片,再到 LPDDR 主機節點,客戶可以基於相同的架構和軟體基礎來建立資料中心的各個層級。發表會上公佈的數據在詳細解讀後依然令人信服:在相近的定價下,吞吐量約為英特爾的兩倍;在相同的編譯器下,單核心效能比 Vera 高出 20%;機架密度是英偉達主機 CPU 的 1.9 倍到 2.2 倍(取決於功耗)。

商業方面無需預測。 SP7 現已投產,合作夥伴平台將於第四季上市;SP8 將於 2027 年上半年推出,Venice-X 和 Verano 則緊隨其後。銷售這些產品的公司已佔據伺服器 CPU 收入的 46%,其現有產品的需求遠遠超過供應,因此買家寧願排隊等待也不願放棄。即使 Venice 的發佈時間推遲一年,本文中的對比仍然會顯示其領先地位,因為 Turin 的表現已經超越了圖表上所有其他產品,無論是否已出貨。 AMD 的領先優勢如此之大,以至於目前最接近的競爭對手竟然是其上一代產品。

參與 StorageReview

電子報| YouTube | PodcastiTunes / Spotify | Instagram | Twitter | TikTok | RSS訂閱

迪維揚什·賈恩

機器學習工程師,家庭實驗室愛好者和技術發燒友。在 StorageReview,我負責人工智慧和新興工作負載的測試,提供洞察分析和效能分析。