存儲評論網

NVIDIA 在 CES 2026 上發布 Vera Rubin 架構:VR NVL72 機架

AI  ◇  數據處理單元  ◇  企業  ◇  網路相關  ◇  伺服器  ◇  服務器機架

在 2026 年國際消費電子展 (CES) 上,NVIDIA 發布了 Rubin 平台,其核心產品是 Vera Rubin NVL72 機架式系統。這是 NVIDIA 的第三代機架式架構,將六款共同設計的晶片整合到一個統一的系統中。該平台將於 2026 年下半年透過合作夥伴管道發售,所有六款晶片均已完成製造,目前正在進行實際工作負載驗證。

Vera Rubin NVL72:六晶片,一個統一系統

Vera Rubin NVL72 採用了 NVIDIA 所謂的“極端協同設計”,即同時開發六個不同的晶片,使其作為一個統一的系統運作。

Vera CPU:專為人工智慧工廠設計的ARM晶片

NVIDIA 首次展示的晶片是 Vera CPU,NVIDIA 繼續增加對用於 AI 工作負載的客製化 ARM 晶片的投入。 Vera CPU 基於 88 個客製化的 Olympus ARM 內核,完全相容於 Armv9.2,專為滿足現代 AI 工廠的資料傳輸和智慧體處理需求而設計。它採用 NVLink-C2C 連接,可為 Rubin GPU 提供 1.8 TB/s 的頻寬,C2C 頻寬是上一代產品的兩倍,運行速度是 PCIe Gen 6 的七倍。與上一代 Grace CPU 相比,Vera CPU 在資料處理、壓縮和程式碼編譯方面的效能提升了一倍。

世代對比:Blackwell Ultra 與 Vera Rubin NVL72

規格 GB300 NVL72(Blackwell Ultra) VR NVL72(維拉魯賓)
GPU 數量 72塊Blackwell Ultra GPU 72 個 Rubin GPU
CPU數量 36 個 Grace CPU 36個Vera CPU
CPU內核 每個CPU配備72個ARM核心 每個CPU配備88個奧林巴斯ARM核心
FP4推理性能 1.44 百億億次浮點運算 3.6 百億億次浮點運算
每個 GPU 的 NVFP4(推理) 20 浮點數 50 浮點數
每個 GPU 的 NVFP4(訓練) 10 浮點數 35 浮點數
GPU記憶體型 HBM3e HBM4
GPU內存帶寬 約 8 TB/秒 約 22 TB/秒
NVLink 世代 NVLink 5 NVLink 6
NVLink頻寬(每個GPU) 1.8 TB / s 3.6 TB / s
機架級 NVLink 頻寬 130 TB / s 260 TB / s
橫向擴展網卡 ConnectX-8(800 Gb/s) ConnectX-9(1.6 TB/s)
CPU-GPU互連 NVLink-C2C(900 GB/s) NVLink-C2C(1.8 TB/s)

Rubin GPU:Transformer Engines、NVFP4 和 HBM4

接下來是本次發表會的明星產品-NVIDIA Rubin GPU。它搭載了第三代Transformer引擎,並配備了硬體加速的自適應壓縮技術。這項技術能夠動態調整Transformer各層的精度,在可以降低精度的地方提高吞吐量,同時在關鍵區域保持高精度。這款NVFP4實現的推理運算能力高達50 petaflops(是Blackwell的5倍),訓練運算能力高達35 petaflops(是Blackwell的3.5倍)。 Rubin GPU是首款整合HBM4顯存的GPU,頻寬高達22 TB/s,這項顯著提升解決了大型MoE模型面臨的記憶體頻寬瓶頸問題。

NVLink 6:機架級全對全通信

NVIDIA NVLink 6 交換器將單 GPU 頻寬提升至 3.6 TB/s,整套機架可提供 260 TB/s 的縱向擴充網路頻寬-超過全球網路橫斷面頻寬的兩倍。這種縱向擴展架構使每個 GPU 都能同時與其他所有 GPU 通訊(這是 MoE 專家並行運算的必要條件),其中所有專家必須在叢集內共享運算結果。內建的網路內運算能力可加速集體運算並減少網路擁塞,從而卸載原本會佔用 GPU 運算週期的工作。

ConnectX-9 SuperNIC:重新定義橫向擴充網絡

NVIDIA ConnectX-9 超級網卡可處理橫向擴展網絡,每個 GPU 可提供 1.6 TB/s 的 RDMA 頻寬,實現機架外部的通訊。 ConnectX-9 與 Vera CPU 共同設計,旨在最大限度地提高資料路徑效率,並引入完全軟體定義、可編程的加速資料路徑,使 AI 實驗室能夠實現針對其特定模型架構優化的自訂資料傳輸演算法。

BlueField-4 DPU 與 ASTRA 安全架構

BlueField-4 是 NVIDIA 的第四代資料處理單元 (DPU),它從根本上重新定義了 AI 工作負載的儲存和網路架構。與 BlueField-3 的 16 個 ARM Cortex-A78 核心相比,這款全新的 DPU 配備了 64 核心 NVIDIA 級 CPU,運算效能提升了 6 倍。它整合了 ConnectX-9 SuperNIC(而非 BlueField-3 的 ConnectX-7),網路頻寬翻倍至 800 Gb/s。 GPU 對資料儲存的存取速度也比上一代產品快了 2 倍。除了規格上的提升,BlueField-4 的意義在於它所實現的:一種全新的 AI 原生儲存基礎設施,NVIDIA 將其定位為大規模智慧 AI 的關鍵所在。

BlueField-4 將網路、儲存和安全處理任務卸載到 CPU 上,使 Rubin GPU 和 Vera CPU 能夠專注於模型執行。它已完全整合到 NVIDIA 企業級 AI 工廠的驗證設計中,並獲得 Red Hat、Palo Alto Networks、Fortinet 等公司的生態系統支援。

BlueField-4 也引進了 ASTRA(進階安全可信任資源架構)。這種系統級信任架構提供了一個統一的控制點,用於安全地配置、隔離和運行大規模 AI 環境,同時不會影響效能。

整個機架上的機密計算

Vera Rubin NVL72 是首款在整個系統範圍內提供 NVIDIA 機密運算的機架級平台。第三代機密運算可在 CPU、GPU 和整個 NVLink 域中維護資料安全,所有匯流排在傳輸過程中均經過加密。這解決了企業和 AI 實驗室在共享基礎設施上運行專有模型時日益關注的問題:即使部署在第三方系統上,也能確保模型、訓練資料和推理工作負載的安全。

NVIDIA Spectrum-6 乙太網路交換器為 NVIDIA 的橫向擴充網路提供強大支援。它基於 200G SerDes 技術,採用共封裝光模組 (CPO),交換容量高達 102 TB/s,可為 VR NVL72 機架提供東西向流量支援。採用 CPO 技術意義重大。 NVIDIA 聲稱,透過將光模組直接整合到交換器晶片中,與傳統的可插拔光模組相比,可靠性提高了 10 倍,正常運行時間延長了 5 倍,電源效率提高了 5 倍。

降低教育部模型成本與提高效率

NVIDIA 表示,VR NVL72 在與 Blackwell 相同的延遲下,進行大型混合專家模型推理時,代幣成本僅為 Blackwell 的七分之一。它只需四分之一的 GPU 即可在相同時間內訓練相同的大型 MoE 模型。該平台每瓦的推理計算能力是 Blackwell 的 8 倍。

這些改進滿足了 MoE 模型的需求,這類模型針對任何給定的令牌僅啟動其專家子集。例如,Kimi K2 Thinking 模型使用了 384 位專家,但每次只啟動 8 位,這需要大量的 GPU 間通訊。 VR NVL72 的 260 TB/s 可擴充網路能夠處理這種通訊模式。

專為大規模應用而設計的無纜機架

VR NVL72 採用模組化、無電纜、無風扇、無軟管的托架設計,僅使用 PCB 和連接器,無需內部佈線。計算托架插入機架時透過盲插連接器連接,無需手動佈線。唯一的外部連接是連接到液冷模組的兩根液體進出水軟管。

之前的系統,例如 GB300 NVL72,組裝一個計算托架大約需要 100 分鐘。每條線纜連接都是潛在的故障點,在數十萬個 GPU 的規模下,這個問題尤其嚴重。線纜佈線限制了散熱路徑並佔用空間,而風扇則增加了機械複雜性和噪音。

全新設計將組裝和維護時間縮短了 18 倍。該平台還配備了第二代 RAS(可靠性、可用性、可維護性)引擎,涵蓋 GPU、CPU 和 NVLink,提供即時健康檢查、容錯和主動維護功能。 NVLink 交換器托架現在支援零停機維護,即使移除或部分安裝交換器托架,機架也能保持運作。在數十萬 GPU 的規模下,這些可維護性的改進將直接轉化為叢集的正常運作時間和吞吐量。

這種架構為未來更高密度的配置奠定了基礎。這也是關鍵所在。 允許之前預告過的 我們在人工智慧基礎設施高峰會上介紹了 Vera Rubin CPX 機架設計。此外,還增加了上下文處理 GPU。 在原本就十分緊湊的設計中,仍使用相同的計算模組。

推理情境記憶儲存平台

NVIDIA 在 CES 2026 上發布了推理上下文記憶體儲存平台,這是一個專為鍵值快取 (KV 快取) 建構的全新 AI 原生儲存基礎架構。該平台採用 BlueField-4 和 Spectrum-X 乙太網路技術,與用於推理上下文的傳統網路儲存相比,其每秒令牌處理能力提升高達 5 倍,每美元總擁有成本 (TCO) 效能提升高達 5 倍,能源效率提升高達 5 倍,並且首次令牌處理時間縮短了 20 倍。 BlueField-4 的硬體加速 KV 快取放置功能消除了元資料開銷並減少了資料移動,而 Spectrum-X 乙太網路則為基於 RDMA 的存取提供了高頻寬、低延遲的架構。

該平台旨在解決LLM推理中日益嚴重的瓶頸:鍵值快取管理。 Transformer模型使用注意力機制,其中每個產生的token必須專注於所有先前的token。如果沒有緩存,則需要為每個token重新計算鍵值向量,導致複雜度為O(n²)。鍵值快取將這些預先計算好的矩陣儲存在記憶體中以供重用,從而將複雜度降低到O(n)。問題在於,鍵值快取的大小與序列長度和批次大小呈線性成長。一次長上下文對話可能會消耗數GB的記憶體。在多租戶環境中,處理跨越數百萬token的上下文視窗的數千個並發請求,GPU HBM將不堪重負。維運人員必須要么減小批次大小,要么縮短上下文窗口,要么購買更多GPU。

傳統網路儲存並非為鍵值快取存取模式而設計,此模式需要對分佈在多個並發會話中、可能高達TB級的瞬態資料進行低延遲隨機存取。推理上下文記憶體儲存平台提供了一個專用的儲存層,專門針對這種工作負載進行了最佳化,位於GPU HBM和傳統儲存之間。這使得AI工廠能夠獨立於GPU運算擴展上下文容量。我們之前介紹過如何使用Pliops的鍵值快取加速器在NVIDIA Dynamo中實現鍵值快取卸載。 NVIDIA透過NVIDIA推理上下文記憶體儲存平台進一步擴展了這項功能,並將其整合到其開源的Dynamo專案中。這提供了一個軟體框架,將這個新平台的解耦預填/解碼階段、智慧路由和分層儲存卸載整合在一起。

包括 VAST Data、NetApp、DDN、戴爾科技、HPE、日立 Vantara、IBM、Nutanix、Pure Storage 和 WEKA 在內的儲存合作夥伴正在建立基於 BlueField-4 的平台。這些平台將於 2026 年下半年上市。

Alpamayo:基於推理的自動駕駛車輛物理人工智慧

NVIDIA 發布了 Alpamayo 系列開源 AI 模型、模擬工具和資料集,旨在加速安全、基於推理的自動駕駛汽車 (AV) 開發。 Alpamayo 系列引入了基於思維鍊和推理的視覺-語言-動作模型,使自動駕駛汽車的決策過程能夠模擬人類的思維方式。 NVIDIA Halo 安全系統為這些系統提供了支援。

傳統的自動駕駛架構將感知和規劃分離,這會在出現新的或異常情況時限制其可擴展性。罕見且複雜的場景「長尾效應」仍然是自動駕駛系統安全應對的最大挑戰之一。 Alpamayo 透過讓模型能夠推理因果關係,逐步思考新的場景,從而提高駕駛能力和可解釋性,解決了這個問題。

Alpamayo 模型並非直接在車輛中運行,而是作為大規模的教學模型,開發者可以對其進行微調,並將其提煉成完整自動駕駛技術堆疊的核心。開發者可以將 Alpamayo 適配成更小的運行時模型用於車輛開發,或者將其用作自動駕駛開發工具(例如基於推理的評估器和自動標註系統)的基礎。

Alpamayo 模型、模擬和開放資料集

Alpamayo 1 是業界首款針對自動駕駛研究領域的鍊式推理 VLA 模型,現已在 Hugging Face 平台上線。 Alpamayo 1 採用 10 億參數架構,利用視訊輸入產生軌跡和推理過程,展現每個決策背後的邏輯。 Alpamayo 1 提供開源的模型權重和推理腳本。該系列未來的模型將擁有更高的參數數量、更精細的推理能力、更靈活的輸入輸出以及更多商業應用選項。

AlpaSim 是一個完全開源的端到端模擬框架,用於高保真自動駕駛汽車開發,可在 GitHub 上取得。它提供逼真的感測器建模、可配置的交通動態和可擴展的閉環測試環境,從而實現快速驗證和策略改進。

實體人工智慧開放資料集包含超過 1,700 小時的駕駛數據,涵蓋了最廣泛的地理區域和路況,囊括了罕見且複雜的現實世界邊緣案例,對於推進推理架構至關重要。這些資料集可在 Hugging Face 上取得。

開發人員可以根據專有的艦隊資料微調 Alpamayo 模型版本,將其整合到使用 NVIDIA DRIVE AGX Thor 加速運算建置的 NVIDIA DRIVE Hyperion 架構中,並在商業部署之前透過模擬驗證效能。

NVIDIA DRIVE、冗餘AV堆疊和梅賽德斯-奔馳CLA

英偉達已投入數千人的團隊,在自動駕駛汽車領域深耕八年。該公司建構了完整的技術棧:晶片(雙路Orin處理器、下一代雙路Thor處理器)、基礎設施(Omniverse和Cosmos)、模型(Alpamayo)以及應用層。五年前,賓士與英偉達合作部署了這套技術堆疊。

首款採用NVIDIA全端式自動駕駛技術的賓士CLA將於2026年第一季在美國上市,第二季在歐洲上市,第三/四季在亞洲上市。歐洲新車安全評鑑協會(Euro NCAP)給予CLA最高主動安全評分,該評分是2025年所有參賽車輛中最高的。系統中的每一行程式碼和每一個晶片都經過了安全認證。

該系統並行運行兩套完整的自動駕駛(AV)協定棧。 Alpamayo 協定棧採用鍊式推理,能夠處理複雜的駕駛場景。其底層是一套完整的傳統自動駕駛協定棧,具有完全可追溯性,耗時六到七年才開發完成。策略和安全評估人員會根據置信度決定使用哪套協定堆疊。如果 Alpamayo 遇到置信度不足的場景,系統將回退到傳統協定堆疊。這種軟體的多樣性和冗餘性,與安全關鍵型系統處理硬體冗餘的方式相呼應。

NVIDIA 將繼續使用新版本的 Alpamayo 更新系統。包括捷豹路虎、Lucid、Uber 和柏克萊 DeepDrive 在內的行動旅遊合作夥伴正在使用 Alpamayo 開發基於推理的 L4 級自動駕駛技術。

新型實體人工智慧模型與機器人技術公告

除了基礎設施和系統方面的發布,NVIDIA 還利用 CES 2026 推進其實體人工智慧策略,發布了新的開放模式、框架和邊緣平台,以加速機器人技術的發展。該公司推出了用於機器人學習的 Cosmos 世界模型和 GR00T 推理模型的更新版本,以及用於大規模機器人評估的全新開源工具(包括 Isaac Lab-Arena)。 OSMO 是一個邊緣到雲端的編排框架,旨在簡化跨異質運算環境的訓練工作流程。

NVIDIA重點介紹了其機器人技術堆疊在業界的廣泛應用,包括Boston Dynamics、Caterpillar、LG Electronics和NEURA Robotics在內的合作夥伴展示了基於NVIDIA技術構建的下一代自主機器人。該公司還宣布與Hugging Face加強合作,將NVIDIA Isaac和GR00T模式整合到開源的LeRobot框架中,進一步擴大全球機器人開發者社群的存取權。

在邊緣運算領域,NVIDIA 確認了搭載 Blackwell 處理器的 Jetson T4000 模組的上市,該模組可顯著提升自主機器和工業機器人的 AI 運算能力和能源效率。這些公告共同強化了 NVIDIA 將其全端 AI 平台擴展到資料中心之外的策略,該平台涵蓋模擬、模型、邊緣運算以及在機器人和自主系統中的實際部署。

參與 StorageReview

電子報 | YouTube | 播客 iTunes/Spotify | Instagram | Twitter | TikTok | RSS訂閱

迪維揚什·賈恩

機器學習工程師、家庭實驗室愛好者和技術發燒友。在 Storage Review,我負責人工智慧和新興工作負載測試,旨在提供實用見解和效能分析。