存儲評論網

NVIDIA 和 Google Cloud 將在 Next 2026 大會上擴展 AI 超級電腦平台

AI  ◇  企業

NVIDIA 和 Google Cloud 在拉斯維加斯舉行的 Google Cloud Next 大會上宣布了雙方長期工程合作的新階段,並介紹了 Google Cloud AI 超級電腦平台的更新,旨在擴展智能體和實體 AI 在生產環境中的應用。兩家公司將繼續合作設計涵蓋晶片、系統、網路和軟體的基礎設施,以支援日益複雜的 AI 工作負載,包括自主代理、機器人和數位孿生。

NVIDIA 和 Google Cloud 的標誌

Vera Rubin 開發的 A5X 基礎設施瞄準大規模人工智慧工廠

Google Cloud推出了基於NVIDIA Vera Rubin NVL72機架級系統的A5X裸機實例。這些系統旨在顯著提高推理的經濟性和效率,與上一代產品相比,每個令牌的成本最多可降低10倍,每兆瓦的令牌吞吐量最多可提高10倍。

A5X 平台整合了NVIDIA ConnectX-9 SuperNIC和 Google 的下一代 Virgo 網路協定堆疊。該架構支援在單一站點內擴展至 80,000 個 Rubin GPU,並在多站點部署中擴展至 960,000 個 GPU。該設計面向對網路效能和系統級優化要求極高的超大規模 AI 訓練和推理環境。

谷歌雲端強調,緊密整合的基礎架構和託管式人工智慧服務是支援下一代人工智慧工作負載的必要條件。這一組合技術堆疊使客戶能夠訓練、微調和部署模型,並專注於提升效能、效率和營運可擴展性。

布萊克威爾廣泛的產品組合輔助實現適度加速

Google Cloud 也概述了其基於 NVIDIA Blackwell 的實例產品組合,涵蓋各種部署規模和效能配置。產品包括基於 NVIDIA HGX B200 系統的 A4 虛擬機器、基於 GB200 和 GB300 NVL72 平台的 A4X 和 A4X Max 配置,以及透過配備RTX PRO 6000 Blackwell Server Edition GPU的 G4 執行個體提供的 GPU 部分存取權限。

RTX PRO 6000

此系列產品使企業能夠根據工作負載需求調整基礎設施。配置範圍從用於輕量級推理任務的部分GPU,到配備72個GPU的完整NVL72機架(透過第五代NVLink和NVLink交換器技術互連)。高階部署可擴展至數萬個GPU,用於大型模型訓練和分散式推理。

這些系統旨在支援一系列人工智慧工作負載,包括混合專家 (MoE) 模型、多模態推理、大規模資料處理以及機器人和實體人工智慧的模擬工作負載。

早期用戶已經開始利用該平台。 Thinking Machines Lab 使用基於GB300 NVL72的 A4X Max 實例來擴展其 Tinker API 的訓練規模,而 OpenAI 則在 Google Cloud 上基於 GB200 和 GB300 的實例上運行包括 ChatGPT 在內的大規模推理工作負載。

機密人工智慧擴展到 Blackwell GPU

谷歌雲端正在將其機密運算能力擴展到其人工智慧基礎設施。基於 NVIDIA Blackwell 和 Blackwell Ultra GPU 的 Gemini 模型現已在Google分散式雲端上提供預覽版,使企業能夠將模型部署在更靠近敏感資料來源的位置。

Google Cloud 安全控制圖表

NVIDIA Confidential Computing 可實現加密執行環境,確保提示資訊和微調資料免受未經授權的訪問,包括雲端營運商的存取。此功能也即將透過配備 RTX PRO 6000 Blackwell GPU 的 Confidential G4 虛擬機器引入多租戶環境。

這標誌著 Blackwell GPU 在公有雲中首次實現機密運算,目標客戶是需要嚴格資料保護且同時需要存取高效能 AI 基礎架構的受監管產業。

面向智能體的開放模型與託管強化學習管道

該平台支援廣泛的模型生態系統,包括Google的 Gemini 和 Gemma 模型以及英偉達的 Nemotron 開放模型。 NVIDIA Nemotron 3 Super 現已整合到 Gemini 企業代理平台中,使開發人員能夠建置和部署基於推理的代理程式工作流程。

Google Cloud 也推出了基於 NVIDIA NeMo 建構的強化學習 API 的託管訓練叢集。這項服務可自動完成叢集配置、作業編排和故障處理,進而支援大規模強化學習訓練。其目標是降低維運複雜性,使團隊能夠專注於模型行為和最佳化。

CrowdStrike 使用 NVIDIA NeMo 工具(包括 Data Designer、Automodel 和 Megatron Bridge)產生合成資料並微調特定領域的網路安全模型。這些工作流程運行在基於 Blackwell 的基礎架構上,加速威脅偵測和回應流程。

不斷擴展的工業和實體人工智慧工作負載

該聯合平台也面向工業和物理人工智慧應用場景。 Cadence 和西門子數位化工業軟體的應用現已在 Google Cloud 上提供,並藉助 NVIDIA 加速技術,支援半導體、汽車、航太和重型設備等行業的各種設計、模擬和製造工作流程。

NVIDIA Omniverse 庫和 Isaac Sim 已在 Google Cloud Marketplace 上架,可用於開發實體上精確的數位孿生模型和機器人模擬流程。這些工具使企業能夠在部署前對系統進行模擬和驗證。

此外,NVIDIA NIM 微服務可以部署在 Vertex AI 和 Google Kubernetes Engine 上,以支援視覺 AI 和機器人工作負載。這些服務支援即時視訊分析、機器人規劃和自動化數據處理等功能。

平台聚焦:從實驗到生產

此更新將 Google Cloud AI Hypercomputer 定位為全端平台,用於將 AI 工作負載從研究階段遷移到生產階段。該平台緊密整合了運算、網路、軟體和安全功能,旨在支援大規模智慧體系統、工業自動化和即時 AI 應用。

參與 StorageReview

電子報| YouTube | PodcastiTunes / Spotify | Instagram | Twitter | TikTok | RSS訂閱

哈羅德弗里茨

自 IBM 創建 Selectric 以來,我一直在科技行業工作。 不過,我的背景是寫作。 因此,我決定退出售前業務,回歸本源,從事一些寫作工作,但仍從事技術工作。