存儲評論網

CoreWeave 推出首款戴爾 XE9712 GB200 NVL-72 系統

AI  ◇  企業

CoreWeave 已在新的 Dell XE200 伺服器上部署了最新的 GB72 NVL-9712 系統。該系統在 Switch 最先進的數據中心進行了現場演示,強調了其突破性的性能和先進的冷卻基礎設施。

戴爾 XE9712 GB200 NVL-72

CoreWeave 的 GB200 NVL-72 系統位於 Rob Roy 的 Evo Chamber 中,旨在處理最苛刻的計算工作負載。現場演示從 NCCL All-Reduce 測試開始,該基準測試展示了機架 72 個 GPU 上 Nvidia NVLink 互連的超高頻寬和低延遲。此測試確保 GPU 之間的無縫通訊。

B在此基礎上,GPU Blaze 測試展示了系統的原始運算能力。 GPU 可以處理複雜的矩陣乘法工作負載、模擬人工智慧訓練、科學模擬和進階資料處理中使用的操作。

使用 CoreWeave 的 Sunk 進行現場訓練

GB200 NVL-72 也使用 Kubernetes (Sunk) 上的 Slurm 進行了即時訓練測試,訓練威震天模型。培訓課程透過實際工作負載驗證了機架,並演示了冷卻和電力基礎設施上產生的負載。

隨著 GPU 活動的增加,機架內冷卻分配單元 (CDU) 會動態調整冷卻輸出,以保持最佳的硬體溫度。來自 CDU 的即時數據說明了流體回流溫度如何隨著 GPU 工作負載而增加,從而確保高效的熱管理而不影響效能。

GB200 NVL-72 的電源儀表板提供了系統能源需求的持續概覽,展現了其能源管理的效率和透明度。

羅布·羅伊的進化室

NVL72 安裝在 Rob Roy 的 Evo Chamber 中,每個機架提供令人印象深刻的 1MW 電力和冷卻能力。這項基礎設施的進步將 250kW 的空氣冷卻與 750kW 的直接晶片液體冷卻能力相結合,確保為最苛刻的 AI 和 HPC 工作負載提供最佳性能。該室的複雜設計可保持高效的電源使用和熱管理,同時支援下一代運算要求。

結語

在證明人工智慧基礎設施即服務方面,CoreWeave 無疑是產業領導者。他們的成功很大程度上歸功於他們比其他雲端更快搭載最新人工智慧基礎設施的能力。全新戴爾 GB200 NVL-72 系統代表了高效能運算的新時代。它們結合了尖端的GPU 性能、先進的冷卻解決方案和能源效率,以滿足人工智慧、科學研究和數據密集型應用程式的需求,這對於大規模運行人工智慧工作負載的客戶來說是巨大的勝利。 

核心編織

參與 StorageReview

電子報| YouTube | PodcastiTunes / Spotify | Instagram | Twitter | TikTok | RSS訂閱

迪維揚什·賈恩

機器學習工程師,家庭實驗室愛好者和技術發燒友。在 StorageReview,我負責人工智慧和新興工作負載的測試,提供洞察分析和效能分析。