存储评论网

CoreWeave 推出首款戴尔 XE9712 GB200 NVL-72 系统

AI  ◇  企业版

CoreWeave 已将最新的 GB200 NVL-72 系统与新的 Dell XE9712 服务器一起部署。该系统在 Switch 最先进的数据中心进行了现场演示,突出了其突破性的性能和先进的冷却基础设施。

戴尔 XE9712 GB200 NVL-72

CoreWeave 的 GB200 NVL-72 系统位于 Rob Roy 的 Evo Chamber 中,旨在处理最苛刻的计算工作负载。现场演示从 NCCL All-Reduce 测试开始,这是一项基准测试,展示了 Nvidia NVLink 互连在机架的 72 个 GPU 上的超高带宽和低延迟。该测试确保 GPU 之间的无缝通信。

B在此基础上,GPU Blaze 测试展示了系统的原始计算能力。GPU 处理了复杂的矩阵乘法工作负载,模拟了 AI 训练、科学模拟和高级数据处理中使用的操作。

CoreWeave 的 Sunk 现场培训

GB200 NVL-72 还通过 Kubernetes 上的 Slurm (Sunk) 进行了实时训练,训练了 Megatron 模型。训练课程使用​​实际工作负载验证了机架,并演示了冷却和电源基础设施上产生的负载。

随着 GPU 活动的增加,机架内冷却分配单元 (CDU) 会动态调整冷却输出以保持最佳硬件温度。来自 CDU 的实时数据显示了流体回流温度如何随着 GPU 工作负载的增加而升高,从而确保高效的热管理而不影响性能。

GB200 NVL-72 的电源仪表板持续概览系统的能源需求,展示了其在能源管理方面的效率和透明度。

Rob Roy 的 Evo Chamber

NVL72 安装在 Rob Roy 的 Evo Chamber 中,该 Chamber 为每个机架提供了令人印象深刻的 1MW 电力和冷却能力。这一基础设施的进步将 250kW 的空气冷却与 750kW 的直接芯片液体冷却能力相结合,确保在最苛刻的 AI 和 HPC 工作负载下也能发挥最佳性能。该 Chamber 的先进设计在支持下一代计算要求的同时,保持了高效的电力使用和热管理。

结语

在提供 AI 基础设施即服务方面,CoreWeave 无疑是行业领导者。他们的成功很大程度上归功于他们能够比其他云更快地加入最新的 AI 基础设施。新的 Dell GB200 NVL-72 系统代表了高性能计算的新时代。它们结合了尖端的 GPU 性能、先进的冷却解决方案和能源效率,以满足 AI、科学研究和数据密集型应用程序的需求——这对大规模运行 AI 工作负载的客户来说是一个巨大的胜利。 

核心编织

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

迪维扬什·贾恩

机器学习工程师,家庭实验室爱好者和技术发烧友。在 StorageReview,我负责人工智能和新兴工作负载的测试,提供洞察分析和性能分析。