CoreWeave 已将最新的 GB200 NVL-72 系统与新的 Dell XE9712 服务器一起部署。该系统在 Switch 最先进的数据中心进行了现场演示,突出了其突破性的性能和先进的冷却基础设施。
CoreWeave 的 GB200 NVL-72 系统位于 Rob Roy 的 Evo Chamber 中,旨在处理最苛刻的计算工作负载。现场演示从 NCCL All-Reduce 测试开始,这是一项基准测试,展示了 Nvidia NVLink 互连在机架的 72 个 GPU 上的超高带宽和低延迟。该测试确保 GPU 之间的无缝通信。

CoreWeave 的 Sunk 现场培训
GB200 NVL-72 还通过 Kubernetes 上的 Slurm (Sunk) 进行了实时训练,训练了 Megatron 模型。训练课程使用实际工作负载验证了机架,并演示了冷却和电源基础设施上产生的负载。


Rob Roy 的 Evo Chamber
NVL72 安装在 Rob Roy 的 Evo Chamber 中,该 Chamber 为每个机架提供了令人印象深刻的 1MW 电力和冷却能力。这一基础设施的进步将 250kW 的空气冷却与 750kW 的直接芯片液体冷却能力相结合,确保在最苛刻的 AI 和 HPC 工作负载下也能发挥最佳性能。该 Chamber 的先进设计在支持下一代计算要求的同时,保持了高效的电力使用和热管理。
结语
在提供 AI 基础设施即服务方面,CoreWeave 无疑是行业领导者。他们的成功很大程度上归功于他们能够比其他云更快地加入最新的 AI 基础设施。新的 Dell GB200 NVL-72 系统代表了高性能计算的新时代。它们结合了尖端的 GPU 性能、先进的冷却解决方案和能源效率,以满足 AI、科学研究和数据密集型应用程序的需求——这对大规模运行 AI 工作负载的客户来说是一个巨大的胜利。





Amazon