英伟达的黄仁勋本周出席了在台湾举行的2023年台北国际电脑展(Computex 2023),并发表了主题演讲,发布了一系列新产品,重点关注如何助力下一代生成式人工智能应用、数据分析和推荐系统的开发。搭载英伟达GH200 Grace Hopper超级芯片的英伟达DGX超级计算机和英伟达NVLink交换系统成为本次展会的焦点。
NVIDIA DGX GH200采用 NVLink 互连技术和 NVLink 交换系统,将 256 个 GH200 超级芯片组合成一个 GPU,提供 1 exaflop 的性能和 144 TB 的共享内存。这几乎是单个 NVIDIA DGX A100 系统的 500 倍内存!
NVLink 技术大规模扩展 AI
GH200 超级芯片采用NVLink-C2C芯片互连技术,将基于 Arm 架构的 NVIDIA Grace CPU 与 NVIDIA H100 Tensor Core GPU 集成在一起,无需传统的 CPU 到 GPU 的 PCIe 连接。与最新的 PCIe 技术相比,GPU 和 CPU 之间的带宽提升了 7 倍,互连功耗降低了 5 倍以上,并为 DGX GH200 超级计算机提供了一个 600GB Hopper 架构的 GPU 构建模块。
这是第一台将 Grace Hopper 超级芯片与 NVLink 开关系统配对的超级计算机。 这种新的互连使 DGX GH200 系统中的所有 GPU 能够作为一个 GPU 工作,而八个 GPU 限制与 NVLink 结合作为单个 GPU 而不会影响性能。 DGX GH200 架构提供比上一代多 10 倍的带宽,提供大型 AI 超级计算机的强大功能,同时只需对单个 GPU 进行编程即可。
人工智能先驱获得新的研究工具
预计最先访问新超级计算机的将是 Google Cloud、Meta 和 Microsoft,使他们能够探索其生成 AI 工作负载的能力。 NVIDIA 打算将 DGX GH200 设计作为蓝图提供给云服务提供商和其他超大规模提供商,以便他们可以根据自己的基础设施对其进行定制。
NVIDIA 研究人员和开发团队将可以使用配备四个 DGX GH200 系统的全新 NVIDIA Helios 超级计算机。 Helios 将包含 1,024 个 Grace Hopper 超级芯片,预计将于今年年底上线。 Helios 超级计算机中的每个系统都将与 NVIDIA Quantum-2 InfiniBand 网络互连,带宽数据吞吐量高达 400Gb/s,用于训练大型 AI 模型。
集成和专用
DGX GH200 超级计算机将搭载 NVIDIA 软件,提供一站式全栈解决方案,支持规模最大的 AI 和数据分析工作负载。NVIDIA Base Command软件提供 AI 工作流管理、企业级集群管理、用于加速计算、存储和网络基础设施的库,以及针对运行 AI 工作负载优化的系统软件。NVIDIA AI Enterprise软件将提供 100 多个框架、重新训练的模型和开发工具,以简化生产级 AI 的开发和部署,包括生成式 AI、计算机视觉、语音 AI 等。
可用性
NVIDIA DGX GH200 超级计算机预计将于今年年底上市。




Amazon