存储评论网

HPE Cray GX5000 和 AI Factory 新增 NVIDIA Vera Rubin NVL72、Quantum-X800 InfiniBand 和 Blackwell 选项

AI  ◇  企业版

HPE 发布了 NVIDIA AI Computing by HPE 产品组合的更新,旨在支持大规模 AI 工厂和下一代超级计算机。这些产品将计算、GPU、网络、液冷、软件和服务整合到全栈解决方案中,专为大规模和自主环境而设计。NVIDIA AI 已集成到HPE 百亿亿次级超级计算平台中。阿贡国家实验室、HLRS、Hudson River Trading 和韩国科学技术信息研究院均已采用集成 NVIDIA 技术的 HPE AI 基础设施,以加速科学和产业创新。

HPE Cray Discovery

HPE 正在将 NVIDIA 技术扩展到其第二代百亿亿次级平台 HPE Cray 超级计算 GX5000 中,该平台将人工智能 (AI) 和高性能计算 (HPC) 融合于单一架构。研究实验室、主权实体和企业正日益将 AI 模型与传统的 HPC 模拟相结合,而 HPE 正在调整该平台以满足这些融合的需求。

HPE产品线新增了一款基于NVIDIA Vera CPU的计算刀片服务器。每台液冷式HPE Cray超级计算GX240计算刀片服务器最多可配备16颗NVIDIA Vera CPU。一个完整的机架最多可支持40台刀片服务器,总计640颗CPU和56,320个Arm兼容内核。GX240的目标应用是需要持续高吞吐量的高密度、高性能AI计算环境。

HPE 还在扩展大规模系统的网络选项,增加了对NVIDIA Quantum-X800 InfiniBand 的支持。这些交换机提供 144 个端口,运行速度为 800 Gb/s,并集成了节能功能,这在百亿亿次级计算中变得越来越重要。

HPE 高级副总裁兼高性能计算和人工智能基础设施解决方案总经理 Trish Damkroger 表示,公司在百亿亿次级超级计算领域的经验正在影响其将高级人工智能工作负载与传统高性能计算相结合的方式。她指出,与 NVIDIA 的持续合作有助于客户实现更高的性能密度,并推动医疗、生命科学、工程和制造等领域的发展。

针对大规模和自主部署的 HPE AI Factory 的增强功能

除了超级计算产品组合外,HPE 还在扩展其 HPE AI Factory,以支持采用 NVIDIA Vera Rubin 和 NVIDIA Blackwell 平台的服务提供商、主权政府和大型企业。

HPE推出的新一代NVIDIA Vera Rubin NVL72是此次发布会的重头戏。这款机架级系统专为参数量超过万亿的超大规模模型而设计,可高效部署于新云环境中。它包含36个NVIDIA Vera CPU、72个NVIDIA Rubin GPU、第六代NVIDIA NVLink纵向扩展网络、NVIDIA ConnectX-9 SuperNIC以及NVIDIA BlueField-4 DPU。HPE将该平台与其液冷技术和数据中心设计服务相结合,从而简化大规模部署流程。

HPE 同时推出了 HPE Compute XD700,这是一款基于 NVIDIA HGX Rubin NVL8 的 OCP 系统。XD700 专为高密度 AI 训练和推理而设计,每个机架最多可支持 128 个 Rubin GPU。该系统在降低空间占用、功耗和散热的同时,GPU 密度比上一代产品翻了一番。

此外,HPE 正在扩大 NVIDIA Blackwell 的访问权限,使所有 HPE AI Factory 系统都能使用 NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU。

软件和服务更新,加速人工智能部署

HPE 的更新涵盖了支持大规模 AI 工厂的软件和服务堆栈。HPE AI 工厂产品组合现已获得 NVIDIA 云合作伙伴计划的认可,这简化了云运营商的 NVIDIA 云提供商认证流程。这有助于加快验证周期,并简化服务提供商构建多租户 AI 环境的集成。

HPE 还通过支持虚拟机 GPU 直通和使用 NVIDIA 多实例 GPU (MIG) 的安全 Kubernetes 命名空间,扩展了多租户选项。这些功能得益于与 SUSE Virtualization 和 SUSE Rancher Prime 的集成,使服务提供商能够在严格和灵活的租户模型之间进行选择。

Red Hat Enterprise Linux 和 Red Hat OpenShift 作为 Red Hat AI Enterprise 的一部分继续得到支持,并与 NVIDIA AI Enterprise 软件无缝集成,为采用企业级 Linux 的客户提供服务。

HPE AI Factory at scale 和 HPE AI Factory Sovereign 也将集成 NVIDIA Mission Control 软件。Mission Control 为 AI 工厂提供统一的运维层​​,通过NVIDIA Run:ai简化编排流程,并添加来自 NVIDIA Dynamo 的监控和自主恢复功能。其目的是简化管理,并提高运行大型 AI 集群的平台团队的运维一致性。

NVIDIA 任务控制仪表板

NVIDIA企业平台副总裁克里斯·马里奥特强调,人工智能的开发依赖于强大的基础设施。他重点介绍了HPE和NVIDIA在加速计算、先进网络和液冷技术方面的联合工程合作,旨在支持大规模自主部署中更快地获得洞察。

可用性

NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU 现已加入 HPE AI Factory 产品组合。Red Hat Enterprise Linux 和 Red Hat OpenShift 与 NVIDIA 的集成也已于今日推出。

HPE AI Factory 的多租户和 GPU 直通功能将于 2026 年春季推出。NVIDIA Mission Control 对 HPE AI Factory 的大规模和自主支持计划于 2026 年晚些时候推出。NVIDIA Vera Rubin NVL72 by HPE 机架式系统将于 2026 年 12 月上市。

HPE Compute XD700 将于 2027 年初上市。配备多达 16 个 NVIDIA Vera CPU 和 NVIDIA Quantum-X800 InfiniBand 网络的 HPE Cray Supercomputing GX240 超级计算刀片服务器(适用于 HPE Cray Supercomputing GX5000)也将于 2027 年上市。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。