存储评论网

HPE 扩展其面向 AI-HPC 时代的下一代 Cray 超级计算产品组合

企业版  ◇  服务器

HPE推出了新一代HPE Cray超级计算解决方案,旨在满足大规模人工智能在性能密度、效率和运维方面的迫切需求。该产品组合的核心是多厂商、多工作负载刀片架构、统一的系统管理软件以及高性能互连架构,从而构建了一个面向研究机构、政府机构和大型企业的一体化平台,加速人工智能的发现、模拟和生产应用。

融合人工智能和高性能计算架构

HPE 最新推出的 Cray 平台将高性能计算 (HPC) 和人工智能 (AI) 整合到一个统一的架构中,能够大规模地提供确定性性能,并满足企业 IT 所需的运维控制。在发布该平台时,HPE 高级副总裁兼 HPC 和 AI 基础设施解决方案总经理 Trish Damkroger 强调,融合 AI 和 HPC 架构对于提高性能密度、推动科学技术进步至关重要。总而言之,HPE 的立场很明确:AI 和超级计算正在融合,HPE 致力于打造引领潮流的集成系统,从而推动研究和实际应用。

此次扩展是在上个月推出的 HPE Cray 超级计算机 GX5000 的基础上进行的,GX5000 专为 AI+HPC 集成时代而设计,现在又新增了 HPE Cray 超级计算存储系统 K3000。K3000 的显著特点是首款预装嵌入式 DAOS(分布式异步对象存储)开源软件的工厂预装存储系统,旨在为 I/O 密集型 AI 和仿真工作负载提供持续的性能支持。

各大研究中心迅速采用

该平台早期取得的进展包括斯图加特大学高性能计算中心 (HLRS) 和巴伐利亚科学院莱布尼茨超级计算中心 (LRZ) 的青睐。它们的下一代系统,HLRS 的 Herder 和 LRZ 的 Blue Lion,都将采用 HPE Cray 超级计算机 GX5000。这些部署共同凸显了欧洲顶级高性能计算中心的发展势头,它们正寻求利用生产级高性能计算的严谨性来扩展人工智能驱动的发现。

新型直冷式多厂商计算刀片服务器

HPE 推出三款全新计算刀片服务器,可灵活组合部署于 HPE Cray GX5000 机架中,以满足不同的工作负载需求、预算和设施限制。所有刀片服务器均采用直冷式液冷设计,配备两个板载 NVMe SSD 用于节点本地加速,并集成四个或八个 HPE Slingshot 400 Gbps 端点,实现高吞吐量、低延迟的互连架构。支持的处理器涵盖领先的 GPU(NVIDIA Rubin 和 AMD Instinct MI430X)以及 AMD EPYC “Venice” CPU,从而能够根据工作负载特性精准匹配计算能力。

HPE Cray 边车
  • HPE Cray 超级计算 GX440n 加速刀片服务器: 这款刀片服务器被设计为通用型人工智能高性能计算引擎,它集成了四个 NVIDIA Vera CPU 和八个 NVIDIA Rubin GPU。每个机架最多可容纳 24 个刀片服务器,配置可扩展至每个机架 192 个 GPU,旨在满足大规模人工智能训练、多节点推理和加速仿真工作流程的需求。
  • HPE Cray 超级计算 GX350a 加速刀片服务器: GX350a 专为混合精度计算而优化,它将一颗 AMD EPYC SP7 600W “Venice” CPU(最多 256 个核心)与四颗 AMD Instinct MI430X MI400 系列 GPU 相结合。这种组合旨在提升 AI 训练和高性能计算 (HPC) 性能,在提供强大的 FP16/BF16 性能的同时,也保留了用于模拟阶段的双精度能力——每个机架最多可容纳 28 个刀片,总共配备 112 颗 AMD MI430X GPU。
  • HPE Cray 超级计算 GX250 计算刀片: GX250 专为仅使用 CPU 的双精度密集型工作负载(例如 CFD、气象和传统模拟)而设计,每个刀片集成 8 个 AMD EPYC “Venice” CPU,每个 CPU 最多可达 256 个核心。每个机架最多可容纳 40 个刀片,对于需要整合大型 MPI 作业并具备可预测扩展性能的机构而言,GX250 极具吸引力。

这些刀片的灵活机架级混合可实现定制化的系统设计,从 GPU 密集的 AI 训练岛到 CPU 主导的模拟池,而不会浪费电力、冷却或互连资源。

统一的多租户系统管理

HPE 超级计算管理软件可在裸机、虚拟化和容器化环境中提供企业级多租户和安全保障。其目标是在最大限度提高资源利用率的同时,为运维人员提供针对用户、项目和工作负载的强大隔离控制。电源和能源管理是该软件的首要功能。它提供实时和历史遥测数据、成本估算以及节能调度接口,帮助企业优化能源效率并预测成本。

运维范围涵盖系统全生命周期,包括资源配置、监控、电源/散热管理以及弹性扩展,并增强了安全控制和报告功能。对于技术运维团队而言,最终实现的是面向高利用率混合型人工智能和高性能计算环境的单一控制平台。

适用于基于 GX5000 系统的 HPE Slingshot 400

HPE Slingshot 400 现已面向 HPE Cray 超级计算 GX5000 集群推出,它采用直接液冷式交换机刀片架构,专为高密度部署和在 AI+HPC 复合负载下保持持续吞吐量而设计,从而提升了互连架构的性能。每个交换机刀片提供 64 个 400 Gbps 端口,并且机箱级配置支持:

  • 8 台交换机,每台 512 个端口
  • 16 台交换机,每台 1,024 个端口
  • 32 台交换机,每台 2,048 个端口

Slingshot 400 于去年首次发布,旨在充分利用 GX5000 的高性能拓扑结构,在降低延迟、提升持续带宽和增强可靠性的同时,保持成本控制。对于多租户环境和混合工作流程,该组合旨在实现大规模、可预测的性能。

DAOS支持的存储加速I/O密集型人工智能

HPE Cray 超级计算存储系统 K3000 利用 HPE ProLiant Compute DL360 Gen12 服务器及其嵌入式 DAOS,优先考虑低延迟对象访问、高并行性和线性扩展——这些特性对于 I/O 密集型 AI 流水线和仿真检查点至关重要。该平台平衡了每个存储节点的计算能力、内存和 NVMe 密度,以确保 GPU 和 CPU 在并发访问模式下都能获得充足的资源。

可配置选项允许对性能或容量进行调整:

  • 性能优化的 DAOS 存储服务器,配备 8、12 或 16 个 NVMe 硬盘
  • 容量优化的 DAOS 存储服务器,配备 20 个 NVMe 硬盘
  • NVMe 硬盘容量:3.84 TB、7.68 TB 或 15.36 TB
  • DRAM 容量选项:512 GB、1,024 GB 或 2,048 GB,根据硬盘数量和工作负载类型而定。

互连方式的选择反映了异构数据中心网络和工作流程需求:

  • HPE Slingshot 200
  • HPE Slingshot 400
  • InfiniBand NDR
  • 400千兆以太网

通过将 DAOS 集成到工厂集成、供应商支持的系统中,HPE 旨在缩短部署时间、降低集成复杂性,并提高数据密集型 AI 和 HPC 的持续性能。

可用性

  • HPE Cray 超级计算存储系统 K3000 与 HPE ProLiant 计算服务器:2026 年初
  • HPE Cray 超级计算 GX440n 加速刀片服务器、GX250 计算刀片服务器和 GX350a 加速刀片服务器:2027 年初
  • HPE 超级计算管理软件:2027 年初
  • 适用于基于 GX5000 系统的 HPE Slingshot 400:2027 年初

HPE 的下一代 Cray 产品组合旨在打破传统的 AI/HPC 孤岛,为每个机架提供更高的性能密度,并简化机构在通用、高效平台上扩展仿真和 AI 训练/推理的操作。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。