存储评论网

Liqid Pools 在一台服务器中集成 30 个 AMD MI350P GPU:4.3TB HBM3E 显存和 69 PFLOPS 的 AI 推理性能

AI  ◇  企业版

7月下旬,Liqid发布了基于AMD Instinct MI350P PCIe GPU的可扩展AI平台UltraStack 30。该平台将Liqid的可组合GPU池化技术与AMD加速器相结合,旨在满足企业和云端AI推理部署的需求,突破传统服务器加速器数量和内存容量的限制。

在戴尔科技世界展现场,我拿到了AMD Instinct MI350P工程样品,这款PCIe卡采用液冷技术,并集成在UltraStack 30中。

UltraStack 30:30 个 AMD MI350P GPU 的池化

该架构允许在单个服务器环境中整合多达 30 个 AMD Instinct MI350P GPU。Liqid 表示,这可以为大型模型、检索增强型生成部署和长上下文推理工作负载提供 4.3TB 的聚合 HBM3E 容量。该平台旨在实现 GPU 资源的动态分配,而非固定分配给单个服务器,并原生支持 Kubernetes 以实现并行模型部署。

此次合作旨在应对人工智能推理领域日益严峻的基础设施挑战:如何在控制代币生成成本的同时,最大限度地提高加速器的利用率。Liqid 声称,其 GPU 池化方案相比传统服务器配置,可提供高达 3.7 倍的代币吞吐量提升、每美元代币产量提升 2.1 倍,以及每瓦特代币产量提升 1.8 倍。该公司还表示,对于大型模型部署,其目标是将部署成本降低高达 65%,并将功耗降低高达 50%。Liqid 指出,这些数据基于内部预测,具体数值会因配置和工作负载而异。

“Liqid 已成为 GPU 池化和扩展领域的领导者。AMD Instinct MI350P 系列为我们提供了理想的基于 PCIe 的 GPU,用于构建下一代 AI 基础设施,使我们能够提供针对企业级 AI 推理进行优化的解决方案,其中利用率和每个令牌的成本决定了经济效益,”Liqid 首席执行官 Rick Hegberg 表示。

Liqid UltraStack 30:AMD MI350P
规格 配置
服务器 AMD EPYC™ 9005 系列 CPU,双路
图形处理器 30× AMD Instinct™ MI350P PCIe
人工智能性能 69 PFLOPS(FP8)
GPU HBM 显存 4.3 TB
系统总功率 〜22千瓦
关键指标 价值
每千瓦性能 约 3.14 PFLOPS/kW
每千瓦 HBM 约 195 GB/kW
每 PFLOP 的 HBM ~62 GB/PFLOP

小米350P内部构造

AMD 将MI350P定位为一款基于 PCIe 的加速器,旨在提供卓越的 AI 推理性能,而无需专用散热或对数据中心进行大规模改造。AMD 的规格表显示,该显卡配备 144GB HBM3E 显存,拥有 4TB/s 的显存带宽,基于 CDNA 4 架构,可提供 2.3 PFLOPS 的密集型 FP8 计算能力,典型板载功耗为 600W(可配置为 450W),采用被动散热的双槽 PCIe 5.0 外形尺寸。UltraStack 的 4.3TB 和 69 PFLOPS 的综合性能数据正是由 30 张这样的显卡组成的。结合 Liqid 的架构,可以根据需要添加和扩展 GPU,以支持不断变化的推理需求,从而减少闲置的 GPU 容量,并提高每个系统的模型密度。

AMD计算与企业AI事业部副总裁Suresh Andani表示:“AMD Instinct MI350P PCIe GPU无需专用基础设施即可提供卓越的AI推理性能。结合Liqid的GPU池化解决方案,客户可以按需扩展GPU资源,从而实现更高的利用率、更低的基础设施成本以及业界领先的AI推理经济效益。”

平台的目标用户群体

该解决方案面向企业人工智能团队、NeoCloud 提供商、人工智能服务提供商以及高性能计算和研究机构。已确定的应用场景包括:用于销售、人力资源、市场营销、法律和编码等功能的私有本地企业助手;红绿灯和长上下文推理;包括药物发现和材料科学在内的科学工作负载;以及从共享加速器池中支持多种模型规模的混合模型集群。

从GPU池化到CXL内存池化

CXL相关技术已不再是纸上谈兵。8月初,Liqid 发布了 EX-5410C 内存平台,该公司称之为业界首款也是唯一一款完全解耦的软件定义内存池解决方案。EX-5410C 基于 CXL 2.0 构建,并通过 Liqid Matrix 软件进行管理,每个机箱可容纳高达 40TB 的 DRAM,可扩展至超过 160TB 的统一内存池,并可在多达 16 个服务器节点之间动态分配内存,Liqid 称之为零冗余容量。

Liqid 声称,该平台在处理图分析工作负载时速度可提升高达 30 倍,在处理某些键值缓存工作负载时每秒令牌数可提升高达 7 倍。目前,太平洋西北国家实验室已搭建了一个早期测试平台,并通过 AMAIS 计划向美国能源部资助的研究人员开放。对于 UltraStack 而言,其意义在于:Liqid 应用于 GPU 容量的可组合性模型正扩展到系统内存,这将使未来的部署能够为键值缓存和其他内存密集型 AI 工作负载分配共享内存,并与池化加速器协同工作。

随着 Liqid 和 AMD 两家公司推进研发和客户部署活动,预计将公布更多关于双方联合解决方案的详细信息。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。