存储评论网

AMD Instinct MI350P:企业级 PCIe AI 推理重返标准服务器

AI  ◇  企业版

AMD 发布了 Instinct MI350P,这是一款面向企业用户的 PCIe 加速卡,旨在帮助他们在无需重建数据中心的情况下实现本地 AI 推理。该卡采用双槽、全高、全长设计,专为标准风冷服务器打造。这也是近四年来 AMD 首次将新一代 Instinct 芯片集成到可直接安装到普通服务器中的小型显卡中。

AMD Instinct MI350P

自 2022 年初 MI210 上市后,PCIe Instinct 产品线实际上就陷入了沉寂。此后的每一代产品(MI300X、MI325X 和 OAM MI350X)都是采用 OAM 插槽的通用基板模块,需要专门设计的机箱,该机箱必须具备足够的供电和散热能力,才能在一个托架内容纳八个 1,000W 级加速器。这对于按机架采购 GPU 的超大规模数据中心来说很合适。但对于想要在本地进行推理但又无法或不愿投入定制 AI 机架的企业来说,这种方式并不适用。MI350P 正好填补了这一空白,而且目前 NVIDIA 还没有同级别的旗舰级服务器 PCIe 显卡,因此 AMD 暂时独占了这一细分市场。

硬件:MI350P 与 MI350X OAM 对比

MI350P 并非 MI350X 的缩小版。AMD 为其设计了一款尺寸更小的芯片。MI350X 拥有两个 I/O 芯片,每个芯片包含四个加速器复合体芯片 (XCD),总共八个 XCD 和 256 个计算单元。MI350P 只有一个 I/O 芯片,包含四个 XCD 和 128 个计算单元,芯片尺寸只有 MI350X 的一半,但其峰值频率与 MI350X 相同,均为 2.2 GHz。内存配置也类似:四个 HBM3E 显存堆栈(而非八个);4,096 位总线(而非 8,192 位总线);144GB 容量,传输速率为 4 TB/s(而非 288GB 容量,传输速率为 8 TB/s)。

AMD Instinct MI350P架构

峰值计算能力也减半。MI350P 在 MXFP4 下的峰值计算能力为 4,600 TFLOPS,而 MI350X 为 9.2 PFLOPS;在 FP8 下的峰值计算能力为 2,300 TFLOPS,而 MI350X 为 4.6 PFLOPS。BF16、FP16 以及其他精度栈的性能也呈现相同的下降趋势。令人欣慰的是,AMD 同时公布了实际性能和峰值计算能力。实际性能分别为:MXFP4 下 2,299 TFLOPS,FP8 下 1,529 TFLOPS,BF16 下 713 TFLOPS。这些数值反映了显卡在 600W 功耗下的实际性能,因为实际功耗会受到电力和内存带宽的限制,从而影响理论峰值性能。

我们通过 Supermicro 的 Jumpstart 项目体验了 MI350X 平台,其在推理工作负载方面的出色性能给我们留下了深刻的印象。我们迫不及待地想要拿到 MI350P 进行测试,看看这款 PCIe 版本在它所设计的传统服务器机箱中表现如何。

AMD Instinct MI350P PCIe 卡
规格 已交付(FLOPS) 峰值(TFLOPS)
性能
BF16 713 1150
FP16 672 1150
FP8 1529 2300
MXFP8 1327 2300
MXFP6 1804 4600
MXFP4 2299 4600
内存和分区
内存容量 144 GB HBM3E 144 GB HBM3E
内存带宽 3.6 TB / s 4.0 TB / s
GPU实例 最多 4 个,每个 36GB 最多 4 个,每个 36GB
平台
视频和JPEG解码
GPU 扩展互连 不支持 不支持
产品 FF FHFL双槽风冷 FHFL双槽风冷
最大总电路板功率 (TBP) 600W
(可配置450W)
600W
(可配置450W)
PCIe主机 x16 PCIe Gen 5,速度为 128GB/s x16 PCIe Gen 5,速度为 128GB/s

功耗并没有完全减半。MI350P 的额定功耗为 600W TBP,约为 MI350X 1,000W 的 60%。600W 是 PCIe CEM 规范规定的上限,因此该显卡的运行温度已达到插槽允许的最高值。对于无法提供全功率或散热的机箱,MI350P 提供 450W 模式,但性能会有所降低。600W 的额定功耗也使 MI350P 与 NVIDIA 的 H200 NVL 和 RTX Pro 6000 Server 处于同一价位,它们将在该细分市场中成为 MI350P 的主要竞争对手。

与 NVIDIA 的 H200 的 NVL4 不同,AMD 没有在 MI350P 上暴露 GPU 的 Infinity Fabric 链路;所有集体通信都通过 PCIe Gen5 x16 (128 GB/s) 链路进行。

八GPU风冷的故事

由于 MI350P 是一款标准的双槽全高全长 PCIe 卡,因此它可以安装在企业已部署和运营的服务器中,包括目前主流 OEM 厂商推出的配备八 GPU 的紧凑型风冷平台。我们之前评测过的戴尔 PowerEdge XE7740 和 HPE ProLiant DL380a Gen12 显然是其目标平台。这两款服务器均采用风冷机箱,专为容纳八张双槽全高全长加速卡而设计,其供电和气流设计均已针对 600W 级显卡进行了优化。无需定制机架、液冷系统或 OAM 底板。

在这些系统中,八卡 MI350P 配置将 1,152GB 的 HBM3E 显存和 32 TB/s 的总内存带宽集成到一个风冷机箱中。对于大型开放权重模型的推理,这足以在单个机箱中运行一个基于 MXFP4 的万亿参数模型。但正如我们之前提到的,这种配置的缺点是缺乏可扩展的架构。在 OAM MI350X 上,GPU 通过通用基板上的 Infinity Fabric 进行通信。而在 MI350P 上,每个 GPU 之间的通信都通过 PCIe Gen5 x16 以 128 GB/s 的带宽进行,与连接到主机的路径相同。对于推理工作负载,尤其是在节点内部进行张量并行分片以及跨节点进行流水线或数据并行处理的情况下,这种方式是可行的。对于紧耦合训练(其中所有归约带宽主导步长),OAM 平台仍然是最佳选择。

精确格式

尽管MI350P支持的所有格式都不是新的,但精度仍然值得一提。MI350X也支持相同的格式集。之所以精度仍然重要,是因为OCP块缩放数据类型(MXFP8、MXFP6、MXFP4)已成为前沿模型实验室训练和发布模型的标准。这些格式允许实验室以较低的精度进行训练,而质量损失几乎可以忽略不计,并且推理性能的提升会立即显现。

低精度速度更快。MXFP4 的运行速度是 FP8 的两倍多,峰值速度约为 BF16 的四倍。这种速度提升在实际工作负载中显而易见。OpenAI 的 gpt-oss 版本使吞吐量的提升更加显著,像 Kimi K2.6 这样的前沿模型从一开始就使用 INT4 进行原生量化感知训练,而不是事后进行量化。另一方面,内存也是一大优势。INT4 和 MXFP4 的权重占用的空间仅为 BF16 的四分之一。这意味着,拥有万亿参数的模型可以装进一台配备八个 GPU 的服务器。对于希望在本地部署大型开放权重模型的企业而言,区别仅仅在于一个机架与一个包含所有网络和编排所需的多节点集群之间的差异。

底线

大多数评估本地部署AI的企业,在计算能力不足之前,往往就已经面临电力、散热、机架密度或预算方面的限制。而AMD的PCIe Instinct显卡可以直接集成到他们现有的服务器环境中,从而规避了这些限制中最严重的问题。NVIDIA目前还没有旗舰级的服务器PCIe显卡与之竞争,这意味着在这种情况持续下去之前,AMD在这个细分市场将占据绝对优势。

更多信息可在 AMD 本能 页面。

参与 StorageReview

资讯订阅 | YouTube | 播客 iTunes/Spotify | Instagram | Twitter(现为X) | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。