存储评论网

AMD Instinct MI355X 处理器在 MLPerf 推理 v6.0 测试中性能提升显著,每秒处理超过 1 万个令牌,并支持可扩展的 ROCm 堆栈。

AI  ◇  企业版

AMD 发布了 MLPerf Inference v6.0 测试结果,将Instinct MI355X GPU定位为可扩展的推理平台,支持单节点、多节点和异构部署。此次测试不仅在性能上实现了增量提升,还新增了多种工作负载,展示了超过每秒 1 万个令牌的集群级吞吐量,并在不断壮大的合作伙伴生态系统中验证了测试结果的可复现性。

CDNA 4架构旨在实现高容量推断

Instinct MI355X GPU 基于AMD 的 CDNA 4架构,采用台积电 3nm | 6nm FinFET 工艺制造(它采用双工艺芯片设计:计算芯片 (XCD) 采用台积电的 3nm 工艺,而 I/O 芯片采用 6nm 工艺),集成了 185 亿个晶体管,并支持 FP4 和 FP6 数据格式。值得注意的是,这是整个多芯片封装,而非单芯片。每个 GPU 包含高达 288GB 的​​ HBM3E 显存,使单个设备能够支持高达 520 亿个参数的模型。AMD 认为,这种计算密度和内存容量的组合对于在不进行过多模型划分的情况下进行大型模型推理至关重要。

该平台提供 UBB8 配置,并有风冷和直接液冷两种选择,符合数据中心部署要求。

多节点吞吐量超过每秒 1 万个代币

本轮测试的一项关键成果是AMD在集群规模下实现了每秒处理超过1万个令牌的目标。AMD使用Instinct MI355X GPU,在Llama 2 70B的服务器和离线场景下均达到了这一阈值,并在GPT-OSS-120B的离线场景下也实现了这一目标。

AMD MLPerf 每秒 1 万个令牌图形

这些结果反映出评估推理性能的趋势正在从单个加速器转向集群层面。聚合吞吐量和服务时间正日益被用于判断大规模人工智能部署的生产就绪程度。

AMD 还展示了高效的扩展能力。在 Llama 2 70B 平台上,一个由 11 个节点和 87 个 GPU 组成的集群在离线、服务器和交互式场景下均实现了每秒超过 1 万个令牌的处理能力,横向扩展效率在 93% 到 98% 之间。在 GPT-OSS-120B 平台上,一个由 12 个节点和 94 个 GPU 组成的集群也实现了类似的吞吐量,扩展效率超过 90%。这些结果表明,性能提升能够有效地扩展到多个系统,而不仅仅是单个系统。

代际收益和具有竞争力的单节点性能

AMD 报告称,Llama 2 70B 服务器的性能相比上一代 Instinct MI325X 提升了 3.1 倍,达到每秒 100,282 个令牌。这一提升得益于架构改进和 ROCm 软件优化。离线性能提升了 4.4 倍,服务器性能提升了 4.8 倍。这些提升主要归功于 FP4 量化技术。

AMD 推理结果与上一代显卡对比

在单节点对比测试中,MI355X 展现了与 NVIDIA 平台相匹敌的实力。在 Llama 2 70B 平台上,AMD 的离线吞吐量与 NVIDIA B200 持平,服务器性能接近,交互式性能则更胜一筹。与 NVIDIA B300 相比,AMD 的 GPU 在离线模式下性能达到 92%,服务器模式下达到 93%,交互式模式下更是高达 104%,远超后者。

首次启用新机型扩大覆盖范围

MLPerf Inference v6.0 包含多个新的工作负载,AMD 在本轮测试中展示了快速模型启用能力。GPT-OSS-120B 是一款混合专家模型,首次亮相,并在离线和服务器场景下均取得了与 NVIDIA 系统相媲美的性能。

AMD 还提交了 WAN-2.2 文本转视频生成的测试结果,标志着其正式进军多模态和生成式视频推理领域。虽然官方提交的测试结果侧重于单流延迟,但其性能已与现有平台相媲美。提交后的优化调优进一步提升了性能,表明随着软件的成熟,仍有很大的优化空间。

这些新增功能凸显了 AMD 致力于超越传统的 LLM 基准测试,以支持新兴的 AI 工作负载。

ROCm软件支持扩展和异构推理

AMD 将性能和可扩展性的大部分提升归功于其 ROCm 软件栈。增强功能包括优化的 FP4 执行、改进的 GPU 间通信以支持分布式推理,以及支持跨异构环境的动态工作负载分配。

AMD MLPerf 推理结果 Instinct mI355x 图形

最初的 MLPerf 异构提交使用了三款 AMD Instinct GPU 型号:MI300X、MI325X 和 MI355X。该配置由戴尔和 MangoBoost 提交,在 Llama 2 70B Server 上实现了每秒 141,521 个令牌,在 Llama 2 70B Offline 上实现了每秒 151,843 个令牌。

值得注意的是,AMD Instinct MI355X 平台位于戴尔位于美国的实验室,而 Instinct MI300X 和 MI325X 平台则位于韩国。这体现了跨地域系统协调的能力。

生态系统增长和可复制性

在本次 MLPerf 测试中,AMD 的合作伙伴生态系统进一步扩展,共有九家公司提交了涵盖多代 Instinct GPU 的测试结果。参与测试的厂商包括 Cisco、Dell、Giga Computing、HPE、MangoBoost、MiTAC、Oracle、Supermicro 和 Red Hat。

合作伙伴提交的测试结果与AMD内部测试结果高度吻合,通常在4%以内,某些情况下甚至在1%以内。这种一致性表明,性能在OEM和云平台上均可复现,从而降低了部署风险,并增强了对实际应用效果的信心。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。