MLPerf Inference v5.1 为 LLM、视觉和多模态任务的 AI 推理提供了严格的基准测试。以下是对 NVIDIA Blackwell Ultra 测试结果和 AMD Instinct MI300X/MI325X/MI355X 提交结果的技术分析。分析内容包括详细的基准测试数据、软件优化、架构策略以及对超大规模计算和企业的影响。
MLPerf 基准测试框架
MLPerf 推理基准测试是 AI 加速器的记分牌,它提供了一种标准化、可比性的方法来衡量图像分类、语言模型和推荐系统的性能。对于大规模部署 GPU 的企业来说,这些数字通常可以指导大规模的采购决策。
MLPerf 推理由 MLCommons 管理,并定义封闭式与公开式比赛的规则。场景包括:
- 下架:以吞吐量为中心(批量处理尽可能多的查询)。
- 服务器:符合延迟的多流推理。
- 互动:严格的 TTFT(第一个令牌时间)和 TPS(每秒令牌数@99% 百分位数)。
v5.1 工作负载套件包括:
- DeepSeek-R1: 671B 专家混合模型(推理压力测试)。
- Llama-3.1-405B和8B:跨多种推理模式的最新 LLM。
- 耳语:ASR 取代 RNN-T。
- 稳定扩散 XL (SD-XL):文本到图像的生成人工智能。
- 混合, DLRMv2,以及 ResNet-50 等传统工作负载。
当显示吞吐量(令牌/秒或样本/秒)图表时,它们通常会凸显 NVIDIA 在绝对数字(尤其是每 GPU)上的持续主导地位。然而,AMD 在相对效率和 缩放平滑度 表明他们正在逐步缩小差距,特别是在服务器场景和多节点部署方面。
NVIDIA Blackwell Ultra 结果
Blackwell Ultra 系统在所有新工作负载下均实现了创纪录的吞吐量。关键推动因素:
- NVFP4 精度:自定义 4 位浮点数,加速 DeepSeek 和 Llama。
- FP8 KV-cache:为注意层节省内存。
- 分解服务:通过 72 GB/s NVLink 在 1,800 个 GPU 上划分上下文与生成阶段。
- 软件:CUDA Graphs、TensorRT-LLM、ADP Balance。
下方柱状图对比了 Hopper 和 Blackwell Ultra 的单 GPU 性能,显示 DeepSeek-R5 的吞吐量提升了近 1 倍,验证了细粒度数据格式 (NVFP4) 和机架带宽在大规模推理工作负载下能够线性扩展。另一张以交互式 Llama-405B 创纪录结果为蓝本的图表展示了 NVIDIA 如何利用 NVLink 架构和分解式服务在突破先前吞吐量限制的同时,保持延迟 SLA 的一致性。结论:NVIDIA 在纯粹的原始速度和延迟敏感型工作负载方面依然保持行业领先地位。
AMD Instinct MI300X/MI325X/MI355X 结果
AMD 针对效率和灵活性:
- MI4X 上的 FP355:与 MI2.7X FP2 相比,Llama-70-325B 吞吐量提高了 8 倍。
- 结构化剪枝:在 Llama-405B 上,修剪 21–33% 可减少 FLOP,而不会影响准确性,同时将吞吐量提高约 82–90%。
- 缩放:已证实可实现最多 8 个节点的平滑线性扩展;第一个异构集群(4 × MI300X + 2 × MI325X)实现了 94% 的扩展效率。
- ROCm 生态系统可重复性:合作伙伴提交的结果与 AMD 自身结果的差异始终在 1-3% 以内。
上图显示了 MI325X FP8 与 MI355X FP4 的对比,展现了 FP4 的突破性优势:更高的令牌/秒,同时将准确度损失降至最低,证明 FP4 不是实验性的,而是已准备好部署。
本篇 缩放曲线 (1 → (8 个节点)图表突出显示了近线性扩展,这是超大规模用户所看重的一点,因为它可以转化为可预测的扩展成本。同时,结构化剪枝的示意图表明,AMD 的重点不仅在于硬件暴力破解,还在于算法效率,这对于受功耗和空间限制的实际推理集群至关重要。
AMD 与 NVIDIA 正面对比
|
米制 |
NVIDIA Blackwell Ultra |
AMD MI355X |
笔记 |
优胜者 |
|
每个 GPU 每秒令牌数 |
5842(DeepSeek-R1) |
~2200(缩放 FP4) |
更高的 NVIDIA 原始性能 |
NVIDIA公司 |
|
每个 GPU 的内存 |
192GB HBM3e |
288GB HBM3e |
AMD 适配 520B 型号单 GPU |
AMD |
|
精准支持 |
FP16、FP8、NVFP4 |
FP16,FP8,FP4 |
均领先4位 |
领带 |
|
扩展结构 |
72 GPU NVLink |
线性节点扩展至 8 |
不同的规模策略 |
领带 |
并排的可视化强调了权衡。
- NVIDIA 在每个 GPU 吞吐量方面占据主导地位,使其成为浮点密度至关重要的 AI 工厂的理想选择。
- AMD 拥有更大的内存(288GB)和 FP4 修剪,在代币成本和部署灵活性至关重要的领域表现出色。
行业影响
- 超大规模NVIDIA 仍然是追求巅峰性能的 AI 工厂的首选工具。然而,AMD 不断增强的效率创新,解锁了成本优化的扩展能力,从而有利于平衡不同层级的工作负载。
- 云服务提供商:期待异构产品、高性能 NVIDIA 层与经济高效的 AMD Kubernetes pod。
- 企业:结构化剪枝、FP4 和异构集群支持使 AMD 能够以更低的 TCO 提供 405B+ 模型推理能力。NVIDIA 的创新(分解服务和 Dynamo)对于延迟敏感型应用(例如实时 LLM 聊天机器人)仍然有益。
- 未来展望:预计将普遍采用 4 位推理作为基线,更广泛地使用异构 GPU 池,以及新的系统设计,包括用于长序列的 NVIDIA Rubin CPX 和 AMD 的 ROCm 扩展以覆盖更多框架。
NVIDIA 继续在原始吞吐量方面保持领先,H200 GPU 在 ResNet-50 和 BERT 推理测试中,在封闭组别基准测试中均处于领先地位。即便如此,AMD 的 MI300 也紧随其后,在服务器和离线场景中均取得了具有竞争力的成绩,同时在能效方面也表现出强劲的提升。真正的亮点不仅在于 NVIDIA 依然保持领先,还在于与仅仅一轮 MLPerf 测试之前相比,AMD 已经显著缩小了差距。对于买家来说,这意味着只关注绿色 GPU 的时代可能已经结束——ROCm 正在走向成熟,而 MI300 在实际推理部署中也已具备可行性。





Amazon