英伟达已公布结果 针对 MLPerf Inference v6.0,重点介绍了硬件、软件和模型之间紧密协作设计所带来的系统级性能提升。该公司将推理吞吐量和令牌经济性作为衡量 AI 工厂性能的主要指标,超越了峰值加速器规格,转向实际工作负载下的实际输出。
在本轮评测中,基于 NVIDIA Blackwell Ultra GPU 构建的系统在所有提交的模型和场景中均实现了最高的吞吐量。该平台的生态系统也得到了扩展,共有 14 家合作伙伴提交了测试结果,其中包括华硕、思科、CoreWeave、戴尔科技、GigaComputing、谷歌云、HPE、联想、Nebius、Netweb Technology、QCT、红帽、Supermicro 和 Lambda 等主要 OEM 厂商、云服务提供商和系统集成商。
扩大基准测试覆盖范围反映了新兴的工作负载
MLPerf Inference v6.0 引入了多个新的基准测试,以更好地反映当前的 AI 部署情况。NVIDIA 是唯一一家提交了所有新测试结果的厂商,这些测试涵盖大型语言模型、多模态系统、生成式视频和推荐引擎。
新增的关键模型包括 DeepSeek-R1 Interactive,与之前的服务器场景相比,该模型能够评估更高的交互性,实现更快的令牌传递速度和更短的首次令牌获取时间。此外,该套件还新增了 Qwen3-VL-235B-A22B,这是首个在 MLPerf 推理中引入的多模态视觉语言模型;以及 GPT-OSS-120B,这是一个混合专家推理模型,已在离线、服务器和交互式场景下进行了测试。
| EventXtra XNUMX大解决方案 | DeepSeek-R1 | GPT-OSS-120B | Qwen3-VL | 莞2.2 | DLRMv3 |
|---|---|---|---|---|---|
| 下架 | 2,494,310 个代币/秒* | 1,046,150 个令牌/秒 | 79个样本/秒 | 0.059个样本/秒 | 104,637个样本/秒 |
| 服务器 | 1,555,110 个代币/秒* | 1,096,770 个令牌/秒 | 每秒 68 次查询 | 21秒** (单流) |
每秒 99,997 次查询 |
| 互动 | 250,634 个令牌/秒 | 677,199 个令牌/秒 | *** | *** | *** |
* 这并非 MLPerf 推理 v6.0 中的新情况
**WAN 2.2 采用单流场景,测量端到端请求延迟,而不是服务器场景。延迟越低越好。
*** 未经 MLPerf 推理 v6.0 测试
现在新增了生成式媒体和推荐工作负载。Wan 2.2 文本转视频模型同时包含对延迟敏感和对吞吐量敏感的测试,而 DLRMv3 则用基于 Transformer 的架构取代了之前的推荐基准测试,从而提升了计算强度和模型复杂度。
软件优化带来可衡量的收益
此次提交方案的一大亮点在于通过软件更新显著提升了现有硬件的性能。NVIDIA 报告称,在 DeepSeek-R1 服务器场景下,GB300 NVL72 平台上的令牌吞吐量比六个月前的结果提高了 2.7 倍。这一改进意味着每个令牌的成本大幅降低,并且已部署基础设施的利用率也更高。
这些性能提升归功于TensorRT-LLM技术栈及其相关框架的更新。内核级优化和融合技术降低了执行开销,而改进的注意力机制数据并行性则能更有效地平衡GPU之间的工作负载。Dynamo分布式推理框架的进一步增强实现了解耦式服务,从而可以独立优化预填充和解码阶段。
对于混合专家模型,诸如 Wide Expert Parallel 之类的技术将专家权重分布到多个 GPU 上,以减少内存瓶颈。多标记预测通过同时生成和验证多个标记,提高了低批量、对延迟敏感场景下的计算效率。KV 感知路由则根据预估的计算成本来定向推理请求,从而进一步优化调度。
| 基准 | GB300 NVL72 v5.1 |
GB300 NVL72 v6.0 |
提速 |
|---|---|---|---|
| DeepSeek-R1 (服务器) |
2,907 个令牌/秒/GPU | 8,064 个令牌/秒/GPU | 2.77x |
| DeepSeek-R1 (离线) |
5,842 个令牌/秒/GPU | 9,821 个令牌/秒/GPU | 1.68x |
| 羊驼 3.1 405B (服务器) |
170 个令牌/秒/GPU | 259 个令牌/秒/GPU | 1.52x |
| 羊驼 3.1 405B (离线) |
224 个令牌/秒/GPU | 271 个令牌/秒/GPU | 1.21x |
NVIDIA 还展示了其在现有型号上的持续扩展能力。在 Llama 3.1 405B 版本中,GB300 NVL72 平台在服务器场景下的性能提升了 1.5 倍,这表明 NVIDIA 正在持续优化高密度 LLM 以及更新的架构。
开放生态系统和框架集成
针对新工作负载提交的测试结果融合了 NVIDIA 和开源框架。Qwen3-VL 基准测试使用了 vLLM 框架,反映了多模态推理优化技术的快速发展。Wan 2.2 文本转视频测试结果则由 TensorRT-LLM VisualGen 提供支持,该框架针对 GPU 上的基于扩散的流水线。
为了应对基于Transformer的推荐模型日益增长的性能需求,NVIDIA将自身的recsys-example框架与GPU加速的嵌入查找技术相结合,以支持DLRMv3的开发。这些集成凸显了更广泛的软件生态系统在从底层硬件中挖掘性能方面的重要作用。
利用 InfiniBand 实现横向扩展性能
NVIDIA 还展示了使用四套通过 Quantum-X800 InfiniBand 连接的 GB300 NVL72 系统进行的大规模推理性能。这套配置共包含 288 个 Blackwell Ultra GPU,是迄今为止规模最大的 MLPerf 推理提交,并在 DeepSeek-R1 上实现了每秒数百万个 token 的系统级吞吐量。
| DeepSeek-R1 | 4x GB300 NVL72 | 每秒代币数 |
|---|---|
| 下架 | 2,494,310 |
| 服务器 | 1,555,110 |
研究结果凸显了高性能互连在扩展推理工作负载方面的重要性,特别是对于分布式 LLM 服务和高吞吐量批处理而言。
迈向服务水平基准测试
展望未来,NVIDIA 正在协助 MLCommons 联盟开发 MLPerf Endpoints。这项即将推出的基准测试旨在利用真实的 API 流量来衡量已部署的推理服务,从而深入了解服务层面的延迟、吞吐量和效率,而不仅仅是组件层面。
随着 AI 工作负载发展成为具有更长上下文窗口的智能体系统,衡量端到端服务性能的基准对于云提供商和企业部署来说预计将变得更加重要。




Amazon