存储评论网

NVIDIA 在 AI 基础设施峰会上公布路线图:从 Blackwell Ultra 到 Vera Rubin CPX 架构

AI  ◇  企业版

AI Infra Summit 重点介绍了 AMD 和 NVIDIA 的 MLPerf 推理结果,以及 NVIDIA 的 2026 年 Vera Rubin 路线图,特别是 Rubin CPX。

在 2025 年 AI 基础设施峰会上,NVIDIA 展示了两个方面的发展势头:其 Blackwell Ultra 系统令人印象深刻的全新 MLPerf 推理结果,更重要的是,它为 2026 年 Vera Rubin 一代制定了详细的路线图,其中包括 Rubin CPX,这是一种专为大规模上下文推理而构建的新型 GPU。

Blackwell Ultra 树立了新的性能基准

NVIDIA 的 GB300 NVL72 机架级系统已在 MLPerf Inference v5.1 中取得了卓越的性能,展现了 Blackwell Ultra 平台在软件不断释放其全部潜力的同时,架构的成熟度。Llama 2 70B 基准测试清晰地展现了这一强大性能,该平台在离线场景下每 GPU 每秒可处理 12,934 个令牌,令人印象深刻。在线服务测试中,其性能几乎相同,为每秒 12,701 个令牌,充分证明了该架构在不同工作负载下的卓越效率。

全新引入的交互类别进一步证明了该平台已为实际应用做好准备。该类别对延迟提出了更严格的要求,包括低于 500 毫秒的首个令牌生成时间要求以及每用户每秒 33 个令牌的阈值。即使在如此严苛的服务质量要求下,Blackwell Ultra 仍保持了高吞吐量,每 GPU 每秒可交付 7,856 个令牌。在 DeepSeek-R1 推理基准测试中,该平台以每 GPU 每秒 5,842 个令牌的速度再次创下新的纪录。

最终,这些结果表明硬件的性能超越了当前的软件堆栈。随着 TensorRT-LLM 和 NVIDIA Dynamo 等框架的不断发展,Blackwell Ultra 的架构优势(例如其增强的 NVFP4 计算路径和每个 GPU 高达 288GB 的​​ HBM3e 容量)将得到充分释放,其性能提升空间仍然巨大。

加速创新节奏:Vera Rubin 平台

NVIDIA 采取了每年一次的架构更新周期,以战略性地应对 AI 计算需求的指数级增长。为了遵循这一积极的时间表,NVIDIA 透露 Vera Rubin 一代架构已经完成流片,并计划于 2026 年下半年投入企业部署。

Vera Rubin 架构引入了全面的平台更新,重点集成了全新的 Vera CPU 和 Rubin GPU。Vera CPU 代表了过去三代 NVIDIA 系统的重大演进。Vera CPU 拥有 88 个 ARM 核心,支持 176 个线程。这些处理器还将芯片间 (C2C) 链路带宽翻倍至 1,800 GB/s,从而实现 CPU、GPU 及其共享内存资源之间更快的链接。

在互连层,第六代 NVLink 提供 3,600 GB/s 的双向带宽,是当前第五代 NVLink 交换机带宽的两倍。随着模型规模不断扩大,超越单个设备的内存容量,这种增强的连接性变得尤为重要,这需要复杂的并行执行策略,从而实现最小的通信延迟和节点间最大的吞吐量。

作为 NVLink 技术的补充,Spectrum-6 交换机采用共封装光学器件 (CPO) 技术,可实现 102 TB/s 的交换容量。将光学组件直接集成到交换机封装中,消除了传统的电光转换瓶颈,降低了延迟,同时显著提高了能效——随着 AI 工厂向千兆瓦级功耗扩展,这至关重要。

VR NVL144 系统仍将利用目前支持 Grace Hopper、Grace Blackwell 和 Grace Blackwell Ultra 部署的成熟 Oberon 机架平台。

架构命名法的演变:从封装到芯片

NVIDIA 正在将其命名规则从基于封装改为基于芯片数量。虽然这一变化可能存在争议,但这是一个具有前瞻性的举措,将提供更清晰的理解,尤其是在预计于 2026 年末推出的 Rubin Ultra GPU 的情况下,该系列 GPU 预计将采用四个光罩大小的芯片。

在 Rubin 一代中,NVIDIA 采用了一种基于芯片数量的命名法,能够直接反映可用的计算资源。NVL144 的名称明确指的是 144 个 GPU 芯片,同时保持了 72 个封装的物理配置,并提供了更精确的计算能力度量。这与当前一代 GB200 和 GB300 NVL72 系统类似,后者包含 72 个 GPU 封装,每个封装包含两个 GPU 芯片,总共 144 个计算芯片。

解决上下文处理挑战

Rubin CPX 计划于 2026 年底上市,这是 NVIDIA 针对 LLM 推理领域最紧迫挑战之一的架构性回应:在 token 生成的各个阶段,计算模式之间存在根本性的不匹配。为了理解这一创新,我们需要探究 LLM 推理工作负载的独特特性,以及当前同构 GPU 架构在满足这些多样化计算需求方面的局限性。

大型语言模型推理包含两个截然不同的计算阶段,对硬件资源的需求也截然不同。预填充阶段处理初始输入提示,计算键和值矩阵以供后续生成。此阶段计算密集型,能够有效利用现代 GPU 的海量浮点吞吐量。

解码阶段带来了完全不同的计算挑战。在解码过程中,模型会自回归地生成输出标记,通过关注先前的上下文,一次生成一个标记。每个新标记都需要注意力机制来处理整个序列历史,计算其与所有先前标记的关系。这创建了一种独特的计算模式,其中内存带宽(而非计算吞吐量)成为主要瓶颈。用于存储维护上下文所需中间表示的键值缓存 (KV cache) 成为内存的主要消耗者。

KV 缓存的扩展特性在生产环境中带来了特殊的挑战。对于像 Llama 3.1 405B 这样处理扩展上下文的模型,每个序列的 KV 缓存很容易消耗数十 GB 的数据。在批量推理场景中(这对于在生产环境中实现高吞吐量至关重要),KV 缓存的总大小通常会超过模型权重本身的大小。由于大规模 NVL72 部署中可能存在较大的批量,KV 缓存的大小可以达到数 TB。虽然这些数据必须以合理的延迟保持可访问性,但并非所有 KV 缓存访问都需要 HBM 内存的极高带宽。许多注意力操作表现出适合分层内存架构的访问模式。

Rubin CPX:专为上下文处理构建的架构

Rubin CPX 通过专门针对长上下文 LLM 推理的设计解决了这些架构不匹配的问题。该架构以 128GB GDDR7 内存为核心,为键值缓存操作提供了庞大且经济高效的内存池。GDDR7 的带宽特性虽然低于 HBM4,但足以满足大多数注意力操作的需求,尤其是在与智能缓存策略结合使用时。

通过 ConnectX-144 网卡和交换芯片的 PCIe 链路,与 VR NVL9 CPX 机架中更广泛的 Vera Rubin 平台集成,从而促进了在传统 GPU 上进行计算密集型操作的混合执行模型。内存密集型上下文管理迁移到 CPX 处理器。

灵活的部署架构和配置选项

Vera Rubin 平台的模块化架构实现了灵活的部署,使企业能够根据特定的工作负载特性优化配置。标准的 VR NVL144 机架配置包含 Vera Rubin GPU 和八个 ConnectX-9 网卡,从而提供适用于各种 AI 工作负载的均衡架构。该配置可提供 3.6 ExaFLOPS 的 NVFP4 计算能力,比当前 GB3.3 NVL300 系统提升了 72 倍,同时还具备 1.4 PB/s 的 HBM4 带宽(是当前一代的 2.5 倍)和 75 TB 的 HBM4 内存容量(是当前一代的 2 倍)。

对于需要优化推理和长上下文强化学习后训练的组织,可以使用超高密度 VR NVL144 CPX 计算托盘。每个托盘包含四个 VR GPU 封装,每个封装包含八个 GPU 芯片,从而保持标准配置的计算密度,同时还添加了八个 Rubin CPX GPU。八个 ConnectX-9 NIC/交换机芯片确保了分布式推理所必需的无缝数据流。

该架构的模块化特性使其部署策略异常灵活。企业可以先部署标准的 VR NVL144 机架,然后随着上下文处理需求的增长,再使用专用的 Rubin CPX 机架进行扩展。这种方法使基础设施能够与模型功能同步演进,从而避免过度配置。

完整的 VR NVL144 CPX 配置为计算能力树立了新的标杆。该系统可提供 8 ExaFLOPS 的 NVFP4 计算能力,比当前一代 GB7.5 NVL300 系统提升了 72 倍。如此强大的计算能力与 1.7 PB/s 的总内存带宽相结合,充分利用 HBM4 和 GDDR7 显存,实现了当前系统三倍的内存吞吐量。总内存容量达到 100TB,提供的内存资源是当前一代平台的 2.5 倍。

NVIDIA 的目标是在 2026 年底实现这一目标。这将赋能全新类别的 AI 应用,并使百万级令牌上下文窗口真正应用于生产环境,从而使 AI 系统能够一次性处理整个代码库或冗长的文档。这些创新还能帮助企业支持更大的批量处理规模,从而降低推理成本,并实现更优化的运营成本 (OPEX) 计算。

千兆瓦级基础设施蓝图

除了单个系统创新之外,NVIDIA 还发布了针对千兆瓦级 AI 工厂的参考架构。这些蓝图由 NVIDIA 与 Jacobs、施耐德电气、西门子能源和 Vertiv 等基础设施合作伙伴合作开发,涵盖了从发电到计算交付的完整基础设施堆栈。这些参考设计表明,下一代 AI 部署需要进行整体优化,而这远远超出了计算组件本身的范畴。

这些架构蓝图利用 NVIDIA Omniverse 数字孪生技术,在物理部署之前进行全面的设施模拟。企业可以在统一的模拟中对配电、冷却系统和计算工作负载进行建模,从而在部署物理基础设施之前识别并解决瓶颈问题。

结语

NVIDIA 继续引领 AI 基础设施领域,其前瞻性的、以开发者为中心的方法直接解决了组织和 AI 实验室面临的痛点。从通用加速到特定工作负载架构的转变,例如 Rubin CPX 针对上下文处理的定向方法,表明未来的 AI 系统将越来越多地包含针对 AI 工作流程各个阶段进行优化的异构计算资源。这种架构演变要求规划多年 AI 基础设施投资的组织不仅要考虑原始计算吞吐量,还要考虑硬件功能与不断发展的模型架构之间的协调性。

从 Blackwell Ultra 到 Vera Rubin,再到 Rubin CPX,在如此短的时间内,创新节奏的加快令人印象深刻。如此快的步伐要求企业设计出能够集成新兴架构范式的系统,从而避免前几代数据中心基础设施所特有的锁定效应。为了应对这一挑战,NVIDIA 的 AI Factory 参考设计和 Omniverse 数字孪生提供了必要的蓝图和仿真工具,以确保这些关键投资面向未来。随着 AI 模型继续向万亿参数规模和百万令牌上下文发展,在 AI 基础设施峰会上发布的架构创新为计算的未来奠定了重要基础。它们构建了定义未来十年企业 AI 能力的框架和技术。

参考文章: Nvidia GTC25新闻

所有幻灯片和图片均来自 Nvidia

参与 StorageReview

资讯订阅 | YouTube | 播客 iTunes/Spotify | Instagram | Twitter(现为X) | TikTok | RSS订阅

迪维扬什·贾恩

机器学习工程师、家庭实验室爱好者和技术发烧友。在 Storage Review,我负责人工智能和新兴工作负载测试,旨在提供实用见解和性能分析。