为了应对大型语言模型和复杂推理工作负载,超大规模数据中心运营商和专注于人工智能的基础设施运营商正日益开发专有的人工智能加速器和扩展处理器 (XPU)。为了解决大规模部署专有芯片在物理、内存和网络方面面临的挑战,NVIDIA 详细介绍了其NVLink Fusion 互连和 NVHBM 定制基片内存架构。这一统一的产品组合旨在将定制芯片与 NVIDIA 现有的纵向扩展网络和 MGX 机架级平台连接起来。
率先采用 NVHBM 技术的是亚马逊旗下的 Annapurna Labs,其 NVHBM 计划与AWS 2 万 GPU 的合作伙伴关系扩展计划同时公布;此次公告揭示了该合作背后的架构,并指出 Trainium4 是首款支持 NVLink Fusion 的 Trainium 架构产品。NVIDIA 还正在制定一项可供多家内存供应商使用的标准 NVHBM 实现方案,该公司表示,这将减少跨供应商集成和验证内存的工程工作量。亚马逊 Annapurna Labs 副总裁 Nafea Bshara 表示:“NVHBM 代表了一种提升高带宽内存性能和效率的全新架构方法。我们期待这项技术合作能够惠及未来的 AWS 基础设施设计。”
在高密度数据中心部署定制化 XPU 需要平衡计算逻辑、电源分配、散热开销和高带宽内存。集成和验证前沿内存堆栈通常会造成严重的封装和开发瓶颈。借助 NVLink Fusion 和 NVHBM,设计人员可以利用预验证的基础芯片和接口 IP,从而降低集成复杂性并加快产品上市速度。
内存带宽和延迟优化
现代人工智能工作负载,尤其是大型模型推理和智能体流水线,对读取模型权重、激活值和键值 (KV) 缓存条目的内存吞吐量提出了很高的要求。NVHBM 采用与内存制造商合作开发的定制基片,与标准的 JEDEC HBM4E 规范相比,每个堆栈的内存带宽最多可提高 30%。
| 特性 | NVHBM 福利 |
| 带宽 | 与标准 HBM4e 相比,内存带宽最多可提升 30%。 |
| 区域 | 更高效的接口连接可使计算芯片面积增加高达 25%,从而实现额外的 XPU 功能。 |
| 电力 | 与标准 HBM4e 相比,HBM 功耗最多可降低 15%,这在数千个 XPU 上累积起来可节省大量成本。 |
表 1. NVHBM 为 AI 加速器项目带来三大平台级优势:更高的内存带宽、更大的封装和硅片面积以及更低的 HBM 功耗
带宽的提升最大限度地减少了执行过程中内存密集型阶段的计算引擎资源不足问题。通过加速HBM堆栈和板载计算逻辑之间的数据传输,加速器可以维持更高的利用率,并在密集推理工作负载期间提高每个用户的令牌生成速率。
芯片面积重新分配和PHY优化
现代加速器封装上的硅片空间非常有限,设计人员需要在计算ALU、矩阵引擎、片上SRAM和外围接口之间权衡空间。标准的HBM架构需要宽大的物理接口,这会占用大量的布局面积。
NVHBM 通过将内存控制器直接移至 3D HBM 堆栈并采用定制的物理层 (PHY) 来解决这一问题。与标准 HBM4E 实现相比,这种方法可将 PHY 和外设支持面积减少高达 67%,同时简化中介层走线,从而在整个布局中回收高达 80% 的可用硅片。更窄的内存接口释放了封装空间,使设计人员能够在固定的物理封装内将中央 AI 计算芯片扩展高达 30%,从而添加更多矩阵内核、向量单元或缓存层次结构。
电力效率和设施规模余量
电力分配仍然是超大规模数据中心运行中最严格的限制因素之一,它直接影响加速器的热设计和冷却需求。与标准 HBM4E 相比,NVHBM 可将 HBM 功耗降低 15%。
在芯片层面,降低内存功耗可以降低热压力,从而为计算核心提供额外的电力余量,使其能够以更高的持续频率运行。在数据中心规模上,这些节能效果将成倍放大。在一个理论上的 1 吉瓦数据中心中,如果部署了 2,000 瓦的 XPU,那么降低内存功耗可以释放足够的散热和电力容量,从而支持多达 15,000 个额外的 XPU。
通过 NVLink Fusion 实现机架级集成
NVHBM 在单个封装级别优化性能,而 NVLink Fusion 则充当系统级桥梁。利用专用的 NVLink Fusion 芯片,定制的 XPU 可以直接连接到第六代 NVLink 扩展架构,将机架内的所有加速器整合到一个统一的内存和计算域中。
这种可扩展架构对于专家并行(EP)和 WideEP 等高级并行化方案至关重要,在这些方案中,分布式混合专家模型需要跨多个物理设备实现激活值和隐藏状态的低延迟同步。定制处理器还可以通过 NVLink-C2C 连接到主机 CPU。
通过将半定制芯片集成到更广泛的 NVIDIA 硬件和软件生态系统中,NVLink Fusion 使运营商能够在标准化的 MGX 机架架构下部署混合了定制 XPU 和标准 NVIDIA GPU 的异构环境,从而简化操作和工作负载配置。




Amazon