存储评论网

Broadcom Jericho4:面向人工智能驱动数据中心的下一代以太网路由芯片

企业版  ◇  社交

博通已开始发售其 Jericho4 交换机系列,将其定位为可用于在现代数据中心内横向扩展 AI 的最先进的以太网路由芯片。Jericho4 专为满足分布式 AI 基础设施日益增长的需求而设计,可提供高达 51.2 Tbps 的无损深度缓冲以太网。因此,AI 工作负载可以轻松跨机架、集群甚至地理位置进行扩展,且不会影响可靠性或性能。

Broadcom Jericho4 交换机路由器芯片

分布式人工智能

随着人工智能模型的不断发展和复杂程度的提升,它们正迅速超越单个数据中心的容量和物理限制。由于需要将 XPU(例如 GPU 和 TPU 等加速器)分布在多个设施中,而每个设施的功耗高达数兆瓦,这带来了一系列额外的网络挑战。这些挑战包括跨城域甚至跨区域进行无损、低延迟和高带宽传输的需求。

Broadcom Jericho4 横向扩展图

博通核心交换事业部高级副总裁兼总经理 Ram Velaga 强调,人工智能时代需要能够支持拥有超过一百万个 XPU 的分布式计算环境的网络解决方案。Velaga 解释说,Jericho4 系列旨在实现超越单个数据中心界限的 AI 规模以太网结构,支持长距离 RoCE(融合以太网上的远程直接内存访问)传输、高级拥塞控制和高效互连。

亮点和差异化

Jericho4 系列专为跨数据中心扩展而构建,提供一系列满足 AI 工作负载特定需求的功能。

  • 51.2 Tbps 可扩展深度缓冲容量: Jericho4 系列提供高达 51.2 Tbps 的惊人交换容量,位居业内前列。对于需要在数千个 GPU 或加速器之间传输大量数据的 AI 工作负载而言,如此高的吞吐量至关重要。其“深度缓冲”功能使其能够处理大量突发数据而不丢失数据包,即使在网络拥堵的情况下也能确保分布式 AI 训练的高性能和可靠性。
  • 3.2T HyperPort 接口: HyperPort 将四个 800 千兆以太网 (800GE) 端口组合成单个 3.2 兆兆位/秒 (3.2T) 通道,简化了网络设计和管理。这减少了交换机和服务器之间所需的链路数量,同时最大限度地减少了数据包重新排序和网络效率低下的问题。因此,用户可以将作业完成速度提高高达 40%,并将网络利用率提高高达 70%,从而加快 AI 模型训练速度并更高效地利用计算资源。
  • 具有 200K+ 条安全策略的线速 MACsec: MACsec(媒体访问控制安全)是以太网层数据加密的标准。Jericho4 交换机支持全线速 MACsec,可在不损失性能的情况下进行加密和解密。它支持超过 200,000 万条安全策略,可实现详细的安全控制,这对于多租户环境或“Neo Clouds”至关重要。这确保了敏感的 AI 数据在大型共享基础设施中快速传输时的安全。
  • 端到端拥塞管理和 RoCE 无损传输: 网络拥塞和数据包丢失会影响 AI 工作负载,从而降低分布式训练的速度。Jericho4 的深度缓冲架构和基于硬件的拥塞管理功能,支持使用 RoCE(基于融合以太网的远程直接内存访问)进行无损传输,确保在超过 100 公里的距离内实现可靠的数据传输。这些功能对于连接分布式数据中心或 AI 集群至关重要,能够提供始终如一的性能和可靠性。
  • 每位功耗降低 40%: 随着数据中心不断发展壮大,以支持更大规模的 AI 模型和更多用户,能源效率至关重要。与前几代产品相比,Jericho4 的架构将每比特数据传输功耗降低了 40%。这降低了运营成本,并帮助企业实现可持续发展目标,从而能够在不显著增加能耗的情况下扩展 AI 基础设施。
  • 具有行业领先覆盖范围的 200G PAM4 SerDes: SerDes(串行器/解串器)技术可在铜缆或光纤链路上实现高速数据传输。Jericho4 芯片支持 200G PAM4 SerDes,相比现有技术,可在更长的距离上实现更快的数据传输速率。这使得交换机和服务器能够在更大的数据中心园区或建筑物之间进行连接,而无需牺牲速度或可靠性。
  • 超以太网联盟 合规:超级以太网联盟致力于推广高性能计算和人工智能的以太网标准。Jericho4 的合规性确保了与其他超级以太网设备的无缝兼容,从而保护了投资,并为即将到来的人工智能和云工作负载做好了网络的前瞻性准备。
  • 端点 不可知论者: Jericho4 兼容任何使用以太网的网卡 (NIC) 或 XPU,例如 GPU 或 DPU。这种灵活性使组织能够集成各种计算和存储端点,从而支持各种 AI 架构和供应商解决方案,而不局限于单一生态系统。
  • 人工智能网络: Jericho4 架构以其管理持久、高带宽 AI 流量的能力而脱颖而出。通过利用 HyperPort 技术,它消除了传统的瓶颈和低效之处,为可扩展的 AI 网络提供了更高的吞吐量和更低的延迟。这对于跨园区、城域乃至更广阔地域部署 AI 工作负载的组织尤为重要。

现场部署已证明 Jericho4 的可靠性和有效性,支持超过 100 公里距离的可扩展 AI 设计。这确立了 Jericho4 成为下一代分布式 AI 基础设施的关键技术。

Broadcom Jericho4 灵活性图

单个 Jericho4 系统可扩展至 36,000 个 HyperPort,每个 HyperPort 的运行速度为 3.2 Tb/s,并具备深度缓冲、线速 MACsec 和 RoCE 传输功能,传输距离可达 100 公里以上。部署选项包括:基于机箱、配备 Jericho 线卡的系统、配备 Jericho 叶子节点和 Ramon 主干节点的分布式调度交换矩阵 (DSF),以及固定集中式系统,所有这些系统均采用博通的高基数、低延迟和节能架构。

博通端到端以太网 AI 平台的一部分

Jericho4 是博通完整以太网 AI 平台的重要组成部分,该平台还包括:

  • 战斧6: 102.4 Tbps 交换机,用于 AI 横向扩展和纵向扩展。
  • 战斧超级: 适用于 HPC 和 AI 扩展的 51.2 Tbps 低延迟交换机。
  • 托尔家族: 针对 AI 优化的以太网 NIC。
  • 物理层产品: 包括重定时器、DSP 和第三代共封装光学器件 (CPO)。

这些产品共同提供了一个开放、可扩展的平台,用于开发任何规模的基于以太网的 AI 基础设施——从紧密互连的 GPU 集群到区域部署。

比赛

博通的 Jericho4 进入了一个竞争激烈的市场,超大规模数据中心运营商和 AI 基础设施提供商都致力于突破传统 InfiniBand 和以太网解决方案的局限性。NVIDIA 凭借其基于 InfiniBand 的 Quantum 和 Spectrum-X 以太网交换机,继续在 AI 网络领域占据主导地位,尤其是在紧密耦合的 GPU 集群领域。然而,以太网的开放性、经济性和生态系统支持正在推动人们转向基于以太网的 AI 架构,尤其是在横向扩展和多站点部署方面。

其他竞争对手,例如拥有 Nexus 系列的思科和 Arista Networks,也在大力投资高性能、AI 优化的以太网交换。然而,博通的深度缓冲、无损架构,加上其在芯片创新和生态系统整合方面的领先地位,赋予了 Jericho4 极具吸引力的价值主张,尤其对于那些致力于开发开放、可扩展且面向未来的 AI 基础架构的组织而言。

请访问Jericho4 产品页面了解更多信息。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。