存储评论网

博通Tomahawk Ultra交换机利用无损以太网助力AI扩展

企业版  ◇  社交

博通公司正式宣布推出Tomahawk Ultra 以太网交换机,该产品旨在重新定义高性能计算 (HPC) 和人工智能 (AI) 网络。Tomahawk Ultra 专为超低延迟、高吞吐量和无损传输而设计,为严苛技术环境下的以太网交换树立了新的标杆。

博通战斧超

博通核心交换事业部高级副总裁兼总经理Ram Velaga强调,Tomahawk Ultra是数百名专家多年工程努力的成果。此次发布彰显了博通持续致力于推动以太网技术发展,以应对下一代高性能和人工智能驱动的工作负载的承诺。

打破神话,重新定义以太网

以太网一直以来被视为一种高延迟、高损耗的技术,不适用于要求最严苛的计算集群。Tomahawk Ultra 打破了这一固有观念,它具备以下特性:

  • 超低延迟:在 250 Tbps 的吞吐量下实现 51.2ns 的交换延迟,从而实现紧密耦合的计算环境的实时数据移动。
  • 高性能:支持最小 64 字节数据包的线速交换,每秒可处理多达 77 亿个数据包。
  • 优化的以太网报头:将报头大小从 46 字节减少到仅 10 字节,同时保持完全符合以太网标准,提高网络效率,并允许特定于应用程序的增强功能。
  • 无损结构:实施链路层重试 (LLR) 和基于信用的流量控制 (CBFC) 以消除数据包丢失并确保可靠的数据传输。

专为 HPC 和 AI 扩展而构建

Tomahawk Ultra 针对 HPC 系统和 AI 集群中的低延迟、高带宽通信模式进行了优化。其架构旨在为大规模模拟、科学计算以及同步 AI 模型训练和推理提供可预测的高效性能。

当与扩展以太网 (SUE) 一起部署时,Tomahawk Ultra 可实现低于 400ns 的 XPU 到 XPU 通信延迟(包括交换机传输时间),为大规模紧密同步的 AI 计算树立了新标准。

以太网报头开销从 46 字节减少到 10 字节,同时保持合规性,显著提升了网络效率。这种精简、适应性强的报头在一系列 HPC 和 AI 工作负载中提供了灵活性和性能提升。

适用于数据密集型工作负载的无损结构

Tomahawk Ultra 的无损结构技术旨在防止大容量数据传输过程中出现丢包。该交换机使用 LLR 检测链路错误,并进行前向纠错 (FEC) 并自动重传数据包,从而避免物理层丢包。CBFC 进一步防止了缓冲区溢出(数据包丢失的常见原因)。这些机制共同构成了真正无损的以太网结构,为当今大多数数据密集型应用提供所需的可靠性。

人工智能和机器学习工作负载的一个重大瓶颈是与 AllReduce、Broadcast 和 AllGather 等集体操作相关的开销。Tomahawk Ultra 通过直接在交换芯片内执行这些操作来解决这个问题,从而缩短了作业完成时间并最大限度地提高了昂贵的计算资源的利用率。值得注意的是,此功能独立于端点运行,从而允许跨不同的系统架构和供应商生态系统快速集成。

拓扑感知路由和生态系统开放性

Tomahawk Ultra 采用先进的拓扑感知路由设计,支持 Dragonfly、Mesh 和 Torus 等 HPC 拓扑。该交换机符合 UEC 标准,并充分利用以太网的开放性和丰富的生态系统,确保广泛的兼容性,并适应不断发展的数据中心架构的未来发展。

作为博通面向 AI 扩展的以太网前向战略的一部分,该公司推出了 SUE-Lite,这是 SUE 规范的优化版本。SUE-Lite 专为功耗和面积敏感的加速器应用量身定制,保留了完整 SUE 的核心低延迟和无损特性,同时进一步降低了 AI XPU 和 CPU 上以太网接口的硅片占用空间和功耗。这种轻量级方法简化了符合标准的以太网结构与 AI 平台的集成,从而促进了以太网作为扩展架构首选互连方式的更广泛应用。

Tomahawk Ultra 与 102.4 Tb/s Tomahawk 6 一起构成了统一以太网架构的骨干,支持可扩展的 AI 训练集群以及广泛的 HPC 和分布式工作负载。

可用性

该交换机目前正在出货,用于机架规模的 AI 训练集群和超级计算环境。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。