博通推出了业界首款完全符合超级以太网联盟 (UEC) 规范的 800G AI 以太网网卡 Thor Ultra。它专为拥有超过 100,000 万个 XPU 的集群而设计。Thor Ultra 突破了传统 RDMA 的瓶颈,添加了数据包级多路径、乱序数据放置、基于硬件 SACK 的重传以及完全可编程的拥塞控制流水线。
Thor Ultra OCP 卡
该网卡与博通 Tomahawk 6 无缝集成,并兼容任何符合 UEC 标准的交换机产品线。博通重点强调了其安全功能,包括线速 PSP 加密、安全启动和认证功能。该网卡还支持 100G/200G SerDes,提供灵活的部署能力,并支持各种使用模式,包括 chiplet、IP、PCIe 和 OCP 3.0 卡。Thor Ultra 是一款具有前瞻性、高带宽、支持遥测的组件,适用于基于以太网的 AI 基础设施。
AI 的 RDMA 已达到极限
AI 数据中心正在从可预测的 HPC 式流程过渡到不可预测、突发且分布式的 AI 任务,包括训练、微调和大规模推理。在这些条件下,传统的 RDMA(在许多 RoCE 实现中使用)将面临巨大的压力。造成 RDMA 限制的因素包括:
- 数据包级别缺乏真正的多路径,迫使数据流仅使用一条路径,从而增加了 incast 事件和微突发期间的尾部延迟。
- 当数据包无序到达时,按顺序放置要求会阻碍 PCIe 的最佳利用,从而导致主机停顿和队头阻塞。
- Go-Back-N 重传会增加拥塞并导致带宽浪费,并且丢失后的恢复速度很慢。
- 在 100K 节点规模上调整叶脊结构的拥塞控制是一项挑战,并且通常因供应商而异。
Thor Ultra 通过将 RDMA 语义与大规模 AI 结构的要求更加紧密地结合起来,支持细粒度的负载分配、重新排序容忍度、快速丢失恢复以及随着 UEC 发展而适应的可编程拥塞控制,从而克服了这些限制。
架构与特点
Thor Ultra 旨在锚定符合 UEC 标准的 AI 以太网结构,其配备的 NIC 可消除主机端和结构端的瓶颈。Thor Ultra 的功能包括:
- Thor Ultra 的 RDMA 管道使用数据包级多路径将流量分配到多条路径,并支持直接在 XPU 内存中处理乱序数据包。它通过 SACK 和重传机制确保可靠性,并具有完全可编程的拥塞控制功能,支持各种算法,以实现策略统一性和灵活性。
- Thor Ultra 优先考虑完全符合 UEC 规范,支持可靠性、拥塞信号和遥测等行为。它与 Broadcom Tomahawk 6 和其他 UEC 交换机兼容,从而推动了开放式以太网方法,避免了厂商锁定,并支持混合供应商架构。
- Thor Ultra 的线速安全性包括硬件加速加密/解密、带有签名固件的安全启动和设备证明,确保多租户 AI 集群中的供应链和运行时完整性。
- 支持横向扩展 UEC 兼容遥测功能,例如数据包修剪和显式拥塞信号,从而增强了横向扩展结构中的可观察性、闭环拥塞控制调整和快速故障隔离。
- 该 NIC 支持 100G 和 200G SerDes 配置,可提供灵活的端口和升级选项。它采用散热效率高的无源铜缆 DAC,最长可达五米,适用于短距离机架连接,从而降低功耗和成本。这些型号包含用于定制板卡的 chiplet/IP 以及标准 PCIe 和 OCP 3.0 外形规格,所有型号均共享固件和工具,以便于管理。
以太网 AI 结构与专有替代方案
Thor Ultra 的推出契合了其关键的竞争优势。专有的 AI 互连技术包括 InfiniBand 和供应商特定的以太网覆盖。NVIDIA 的 InfiniBand 解决方案(例如 ConnectX/BlueField 和 Quantum 交换机)提供 SHARP、自适应路由和优化拥塞控制等功能。然而,这些功能存在供应商锁定的风险,并会增加总体拥有成本 (TCO)。Thor Ultra 符合 UEC 标准,并具备先进的 RDMA 功能,旨在达到甚至超越使用标准以太网的尾部延迟和吞吐量性能。这为买家提供了一种基于标准的替代方案,确保了供应灵活性和熟悉的工具链。
与NVIDIA的Spectrum-X以太网战略(该战略瞄准具有专有调度/CC的AI架构)不同,博通则秉持“UEC优先”的开放性,并兼具Tomahawk/Jericho交换机的规模和商用光网络生态系统的广度。然而,对于许多部署定制硬件的云服务提供商(例如AWS和谷歌)来说,UEC可能并非一个强大的卖点。尽管部署定制硬件可能会带来一些麻烦,但他们认为掌控权比UEC合规性更为重要。
英特尔、AMD(Pensando)、Marvell 和 NVIDIA 为 AI 集群提供竞争性以太网 NIC、SmartNIC 和 DPU 解决方案,并支持 RoCEv2 改进和主机卸载功能。Thor Ultra 的独特之处在于其提供 800G 线速、支持乱序放置的数据包级多路径、硬件 SACK 重传以及兼容 UEC 的可编程拥塞控制引擎。
博通的 Tomahawk 6 和 Jericho 在超大规模商用以太网领域处于领先地位。Thor Ultra 提供全面的以太网 AI 基础设施。对于对单一供应商生态系统犹豫不决的运营商来说,UEC 兼容性以及与其他顶级供应商的互操作性提供了灵活性,使博通网卡能够与各种 UEC 交换机兼容,反之亦然。
Thor Ultra 通过解决关键的 RoCE 挑战并推广基于标准的方法(而不是依赖单一供应商的结构),提高了以太网在超过 100,000 个节点上实现 AI 的可行性。
人工智能数据中心设计
Thor Ultra 的功能推动建筑师进行一些设计转变,其中包括:
- UEC 上的织物标准化: 预测符合 UEC 标准的 NIC 和交换机的参考设计,统一各供应商的拥塞信号、遥测和可靠性标准。这将最大限度地减少集成挑战,并简化多源采购。
- 以太网优先的 AI pod 具有可预测的尾部延迟,通过 数据包级多路径和乱序布局支持。这些pod设计采用800G网卡,通过100G/200G SerDes通道连接到ToR/叶子交换机,并基于深度ECMP结构进行分层。这种设置使设计人员能够更积极地处理路径分集和超额认购,同时保持较低的p99和p99.9延迟。
- 可编程拥塞控制作为操作旋钮: CC 在 NIC 芯片上运行且可编程,操作员无需更换硬件即可适应工作负载阶段(数据并行训练 vs. 流水线并行推理)和结构条件。预计将进行基于接收方和发送方方案的 A/B 测试,并使用 UEC 遥测进行闭环控制。
- 更简单的主机数据路径和 PCIe 效率:乱序布局 XPU 内存和硬件 SACK 减少了 CPU/XPU 参与重新排序和恢复的环节,从而释放了主机周期并平滑了 PCIe 带宽利用率。这对于已经在 PCIe 和内存带宽边缘运行的 GPU/加速器服务器至关重要。
- NIC 内置的安全性: 线速加密、安全启动和硬件证明简化了多租户集群中的合规性,特别是在训练和推理租户之间共享结构或跨内部团队进行分区时。
- 布线和电源 TCO:用于 NIC 到 ToR 运行的长达 5 米的无源铜 DAC 可以降低光学功率预算并简化机架级散热。
- 运营遥测和 SLO:UEC 遥测原语(例如数据包修剪和显式拥塞信号)可实现更严格的 SLO 管理和更快的大规模 RCA。能否集成到现有的 NetOps/AI Ops 管道将成为选择标准。
部署
Thor Ultra 支持 100G/200G SerDes 配置,以 chiplet/IP 的形式提供,方便定制集成,并支持标准 PCIe 和 OCP 3.0 卡。所有版本均共享统一的固件、驱动程序和软件工具链,以简化设备群运营。博通将 Thor Ultra 定位为 Tomahawk 6 的“补充”,并声明兼容其他厂商的 UEC 兼容交换机。
Thor Ultra PCIe 卡
博通推出的 Thor Ultra 是人工智能以太网领域的一项重大突破。这款 800G 网卡全面支持 UEC,并提供先进的 RDMA 功能,专注于性能、可扩展性和开放性。它通过提供 800G 网卡,增强了人工智能以太网的潜力,解决了传统 RoCE 在超大规模环境下的关键限制,包括缺乏数据包级多路径、顺序传输不可靠、重传速度慢以及拥塞控制脆弱等问题。
可用性
博通正在向特定客户试用 Thor Ultra。




Amazon