存储评论网

WhiteFiber 的 Redwood 项目将两个 H200 集群连接成一个 111.2 Tbps 的超级集群。

AI  ◇  企业版

WhiteFiber公布了其“红木计划”(Project Redwood)的初步研发成果。该计划是一种分布式GPU超级集群架构,旨在跨地理位置分散的数据中心运行。上周公布的测试结果显示,该计划在83公里长的暗光纤上实现了111.2 Tbps的吞吐量,并保证了0.9毫秒的往返延迟。

WhiteFiber公司表示,该延迟在光纤传输该距离时光的物理传播极限的8%以内。该公司在测试中仅使用了部分可用光纤频谱,但其测试结果已达到已公布的同类全频谱现场试验容量的近两倍左右。该公司计划在2026年第三季度正式商业发布前启用全频谱。

白纤维项目红木

该项目由DriveNets和WEKA共同完成。DriveNets提供基于以太网的设施间AI架构,而WEKA NeuralMesh则提供覆盖整个集群的存储和内存基础设施。WhiteFiber已就此实施方案提交了专利申请。

将多个站点视为一个 GPU 集群

该架构旨在使两个数据中心作为一个逻辑 GPU 超级集群运行,而不是两个通过传统 DCI 链路连接的独立运行的集群。这种区别对于 AI 训练和推理工作负载至关重要,因为 GPU 间的同步、协同操作以及对共享数据基础设施的访问都会影响集群的可用规模。

WEKA 神经网格图

WhiteFiber 的平台定位于那些超出单个站点可用电力、冷却、空间、弹性设计或数据主权要求的工作负载。该公司还认为该平台在边缘计算、电信和自主人工智能部署方面具有应用前景。

DriveNets 的配套公告中明确了硬件配置:该光纤网络连接了相距 52 英里(约 84 公里)的两个 WhiteFiber NVIDIA H200 GPU 集群。DriveNets 将此部署描述为业界首个商用级、长距离、跨区域扩展的 AI 超级集群,并在生产规模而非实验室环境下进行了验证。作为验证的一部分,两家公司对比了单个站点内机架间的性能与跨两个站点的机架间性能,具体方法详见 DriveNets 的白皮书。

DriveNets 面料设计

站点间环境采用冗余暗光纤和DriveNets AI Fabric来承载GPU和存储流量。DriveNets将该架构描述为一种专为可预测的分布式AI通信而构建的调度以太网架构,而非传统的长途以太网扩展。

该设计利用DriveNets的Fabric Sc​​heduled Ethernet技术,在其9300F、5300R和5301R交换机上运行,​​将AI架构扩展到各个站点。该方案结合了基于单元的负载均衡、端到端虚拟输出队列和深度缓冲互连,能够在同步AI流量突发造成站点间链路拥塞之前将其吸收。DriveNets表示,最终实现了站点间可预测且无损的连接,从而保持GPU的高利用率,如同整个集群位于同一屋檐下。

这些机制共同旨在确保远距离集体通信的可预测性,同时支持统一的计算和存储架构。多租户隔离是既定设计目标的一部分。

最终形成的架构将光纤线路视为人工智能架构的一部分,而不仅仅是站点之间的传输连接。其目标是降低物理数据中心边界对跨集群运行的工作负载的运行影响。

与 NVIDIA Spectrum-XGS 不同的方法

WhiteFiber 的测试平台与 NVIDIA Spectrum-XGS 以太网平台不同。然而,这项工作与整个行业向“跨平台”人工智能基础设施扩展的趋势相一致。

在2025年Hot Chips大会上,NVIDIA首席执行官黄仁勋阐述了将跨城市、跨国和跨洲的数据中心连接起来,构建大规模人工智能工厂的必要性。NVIDIA的Spectrum-XGS方案利用距离感知拥塞控制、精确延迟管理和遥测技术,提高了分布式GPU通信的可预测性。CoreWeave是NVIDIA公布的早期采用者之一。

WhiteFiber 提供了比 NVIDIA 公开披露的 Spectrum-XGS 部署更具体的早期现场测试指标。其 83 公里的测试结果实现了 111.2 Tbps 的传输速率和 0.9 毫秒的往返延迟,尽管两套系统采用不同的架构,因此测试结果并不直接可比。

分布式培训超越了单一设施的局限

WhiteFiber 的声明发布之际,其他云和基础设施提供商也在研究多站点 AI 训练和推理架构。

Oracle 云基础设施和 NVIDIA 联合发布了一项研究成果,该成果利用 NeMo 框架和 Megatron-Core 在相距约 1,000 公里的数据中心之间运行 LLM 训练。NVIDIA 报告称,通过分层式全归约和分块式数据中心间通信,训练可扩展性超过 96%。这项工作主要侧重于软件和系统演示,而非城域级传输基准测试。

谷歌还开发了TPU Multislice,允许多个TPU切片在其数据中心网络和光互连中运行,从而构建一个更大的分布式训练环境。谷歌表示,Gemini训练使用了多个数据中心,该平台旨在大规模管理工作负载分区和弹性。

WhiteFiber 致力于将类似的跨站点设计引入 GPU 云基础设施,尤其专注于高带宽、低延迟的城域网连接。该公司计划在 2026 年第三季度推进商业部署时,提供更多架构和可用性方面的细节信息。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。