WhiteFiber公佈了其「紅木計畫」(Project Redwood)的初步研發成果。該計劃是一種分散式GPU超級叢集架構,旨在跨地理位置分散的資料中心運行。上週公佈的測試結果顯示,該計畫在83公里長的暗光纖上實現了111.2 Tbps的吞吐量,並保證了0.9毫秒的往返延遲。
WhiteFiber公司表示,該延遲在光纖傳輸該距離時光的物理傳播極限的8%以內。該公司在測試中僅使用了部分可用光纖頻譜,但其測試結果已達到已公佈的同類全頻譜現場試驗容量的近兩倍左右。該公司計劃在2026年第三季正式商業發布前啟用全頻譜。
該項目由DriveNets和WEKA共同完成。 DriveNets提供基於乙太網路的設施間AI架構,而WEKA NeuralMesh則提供覆蓋整個叢集的儲存和記憶體基礎設施。 WhiteFiber已就此實施方案提交了專利申請。
將多個站點視為一個 GPU 集群
該架構旨在使兩個資料中心作為一個邏輯 GPU 超級叢集運行,而不是兩個透過傳統 DCI 連結連接的獨立運行的叢集。這種區別對於 AI 訓練和推理工作負載至關重要,因為 GPU 間的同步、協同操作以及對共享資料基礎設施的存取都會影響叢集的可用規模。
WhiteFiber 的平台定位於那些超出單一站點可用電力、冷卻、空間、彈性設計或資料主權要求的工作負載。該公司還認為該平台在邊緣運算、電信和自主人工智慧部署方面具有應用前景。
DriveNets 的配套公告中明確了硬體配置:該光纖網路連接了相距 52 英里(約 84 公里)的兩個 WhiteFiber NVIDIA H200 GPU 叢集。 DriveNets 將此部署描述為業界首個商用級、長距離、跨區域擴展的 AI 超級集群,並在生產規模而非實驗室環境下進行了驗證。作為驗證的一部分,兩家公司比較了單一站點內機架間的性能與跨兩個站點的機架間性能,具體方法詳見 DriveNets 的白皮書。
DriveNets 布料設計
站點間環境採用冗餘暗光纖和DriveNets AI Fabric來承載GPU和儲存流量。 DriveNets將該架構描述為一種專為可預測的分散式AI通訊而建構的調度乙太網路架構,而非傳統的長途乙太網路擴充。
該設計利用DriveNets的Fabric Scheduled Ethernet技術,在其9300F、5300R和5301R交換器上運行,將AI架構擴展到各個站點。此方案結合了基於單元的負載平衡、端對端虛擬輸出佇列和深度緩衝互連,能夠在同步AI流量突發造成站點間鏈路擁塞之前將其吸收。 DriveNets表示,最終實現了站點間可預測且無損的連接,從而保持GPU的高利用率,如同整個集群位於同一屋簷下。
這些機制共同旨在確保遠距離集體通訊的可預測性,同時支援統一的運算和儲存架構。多租戶隔離是既定設計目標的一部分。
最終形成的架構將光纖線路視為人工智慧架構的一部分,而不僅僅是站點之間的傳輸連接。其目標是降低實體資料中心邊界對跨叢集運行的工作負載的運作影響。
與 NVIDIA Spectrum-XGS 不同的方法
WhiteFiber 的測試平台與 NVIDIA Spectrum-XGS 乙太網路平台不同。然而,這項工作與整個行業向「跨平台」人工智慧基礎設施擴展的趨勢相一致。
在2025年Hot Chips大會上,NVIDIA執行長黃仁勳闡述了將跨城市、跨國和跨洲的資料中心連接起來,建構大規模人工智慧工廠的必要性。 NVIDIA的Spectrum-XGS方案利用距離感知擁塞控制、精確延遲管理和遙測技術,提高了分散式GPU通訊的可預測性。 CoreWeave是NVIDIA公佈的早期採用者之一。
WhiteFiber 提供了比 NVIDIA 公開揭露的 Spectrum-XGS 部署更具體的早期現場測試指標。其 83 公里的測試結果實現了 111.2 Tbps 的傳輸速率和 0.9 毫秒的往返延遲,儘管兩組系統採用不同的架構,因此測試結果並不直接可比。
分散式培訓超越了單一設施的限制
WhiteFiber 的聲明發布之際,其他雲端和基礎設施供應商也在研究多站點 AI 訓練和推理架構。
Oracle 雲端基礎架構和 NVIDIA 共同發布了一項研究成果,該成果利用 NeMo 框架和 Megatron-Core 在相距約 1,000 公里的資料中心之間運行 LLM 訓練。 NVIDIA 報告稱,透過分層式全歸約和分塊式資料中心間通信,訓練可擴展性超過 96%。這項工作主要著重於軟體和系統演示,而非城域層級傳輸基準測試。
谷歌還開發了TPU Multislice,允許多個TPU切片在其資料中心網路和光互連中運行,從而建立一個更大的分散式訓練環境。谷歌表示,Gemini訓練使用了多個資料中心,該平台旨在大規模管理工作負載分區和彈性。
WhiteFiber 致力於將類似的跨站點設計引入 GPU 雲端基礎設施,尤其專注於高頻寬、低延遲的城域網路連線。該公司計劃在 2026 年第三季推進商業部署時,提供更多架構和可用性方面的細節資訊。




Amazon