Arista Networks 宣布了一項突破性的技術演示,旨在創建 AI 資料中心,將運算和網路域整合到單一託管 AI 實體中。該計劃與 NVIDIA 合作開展,旨在建立最佳的生成式 AI 網絡,允許客戶跨關鍵組件(包括網絡、NIC 和伺服器)統一配置、管理和監控 AI 集群,從而縮短作業完成時間。
AI集群統一管理
隨著人工智慧叢集和大型語言模型(LLM)的不斷擴展,所涉及組件的複雜性和數量也顯著增加。這些組件包括 GPU、NIC、交換器、光學器件和電纜,它們必須協同工作才能形成一個全面的網路。統一控制確保託管 NIC 和 GPU 的 AI 伺服器與各層的 AI 網路交換器保持同步。如果沒有這種對齊,就會存在配置錯誤或不一致的風險,特別是在 NIC 和網路交換器之間,這可能會由於難以診斷的網路問題而嚴重影響作業的完成。
協調擁塞管理
大型 AI 叢集需要同步擁塞管理,以防止資料包遺失和 GPU 利用率不足。協調、同步的管理和監控對於優化運算和網路資源也是必要的。 Arista 解決方案的核心是基於 EOS 的代理,可實現網路和主機之間的通信,協調配置以優化 AI 叢集。
用於增強控制的遠端 AI 代理
在 Arista 交換器上執行的 Arista EOS 可以透過遠端 AI 代理擴展到直接連接的 NIC 和伺服器。這允許跨人工智慧資料中心進行單點控制和可見性,從而創建統一的解決方案。遠端 AI 代理程式託管在 NVIDIA BlueField-3 SuperNIC 上或在伺服器上運行並從 SuperNIC 收集遙測數據,允許網路交換器上的 EOS 配置、監控和調試伺服器上的網路問題。這確保了端到端網路配置和服務品質 (QoS) 的一致性,使人工智慧叢集能夠作為一個有凝聚力的解決方案進行管理和最佳化。
Arista Networks 首席平台長 John McCool 表示:「Arista 旨在提高已發現網路和 GPU 拓撲之間的通訊效率,透過協調編排、配置、驗證和監控 NVIDIA 加速運算、NVIDIA SuperNIC,縮短作業完成時間,以及Arista 網絡基礎設施。
這項新技術強調了基於 Arista EOS 的遠端 AI 代理程式如何允許將整合的 AI 叢集作為單一解決方案進行管理。透過遠端 AI 代理將 EOS 功能擴展到伺服器和 SuperNIC,Arista 可確保持續追蹤和報告主機和網路之間的效能問題或故障,從而實現快速隔離並將影響降至最低。基於 EOS 的網路交換器保持對準確網路拓撲的持續感知,並透過遠端 AI 代理將 EOS 擴展到 SuperNIC 和伺服器,增強了 AI 資料中心所有元素的端對端 QoS 的協調優化,最終縮短了作業完成時間。
Arista Networks 的下一步
Arista Networks 將於10 月5 日在紐約證券交易所舉行的Arista IPO 2024 週年慶典上展示AI 代理技術,預計將於XNUMX 年下半年開始客戶試用。互通的目標邁出了重要一步。




Amazon