存儲評論網

NVIDIA Run:ai:釋放企業級 GPU 效率

AI  ◇  企業

人工智慧基礎設施歷來資源消耗巨大,企業始終面臨如何優化GPU利用率的挑戰。戴爾科技集團透過其AI Factory平台,整合了NVIDIA近期收購的編排解決方案Run:ai,從而有效應對這項挑戰。在戴爾近期發布的一篇部落格文章中,該公司重點介紹了Run:ai如何最大限度地提高資源利用率並加速人工智慧成果的實現,從而徹底改變企業大規模部署和管理GPU資源的方式。

戴爾 NVIDIA 集群

戴爾NVL72集群

Run:ai 到底是什麼?

Run:ai 是一個基於 Kubernetes 建構的編排平台,專為以 GPU 為中心的工作負載而設計。 Run:ai 成立於 2018 年,透過解決業界普遍存在的挑戰——GPU 使用效率低下而獲得關注。傳統上,分配給 AI 工作負載的 GPU 通常處於閒置狀態或未充分利用。 Run:ai 透過動態池化和智慧調度 GPU 資源解決了這個問題,實現了 GPU 的分級分配、高效的多 GPU 部署以及跨混合雲、雲端和本地環境的無縫管理。

什麼是 nvidia run:ai

NVIDIA意識到 Run:ai 具有重塑 AI 基礎設施的巨大潛力,於 2024 年 12 月以約 7 億美元的價格完成了對該公司的收購。值得注意的是,NVIDIA 已承諾最終將 Run:ai 開源,這表明其有意推動 Run:ai 在其硬體平台之外的更廣泛生態系統中得到應用。此舉預計將進一步加速創新,並全面提升整個產業的效率。

對於那些希望深入了解資源管理技術的用戶,NVIDIA 的文檔詳細介紹了Run:ai 如何對 GB200 NVL72 系統上的工作負載編排至關重要。該文件強調了一個關鍵缺陷:Kubernetes 本身無法識別 NVIDIA 的 MNNVL 架構,這使得跨這些高效能領域管理和調度工作負載變得更加複雜。 Run:ai 透過自動偵測 NVLink 域並簡化分散式工作負載的提交,消除了這種複雜性。這確保了 Pod 正確放置在具有 NVLink 互連的節點上,從而無需深入了解硬體知識或為每個作業進行手動配置。這些功能展示了該平台如何簡化密集型訓練環境中的操作,使組織能夠充分利用 GB200 NVL72 等高階硬體配置的強大功能。

為什麼這對企業如此重要

對於運行 GPU 密集型工作負載(尤其是涉及生成式 AI 和大型語言模型的工作負載)的組織而言,GPU 使用率不足會帶來重大風險:投資浪費。 Run:ai 直接解決了這些效率低下的問題,NVIDIA 報告稱,使用該平台的組織可以將 GPU 利用率提高多達五倍。

這種程度的優化不僅提升了投資報酬率,也從根本上重塑了營運效率。先前受限於有限資源和複雜調度流程的團隊,如今擁有了能夠同時部署更多模型、快速擴展並更積極地進行實驗的工具,所有這些都無需額外的硬體資本支出。雖然這些方法在大型 HPC 部署中很常見,但在企業中,最大化 GPU 利用率所需的效率水準卻並不常見。

產業發展勢頭強勁

幾家主要的基礎設施供應商正在採用該平台,這表明整個企業 IT 領域的發展勢頭正在增強。

戴爾持續擴展其 AI Factory 框架,該框架以 NVIDIA 技術為核心,其中包括 Run:ai。戴爾對 Run:ai 的應用展示了企業如何從孤立的手動資源分配模式轉向更動態、更自動化的調度,從而在多租戶環境中顯著提升效率。

HPE將 Run:ai 作為其 GreenLake Marketplace 的一部分提供,並將其與 Ezmeral 平台集成,從而實現高級 GPU 調度、部分分配和混合基礎架構編排。這使客戶能夠以更高的精度和可擴展性部署和管理 AI 工作負載。

思科將 Run:ai 與其 UCS X 系列伺服器和 Intersight 雲端運維平台整合。該解決方案重點關注配額管理、GPU 部分共享和即時監控,以支援大規模本地 AI 部署。

NVIDIA Run:AI 合作夥伴

我們僅重點介紹了 Run:ai 的部分合作夥伴。 NVIDIA 擁有豐富的合作夥伴識別列表,如上所示。各大領先的 OEM 廠商和雲端平台供應商都在與 Run:ai 合作,致力於提供更具創新性和效率的 AI 基礎架構解決方案。

 

參與 StorageReview

電子報| YouTube | PodcastiTunes / Spotify | Instagram | Twitter | TikTok | RSS訂閱

布賴恩·比勒

Brian 位於俄亥俄州辛辛那提市,是 StorageReview.com 的首席分析師兼總裁。