存儲評論網

戴爾擴展AI工廠,以簡化和加速企業本地AI部署

企業  ◇  伺服器

戴爾科技集團宣布對其戴爾人工智慧工廠(Dell AI Factory)進行一系列增強,旨在簡化和加速企業人工智慧轉型。此次擴展後的產品和服務專注於提升人工智慧任務的效能和自動化程度,並透過整合、可靠的本地部署基礎架構來應對常見挑戰,從而提供更強的控制力和更可預測的運作結果。

這一時機恰逢市場發生顯著轉變。未來24個月內,85%的企業計畫將人工智慧部署到企業內部,而非主要依賴公有雲服務。戴爾首席策略辦公室 (CSO) 近期發布的人工智慧應用調查顯示,77% 的人工智慧應用企業正在積極尋找能夠提供從頭到尾支援的單一供應商。戴爾正致力於打造人工智慧工廠 (AI Factory) 以滿足這一需求,並聲稱其擁有業界最全面的端到端人工智慧產品組合,旨在簡化人工智慧的部署流程,並交付切實可衡量的成果。

簡化和自動化的AI之旅

戴爾自動化平台已增強,可與戴爾人工智慧工廠直接協作,為部署人工智慧基礎設施和任務打造更智慧、更自動化的體驗。戴爾不再要求客戶建立自訂架構,而是專注於在安全框架內交付經過驗證和最佳化的解決方案設計。這種方法旨在標準化部署,確保結果的一致性,並顯著降低人工智慧基礎設施設計中常見的各種不確定性。

作為此次擴展計畫的一部分,戴爾正在自動化整合在現代人工智慧工作流程中日益重要的軟體驅動型工具。人工智慧程式設計助理 Tabnine 和智慧體人工智慧平台 Cohere North 現已整合到戴爾人工智慧工廠 (Dell AI Factory) 中,使人工智慧工作負載能夠更快地從實驗階段過渡到生產階段。透過改進系統集成,這些工具有助於簡化操作、增強可擴展性並減少開發團隊和基礎架構團隊之間的摩擦。

服務在戴爾的簡化策略中扮演著至關重要的角色。戴爾專業服務團隊提供基於真實客戶數據的完整互動式人工智慧試點計畫。這些試點項目是結構化的合作項目,旨在客戶進行更大規模投資之前,展示人工智慧的商業價值。專案由專家主導,包含清晰的成功指標和關鍵績效指標 (KPI),並力求展現可衡量的投資報酬率 (ROI)。對於技術銷售團隊和 IT 領導者而言,這些試點項目透過展示人工智慧工廠在客戶特定環境和數據背景下能夠實現的功能,最大限度地降低了風險。

使用 PowerScale 和 ObjectScale 增強資料管理

資料管理仍然是區分人工智慧領域優秀企業和那些難以有效實施人工智慧的企業的關鍵因素。戴爾已更新了戴爾人工智慧資料平台的儲存引擎 PowerScale 和 ObjectScale,以增強其效能、可擴充性和資料發現能力。

Dell PowerScale 即將作為獨立軟體在部分 Dell PowerEdge 伺服器上推出,例如PowerEdge R7725xd。這種軟體定義的方法緊接在 Dell 最近發布的 Dell ObjectScale 之後。這些新配置將為包括雲端服務供應商在內的企業提供更大的靈活性,以提升 AI 效能,並使其能夠採用最新的伺服器和網路技術。客戶不再局限於固定儲存設備,而是可以將 PowerScale 和 ObjectScale 與其選擇的硬體生命週期和平台策略結合。

在協定方面,Dell PowerScale 新增了對平行 NFS (pNFS) 和彈性檔案佈局 (FFL) 的支援。此特性支援元資料伺服器和用戶端之間的雙向通信,從而提高了 PowerScale 叢集中多個節點間並行資料分發的效率。其結果是更高的綜合吞吐量、更優的性能以及透過多路徑並行 I/O 實現的近乎線性的可擴展性。對於需要高 I/O 的 AI 訓練、模擬和大規模推理任務,這種增強的平行性旨在提供所需的強大可擴展性和頻寬,從而確保 GPU 和加速器得到充分利用。

此外,戴爾 ObjectScale AI 優化搜尋還引入了兩個互補的 AI 搜尋功能(S3 表格和 S3 向量),專為 ObjectScale 的 S3 儲存而設計。這些專用 API 可直接、快速地存取儲存在 ObjectScale 上的複雜數據,支援分析和核心 AI 工作負載,例如推理和檢索增強生成 (RAG)。透過支援對不斷增長的非結構化資料集進行更快、更準確的搜索,AI 優化搜尋旨在縮短決策週期,並簡化組織大規模儲存、檢索和分析資料的方式。

PowerEdge 為人工智慧和高效能運算領域帶來的創新

在運算方面,戴爾 PowerEdge 伺服器仍然是企業 AI 基礎架構的重要組成部分,可實現更快的訓練、分散式推理和更短的洞察時間,並提供與各種資料中心策略相適應的冷卻選項。

戴爾PowerEdge XE9785 和 XE9785L專為下一代人工智慧 (AI) 和高效能運算 (HPC) 工作負載而設計。 XE9785 是一款採用風冷的 10U 平台,而 XE9785L 則是採用直接液冷 (DLC) 的 3U 系統。兩種配置均配備雙路 AMD EPYC 處理器,每個節點配備八個 AMD Instinct MI355X GPU。結合 AMD Pensando Pollara 400 AI 網路卡和戴爾 PowerSwitch AI 架構,這些平台旨在提供高整體運算吞吐量、可預測的多節點擴展能力以及更低的總體擁有成本。透過將高密度 GPU 資源與最佳化的網路和靈活的散熱相結合,XE9785 系列旨在滿足建立大型 AI 叢集並需要在效能、功耗和營運成本之間取得平衡的客戶的需求。

戴爾 PowerEdge R770AP

戴爾 PowerEdge R770AP

全新戴爾 PowerEdge R770AP 伺服器專為需要高並行性、低延遲和強大 I/O 能力的工作負載而設計,例如即時分析和交易平台。這款風冷系統搭載英特爾® 至強® 6900 系列六核心處理器,具備高核心數、大快取容量,並支援 CXL 記憶體擴充。豐富的 PCIe 通道可實現高密度的網路、加速器和儲存連接。在實際應用中,這意味著更快的交易演算法、更靈活的記憶體擴展以及更佳的網路效能,尤其是在微秒延遲和吞吐量直接影響業務成果的環境中。

Kevin 使用的是英特爾至強 6 P 核心 6900 系列處理器

Kevin 使用的是英特爾至強 6 P 核心 6900 系列處理器

面向大規模人工智慧的高階網絡

網路連線常常是人工智慧擴展的一大挑戰,尤其是在部署規模達到數萬個加速器時。戴爾正在擴展其開放式網路產品組合,以加速人工智慧架構的部署並簡化大規模環境中的運維。

戴爾 PowerSwitch Z9964F-ON 和 Z9964FL-ON 搭載博通 Tomahawk-6晶片,提供高達 102.4 Tbps 的交換容量,並支援多種速率選項。這些平台旨在支援大型 AI 叢集和高效能運算 (HPC) 資料中心,包括風冷和 DLC 環境,可容納超過 100,000 萬個加速晶片。其目標是在保持可靠性能和低節點間延遲的同時,提供足夠的頻寬和連接埠密度,以確保 GPU 叢集的充分利用。

這些交換器與戴爾科技集團的企業級 SONiC 分發方案和SmartFabric Manager for SONiC搭配使用。客戶可以藉助企業級支持,輕鬆建立開放的大規模網絡,從而簡化部署、管理和監控,並促進廣泛的 AI 網路架構的建置。企業級 SONiC 為營運商提供標準化的多廠商網路作業系統選項,而 SmartFabric Manager 則大幅降低了網路架構設定和日常運維的複雜性。

SmartFabric Manager 現已整合 Dell AI Factory。此整合可為 AI 基礎架構提供自動化“藍圖”,從而以最少的人工幹預實現更快、更無誤的部署。該平台現在可自動部署 Dell PowerScale 儲存解決方案,縮短配置時間,並確保儲存和網路從一開始就保持一致。此外,SmartFabric Manager 還引入了與 OpenManage Enterprise (OME) 的機架級集成,使運維人員能夠全面了解 GPU 基礎架構,涵蓋從運算和儲存到交換矩陣的各個方面。這種高度整合旨在加快故障排除速度,最大限度地減少運維開銷,並使叢集保持最佳效能。

整合、可靠的基礎設施,實現更強大的控制力

戴爾意識到人工智慧基礎設施的成功不僅僅依賴於運算和存儲,因此正在更新其整合機架可擴展解決方案 (IRSS) 項目,旨在為大規模人工智慧部署提供更可靠、更智慧的基礎設施。這些改進旨在確保更高的可用性、更佳的散熱管理以及在密集環境中更平滑的擴展。

OpenManage Enterprise 現提供單一伺服器和機架級環境的統一管理。它將運算、電源和散熱管理整合在一個控制台中,可自動管理多達 25,000 台設備。內建的洩漏偵測和自動反應功能旨在保障液冷環境的正常運作時間,並隨著設備密度的增加降低運作風險。

整合式機架控制器 (IRC) 透過一套全面的軟硬體系統增強了此功能,可提供機架層級的深度可視性。它與 OpenManage Enterprise 和整合式戴爾遠端存取控制器 (iDRAC) 緊密整合,可實現快速自動洩漏偵測以及機架內的協同反應。這種等級的整合旨在縮短事件解決時間、降低故障影響並最大限度地減少整體停機時間。

在散熱方面,戴爾 PowerCool 機架式冷卻液分配單元 (RCDU) 是一款緊湊型 4U 液冷解決方案,支援高達 150 kW 的機架密度。它相容於 19 吋戴爾 IR5000 機架和基於 OCP 標準的 21 吋戴爾 IR7000 機架。 RCDU 可連接至 OpenManage Enterprise 進行集中式散熱管理,使管理員能夠將散熱視為關鍵且可視的資源。與戴爾 ProSupport 服務配合使用時,此解決方案包含預防性維護和主動監控功能,可確保在 AI 部署不斷擴展的過程中,系統始終保持最佳效能並提供可靠的支援。

戴爾科技集團基礎設施解決方案事業部總裁亞瑟·劉易斯強調了企業人工智慧領域的一個普遍問題:企業希望在自身基礎設施上運行人工智慧,以實現可控性和可預測性,但由於架構和維運的複雜性,許多企業面臨著許多挑戰。他認為,戴爾人工智慧工廠透過結合整合自動化、性能優化和穩健的設計,直接解決了這個問題。在實踐中,這意味著提供一個能夠簡化大規模人工智慧部署、確保結果一致性並實現實際收益的平台,而無需不斷對底層基礎設施進行重構。

庫存情況

  • 戴爾人工智慧工作負載藍圖現已推出技術預覽版。
  • 戴爾服務人工智慧用例試點計畫現已在全球推出。
  • 戴爾 PowerEdge XE9785 將於 12 月在全球上市。
  • 戴爾 PowerEdge XE9785L 現已在全球上市。
  • 戴爾 PowerEdge R770AP 將於 12 月在全球上市。
  • 軟體定義的 PowerScale 將於 2026 年上半年在全球推出。
  • Dell PowerScale 並行 NFS 支援將於 2026 年在全球推出。
  • Dell ObjectScale AI 優化搜尋將於 2026 年下半年在全球推出。
  • Dell PowerSwitch Z9964F-ON 和 Z9964FL-ON 將於 2026 年下半年在全球上市。
  • 戴爾科技集團的 SONiC 分發和 PowerSwitch 支援將於 2026 年上半年在全球推出。
  • Dell SmartFabric Manager 將於 2026 年上半年在全球推出。
  • 戴爾面向人工智慧PC的生態系統賦能工具的更新現已在全球推出。
  • OpenManage Enterprise 的更新將於 2026 年 1 月在全球推出。
  • 戴爾整合機架控制器將於本月在全球上市。
  • 戴爾 PowerCool RCDU 將於 2026 年上半年在全球上市。

參與 StorageReview

電子報| YouTube | PodcastiTunes / Spotify | Instagram | Twitter | TikTok | RSS訂閱

哈羅德弗里茨

自 IBM 創建 Selectric 以來,我一直在科技行業工作。 不過,我的背景是寫作。 因此,我決定退出售前業務,回歸本源,從事一些寫作工作,但仍從事技術工作。