存储评论网

戴尔扩展AI工厂,以简化和加速企业本地AI部署

企业版  ◇  服务器

戴尔科技集团宣布对其戴尔人工智能工厂(Dell AI Factory)进行一系列增强,旨在简化和加速企业人工智能转型。此次扩展后的产品和服务专注于提升人工智能任务的性能和自动化程度,并通过集成、可靠的本地部署基础架构应对常见挑战,从而提供更强的控制力和更可预测的运行结果。

这一时机恰逢市场发生显著转变。未来24个月内,85%的企业计划将人工智能部署到企业内部,而非主要依赖公有云服务。戴尔首席战略办公室 (CSO) 近期发布的人工智能应用调查显示,77% 的人工智能应用企业正在积极寻找能够提供从头到尾支持的单一供应商。戴尔正致力于打造人工智能工厂 (AI Factory) 以满足这一需求,并声称其拥有业界最全面的端到端人工智能产品组合,旨在简化人工智能的部署流程,并交付切实可衡量的成果。

简化和自动化的AI之旅

戴尔自动化平台已得到增强,可与戴尔人工智能工厂直接协作,从而为部署人工智能基础设施和任务打造更智能、更自动化的体验。戴尔不再要求客户构建自定义架构,而是专注于在安全框架内交付经过验证和优化的解决方案设计。这种方法旨在标准化部署,确保结果的一致性,并显著降低人工智能基础设施设计中常见的各种不确定性。

作为此次扩展计划的一部分,戴尔正在自动化集成在现代人工智能工作流程中日益重要的软件驱动型工具。人工智能代码助手 Tabnine 和智能体人工智能平台 Cohere North 现已集成到戴尔人工智能工厂 (Dell AI Factory) 中,使人工智能工作负载能够更快地从实验阶段过渡到生产阶段。通过改进系统集成,这些工具有助于简化操作、增强可扩展性并减少开发团队和基础架构团队之间的摩擦。

服务在戴尔的简化战略中扮演着至关重要的角色。戴尔专业服务团队提供基于真实客户数据的完整交互式人工智能试点项目。这些试点项目是结构化的合作项目,旨在展示人工智能的商业价值,从而为更大规模的投资做好准备。项目由专家主导,包含清晰的成功指标和关键绩效指标 (KPI),并力求展现可衡量的投资回报率 (ROI)。对于技术销售团队和 IT 领导者而言,这些试点项目通过展示人工智能工厂在客户特定环境和数据背景下能够实现的功能,最大限度地降低了风险。

借助 PowerScale 和 ObjectScale 增强数据管理

数据管理仍然是区分人工智能领域优秀企业和那些难以有效实施人工智能的企业的关键因素。戴尔已更新了戴尔人工智能数据平台的存储引擎 PowerScale 和 ObjectScale,以增强其性能、可扩展性和数据发现能力。

Dell PowerScale 即将作为独立软件在部分 Dell PowerEdge 服务器上推出,例如PowerEdge R7725xd。这种软件定义的方法紧随 Dell 近期发布的 Dell ObjectScale 之后。这些新配置将为包括云服务提供商在内的企业提供更大的灵活性,以提升 AI 性能,并使其能够采用最新的服务器和网络技术。客户不再局限于固定存储设备,而是可以将 PowerScale 和 ObjectScale 与其选择的硬件生命周期和平台策略相结合。

在协议方面,Dell PowerScale 新增了对并行 NFS (pNFS) 和灵活文件布局 (FFL) 的支持。该特性支持元数据服务器和客户端之间的双向通信,从而提高了 PowerScale 集群中多个节点间并行数据分发的效率。其结果是更高的综合吞吐量、更优的性能以及通过多路径并行 I/O 实现的近乎线性的可扩展性。对于需要高 I/O 的 AI 训练、仿真和大规模推理任务,这种增强的并行性旨在提供所需的强大可扩展性和带宽,从而确保 GPU 和加速器得到充分利用。

此外,戴尔 ObjectScale AI 优化搜索还引入了两项互补的 AI 搜索功能(S3 表格和 S3 向量),专为 ObjectScale 的 S3 存储而设计。这些专用 API 可直接、快速地访问存储在 ObjectScale 上的复杂数据,支持分析和核心 AI 工作负载,例如推理和检索增强生成 (RAG)。通过支持对不断增长的非结构化数据集进行更快、更准确的搜索,AI 优化搜索旨在缩短决策周期,并简化组织大规模存储、检索和分析数据的方式。

PowerEdge 为人工智能和高性能计算领域带来的创新

在计算方面,戴尔 PowerEdge 服务器仍然是企业 AI 基础设施的重要组成部分,可实现更快的训练、分布式推理和更短的洞察时间,并提供与各种数据中心策略相适应的冷却选项。

戴尔PowerEdge XE9785 和 XE9785L专为下一代人工智能 (AI) 和高性能计算 (HPC) 工作负载而设计。XE9785 是一款采用风冷的 10U 平台,而 XE9785L 是一款采用直接液冷 (DLC) 的 3U 系统。两种配置均配备双路 AMD EPYC 处理器,每个节点配备八个 AMD Instinct MI355X GPU。结合 AMD Pensando Pollara 400 AI 网卡和戴尔 PowerSwitch AI 架构,这些平台旨在提供高整体计算吞吐量、可预测的多节点扩展能力以及更低的总体拥有成本。通过将高密度 GPU 资源与优化的网络和灵活的散热相结合,XE9785 系列旨在满足构建大型 AI 集群并需要在性能、功耗和运营成本之间取得平衡的客户的需求。

戴尔 PowerEdge R770AP

戴尔 PowerEdge R770AP

全新戴尔 PowerEdge R770AP 服务器专为需要高并行性、低延迟和强大 I/O 能力的工作负载而设计,例如实时分析和交易平台。这款风冷系统搭载英特尔® 至强® 6900 系列六核处理器,具备高核心数、大缓存容量,并支持 CXL 内存扩展。丰富的 PCIe 通道可实现高密度的网络、加速器和存储连接。在实际应用中,这意味着更快的交易算法、更灵活的内存扩展以及更佳的网络性能,尤其是在微秒级延迟和吞吐量直接影响业务成果的环境中。

Kevin 使用的是英特尔至强 6 P 核 6900 系列处理器

Kevin 使用的是英特尔至强 6 P 核 6900 系列处理器

面向大规模人工智能的高级网络

网络连接常常是人工智能扩展的一大挑战,尤其是在部署规模达到数万个加速器时。戴尔正在扩展其开放式网络产品组合,以加速人工智能架构的部署并简化大规模环境中的运维。

戴尔 PowerSwitch Z9964F-ON 和 Z9964FL-ON 搭载博通 Tomahawk-6芯片,提供高达 102.4 Tbps 的交换容量,并支持多种速率选项。这些平台旨在支持大型 AI 集群和高性能计算 (HPC) 数据中心,包括风冷和 DLC 环境,可容纳超过 100,000 万个加速芯片。其目标是在保持可靠性能和低节点间延迟的同时,提供足够的带宽和端口密度,以确保 GPU 集群的充分利用。

这些交换机与戴尔科技集团的企业级 SONiC 分发方案和SmartFabric Manager for SONiC配合使用。客户可以借助企业级支持,轻松构建开放的大规模网络,从而简化部署、管理和监控,并促进广泛的 AI 网络架构的构建。企业级 SONiC 为运营商提供标准化的多厂商网络操作系统选项,而 SmartFabric Manager 则显著降低了网络架构设置和日常运维的复杂性。

SmartFabric Manager 现已集成 Dell AI Factory。此集成可为 AI 基础架构提供自动化“蓝图”,从而以最少的人工干预实现更快、更无误的部署。该平台现在可自动部署 Dell PowerScale 存储解决方案,缩短配置时间,并确保存储和网络从一开始就保持一致。此外,SmartFabric Manager 还引入了与 OpenManage Enterprise (OME) 的机架级集成,使运维人员能够全面了解 GPU 基础架构,涵盖从计算和存储到交换矩阵的各个方面。这种高度集成旨在加快故障排除速度,最大限度地减少运维开销,并使集群保持最佳性能。

集成、可靠的基础设施,实现更强大的控制力

戴尔意识到人工智能基础设施的成功不仅仅依赖于计算和存储,因此正在更新其集成机架可扩展解决方案 (IRSS) 项目,旨在为大规模人工智能部署提供更可靠、更智能的基础设施。这些改进旨在确保更高的可用性、更佳的散热管理以及在密集环境中更平滑的扩展。

OpenManage Enterprise 现提供对单台服务器和机架级环境的统一管理。它将计算、电源和散热管理集成在一个控制台中,可自动管理多达 25,000 台设备。内置的泄漏检测和自动响应功能旨在保障液冷环境的正常运行时间,并随着设备密度的增加降低运行风险。

集成机架控制器 (IRC) 通过一套全面的软硬件系统增强了这一功能,可提供机架级别的深度可视性。它与 OpenManage Enterprise 和集成式戴尔远程访问控制器 (iDRAC) 紧密集成,可实现快速自动泄漏检测以及机架内的协同响应。这种级别的集成旨在缩短事件解决时间、降低故障影响并最大限度地减少总体停机时间。

在散热方面,戴尔 PowerCool 机架式冷却液分配单元 (RCDU) 是一款紧凑型 4U 液冷解决方案,支持高达 150 kW 的机架密度。它兼容 19 英寸戴尔 IR5000 机架和基于 OCP 标准的 21 英寸戴尔 IR7000 机架。RCDU 可连接至 OpenManage Enterprise 进行集中式散热管理,使管理员能够将散热视为一项关键且可视的资源。与戴尔 ProSupport 服务配合使用时,该解决方案包含预防性维护和主动监控功能,可确保在 AI 部署不断扩展的过程中,系统始终保持最佳性能并提供可靠的支持。

戴尔科技集团基础设施解决方案事业部总裁亚瑟·刘易斯强调了企业人工智能领域的一个普遍问题:企业希望在自身基础设施上运行人工智能,以实现可控性和可预测性,但由于架构和运维的复杂性,许多企业面临着诸多挑战。他认为,戴尔人工智能工厂通过结合集成自动化、性能优化和稳健的设计,直接解决了这一问题。在实践中,这意味着提供一个能够简化大规模人工智能部署、确保结果一致性并实现实际收益的平台,而无需不断对底层基础设施进行重构。

可用性

  • 戴尔人工智能工作负载蓝图现已推出技术预览版。
  • 戴尔服务人工智能用例试点项目现已在全球范围内推出。
  • 戴尔 PowerEdge XE9785 将于 12 月在全球上市。
  • 戴尔 PowerEdge XE9785L 现已在全球范围内上市。
  • 戴尔 PowerEdge R770AP 将于 12 月在全球范围内上市。
  • 软件定义的 PowerScale 将于 2026 年上半年在全球范围内推出。
  • Dell PowerScale 并行 NFS 支持将于 2026 年在全球范围内推出。
  • Dell ObjectScale AI 优化搜索将于 2026 年下半年在全球范围内推出。
  • Dell PowerSwitch Z9964F-ON 和 Z9964FL-ON 将于 2026 年下半年在全球范围内上市。
  • 戴尔科技集团的 SONiC 分发和 PowerSwitch 支持将于 2026 年上半年在全球范围内推出。
  • Dell SmartFabric Manager 将于 2026 年上半年在全球范围内推出。
  • 戴尔面向人工智能PC的生态系统赋能工具的更新现已在全球范围内推出。
  • OpenManage Enterprise 的更新将于 2026 年 1 月在全球范围内推出。
  • 戴尔集成机架控制器将于本月在全球范围内上市。
  • 戴尔 PowerCool RCDU 将于 2026 年上半年在全球上市。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。