今年早些时候,我们深入评测戴尔 PowerStore Gen 3时,重点在于硬件,而且硬件方面可谓面面俱到。戴尔从机箱开始对平台进行了全面重构:3U 机箱内配备 40 个 E3.S NVMe 硬盘位,没有占用任何缓存插槽;控制器之间采用 200GbE RDMA 中板,且与 CPU 代数解耦;使用软件定义持久内存 (SDPM) 取代 NVRAM 驱动器;采用端到端 PCIe Gen 5;以及使用 OCP 3.0 I/O 模块取代专有的 SLIC 载板。所有这些选择都是为了支持长达十年的使用寿命,并允许多次就地升级控制器,这正是该平台生命周期延长优势的体现。

第三代硬件配置齐全。故事的另一半是 PowerStoreOS 5.0。
在硬件发布之时,PowerStoreOS 5.0 仍处于保密状态。如今,它已正式发布,预装在新出厂的第三代 PowerStore 系统中,现有用户也可下载更新。因此,我们仔细研究了此次更新的新增功能和改进之处。简而言之,此次更新的亮点在于其运行层面。5.0 版本并非着重于某一项核心功能,而是致力于让不同世代的 PowerStore 设备协同工作,如同运行在一个统一的系统上,从而最大限度地发挥新硬件的效能,并更加注重性能和安全性。
一个操作系统,每一代
PowerStoreOS 5.0 最重要的方面在于其运行平台。它并非第三代产品独有;预装在新款 PowerStore 1500 上的 5.0 版本也可下载到第一代和第二代设备上。某些功能自然会受到硬件的限制(例如加密飞行数据 FC 卡),但操作系统本身适用于所有安装平台。

一个集群,两代产品,两种介质类型:一台第二代 1200T 和一台 500T,以及一台运行 QLC 的第三代 9500。
这一点至关重要,因为集群功能允许第一代、第二代和第三代设备在同一个 PowerStore 集群中共存,并且工作负载可以在它们之间无缝迁移。戴尔向我们展示的演示环境清晰地说明了这一点:一台最初是第一代 1000T 的 1200T 设备,经过就地升级后,与一台第三代设备组成集群,所有设备都由同一个 PowerStore Manager 实例进行管理。PowerStore Manager 现在会在集群视图中显示每台设备的代数及其存储类别,因此混合部署环境一目了然。需要注意的是:对于新硬件而言,集群是单向的。第三代设备可以加入第二代集群,但反之则不行。一旦添加了第三代设备,就无法再添加其他第二代设备,初始配置向导会预先说明这一规则。
对于使用旧款 PowerStore 硬件的客户,这是迁移路径。将第三代设备添加到现有集群,在 PowerStore Manager 中以原生方式迁移卷,数据迁移完成后自动切换,并在旧设备清空后将其停用或重新利用。目前,块迁移就是这样进行的;集群内设备之间的文件迁移计划在下一个版本中推出。在此期间,戴尔建议文件迁移客户使用复制、从 Unity 或 VNX 进行原生文件迁移,或者对于虚拟化环境,使用基于主机的迁移,例如 Storage vMotion。我们在演示过程中监控了 Unity NFS 的实时导入,对于任何停用过 EMC 时代中端阵列的用户来说,该流程都非常熟悉:发现源、配对文件系统、在后台复制,然后在 PowerStore 接管旧系统功能期间进行短暂的切换。据戴尔估计,目前仍有数万套 Unity 系统在运行,因此该导入路径将会持续繁忙。

第二代初始配置仍然会提出这样的问题:统一模式还是块优化模式。

在第三代产品中,选择不再存在:默认情况下采用统一模式,资源动态分配。
在第一代和第二代产品中,部署首先需要选择:统一模式或块优化模式。选择统一模式会静态地为 NAS 容器分配一部分 CPU 和内存,无论该文件是否被使用,这意味着块工作负载需要为可能闲置的文件资源付费。在第三代产品中,这种选择不再存在。每个设备都采用统一模式部署,动态核心分配 (Dynamic Core Allocation) 会根据需求在块服务和文件服务之间共享资源。文件服务会获得其所需的资源,而不是向导预测的资源,而块服务则会回收剩余的资源。Metro 复制也跨越了不同代;在第三代和第二代设备之间切换主动-主动 Metro 卷对的首选角色只需单击一下,切换过程不到一秒即可完成。
TLC 或 QLC:适合工作负载的存储方案
所有第三代机型,包括 1500、5500 和 9500,均兼容 TLC 或 QLC E3.S 固态硬盘,没有单独的型号层级划分,而且据戴尔称,不同介质类型之间不存在性能差异。第三代产品取消了之前用于区分产品线的 T 和 Q 后缀;型号代表平台,而硬盘类型则根据您的实际使用需求而定。
实现这一目标的软件是 OS 5.0 中的自主数据路径功能,它应用了基于 I/O 的智能技术来处理数据放置和卸载,从而为高容量 QLC 固态硬盘的运行留出了充足的空间。在底层,写入操作首先进入 DRAM,然后通过 RDMA 互连在节点间进行镜像,而不是像老一代产品那样通过 CPU 中介路径,最后无需触及硬盘即可将数据确认信息返回给主机。在卸载过程中,系统会将缩减后的数据聚合为全条带写入后端,从而降低写入放大,这对于 QLC 固态硬盘的耐用性至关重要。戴尔表示,改进后的数据路径使读取速度提升了高达 2 倍,这与底层硬件的性能提升相符。
TLC 容量分别为 3.84TB、7.68TB 和 15.36TB,QLC 容量为 30.72TB;如果 40 个硬盘位全部使用 QLC 硬盘,戴尔宣称 3U 机架式服务器的有效容量可达 5.8PB,这一有效容量数据基于 6:1 的压缩比。戴尔还降低了 QLC 硬盘的入门门槛:第三代 1500 型服务器起步配置为 3 块 30.72TB QLC 硬盘,而上一代 QLC 配置至少需要 3 块。自 PowerStore 5200Q将 QLC 硬盘引入主流工作负载以来,我们见证了戴尔 QLC 硬盘战略的演变;随着第三代产品的推出,QLC 与 TLC 硬盘的选择最终简化为每 GB 的价格和容量,而非性能等级。

第二代产品中,前置硬盘位用于安装 NVRAM 缓存驱动器。

在第三代产品中,所有 40 个存储槽都用于存储数据;缓存持久性转移到了软件定义持久内存中。
效率与 6:1 保证
第三代硬件改变了磁盘几何结构:页面大小从前几代的 4K 增加到 8K。这使得系统每 TB 需要跟踪的元数据减少了一半,从而为用户工作负载释放了容量和处理空间。然而,就单就这一点而言,对于重复数据删除来说却是一种倒退,因为之前可以独立删除的两个 4K 数据块现在可能被拆分到不同的 8K 页面上。OS 5.0 的解决方案是非对齐重复数据删除。系统不再仅仅匹配 8K 边界上的页面,而是可以找到跨越页面边界的重复 8K 数据块并将其删除。这需要更多的处理能力,而这正是第三代硬件所具备的计算周期和新型卸载芯片的优势所在。增强的压缩卸载完善了数据缩减流程。这种几何结构的变化对主机和应用程序是透明的;发起方无需进行任何重新配置。
这条数据管道正是支撑着戴尔引以为傲的DR(灾难恢复)数据量的关键所在。戴尔凭借此平台将数据缩减率保证从5:1提升至6:1,而这一数字也附带一项限定条件:6:1的保证适用于最初安装OS 5.0的第三代阵列,且仅适用于可缩减数据。戴尔的工程师坦诚地向我们解释了其中的机制:如果符合条件的客户在处理可缩减数据时未能达到6:1的缩减率,戴尔将通过提供额外的硬盘来弥补。戴尔认为,这得益于以下几项技术的综合运用:新一代QAT卸载技术、更快的处理器、RDMA卡减轻了CPU在节点间传输的负担、改进的数据条带化,以及戴尔AIOps(原CloudIQ)多年来积累的集群遥测数据,这些数据揭示了缩减算法在哪些方面未能充分发挥其性能优势。
戴尔提供了两个来自低负载集群(物理容量使用率仅为 1.4%)的容量仪表板截图,以展示这些数字在 PowerStore Manager 中的显示效果。“数据节省”面板报告了针对所有写入数据的总体数据节省率 (DRR),以及一个单独的可减少数据节省率 (DRR),该节省率排除了阵列已分类为不可减少的数据,并以 GB 为单位显示不可减少的数据部分。在第一张截图中,2.5TB 的逻辑数据占用了 359GB 的物理空间,总体 DRR 为 7.2:1,可减少数据的 DRR 为 11.7:1。

Dell PowerStore 容量仪表板:2.5TB 逻辑数据(Dell 提供的捕获数据)的总体 DRR 为 7.2:1,可减少的 DRR 为 11.7:1。
第二次捕获,写入相同卷的数据量更多,显示逻辑空间为 2.7TB,物理空间为 376.4GB,总体效率比为 7.4:1,可缩减效率比为 12.3:1。仪表板还将快照和精简配置节省的数据纳入整体效率计算(此处分别为 29.5:1 和 28.2:1),但该数值不应计入任何关于 6:1 效率比的讨论中,因为该保证仅限于可缩减数据的数据缩减。这些是戴尔对戴尔数据集的捕获结果,因此请将其视为报告功能的示例。特定生产工作负载的缩减效果是另一个问题。

数据节省面板的总体 DRR 为 7.4:1,快照和精简节省合并为 28.2:1 的总体效率数字(戴尔提供的捕获)。
NAS、Nutanix 和外部存储的故事

Prism Central 将 PowerStore 连接为 AHV 集群的外部存储。
继 PowerStore 与 Nutanix 合作,将 NCI 7.6 作为 AHV 的外部全闪存存储之后,OS 5.0 让 PowerStore Manager 的集成度更高。Nutanix 的存储由多个卷组成,类似于 VMware 将虚拟机分解为文件;AHV 上的几百个虚拟机在阵列上可以转化为 4,000 个卷。在 5.0 版本之前,这些卷会出现在常规卷视图中,遮挡了其他所有内容。现在,当连接 Nutanix 集群时,PowerStore Manager 会添加一个“外部管理卷”选项卡(以及一个对应的“外部管理主机”选项卡),将 Nutanix 对象隔离到单独的视图中,每个对象都标记有 Nutanix 应用程序类型。存储管理员可以重新获得卷列表,并且在未连接 Nutanix 的系统上不会显示该选项卡。

“外部管理卷”选项卡将数千个 Nutanix 创建的卷隐藏在主视图之外。
通过 Prism Central 连接 PowerStore:选择 Dell PowerStore 作为外部存储供应商,将其指向 PowerStore Manager,集成过程会自动在 Nutanix 端创建和映射卷。对于希望优化虚拟机管理程序策略的企业而言,底层阵列保持不变,而上层平台则可以灵活选择。
5.0 版本中的迁移功能也扩展到了 OpenShift。PowerStoreOS 5.0 将 XCOPY 卸载功能与 Red Hat 的虚拟化迁移工具包 (Migration Toolkit for Virtualization) 集成,因此虚拟机迁移可以将复制工作卸载到阵列,而无需通过 iSCSI 或光纤通道将数据路由到主机,包括多磁盘虚拟机。对于将虚拟机迁移到 KubeVirt 的客户而言,这与本文稍后将介绍的自动化平台完美契合:主机无需处理迁移流量。
更敏锐的观察力

利用率分解:CPU、缓存介质、前端端口和后端概览。
OS 5.0 引入了一系列全新的性能仪表盘组件,让阵列的性能余量更加直观。性能利用率组件将设备负载分解为各个组成部分,因此利用率不再是谜:将鼠标悬停在图表上的某个点上,即可查看该时刻 CPU、缓存介质、前端端口和后端驱动器的利用率,以及延迟情况。该组件还提供持续 IOPS 视图。系统收集大约两周的历史数据后,即可启用“预测”开关,以置信区间预测未来三个月的利用率和延迟。在我们的屏幕截图中,预测范围为三个月。

预测视图预测未来三个月的利用率和延迟,并提供置信范围。
PowerStoreOS 4.2 中,异常检测功能已下放到设备层面。5.0 版本在此基础上,将异常检测功能提升至仪表盘,新增了一个专用组件,涵盖六项指标(带宽、总 IOPS、读取 IOPS、写入 IOPS、延迟和平均 I/O 大小),支持跨设备并排比较,并可导出结果。其工作原理保持不变:在建立约 72 小时的历史基线后,系统会学习每个工作负载的行为,并在实时指标后方绘制预期范围,从而标记异常值,而无需等待静态阈值触发。屏幕截图清晰地展示了这一过程:带宽在灰色的历史季节性范围内波动,工具提示会显示观测值、预期范围以及明确的异常判定结果。

异常检测会根据实时指标描绘出预期的季节性变化,并标记出异常值。
限制表中的可用空间也得到了提升。5.0 版本将每个卷系列的克隆限制从 256 个提升至 1,000 个(第二代 500 型号及以上型号和所有第三代型号,升级后自动提升),高端 9XXX 系列型号的卷到 NVMe 主机映射数量翻倍至 32,000 个,大型第二代和第三代系统的 NAS 服务器接口数量提升至 1,000 个,文件系统数量提升至 14,000 个,并在文件使用率达到 80%、90% 和 99% 时发出文件限制通知,确保用户不会意外达到上限。
这些视图下方的 I/O 级遥测数据是戴尔为阵列本身的在线勒索软件检测奠定的基础,该公司表示该功能即将推出。
网络弹性:MPA、戴尔网络检测和密钥
5.0 中的安全工作分为三个方向:加强人员防护、扫描数据和管理密钥。

PowerStoreOS 5.0 中的 MPA:受保护的操作现在是选择而不是强制执行的。
多方授权功能在早期版本中以全有或全无的方式引入:启用后,集群上的所有破坏性操作都需要第二位管理员的批准。OS 5.0 版本则实现了更精细的控制。管理员现在可以从涵盖计算、存储、保护、系统、硬件和设置等类别的 61 项受保护操作中进行选择(默认保护 41 项),并可根据自身需求调整列表。例如,有的团队可能要求对每次快照删除操作进行批准,但允许对保护策略的编辑操作进行批准;有的团队可能希望对用户删除操作进行二次审核,但对 SMB 共享更改操作则不需要。
审批超时时间现在可以配置为三到七天,而不是固定为七天;电子邮件通知和提醒功能可防止请求在队列中积压而失效,并且整个配置应用于整个集群,并在新设备加入时自动更新。甚至审批流程本身也受到 MPA 保护:修改受保护的操作列表会生成一个请求,该请求必须由第二位管理员批准,并且审计跟踪会记录请求者和批准者。所有功能都通过 REST 接口公开,因此拥有数十个阵列的服务提供商可以编写一个适用于整个集群的黄金 MPA 配置脚本。

按类别细粒度划分,涵盖计算、存储、保护、系统和设置。

Dell Cyber Detect 是 Index Engines 的 CyberSense 技术,已集成到 PowerStore 中。
Dell Cyber Detect 是戴尔集成了 Index Engines 的 CyberSense 分析功能,它是一种与阵列并行运行的集成产品,而非 OS 5.0 内部的代码;该功能与业界熟知的 PowerProtect 中的全内容分析引擎相同。Cyber Detect 针对 PowerStore 进行扫描,查找损坏和加密事件的统计特征,并通过向导配置策略。该向导连接到阵列,选择生产主机,并通过 iSCSI 或 FC 安排扫描。管理员可以从中获得一个经过验证的干净快照目录,因此攻击后的恢复可以从已知良好的副本开始。这与 PowerStore 的安全快照功能相辅相成,即使是管理员也无法在保留期到期前删除这些快照,因此 Cyber Detect 识别出的干净副本也是攻击者无法删除的副本。凭借 Cyber Detect 对数据的分析、AIOps 对遥测数据的勒索软件监控以及 MPA 对控制平面的分析,勒索软件的防护范围现在可以涵盖内容、行为和影响范围。

在创建之前,需要审查 Cyber Detect 扫描策略:阵列、主机、连接和计划。
第三条改进路线直接源于客户的需求,尤其是来自政府相关机构的需求:静态数据加密密钥轮换 (D@RE) 现在可由用户控制。密钥管理此前完全在后台运行,而 5.0 版本允许管理员根据自身合规要求按需生成新密钥集,并下载密钥库。戴尔将此描述为第一阶段,并已将定期轮换列入路线图。第三代硬件还增加了两个额外的安全层:采用后量子加密技术签名的固件,使平台能够抵御“先收集后解密”的攻击策略;以及符合 FIPS 140-3 标准的 SDPM,确保等待降级的缓存数据与驱动器上的数据受到同等标准的保护。
人工智能建议:从洞察到行动
截至 7 月,Dell AIOps(以前称为 CloudIQ)和 Dell Automation Platform 开始协同工作,通过集成将 AI 驱动的建议与自动化优化联系起来,但目前该集成功能仅在有限范围内可用。
这种组合为运营人员提供了一条从洞察到行动的更直接路径,同时辅以人工监督和数字孪生技术,以建立用户对系统建议的信任。用户只需在一个界面中即可完成从建议到自动化操作的整个过程。戴尔已将该界面重新设计为生成式用户界面:默认情况下以聊天优先且界面简洁,用户可以生成所需的表格、图表和视图,并将其固定到持久的个性化工作区中。

在其发布时的深色模式下,生成式 UI 包含一个固定的工作区,其中包含从聊天中构建的舰队健康状况、IOPS 和库存小部件。
发布时,该功能包含三个可操作的用例,其中两个专门针对 PowerStore。持续容量优化功能可识别可回收的存储空间、没有主机映射或近期没有 I/O 的卷,并引导管理员从建议到实际回收,全程无需打开 PowerStore Manager。PowerStore 系统更新功能允许管理员设置代码级容差、目标安装日期、批处理大小和重复的升级前健康检查,然后在同一对话中执行更新计划,如果更新失败,系统将自动生成支持工单。第三个用例通过识别过度配置的基于 VMware 的集群并整合工作负载不再需要的节点,同时保留集群仍然需要的节点,从而扩展 Dell 私有云集群。

持续的容量优化正在发挥作用:在三个卷中释放了 2.0TB 的空间,并显示了优化前后的利用率。
两项设计决策尤为突出。首先,所有操作都由人参与,系统会展示其方案和理由,用通俗易懂的语言回答“您是如何得出这个建议的?”,并等待明确的批准。客户环境的数字孪生模型将在系统初始发布后不久推出,用于在执行变更之前验证其对下游环境的影响。ServiceNow 变更控制集成正在开发中,因此可以对工单进行审批。其次,许可方式不变:AI Recommendations 包含在 AIOps 中,而 AIOps 包含在 Dell ProSupport 或更高级别的合同中,因此大多数 PowerStore 用户都可以使用此功能。

人机协作,端到端:更新计划出现一次故障,并在同一对话中提出了支持工单。
私有云、自动化平台和 MCP
在 AI 推荐层之下,是部署和运行私有云的底层机制。借助戴尔自动化平台编排器,管理员可以选择一个蓝图,上传 JSON 配置(或手动填写参数),然后通过执行图查看完整的环境部署过程。这包括 PowerStore 硬件验证、计算和网络准备以及虚拟机管理程序安装,存储步骤也直接集成到工作流程中,例如通过 iSCSI 将 PowerStore 卷连接到 VMkernel 适配器,以及在 Kubernetes 运行时安装 CSI 驱动程序。虚拟机管理程序菜单涵盖 VMware、Red Hat、Nutanix 和 Microsoft Azure Local,戴尔私有云扩展程序可以安装到每个平台的控制台、vSphere Client、OpenShift Web Console、Prism 或 Azure 门户中。因此,虚拟机和容器的日常生命周期管理可以在团队已使用的工具中完成。戴尔还可以通过同一扩展程序将 Windows 虚拟机部署到 OpenShift 上的 KubeVirt,从而将容器和虚拟机操作整合到一个位置,形成闭环。

编排器的执行图会逐步执行由 PowerStore 支持的 VMware 部署,并记录每一步的日志。

Dell Private Cloud 插件已集成到 vSphere Client 中,PowerStore iSCSI 数据存储已准备好用于集群。

蓝图目录涵盖虚拟机、Kubernetes、公有云、操作系统和数据库;自动化工作室增加了人工智能辅助的自定义编排功能。
对于工作负载所有者而言,蓝图目录是最吸引人的部分。除了基础架构蓝图之外,Dell Automation Studio 还允许客户构建自定义编排。戴尔的展示案例是一种数据库即服务模式:一个部署在基于 PowerStore 的 vCenter 数据存储上的 PostgreSQL 蓝图,该应用程序通过 Ansible 安装。日志在作业的 VMware 和 Red Hat 步骤之间统一记录,实时云初始化和虚拟机初始化日志会流式传输到一个报告视图中,而 vSphere 则负责启动。vSphere 端通过基于 VMware SDK 构建的平台插件运行,当 Ansible 操作完成后,数据库即可就位并投入使用。对于 PowerStore 客户而言,其优势在于阵列不再是需要配置的目标,而是平台自动构建的资源。
这一切最终都将朝着智能代理的方向发展。戴尔的官方发布措辞非常明确:自动化平台“将人工智能代理与对话式界面相结合,从而变革企业部署、监控和管理基础设施的方式”,该平台的智能代理功能计划于今年晚些时候推出。戴尔已承认,为了响应客户希望引入自有代理的需求,他们正在开发 MCP 服务器,其中戴尔存储的 MCP 服务器将率先推出。戴尔科技开发者网站已经描述了即将推出的功能:涵盖 PowerStore、PowerScale、PowerProtect、PowerFlex、PowerMax 和 ObjectScale 的 100 多种 MCP 工具,预计将于年底正式发布。这些工具和参数均源自各平台的版本化 OpenAPI 规范,因此模型无法创建不存在的调用。它可以作为本地进程、HTTP 服务器或 Kubernetes sidecar 运行,每次变更都会生成结构化的审计日志,批量破坏性操作需要双重确认。MCP 已迅速成为为人工智能代理提供对企业系统结构化、权限控制访问权限的标准接口。自动化平台的 MCP 服务器将使客户自己的代理能够使用与平台原生代理相同的蓝图、推荐和遥测数据。我们预计随着代理的全面部署,该平台的 MCP 功能也将逐步完善,届时我们将进行报道。
接下来:节奏仍在继续
PowerStoreOS 5.0 现已发布,但戴尔的发布节奏很快,旨在快速满足客户需求。目前,团队已在紧锣密鼓地开发 5.1 版本,预计将于今年秋季发布。戴尔将在临近发布时公布 5.1 版本的完整功能介绍,但其中一项功能已确定:飞行中加密。

我们第三代实验室单元中的 EDIF 功能四端口光纤通道 OCP 卡;硬件今天发货,加密功能通过软件实现。
目前,所有 PowerStore Gen 3 的 OCP 插槽均可配置支持 EDIF 的光纤通道卡;加密功能通过无中断软件更新实现,这也是 5.1 版本更新的重点所在。EDIF(传输中加密数据)可对主机和阵列之间,或两个复制阵列之间的光纤通道流量进行加密,从而弥补了防火墙从未触及的漏洞:内部 SAN 流量以明文形式传输。由于阵列会在接收时进行解密,因此去重和压缩操作仍然能够处理可减少的数据,从而在不牺牲效率提升的前提下保护了传输线路。如果在主机或应用层进行加密,则到达阵列的每个数据块都会变成唯一的噪声;EDIF 能够在不增加这种成本的情况下保护传输。
故事的另一半发生在服务器端。我们深入探讨了Emulex Secure HBA,它采用硬件卸载的会话加密技术,集成在适配器内部,符合新兴的 FC-SP-3 标准,并针对内部流量构建了零信任架构。我们见证了该方案发展成为自主的 SAN 级加密。当 5.1 版本启用阵列端时,端到端加密的光纤通道将成为 PowerStore 上的常规配置。
我们在硬件发布会上撰写的文章以对第三代产品和 PowerStoreOS 5.0 的融合充满期待而告终。如今,在体验了正式版之后,答案是:这款软件与它所运行的硬件平台完美契合。一个操作系统即可支持三代硬件,QLC 闪存已成为主流,效率显著提升且有保障,运维层也在不断学习闭环管理,从而大幅扩展了存储管理员的快速操作能力。
还有一个值得一提的数字。今年7月,戴尔的运营遥测数据显示,其报告集群中PowerStore的累计运行时间突破了10亿小时,相当于六年的生产经验,即超过11.4万机器年。如此大规模的集群学习正是训练上述数据缩减调优、异常模型和推荐引擎的基础,也是5.0版本诸多优势的源泉。该平台的下一个十亿小时运行时间将基于更加智能的软件和同样强大的硬件平台。
PowerStore 产品页面
本报告由 Dell Technologies 赞助。 本报告中表达的所有观点和意见均基于我们对所考虑产品的公正看法。




Amazon