有些服务器是对现有功能的扩展,而有些则重新定义了预期。戴尔 PowerEdge R7725xd 就属于后者。在我们最近的测试中,这款 2U 服务器配置了 24 块 Micron 9550 PRO PCIe Gen5 NVMe SSD 和四块 2x 200GbE 网卡,其原始存储吞吐量超过了我们之前测试过的任何系统。在内部,该平台在整个 NVMe 存储池中实现了超过 300 GB/s 的吞吐量。在网络方面,它使用标准的 RDMA 协议实现了 160 GB/s 的吞吐量,无需任何额外的复杂配置。
这不仅仅是一台速度更快的存储服务器,它是一个彻底改变数据密集型计算架构的系统。现代人工智能训练和推理流程的瓶颈通常不在于GPU的性能,而在于数据暂存、流式传输、混洗和检查点创建的速度。如果存储速度跟不上,大型GPU节点就会闲置。为了解决这些限制,团队会使用缓存、超容量存储和复杂的层级结构,以确保加速器能够足够快地接收数据,从而体现其成本的合理性。
戴尔 PowerEdge R7725xd 从源头上解决了瓶颈问题。该服务器采用 24 盘位 U.2 背板,每个硬盘都通过专用的 PCIe Gen5 x4 链路直接连接到 AMD EPYC CPU 复合体。没有带宽扇出,也没有使用中板扩展器来降低并发性。由于硬件架构旨在聚合吞吐量而不会发生争用,因此性能可以平滑扩展。在传统的双路配置中,CPU 通过 4 条 XGMI 链路进行路间通信。在 R7725xd 中,每个 CPU 的其中一个链路被重新用于提供额外的 16 条 PCIe Gen5 通道,使服务器总共拥有 160 条 PCIe Gen5 通道(前置 SSD 96 条,后置四个 PCIe 插槽 64 条)。搭配专为持续写入工作负载和高耐久性而设计的 Micron 9550 PRO SSD,该系统将成为高吞吐量数据引擎,能够支持检查点密集型和连续流式工作负载。
我们在此架构之上叠加了PEAK:AIO,以利用并行提交路径并在并发量增加时保持效率。最终不仅实现了峰值性能,而且在高负载下也能保持性能稳定。该平台既可以作为本地执行节点进行预处理、训练或转换,也可以通过网络为多个 GPU 系统提供高带宽存储服务。如果您想尝试更多功能,还可以同时进行这两种操作。
关键精华
- 单节点吞吐量空前: R7725xd 内部带宽超过 300 GB/s,通过 NVMe-oF RDMA 传输带宽达到 160 GB/s,在 2U 机箱内可与多节点存储集群相媲美。
- 真正的第五代架构,无交换机,无扇出: 所有 24 个 Micron 9550 PRO SSD 均可直接从 CPU 复合体获得专用的 x4 PCIe Gen5 通道,从而实现无争用的线速扩展。
- 搭载 AMD EPYC 9005 系列处理器: 双 AMD EPYC 9575F 处理器提供持续高并发 I/O 所需的通道数、内存带宽和 NUMA 拓扑结构。
- 专为人工智能、分析和大量检查点工作负载而设计: 该系统消除了阻碍现代 GPU 流水线运行的 I/O 瓶颈,从而实现了连续、高带宽的数据传输。
- PEAK:AIO 解锁完全并行化: PEAK:AIO 的软件堆栈在负载下保持队列结构饱和,以极具吸引力的每 GB 美元比率提供企业级性能。
专为 NVMe 吞吐量而设计
在最新一代服务器中,戴尔不再在高密度存储服务器配置中使用 PCIe 交换机。例如 PowerEdge R770 或 R7725 等型号提供 PCIe Gen5 x4 插槽,最多支持 16 个 SSD 配置,而在更大的存储背板配置中则切换到 x2 插槽。上一代服务器,例如 PowerEdge R760,在 24 盘位 NVMe 配置中会包含一个 PCIe 交换机。为了简化配置并消除 PCIe 交换机带来的复杂性,新一代服务器采用了减少高密度存储配置中 PCIe 通道数量的策略。直到 R7725xd 的出现,这一策略才有所改变。
标准版 R7725 和 R7725xd 的区别在于平台如何分配 PCIe 根复合体资源。基础版 R7725 将 PCIe 通道分配给存储、GPU 扩展和通用 I/O。“xd”版本则重新分配了这些资源,使 NVMe 子系统成为 PCIe 带宽的主要使用者。24 个 U.2 插槽直接连接到 CPU 的 PCIe Gen5 根复合体,每个 SSD 都拥有独立的 x4 端点,而不是通过 PCIe 交换机或重定时器树共享上行链路。这使得每个驱动器都拥有独立的队列结构和独立的 DMA 路径,从而连接到内存控制器。
背板和转接卡的拓扑结构体现了这一理念。戴尔将 NVMe 连接器和 PCIe 插槽分布在两个 AMD EPYC 处理器插槽上,因此每个处理器都直接拥有一部分驱动器组。实际上,这创建了两个对称的 NVMe 域,每个域都具有本地延迟特性和完整的读写并发能力。当我们安装四块博通双端口 200GbE 网卡作为扩展卡时,插槽位置使得每块网卡都能位于与相应 NVMe 组对齐的 PCIe 域中。在 NVMe over RDMA 模式下,这意味着网络流量保持在处理相关驱动器 I/O 的插槽本地,避免了通常会增加延迟并在负载下消耗带宽的插槽间 Infinity Fabric 跳转。
良好的散热性能也支持持续稳定的吞吐量。U.2接口在密集型第五代硬盘配置中依然具有优势,因为它为每个设备提供了明确的气流通道和可预测的散热片表面积。R7725xd的高静压风扇模块和机箱风道确保所有24个硬盘位都能保持稳定的气流,从而保证全盘写入工作负载能够持续运行而不会出现降频。机械设计与电气设计相辅相成:由于该平台专为在负载下同时冷却24个第五代硬盘而设计,因此每个硬盘都能保持全速性能。
这种结合了根复合体对齐、一致的非均匀内存访问 (NUMA) 通道布局、插槽感知型网卡布局以及热稳定性 U.2 封装的技术,使系统能够大规模实现线速 I/O。该架构避免了性能瓶颈,并优化了性能。
戴尔 PowerEdge R7725xd iDRAC 10 概述
与许多其他我们评测过的第 17 代平台一样,这一代 R7725xd 服务器也采用了戴尔全新的 iDRAC 10 平台,该平台作为远程管理、健康监控和带外控制的中心枢纽。仪表盘视图可即时概览系统整体运行状况、存储状态和近期活动。在我们测试的这台服务器上,系统和存储运行状况报告均为绿色,表明服务器运行正常。关键系统信息,例如型号、主机名、BIOS 版本、iDRAC 固件级别、IP 地址和许可信息,都显示在界面右侧。
仪表盘还包含一个任务摘要面板,显示已完成、待处理和正在进行的操作。下方列出了最近的日志,这些日志记录了机箱入侵事件和电源消息,无需深入菜单即可快速了解硬件状态变化。虚拟控制台面板位于右下角,可用于完全远程 KVM 控制。
iDRAC 10 的存储部分全面概述了 R7725xd 中安装的所有物理磁盘。摘要面板显示所有已连接驱动器的概览数量,并附有可视化的饼图,展示驱动器的状态。在此配置中,24 个 NVMe SSD 处于活动状态并显示为就绪状态,系统中还有两个额外的启动设备,与主前置 NVMe 存储组分开。
右侧的“磁盘概览”面板将磁盘细分为物理磁盘和任何关联的虚拟磁盘。由于 R7725xd 采用直接 NVMe 架构,没有传统的 RAID 控制器,因此所有驱动器均被报告为非 RAID 且可单独寻址,这与系统针对大型 NVMe 池和 SDS 平台的设计相符。
在状态摘要下方,“最近记录的存储事件”区域列出了每个 PCIe SSD 的插入日志,并按托架和插槽进行组织。此记录确认所有驱动器托架均已正确检测到 SSD,并有助于识别安装、布线或热插拔操作方面的任何问题。对于大型部署,这些日志在跟踪驱动器配置或验证容量是否已按预期填充时非常有用。
最后一张截图显示了 iDRAC10 中的 NVMe 设备详细视图。系统中安装的每个 NVMe 驱动器都会列出其状态、容量和托架位置。选择单个驱动器即可查看其完整特性分析。
在本例中,驱动器信息面板显示了完整的型号字符串、设备协议、外形尺寸和协商的 PCIe 设置。NVMe 设备以 32 GT/s 的链路速度运行,并采用协商的 x4 连接,这证实了驱动器在系统的 PCIe Gen5 背板上以全带宽运行。信息部分还报告了耐久性百分比、可用备用状态和协议类型,帮助管理员监控驱动器的健康状况和预期寿命。
这种精细的驱动器报告在高密度 NVMe 配置中非常有价值,因为链路宽度、协商速度和介质健康状况会直接影响工作负载行为和存储性能。
总体而言,iDRAC 10 界面提供了 R7725xd NVMe 存储架构的清晰、以硬件为中心的视图,使用户能够一目了然地轻松验证链路健康状况、驱动器状态和系统完整性。
戴尔 PowerEdge R7725xd 性能
在测试之前,我们的系统配置了均衡且高性能的硬件。该系统配备了两颗 AMD EPYC 9575F 处理器,每颗处理器拥有 64 个高频核心,并搭配 24 条 32GB DDR5 内存,运行频率为 6400 MT/s。存储方面,机箱内装满了 24 块 15.36TB 的 Micron 9550 PRO U.2 NVMe 固态硬盘,每块硬盘都通过一条独立的 PCIe Gen5 x4 通道连接。这提供了 368.64TB 的总原始容量,Micron 9550 PRO 固态硬盘的顺序读取速度高达 14,000 MB/s,顺序写入速度高达 10,000 MB/s。网络由四个博通 BCM57608 适配器处理,共提供八个 200Gb 端口,以及一个 BCM57412 OCP 网卡,提供两个额外的 10 千兆端口。
测试系统规格
- CPU: 2颗AMD EPYC 9575F 64核高频处理器
- 记忆: 24 条 32GB DDR5 内存,频率 6400MT/s
- 存储: 24 块 15.36TB Micron 9550 PRO U.2 固态硬盘(每块硬盘通过 4 条 PCIe Gen5 通道连接);目前支持高达 128TB 的硬盘,未来还将支持更高容量。
- 网络: 4 个博通 BCM57608 2x200G 网卡,1 个 BCM57412 2x10Gb OCP 网卡
- 开关: 戴尔 PowerSwitch Z9664
FIO性能基准
为了衡量 PowerEdge R7725xd 的存储性能,我们使用了行业标准指标和 FIO 工具。本节重点介绍以下 FIO 基准测试:
- 随机 4K – 1M
- 连续 4K – 1M
FIO – 本地 – 带宽
在测试对戴尔 PowerEdge R7725xd 服务器内部 24 个 PCIe Gen5 NVMe 固态硬盘的本地访问时,系统表现完全符合预期,因为每个硬盘都通过完整的 x4 通道 PCIe Gen5 链路连接到 CPU。由于没有网络层参与,这便是戴尔 Gen5 存储布局的纯粹内部吞吐量,以及 AMD EPYC 平台 PCIe 带宽不受限制地发挥作用。
顺序读取速度从 4K 数据块的 184 GB/s 开始,并随着数据块大小的增加而迅速提升。从 512K 到 1M,服务器始终保持 312 到 314 GB/s 的稳定速度,这有力地表明系统能够高效地将所有 24 × 4 个 Gen5 通道聚合为持续的读取带宽,而不会出现任何控制器瓶颈。
顺序写入速度曲线有所不同,但始终保持在预期范围内。初始速度为 149 GB/s,随后提升至 100 多 GB/s,在写入 1 万次时达到 182 GB/s。这与 Micron 9550 PRO SSD 的写入特性以及跨多个独立设备进行高并行 NVMe 写入所固有的开销相符。
随机读取性能是另一大亮点。该系统在最小块大小下速度接近 300 GB/s,在中等块大小下略有下降,然后在较大块大小下恢复到 200 多 GB/s 到 300 多 GB/s。在 1M 块大小下,随机读取速度最高可达 318 GB/s,这表明该平台能够将混合操作均匀地分配到所有 24 个硬盘上。
随机写入速率较低,这对于分散在大型 NVMe 阵列上的元数据和写入分配任务来说很常见。测试的大部分时间里,写入速率保持在 140 到 160 GB/s 之间,在 1 M 时逐渐下降到略低于 100 GB/s。
FIO – 本地 – IOPS
在考察 IOPS 方面,R7725xd 表现出强大的小块性能,请求速率可达数千万,之后更大的块大小才会将工作负载转移到带宽驱动的模式。
在 4K 数据块下,读取 IOPS 达到 44.9 万,写入 IOPS 达到 36.3 万。随机读取 IOPS 更高,达到 71.4 万,这表明系统能够高效地将高队列工作负载分配到所有驱动器上。随着数据块大小的增加,这些数值自然会逐渐下降,但在 8K、16K 和 32K 范围内,性能提升的趋势保持一致。
按 16K 和 32K 数据块划分,读取 IOPS 分别稳定在 17.4 万和 8.35 万,随机读取 IOPS 与之非常接近,分别为 16.5 万和 8.15 万。写入性能符合预期,虽然略低,但在顺序和随机访问模式下均保持稳定。
当数据块大小达到 64K 及以上时,测试从纯粹的 IOPS 测试转变为更侧重带宽的测试。IOPS 降至百万级,最终达到数十万级。在 1M 块大小下,读取 IOPS 约为 300 万,写入 IOPS 约为 174 万,随机操作的 IOPS 也大致相同。
总体而言,本地 IOPS 结果清楚地表明,该系统能够跨小块维持非常高的队列深度工作负载,并且随着传输量的增长和带宽成为主要因素,其扩展性是可预测的。
PEAK:AIO:为什么戴尔 PowerEdge R7725xd 适合这种工作负载
PEAK:AIO 专为需要极速、低延迟访问大型数据集的环境而设计,通常用于 AI 训练、推理流水线、金融建模和实时分析。该平台依赖于高密度 NVMe 存储、均衡的 PCIe 带宽以及可预测的大规模延迟。为了满足这些要求,底层硬件必须提供持续的吞吐量,并在并发高负载下保持稳定可靠的性能。
戴尔 PowerEdge R7725xd 服务器与 PEAK:AIO 的理念完美契合。该系统的架构旨在最大限度地利用 PCIe Gen5 资源,将 24 个前置 U.2 NVMe 插槽的全部带宽直接提供给 CPU,无需依赖传统的 RAID 控制器。这种布局使 PEAK:AIO 能够获得现代基于 NVMe 的数据管道所期望的并行性和低延迟特性。系统配置将 NVMe SSD 分为两个 RAID 0 组。
在测试场景中,我们使用了两台连接到 R7725xd 的客户端系统,每台系统都配备了 Broadcom BCM57608 双 200G 网卡。这样就形成了四个 200G 上行链路,分别连接到每台客户端,从而使 R7725xd 达到接近 PEAK:AIO 生产环境实际部署的高性能配置。这种网络带宽使我们能够充分测试 NVMe 子系统、PCIe 拓扑结构和 CPU 互连的性能,而不会在网卡层出现瓶颈。
最终打造出的平台能够有效满足 PEAK:AIO 的工作负载需求。R7725xd 提供高密度 NVMe 容量、PCIe Gen5 吞吐量、用于并行处理的双 AMD EPYC 9005 处理器,以及足以支持多客户端数据摄取(每个客户端数百 Gbps)的网络能力。所有这些特性都是实现 PEAK:AIO 性能预期的基础。
PEAK:AIO – NVMe-oF RDMA – 带宽
在配备 PEAK:AIO 的 PowerEdge R7725xd 服务器上测试 NVMe-oF RDMA 带宽后,总体趋势与我们对拥有如此高 PCIe 和网络带宽的系统所预期的完全一致。随着块大小的增加,吞吐量迅速提升,直至接近平台实际极限时趋于平稳。
在小数据块大小下,读写性能都徘徊在 20GB/s 左右,这是正常的,因为 4K 和 8K 的传输对 IOPS 路径的消耗远大于吞吐量路径。一旦数据块达到 16K 和 32K,流水线性能就会得到提升。读取速度在 32K 时跃升至约 154 GB/s,并持续攀升至 160 GB/s 左右,这与我们预期在四条 200 Gb/s 链路上进行双客户端部署时的性能表现相符。
随机读取性能几乎与顺序读取性能完全一致。PEAK:AIO 能够很好地保持命令队列的正常运转,因此随机读取带宽基本与顺序读取带宽保持一致,在 32K 到 1M 的数据范围内稳定在 159 到 161 GB/s 左右。这表明在混合访问模式下,存储堆栈并未出现瓶颈,并且 R7725xd 的 PCIe 拓扑结构能够将负载均匀地分配到 24 个 Gen5 NVMe 固态硬盘上。
写入性能曲线与读取性能曲线相似,但峰值略低于读取性能。顺序写入在中等大小的数据块下保持在 140 至 148 GB/s 的范围内,在 128K 数据块时下降至约 117 GB/s,但随着数据块大小的增加而恢复。随机写入的性能表现不同,其速度趋于稳定在 110 至 117 GB/s 左右,这对于引入额外开销的混合队列工作负载而言是正常的。
本节的关键在于,即使多个客户端同时运行,R7725xd 也能在 NVMe-oF 上轻松维持极高的带宽。一旦数据块大小达到 32K 或更大,服务器的网络和存储带宽就会持续饱和。这正是 PEAK:AIO 旨在挖掘的性能,这些结果有力地验证了该平台在实际应用场景下的扩展能力。
PEAK AIO – NVMe-oF RDMA IOPS
在 IOPS 方面,PowerEdge R7725xd 展现出强劲的小块性能,尽管我们最初观察到的数值低于预期;预计未来通过改进网络驱动程序支持可以解决这个问题。即便如此,整体扩展趋势仍然与 NVMe-oF RDMA 在块大小增加时的典型表现完全一致。
在最小块大小下,该系统在顺序和随机工作负载下均可提供超过 6 万 IOPS。在 4K 和 8K 块大小下,读取、写入、随机读取和随机写入的性能大致相同,这表明前端客户端、PCIe 基础设施和 NVMe 驱动器本身都能轻松应对请求速率。
随着数据块大小的增加,IOPS开始出现预期的下降。在32KB时,读取操作的IOPS约为4.7万,写入操作略微落后,约为4.4万。随机写入受到的影响最大,下降到约3.3万IOPS,这与混合访问模式引入的额外队列和CPU开销相符。
进入大数据块阶段后,IOPS 继续以可预测的线性方式下降。当传输量达到 256K 和 512K 时,吞吐量成为主要指标,IOPS 自然下降到几十万左右。在 1M 的数据块大小下,所有工作负载的 IOPS 都收敛到 140K-153K,这与我们在上一节中看到的带宽数据一致。
GPUDirect存储性能
我们对 R7725xd 进行的测试之一是 Magnum IO GPUDirect Storage (GDS) 测试。GDS 是 NVIDIA 开发的一项功能,它允许 GPU 在访问存储在 NVMe 驱动器或其他高速存储设备上的数据时绕过 CPU。GDS 无需通过 CPU 和系统内存路由数据,即可实现 GPU 与存储设备之间的直接通信,从而显著降低延迟并提高数据吞吐量。
GPUDirect 存储的工作原理
传统上,当GPU处理存储在NVMe驱动器上的数据时,数据必须先经过CPU和系统内存才能到达GPU。这个过程会造成瓶颈,因为CPU充当了中间人,增加了延迟并消耗了宝贵的系统资源。GPUDirect Storage通过允许GPU直接通过PCIe总线访问存储设备中的数据,消除了这种低效。这种直接路径减少了数据传输的开销,从而实现了更快、更高效的数据传输。
AI 工作负载,尤其是涉及深度学习的工作负载,是高度数据密集型的。训练大型神经网络需要处理数 TB 的数据,任何数据传输延迟都可能导致 GPU 无法充分利用并延长训练时间。GPUDirect Storage 通过确保数据尽快传输到 GPU,最大限度地减少空闲时间并最大限度地提高计算效率,解决了这一挑战。
此外,GDS 对于涉及流式传输大型数据集的工作负载(例如视频处理、自然语言处理或实时推理)尤其有益。通过减少对 CPU 的依赖,GDS 可加速数据移动并释放 CPU 资源以用于其他任务,从而进一步提高整体系统性能。
除了原始带宽之外,搭载 NVMe-oF (TCP/RDMA) 的 GPUDirect 还能提供超低延迟 I/O。这确保 GPU 永远不会缺数据,使该系统成为实时 AI 推理、分析管道和视频回放的理想选择。
GDSIO 顺序读取
使用 GDSIO 对单个客户端进行 PEAK:AIO 测试时,读取吞吐量随着块大小和线程数的增加呈现出明显的扩展模式。该客户端通过两条 400G 链路连接,因此其总吞吐量被限制在 90 GB/s。
在最小数据块大小和低线程数的情况下,性能较为一般,单线程读取 4K 数据的速度约为 189 MiB/s。一旦增加线程并行度,系统响应速度便立即提升,在四线程下可达 691 MiB/s,随着数据块大小的增大,速度更是突破数 GiB/s。
中等大小的数据块对线程数的敏感性最高。在 32K 数据块时,吞吐量从单线程的 1.3 GiB/s 增长到 64 线程时的近 20 GiB/s,之后仅略有下降。64K 和 128K 数据块也呈现出类似的模式,系统吞吐量从低并行度下的个位数 GiB/s 增长到工作负载扩展后的 30 GiB/s 以上。
一旦数据块大小增大,吞吐量便开始趋于平稳,因为系统已接近单客户端的性能极限。在 1 MiB 的数据块大小下,单线程性能为 11 GiB/s,而多线程性能则约为 88 GiB/s。5 MiB 和 10 MiB 的数据传输也呈现出相同的平台期,无论测试是在 64、128 还是 256 个线程下运行,吞吐量都稳定在 89–90 GiB/s 左右。
GDSIO 顺序写入
在写入方面,其扩展行为与读取类似,但在大多数块大小下性能略低,这对于顺序写入工作负载来说是预期之内的。在最小块大小下,单线程在 4K 块大小下的吞吐量为 165 MiB/s,并随着并行度的增加而稳步提升。在四个线程时,吞吐量增长到略高于 619 MiB/s,而在八个线程时则超过 1 GiB/s。
随着线程数的增加,中等大小的数据块的性能提升更为显著。在 32K 数据块下,吞吐量从略低于 1 GiB/s 开始,随着线程数的增加,吞吐量可提升至 21 GiB/s 以上。64K 和 128K 数据块也延续了这一趋势,吞吐量从个位数 GiB/s 提升至 30 GiB/s 和 50 GiB/s 左右,这得益于工作负载的并行化程度提高。
当传输数据量较大时,系统会达到其固有的写入吞吐量上限。在 1 MiB 的传输量下,性能从单线程的 13.3 GiB/s 提升至多线程时的接近 90 GiB/s。5 MiB 和 10 MiB 的测试也呈现类似的趋势,无论系统运行在 64、128 还是 256 个线程,结果都稳定在 90 GiB/s 左右。
重新定义第五代性能
戴尔 PowerEdge R7725xd 不仅仅是一台存储服务器;它代表了机架内部带宽传输方式的一次变革。通过取消 PCIe 交换机,并为每个 NVMe 硬盘提供直达 CPU 的路径,戴尔打造了一个吞吐量可平滑扩展、散热可控且并发性不再是挑战而是优势的系统。
当搭配美光9550 PRO SSD和PEAK:AIO的并行I/O软件时,R7725xd可以从一个高密度NVMe机箱摇身一变,成为真正的数据引擎。它能够充分利用本地PCIe架构,通过RDMA以线速为GPU提供数据,或者同时承担计算和存储的双重角色,所有这些都集成在一个2U的机箱内。

戴尔 PowerEdge R7225xd
实际上,这种配置可提供超过 300 GB/s 的本地吞吐量和 160 GB/s 的网络吞吐量,其性能足以媲美多节点存储集群,而复杂性和成本却低得多。这充分展现了从芯片到软件,整个技术栈的每一层都围绕效率和持续带宽进行优化时所能达到的卓越性能。
R7725xd 为第五代单节点存储性能树立了新的标杆。对于正在构建下一代 AI 流水线、高速分析或大量使用检查点的训练环境的企业而言,它展现了当系统瓶颈被彻底消除时所能达到的极致性能。
本报告由 Dell Technologies 赞助。 本报告中表达的所有观点和意见均基于我们对所考虑产品的公正看法。




Amazon