存储评论网

戴尔 PowerEdge XE7740:企业级 AI 推理架构详解

企业版  ◇  服务器

人工智能基础设施市场并非朝着单一方向发展,而是正在分化为两个截然不同的领域。一方面是前沿训练集群,旨在大规模开发基础模型,这些集群与专有架构和少数加速器紧密耦合。另一方面是快速发展的企业推理应用,企业部署模型来服务用户、处理实时数据并创造可衡量的商业价值。戴尔 PowerEdge XE7740 正是为这第二个领域而设计的。

戴尔 PowerEdge XE7740 GPU 多样性

关键精华

  • PowerEdge XE7740 专为企业级推理而设计, 采用双区散热、结构化 PCIe Gen5 拓扑结构和横向扩展网络,以适应实际生产工作负载。
  • 系统平衡是刻意设计的, 结合 Xeon 6 核心密度、高内存带宽和 PCIe Gen 5 E3.S NVMe,支持 KV 缓存卸载和编排。
  • 硅的柔性是其基础, 支持各种 PCIe Gen5 加速器,无需强制重新设计基础设施。
  • 该平台能够随着时间的推移实现平滑扩展, 从单个机箱内部分 GPU 部署到使用八个后置 Gen5 x16 专用网络插槽在机架上进行分布式推理。

XE7740 的核心在于对芯片多样性的承诺。戴尔并没有将该平台局限于单一的加速器路线图,而是构建了一个能够根据可用性、成本和组织准备情况进行调整的系统。XE7740 支持一系列 PCIe Gen5 加速器,包括 NVIDIA 的 RTX PRO 6000、H100/200、L40S、L4 和 A16 GPU(适用于重视广泛生态系统兼容性的组织),以及 Intel Gaudi 3(适用于寻求更具成本效益且易于获取的推理路径的团队)。Gaudi 3 加速器现已上市,使组织能够从规划阶段直接过渡到部署阶段,避免通常会影响加速器战略的采购延误。

随着推理成为人工智能的主流工作负载,可用性和成本结构至关重要。大多数企业并非在训练前沿规模的模型,而是在运行推理流水线、服务于中等规模的语言模型、驱动检索增强型生成工作流,以及在生产环境中部署计算机视觉。在此背景下,Gaudi 3 定位为市场上最具性价比的现代推理加速器之一,它采用先进的架构,配备高带宽内存和基于以太网的横向扩展能力,且成本远低于旗舰级训练 GPU。在 XE7740 中,Gaudi 3 的目标并非取代现有 GPU,而是助力企业实现可持续的推理部署。

围绕加速器的平台同样经过精心设计。XE7740 基于英特尔至强 6 处理器,在以推理为中心的系统中,CPU 仍然是关键组件。高核心数和更高的内存带宽为调度器、标记化、预处理和编排任务提供了所需的性能余量,这些任务直接位于推理的关键路径上。前置 E3.S NVMe 存储进一步支持本地数据暂存和键值缓存卸载,从而降低加速器负载并提高整体系统效率。这种均衡的设计体现了对推理性能的深刻理解,即推理性能取决于整个系统,而不仅仅是加速器。

戴尔 PowerEdge XE7740 Guadi 3 加速器

XE7740 的设计也充分考虑了其未来的可扩展性。企业可以从适中的配置入手,例如两到四个加速器,无需占用全部机箱空间即可立即获得价值。随着需求的增长,同一平台可以进行垂直扩展或转型为分布式推理。八个后置 PCIe Gen5 x16 插槽提供专用带宽,用于高速网络连接,使 XE7740 能够作为构建横向扩展推理集群的基础模块。可选的 DPU 支持进一步增强了这种灵活性,随着部署的成熟,DPU 可以卸载网络和通信任务。

戴尔 PowerEdge XE7740 主要规格

规格 PowerEdge XE7740
PowerEdge XE7740 的特性
处理器 两颗英特尔® 至强® 6 系列处理器,每颗处理器最多可达 86 个核心
老虎机
PCIe加速器 8 个 PCIe Gen 5 x16 DW-FHFL 插槽,最高可达 600 瓦,或

16 个 PCIe Gen 5 x16 SW-FHFL 插槽,最高 75 瓦

PCIe网卡
  • 最多可支持八张 PCIe Gen5 x16 SW-FHHL 卡,每张卡最大功率 150 瓦
外形尺寸
外形尺寸 4U机架服务器
内存
DIMM 速度,最大容量 最高速度可达 6400 吨/秒,最大容量 4 TB
内存模块插槽 32 个 DDR5 DIMM 插槽
仅支持注册型 ECC DDR5 RDIMM。
存放
前托架 多达 8 个 EDSFF E3.S Gen5 NVMe (SSD),最大容量 122.88 TB
存储控制器
内部引导 启动优化存储子系统 (BOSS-N1 DC-MHS):HWRAID 1,2 个 M.2 接口

NVMe SSD

电源供应
电源供应 3200瓦钛金版,200-240伏交流电或240伏直流电,支持热插拔冗余

适用于 3200 瓦电源的多容量:

  • 3200瓦,适用于220-240伏交流电
  • 2900瓦,适用于200-220伏交流电
  • 3200瓦钛金版,277伏交流电或336伏直流电
  • 2400瓦钛金版,200-240伏交流电或240伏直流电,支持热插拔冗余

适用于 2400 瓦电源的多容量:

  • 2400瓦,适用于200-240伏交流电
  • 1400瓦,适用于100-120伏交流电

注意:系统需要在 CPU 区域和 GPU 区域各安装一个电源单元 (PSU) 以维持 BMC 和待机电源。如果 GPU 区域未安装电源单元,系统将保持待机状态。为确保完全冗余,请在每个区域安装 N+N 个电源单元:CPU 区域 1+1 个,GPU 区域 3+3 个。在系统通电状态下移除 CPU 区域的所有电源单元将导致系统立即关机,并可能导致数据丢失。

冷却选项
冷却选项 空冷
风机 中间托架最多可安装四组高性能(HPR)铂金级风扇(双风扇模块)。

系统前面板最多可安装十二个高性能(HPR)白金级风扇

全部都是热插拔风扇

端口
网络选项 1 个 PCIe Gen 5 OCP 3.0 兼容 I/O(由 x8 PCIe 通道支持)
前端口 1 个 USB 2.0 Type-A 接口(可选)
1 个迷你显示端口(可选)
1 个 USB 2.0 Type-C 双模接口(主机/iDRAC 直通端口)
后端口 1 个专用 iDRAC/BMC 直连以太网端口
2 个 USB 3.1 Type A 端口
1个VGA
内部端口 1 x USB 3.1 Type-A

XE7740 设计与制造

双区架构:CPU 和 GPU 分离

XE7740 最显著的设计特点之一是其物理上将散热和供电区域分隔成两个独立的区域。上部 1U 机架空间容纳了 CPU 区域,包括两颗 Xeon 6 处理器、全部 32 个 DIMM 内存插槽、存储设备和 DC-SCM 管理模块。CPU 区域采用四组高性能双风扇模块(40×40×56mm),可提供 47.4 CFM 的风量。

戴尔 PowerEdge XE7740 计算托架 Xeon 6

下方的3U区域是GPU区域,包含所有加速卡插槽及其独立的散热系统,此外还有PCIe基板(PBB)、后置PCIe扩展插槽以及OCP网卡接口。GPU区域配备了12个尺寸更大的高性能风扇(60×60×56mm),每个风扇的风量高达122.2 CFM,远高于CPU风扇。所有风扇均支持热插拔。这种双区域散热设计意味着,在19英寸标准机架中,高TDP加速卡(单卡最高可达600W)的散热需求不会影响CPU和内存的散热,反之亦然。

戴尔在XE7740机箱中对气流优化格外重视。高密度加速器系统必然需要大量的内部线缆,包括GPU辅助电源线、HPM板和PBB板之间的PCIe信号线以及风扇板连接线。在XE7740中,这些线缆通过专用的线缆固定支架和线缆盖组件沿机箱侧壁布线。每根线缆都根据实际需要精确定制长度,系统内部没有任何多余的线缆束。通过将线缆避开中央气流通道,该设计保持了从前到后的畅通气流路径,并最大限度地降低了CPU和GPU散热区域的阻抗。

戴尔 PowerEdge XE7740 网卡 PCIe 区域

在可容纳多达八个 600W 加速器的机箱中,即使气流路径上存在微小的障碍物,也会造成局部过热,迫使风扇以更高的转速运转,从而增加功耗和噪音。戴尔的线缆管理方案确保机箱中心区域畅通无阻,使气流能够直接、无阻碍地流过最需要散热的组件。

PCIe交换机拓扑结构和数据流

XE7740 的 PCIe 子系统围绕 PBB(PCIe 基板)上的四个 PCIe Gen 5 交换机构建,编号为 SW1 至 SW4。这些交换机构成了系统 I/O 架构的骨干,以精心组织的拓扑结构将加速器、网络和存储连接到两个 Xeon 6 处理器。

16 个内部 GPU 插槽分为两组,每组 8 个,每组由一对 PCIe 交换机提供服务,每个交换机的上游连接到一个 CPU。在每组插槽内,相邻的双倍宽度 GPU 插槽成对交错分布在两个交换机上。在 CPU0 侧,交换机 SW1 服务于 GPU 插槽 21 和 25 以及后置 PCIe 插槽 8 和 9,而交换机 SW2 服务于 GPU 插槽 23 和 27 以及后置 PCIe 插槽 6 和 7。在 CPU1 侧,交换机 SW3 服务于 GPU 插槽 29 和 33 以及后置 PCIe 插槽 3 和 4,而交换机 SW4 服务于 GPU 插槽 31 和 35 以及后置 PCIe 插槽 1 和 2。

因此,每个 CPU 域都拥有四个双倍宽度的加速器插槽、四个后置网卡/I/O 插槽以及八个前置 E3.S NVMe 存储托架中的四个。这种交换机拓扑结构对数据流,特别是基于 RDMA 的流量,有着显著的影响。由于每个交换机都同时拥有加速器插槽和后置网卡插槽,因此同一交换机上的加速器和网络适配器可以完全在交换结构内部执行 RDMA 传输。数据无需经过 CPU 的根复合体,从而消除了当一个根端口上的 PCIe 设备与另一个根端口上的设备通信时通常需要的 CPU 缓冲。这降低了延迟,避免了占用宝贵的 CPU 内存带宽,并将 CPU 周期释放出来用于其他任务。

单个 CPU 域内两个交换机之间的通信通过 CPU 根复合体进行路由,但仅限于该插槽内部。然而,跨 CPU 通信必须通过两个 Xeon 6 处理器之间的 UPI 链路进行。6787P 提供四条 UPI 2.0 链路,每条链路的速率为 24 GT/s,从而提供相当大的插槽间带宽。但是,CPU0 交换机组上的加速器与 CPU1 交换机组上的网卡之间的流量,其延迟必然高于交换机本地或同一插槽内的传输。

交换机本身并非直接互连。所有跨交换机流量都通过 CPU 根复合体路由,因此了解 GPU 插槽、网卡插槽、存储和 CPU 插槽之间的关联性至关重要。为了简化企业用户的配置,戴尔为常用加速器提供经过验证和优化的配置方案。

双区电源

XE7740 的供电设计与其散热架构相呼应,采用了略显独特的双区电源设计。该系统最多支持八个热插拔电源,分为两个区域:区域 1(CPU 区)容纳 1 号和 2 号电源,区域 2(GPU 区)容纳 3 号至 8 号电源。

戴尔 PowerEdge XE7740 散热区域

该系统每个区域至少需要一台电源 (PSU) 来维持 BMC 和备用电源。如果系统运行时任一区域失去交流电源,系统将立即关闭以防止数据丢失。尽管各区域在物理和电气上相互隔离,但它们的运行是相互依赖的。为了实现完全冗余,戴尔建议 CPU 区域采用 1+1 配置,GPU 区域采用 3+3 配置,这意味着所有八个电源插槽都应安装电源,以实现完全冗余部署。

 

戴尔 AIOps、管理和企业可靠性

戴尔的PowerEdge平台以其可靠性和易维护性在业界赢得了良好的声誉。企业客户始终强调以下几点:PowerEdge系统经久耐用,戴尔的支持团队能够快速解决问题,管理工具成熟且集成度高。XE7740延续了这一传统,并且戴尔在这一代产品中,在硬件管理和安全方面都取得了显著进步。

iDRAC 10

XE7740 搭载了戴尔新一代 iDRAC 10,相比戴尔客户多年来一直信赖的、功能强大的 iDRAC 9,iDRAC 10 进行了重大升级。iDRAC 10 并非简单的固件更新,而是全新的硬件,它以数据中心安全控制模块 (DC-SCM) 的形式,符合 OCP DC-MHS 标准。该控制器采用四个 1 GHz 核心,配备 64 位架构和 2 GB DDR4 内存(是上一代的两倍),显著提升了管理操作的性能和响应速度。

在安全性方面,iDRAC 10 引入了多项显著增强功能。该平台全面提升了加密支持,包括 SHA-384 和 SHA-512 身份验证以及量子安全的 AES-256 加密,以应对业界为后量子时代加密威胁所做的准备。iDRAC 10 芯片内部集成了一个专用的安全区域,用于管理网络弹性功能,包括设备级认证和戴尔定制的信任根。这种基于硬件的信任根可确保所有固件(BIOS、iDRAC 和组件固件)在执行前都经过加密验证,从而有效抵御供应链攻击和固件篡改。

安全组件验证 (SECV) 可确保从戴尔工厂交付的系统完全符合客户指定的组件和配置要求,从而从制造到部署全程保持系统完整性。最新的 iDRAC 10 固件还提供了一个全新的模块化用户界面,进一步提升了日常管理体验。

开放管理企业

为了实现大规模的服务器集群管理,戴尔的 OpenManage Enterprise (OME) 可对整个 PowerEdge 部署进行集中式监控、固件更新和配置管理。最近一项针对 AI 部署的显著新增功能是,OME 现在支持直接查看 GPU 和加速器统计信息,包括功耗、温度、利用率、错误计数等,而无需使用其他厂商特定的工具。对于在推理集群中管理数十甚至数百个 XE7740 节点的组织而言,这种统一的管理平台可显著简化运维流程。

英特尔至强 6

XE7740 的核心是两颗英特尔至强 6 6787P 处理器,它是至强 6700P 系列的旗舰产品。6787P 采用英特尔 3 纳米工艺的 Granite Rapids 架构,每个插槽提供 86 个 P 核心(172 个线程),TDP 为 350W,基础频率为 2.0 GHz,睿频频率为 3.8 GHz。

Granite Rapids之所以特别适用于人工智能基础设施,在于其高核心数和内存子系统的完美结合。每个6787P处理器提供8个DDR5内存通道,最高速度可达6400 MT/s。配备双路XE7740处理器和32个DIMM内存插槽,该系统最高可配置4TB的系统内存。

内存容量和带宽对于人工智能工作负载至关重要,尤其是在采用键值缓存卸载技术时。随着大型语言模型上下文长度的增加,键值缓存也会成比例扩展,并可能消耗大量的加速器内存。将部分键值缓存卸载到系统内存或高速存储设备,可以使加速器的 HBM 更高效地用于主动计算,从而缩短多轮对话的首词响应时间 (TTFT)。

值得一提的是,Xeon 6 的 AMX 张量单元承担了大量的 CPU 工作,包括预处理、词法分析以及涉及矩阵运算的混合推理任务。这对于像 SGLang 这样的推理框架尤为重要,因为 SGLang 会利用 CPU 进行基数树键值缓存管理和零开销调度。

英特尔 Gaudi 3 扩展卡:大规模竞争推理能力

英特尔的 Gaudi 3 是该公司旗舰级 AI 加速器,将于 2024 年第四季度发布。英特尔并未选择与顶级数据中心训练加速器正面竞争,而是采取了非常积极的市场策略。Gaudi 3 的目标市场明确锁定在推理领域。

英特尔 GUADI 3 PCB

目前所有流行的LLM(层级模型)中,基于Transformer的模型推理本质上都受限于内存。在自回归生成的解码阶段,模型逐个生成词元,并读取每个生成的词元的模型权重和键值缓存条目。瓶颈不在于计算能力,而在于内存带宽,即加速器将数据从HBM(高阶模型)传输到计算引擎的速度。

Gaudi 3 配备 128 GB HBM2e 显存,内存带宽高达 3.7 TB/s。架构方面,Gaudi 3 采用台积电 5nm 工艺制造,并使用双芯片芯片设计:两个相同的硅芯片通过高带宽互连连接,在软件层面呈现为一个统一的器件。计算部分由四个深度学习核心 (DCORE) 组成,每个核心包含 2 个 MME、16 个 TPC 和 24 MB 本地 SRAM 缓存。片上总共 96 MB 的 SRAM 提供 12.8 TB/s 的内部带宽。该加速器还集成了 14 个专用媒体解码器(H.265、H.264、JPEG、VP9),可实现多模态工作负载的快速视觉预处理。

戴尔 XE7740 Gaudi 3 顶板

目前发布的大量前沿开源人工智能模型要么是原生使用 FP8 训练的,要么是混合了 FP8 (E4M3) 和 BF16 权重的混合模型。Gaudi 3 通过其 8 个矩阵乘法引擎和 64 个张量处理器核心,为这些模型提供原生 FP8 加速,可提供 1.8 PFlops 的 FP8 计算能力。

Gaudi 3 还集成了基于融合以太网的 RDMA (RoCEv2) 网络,其 OAM 版本内置 24 个 200 GbE 端口。虽然 XE7740 中使用的 PCIe 扩展卡版本并未以相同方式暴露所有这些端口,但扩展卡版本支持桥接 4 个卡,从而实现更快的通信。

性能和基准

XE7740配置详情:

  • 2 个英特尔至强 6787P 处理器(86 核,2.00 GHz)
  • 2TB DDR5(32 x 64GB 5200MT/s DDR5)
  • 4 个 Intel Gaudi 3 PCIe AI 加速卡,配备 128GB HBM 显存
  • Ubuntu 24.04.5服务器

vLLM 在线服务性能

为了评估搭载英特尔 Gaudi 3 加速器的戴尔 XE7740 的推理能力,我们对一系列涵盖不同架构、参数数量和精度格式的常用模型进行了 vLLM 在线服务性能基准测试。每个模型均在三种工作负载配置文件下进行测试,并发请求数从 1 到 128 不等。

LLM推理包含两个截然不同的阶段。预填充阶段并行处理所有输入词元,之后才能生成任何输出词元,因此这是一个计算密集型操作,其复杂度与输入词元的数量呈线性关系。解码阶段则逐个生成输出词元(自回归),每个新词元都需要从内存中读取完整的模型权重,但每个词元的计算量相对较小,因此其复杂度受内存带宽限制。

这两个阶段对加速器的不同部分施加了不同的压力,因此我们测试了三种工作负载方案,以改变它们之间的平衡:

  • 相等(1024 个输入标记/1024 个输出标记)表示平衡的聊天交互。
  • Prefill Heavy(8192 输入/1024 输出)模拟检索增强生成或长上下文摘要,其中系统必须处理大型输入上下文。
  • 解码重度(1024 输入/8192 输出)代表长格式内容生成,其中持续内存带宽决定吞吐量。

本节主要关注两个指标。总令牌吞吐量(以每秒令牌数衡量)反映了系统在负载下的整体服务能力。首令牌生成时间 (TTFT) 衡量的是提交请求到收到第一个生成令牌之间的延迟。由于模型必须完成整个预填充阶段才能发出第一个令牌,因此 TTFT 与加速器的计算吞吐量直接相关。这使得预填充密集型场景(结合 TTFT)成为了解 Gaudi 3 加速器原始计算能力的一个特别有用的指标,因为系统必须处理所有 8,192 个输入令牌,用户才能看到任何响应。

相反,解码密集型场景会考验加速器的内存带宽,因为系统必须维持高吞吐量以处理数千个生成的令牌。对于用户需要等待响应才能开始流式传输的交互式应用而言,TTFT 至关重要。系统在大量批处理的情况下可以实现极佳的吞吐量,但如果 TTFT 过高,仍然会感觉运行缓慢,因此这两个指标对于生产部署都至关重要。

关于 FP8 精度测试结果的说明:虽然 Intel Gaudi 3 加速器原生支持 FP8 计算加速(理论上 FP8 的吞吐量应该高于 BF16),但我们基准测试中 FP8 的性能数据却低于 BF16。这并非硬件限制,而是 Intel 版本 vLLM 软件成熟度不足的问题。我们测试的版本(Gaudi Docker 1.22.2 上的 vLLM 安装程序 2.7.1)尚未完全优化其 FP8 代码路径。Intel 目前有一个基于插件的 vLLM 新版本,正处于 beta 测试阶段,有望解决许多此类性能问题。

骆驼 3.1 8B 指导

Llama 3.1 8B Instruct 是 Meta 公司的一款密集 Transformer 模型,这意味着每个参数都会对生成的每个 token 生效。它拥有 8 亿个参数,是开源模型中较为常见的类型之一。这种规模的模型常用于日常任务,例如摘要短文档、撰写电子邮件和消息、回答简单问题,以及为简单的聊天机器人提供交互支持——在这些场景中,速度和成本效益比深度推理更为重要。

我们在 TP1(单加速器)和 TP4(全部四个 Gaudi 3 加速器)配置下测试了该模型。在 TP1 上运行时,该模型在相同工作负载下,128 个并发请求时的总吞吐量约为 8,000 tok/s,从单个请求的约 250 tok/s 平滑扩展。预填充密集型场景呈现出有趣的模式:TP1 的峰值约为 7,000 tok/s,而 TP4 在 128 个并发请求下则飙升至超过 17,900 tok/s,这得益于额外的加速器能够更高效地处理大型输入上下文。

对于单用户延迟,TP1 在低并发情况下实际实现了更低的 TTFT(67 毫秒对比 TP4 的 98 毫秒),这反映了该模型需要跨四个加速器进行协调所带来的开销,而该模型原本只需一个加速器即可完成。然而,随着负载的增加,TP4 的优势就明显显现出来。在 128 个并发请求下,TP4 在相同负载和解码负载下将 TTFT 控制在 2 秒左右,而 TP1 则分别攀升至 3.7 秒和 6.6 秒。在预填充密集型场景下,这种差距最为显著:TP1 在 128 个请求下 TTFT 接近 47 秒,而 TP4 则将其控制在 11 秒左右。

骆驼 3.1 70B 指导

Llama 3.1 70B Instruct 是 Meta Llama 3.1 系列中规模更大的密集型模型。它拥有 70 亿个参数,相比 8 亿版本,在指令执行和多语言处理能力方面都有显著提升。这种规模的模型非常适合处理更密集的智能体工作负载,例如客户支持人员、多步骤研究助理、复杂文档分析以及需要在长时间交互中保持上下文连贯性的任务。

我们使用 TP2 和 TP4 配置测试了该模型。两者的吞吐量差异显著。在 128 个并发请求的情况下,TP4 在相同工作负载下可提供约 3,600 tok/s 的吞吐量,在预填充密集型场景下峰值接近 4,600 tok/s。这分别是 TP2 吞吐量的约 4.4 倍和 4.6 倍,TP2 的峰值吞吐量分别约为 816 tok/s 和 1,005 tok/s。即使在解码密集型工作负载下,TP4 的吞吐量也达到了约 1,960 tok/s,而 TP2 仅为 593 tok/s。

对于 TTFT 测试,TP2 在预填充工作负载下负载过高,表现不佳,在 128 个并发请求时耗时高达 496 秒,几乎无法用于交互式应用程序。TP4 则将耗时缩短至约 73 秒。对于 equal 和 decode 工作负载,TP4 在 128 个请求下 TTFT 控制在约 10 秒,而 TP2 则分别达到 50 秒和 29 秒。在低并发情况下,TP4 在 equal 工作负载下提供首令牌响应的时间约为 160 毫秒,而 TP2 则需要 486 毫秒。

Qwen3 程序员 30B-A3B 指导

Qwen3 Coder 30B-A3B 是本地推理部署中最流行的编码模型之一,它采用混合专家 (MoE) 架构。与每个参数都参与每次前向传播的密集模型不同,MoE 模型会将每个词元路由到一小部分专门的专家网络。Qwen3 Coder 在 BF16 精度下保持 3 亿参数的完整模型规模,而每个生成的词元仅激活 30 亿个参数。这种稀疏激活模式意味着该模型能够以远低于大型网络的计算量实现更高的性能,从而在支持路由开销的硬件上实现极高的效率。对于最终用户而言,该模型非常适合日常编码辅助,例如生成样板代码、完成函数、解释代码、编写单元测试以及处理那些受益于代码专用模型而无需进行繁重推理的常规开发任务。

我们测试了三种配置:TP1 BF16、TP1 FP8 和 TP4 BF16。在 128 个并发请求的情况下,TP4 BF16 在预填充密集型场景中表现最佳,吞吐量约为 14,300 tok/s,这是我们测试套件中所有模型记录到的最高吞吐量。TP1 BF16 在相同场景下紧随其后,吞吐量约为 6,900 tok/s,而 TP1 FP8 则落后于前者,约为 3,360 tok/s。在相同的工作负载下,差距有所缩小,TP4 为 6,073 tok/s,TP1 BF16 为 5,718 tok/s,TP1 FP8 为 2,101 tok/s。正如上文 FP8 部分所述,此处较低的 FP8 数值反映的是英特尔 vLLM 分支的当前状态,而非硬件瓶颈。

由于激活模式较为稀疏,TTFT 保持较低水平。TP4 BF16 在单用户负载下首令牌延迟约为 140 毫秒,在相同工作负载下,128 个并发请求的延迟约为 2.6 秒。TP1 BF16 在低并发情况下表现相近(106 毫秒),但在满负载下延迟上升至 3.1 秒。预填充密集型场景再次清晰地展现了不同配置之间的差异:TP4 在 128 个请求下延迟约为 18 秒,TP1 BF16 为 57 秒,而 TP1 FP8 则长达 72 秒。

Qwen3 235B-A22B 思考

我们基准测试套件中最大的模型 Qwen3 235B-A22B Thinking 是一个庞大的 MoE 推理模型,总共有 235 亿个参数,每个 token 有 22 亿个有效参数。除了其庞大的规模之外,该模型还内置了链式推理能力,使其能够逐步分解复杂问题,最终得出答案,但代价是需要更多的解码 token。这使得它特别适合最具挑战性的任务:高级代码生成和调试、数学问题求解、多步骤逻辑推理以及复杂的、智能体工作流程(在这些工作中,准确性比速度更重要)。该模型需要 TP4 精度才能运行,我们分别在 BF16 和 FP8 精度下对其进行了测试。

BF16 在所有测试场景下都明显优于 FP8。在 128 个并发请求的情况下,BF16 在预填充密集型工作负载下速度约为 2,750 tok/s,在相同工作负载下速度约为 2,500 tok/s,而 FP8 的速度分别约为 1,784 tok/s 和 516 tok/s。此外,在解码密集型场景下,当并发量较高(32 个以上请求)时,FP8 还出现了超时现象。

对于 TTFT,BF16 在单个等长请求下的响应时间约为 340 毫秒,在 128 个并发请求时约为 6.9 秒。对于这种规模的模型来说,这样的响应速度相当不错。FP8 的速度则慢了大约一半,初始响应时间为 615 毫秒,满载时约为 11.2 秒。预填充密集型工作负载是最苛刻的场景,在 128 个请求的情况下,BF16 的响应时间会攀升至 168 秒,而 FP8 的响应时间则会攀升至 80 秒。

这个是谁的?

推理需求并未放缓。无论企业是在内部部署模型以加速开发团队,还是将人工智能嵌入面向客户的产品,亦或是搭建全天候运行的自动化流水线,计算需求都在持续增长。而随之而来的是老生常谈的瓶颈:采购。热门加速器的交付周期可能长达数月,导致那些已经获得资金和人员配备的项目停滞不前。

戴尔 PowerEdge XE7740 服务器,顶部配备 GAUDI 3 系统

搭载英特尔 Gaudi 3 加速器的 XE7740 直接解决了这一难题。Gaudi 3 加速器现已上市,英特尔还提供经过验证的部署模板,使团队能够在数小时内完成从开箱到部署推理的整个流程。戴尔进一步降低了门槛,提供试用购买计划,将 XE7740 系统直接部署到您的环境中,让您在全面部署之前,根据实际工作负载、数据和基础架构验证性能。这种即时可用性、快速实现价值和低风险评估的组合,使得 Gaudi 3 配置对那些需要立即获得推理能力且无法承受等待分配队列的组织来说极具吸引力。

尽管如此,XE7740 并非单一加速器平台。戴尔致力于芯片多样性,因此同一平台可搭配多种选项,并兼容市面上所有主流加速器,而最佳选择完全取决于工作负载。例如,视频处理流水线与 NVIDIA L4 缓存完美契合,XE7740 可配备 16 个 L4 GPU 和 8 个 PCIe Gen5 x16 网卡插槽,打造性能卓越的流媒体和转码系统。对于跨部门运行混合 AI 工作负载的企业而言,XE7740 机箱是标准化的,只需根据具体部署调整加速器配置即可,从而简化集群管理,并根据任务需求定制计算能力。

结语

戴尔 PowerEdge XE7740 服务器专为满足企业级推理的实际需求而设计。其双区散热设计、结构化 PCIe 拓扑结构、高带宽内存架构以及横向扩展网络容量,共同打造了一个能够应对持续生产工作负载的系统。这些并非偶然的设计选择;它们体现了一种基础设施模型,在该模型中,推理可以持续运行、可预测地扩展,并能无缝集成到现有数据中心运营中。在本次评估中,英特尔 Gaudi 3 测试表明,XE7740 服务器能够在密集型和 MoE 架构上实现当前的推理性能,并具有可预测的扩展性和强大的内存密集型吞吐量。软件优化将持续改进,但该平台的架构基础已经非常稳固。

戴尔 PowerEdge XE7740 无边框

更重要的是,XE7740 为企业级 AI 基础设施树立了持久的蓝图。企业可以采用统一的机箱、管理堆栈和部署模型,并随着时间的推移不断演进加速器策略。随着模型规模的扩大、工作负载的多样化以及推理技术在业务运营中日益深入的融合,对稳定、适应性强的基础设施的需求只会与日俱增。PowerEdge XE7740 正是为了满足这一发展趋势而打造的。它能够提供企业级 AI 从快速部署到长期集成所需的架构平衡、运营成熟度和扩展空间。

本报告由 Dell Technologies 赞助。 本报告中表达的所有观点和意见均基于我们对所考虑产品的公正看法。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

迪维扬什·贾恩

机器学习工程师,家庭实验室爱好者和技术发烧友。在 StorageReview,我负责人工智能和新兴工作负载的测试,提供洞察分析和性能分析。