存储评论网

NVIDIA DGX Spark 评测:将数据中心功能引入桌面的 AI 设备

电子消费品  ◇  打标工作站

NVIDIA DGX Spark 代表了 AI 基础设施可访问性的分水岭。2017 年,具有里程碑意义的论文《Attention is All You Need》介绍了 Transformer 架构,该论文依赖于八 GPU P100 服务器配置,功耗高达数十千瓦时,并占用了大量数据中心空间。如今,DGX Spark 以紧凑的 240 瓦台式机尺寸提供卓越的计算性能。这种在能效和尺寸压缩方面的显著提升,使得个人研究人员、小型团队和分布式开发组织能够轻松访问之前数据中心独有的 AI 功能。

Nvidia DGX Spark 前端。

Spark 与以往桌面 AI 解决方案的区别在于其涵盖整个开发生命周期的全面方法。Spark 不会在实验、微调和部署之间做出妥协,而是在所有阶段提供真正的能力。128 GB 统一内存架构支持对模型进行全面的参数微调,而这在传统工作站上需要云资源的支持,同时每秒提供数百个令牌的吞吐量,非常适合批量推理工作负载,包括合成数据生成。它还配备了具有 200Gb 结构容量的 ConnectX-7 网络,这意味着企业可以集群多个 Spark 系统,以进行更大规模的模型探索。正如我们将要演示的那样,即使是单个系统也能展现出非凡的性能。

关键精华

  • 台式机中的数据中心电源:GB10 Grace Blackwell 采用 1.13 升、240W 的盒子,售价 3,999 美元,可提供高达 1 petaFLOP FP4 稀疏性能。

  • 改变工作流程的记忆:128GB 统一内存支持本地 8B 模型的全参数微调和高吞吐量推理。测试中,我们发现 Llama 3.1 8B FP4 在 128 个并发数下达到约 924 tok/s,而 Qwen3 Coder 30B-A3B FP8 在 64 个批次下达到约 483 tok/s。

  • 准备扩展并连接快速存储:集成的 ConnectX-7 提供 200G 架构,可用于集群或 NVMe-oF。内置 2242 Gen5 NVMe 虽然方便,但对于高负载 I/O 性能有所限制,因此基于 RDMA 的外置 NVMe-oF 是实现持续吞吐量的更佳途径。

  • 第一天软件成熟度:配备 DGX OS、CUDA、cuDNN、TensorRT、AI Workbench、容器和工作流剧本,因此团队可以立即运行实际工作负载。

  • 经过验证的实际性能:MAMF 测得 BF16 约为 99.8 TFLOP,FP8 约为 207.7 TFLOP。GDSIO 内部读取峰值约为 11.4 GiB/s,预计 200G 架构下上限会更高。

什么是 DGX Spark?谁应该考虑它?

NVIDIA DGX Spark 本质上是一个完整的 AI 开发平台,而不仅仅是一个 GPU 组件。其核心是 GB10 Grace Blackwell 超级芯片,该芯片集成了搭载第五代 Tensor Core 的 Blackwell 架构 GPU 和通过 NVLink-C2C 连接的 20 核 Arm CPU(10 个 Cortex-X925 + 10 个 Cortex-A725)。据 NVIDIA 称,这种一致的互连架构与 PCIe Gen 5 相比,可实现高达 5 倍的带宽,从而创建统一的计算结构,而非离散的处理域。 

为了方便用户入门,NVIDIA 推出了基于 Ubuntu 桌面构建的 DGX 操作系统,并预配置了完整的 AI 软件堆栈,包括 CUDA、cuDNN、TensorRT、NVIDIA Container Runtime 和 AI Workbench,从而消除了定制工作站构建中常见的驱动程序难题和环境配置开销。该系统提供灵活的部署模式:您可以连接外围设备,将其用作具有完整 Ubuntu 桌面体验的紧凑型工作站,也可以将其部署为可通过 NVIDIA Sync 访问的无头网络设备,从而与 JupyterLab、VS Code、Cursor IDE 和 SSH 终端无缝集成。 

这是专为 AI 从业者、微调语言模型的研究人员、加速 RAPIDS 工作流程的数据科学家、实现代理系统的开发人员,以及小规模实验烧蚀模型架构的团队打造的基础设施。Spark 的目标用户是那些需要强大 AI 计算能力且无需担心数据中心复杂性的专业人士。

NVIDIA DGX Spark 技术规格

规格 信息
卓越
GPU NVIDIA Blackwell 架构
中央处理器 20 核 Arm(10 个 Cortex-X925 + 10 个 Cortex-A725)
张量核心 5th代
RT核心 4th代
NVENC/NVDEC 1× / 1×
内存
系统内存 128 GB LPDDR5X(统一系统内存)
存储器接口 256 bit
内存带宽 273 GB /秒
性能
FP4 高达 1 petaFLOP(具有 Sparsity)
存放
存放 1 TB 或 4 TB NVMe M.2(自加密)
连接方式
USB 4× Type-C USB 3.2 Gen 2×2(20Gbps)
以太网(EtherNet) 1×10GbE RJ-45
网卡 ConnectX-7 智能网卡 – 2x 200G QSFP(允许最大 200G 带宽)
无线耳机 Wi-Fi 7,蓝牙5.3
音频输出 HDMI多声道音频输出
显示连接器 1×HDMI 2.1a
机械
尺寸 150 × 150 × 50.5 毫米 (5.9 × 5.9 × 1.98″)
重量 1.2 kg
能量消耗 240W 瓦

NVIDIA DGX Spark 设计与构建

NVIDIA DGX Spark 延续了 NVIDIA 标志性的工业设计语言,其紧凑的机身与大型 DGX 系统的外观和质感相得益彰。前面板采用微型手持式设计,致敬原版全尺寸 DGX 设备的手柄,并采用金色斑点金属饰面,营造出精致高端的质感,并与 NVIDIA 标志性的绿色徽标相得益彰。

DGX Spark 的外形尺寸为 5.9 × 5.9 × 1.98 英寸(150 × 150 × 50.5 毫米),重 2.6 磅(1.2 千克),总内部容积为 1.13 升。这使得它稳居 1 升小型 PC 级别。尽管体积小巧,但由于全金属合金外壳兼具被动式散热器的功能,该系统仍感觉坚固耐用,兼顾了外形和功能。

电源由一个 240 W USB-C 外接电源模块供电,如图所示,该模块位于主机旁边。该电源模块结构紧凑,做工精良,采用标准 C5(三叶草)连接器进行交流输入,与 DGX Spark 简洁高效的设计相得益彰。

Nvidia DGX Spark Front 配有电源砖。

回到机身背面,DGX Spark 延续了机身正面的金色斑点纹理饰面,使整个机箱的设计风格保持一致。从左侧开始,电源按钮位于四个 USB-C 端口旁边,其中一个端口为设备提供电源传输 (Power Delivery)。此外,还有一个 HDMI 2.1a 输出端口、一个 10 GbE RJ-45 端口,而这款设备的亮点在于其集成的 NVIDIA ConnectX-7 SmartNIC 驱动的双 200 GbE QSFP56 接口。

Nvidia DGX Spark 后部。

乍一看,你可能会推断 Spark 支持 400G 的连接;不幸的是,由于 PCIe 的限制,Spark 只能提供 200G 的连接。为了了解更多信息,我们深入研究了 Spark 的拓扑结构:

使用 lstopo,我们观察到 CX7 网卡的两个互连。CX7 通过两条 Gen5 x4 链路进行电气连接。在操作系统中,这些连接显示为四个接口,每个接口支持的最大带宽为 200G。由于测试时间有限,我们无法在 NVMe-oF 测试之外发现该平台的所有网络特性,本文稍后将详细介绍这些测试。但是,我们计划进一步探索该平台,并将在未来发布文章,深入探讨其功能,例如将多个 Spark 集群在一起形成一个微型集群。 

查看其他连接的设备,接下来是与 Gen5 x4 连接的微型 2242 外形 M.2 SSD,然后是与 PCIe Gen4 x1 链路连接的 Realtek RJ45 10GbE 控制器,以及与 PCIe Gen3 x1 链路连接的联发科 Wi-Fi 控制器。

深入 CPU 方面,Spark 搭载 20 核 Arm 处理器,采用类似于英特尔最新处理器的异构“大小”架构,由 10 个 Cortex-A725 能效核心和 10 个 Cortex-X925 性能核心组成,分布在两个 L3 缓存集群中。第一个集群(8MB L3)包含 CPU 0-4(Cortex-A725,最高 2808 MHz)和 CPU 5-9(Cortex-X925,最高 3900 MHz);第二个集群(16MB L3)包含 CPU 10-14(Cortex-A725,最高 2860 MHz)和 CPU 15-19(Cortex-X925,最高 3978-4004 MHz)。每个核心都拥有 64KB 的私有 L1 数据缓存和 64KB 的 L1 指令缓存,但 L2 缓存因核心类型而异:高能效 Cortex-A725 核心拥有 512KB 的 L2 缓存,而高性能 Cortex-X925 核心则拥有更大的 2MB L2 缓存(大 4 倍)。最快的核心是 CPU 15-19,它们受益于更大的 16MB L3 缓存和更高的频率,其中 CPU 19 是峰值性能核心,频率高达 4004 MHz。这些不同的功率/频率级别在上图所示的拓扑结构中用核心上的虚线表示。

放大后,我们将 DGX Spark 翻转过来;唯一可见的塑料部件是底座盖,它通过磁力吸附在机箱底部。这种设计既能保持外部清洁,又能快速拆装内部部件。拆下磁力底座后,露出四颗螺丝,即可打开主内部隔层。

在内部,我们可以看到天线布线朝向设备顶部,这证实了它支持 Wi-Fi 7 和蓝牙 5.3 连接。这提供了灵活的网络选项,对于可能无法进行有线访问的移动或实验室部署尤其有用。

图中还可以看到该设备的存储解决方案,即 PCIe Gen5 2242 M.2 SSD,这种规格对于此类高性能硬件来说并不常见。此处显示的配置包含一个 4TB 三星 NVMe 硬盘。

Nvidia DGX Spark 内部视图 ssd。

深入研究 DGX Spark,便会发现系统的核心——NVIDIA Grace Blackwell 的 GB10 超级芯片。GB10 超级芯片两侧是 8 个焊接的 LPDDR5X 统一系统内存,可提供 273 GB/s 的带宽,确保 CPU 和 GPU 操作之间的快速数据访问。

芯片旁边是 CX7 网卡,如前所述,它提供 200G 的连接能力。这使得用户能够将 Spark 连接到高速存储,甚至可以将多个 Spark 实例集群在一起。NVIDIA 已经验证并销售了由 2 个 Spark 组成的集群,可以直接连接,以支持更大规模的 AI 模型。

最后,翻转主板即可看到所有 PCIe 连接,包括 PCIe Gen5 x4 2242 M.2 SSD 和 PCIe Gen3x1 MediaTek Wi-Fi 适配器。

Spark 不可或缺之处:现代 AI 开发设备

DGX Spark 在多个不同的专业环境中表现出特别的吸引力,每个环境都受益于其统一内存、紧凑外形和全面软件集成的独特组合。

数据科学加速:从 Pandas 到生产

对于数据科学家而言,NVIDIA DGX Spark 代表着工作流程速度和体验的大幅提升。ConnectX-7 网络提供 200 Gbps 带宽,并结合 CUDA X 加速库,彻底革新了数据预处理。人工智能和数据科学建立在“优质数据输入,优质数据输出”的基础之上。传统机器学习项目最耗时的阶段通常是数据清理和特征提取。传统的工作流程通常涉及将数据集加载到 Pandas 等工具中,并在 CPU 核心上执行转换,这通常速度较慢。手动探索和特征工程也可能成为重大阻碍。Spark 通过 RAPIDS 实现端到端 GPU 加速。

典型的企业数据科学场景涉及对 40-80GB 数据集进行特征工程:连接多个表、跨时间窗口计算聚合、处理分类编码以及规范化分布。在 CPU 基础架构上,这种预处理可能耗时数小时。借助 RAPIDS cuDF 将整个数据集加载到 Spark 的 128 GB 统一内存中,这些操作可在几分钟内完成,加速可达 10 倍或更高。后续的模型训练,无论是使用 cuML 进行经典机器学习,还是使用 PyTorch 进行深度学习,都能获得同等的收益,从而消除了数据科学家需要等待基础架构而非迭代假设的传统瓶颈。

合成数据生成:机器人与模拟

第四代 RT Core 的加入使 Spark 在新兴工作流程中占据了独特的地位:用于世界模型训练的合成数据生成。传统上,训练稳健的操作策略需要数万次真实世界的演示,这既昂贵又耗时。Isaac Sim 或 Omniverse 等平台上的照片级逼真模拟提供了一种替代方案,但要渲染具有物理上精确的光照、反射和材质的光线追踪图像,一直以来都需要昂贵的工作站 GPU,例如 NVIDIA 的 GPU。 L40S 和 RTX 6000 Ada。

资料来源:英伟达

Spark 整合了这一工作流程。RT Core 使 OpenUSD 工作负载能够处理合成数据生成,而 Tensor Core 则用于蓝图/工作流程中的 AI 推理。以前,组织可能需要部署多台机器进行渲染,并单独部署一台推理优化服务器。现在,只需一台 240W 的设备即可实现。对于探索自主操控的机器人初创公司、大学实验室或汽车制造商而言,这种集成显著缩短了开发时间和资本支出。

 

我们之前曾探索过类似的合成数据生成管道,使用专用的 L40S 渲染系统与 H100 配对进行推理 较早的报道 NVIDIA L40S 的架构。GB10 将这些功能整合到统一的开发设备中,代表了该工作流程的一次引人注目的革新。我们计划在接下来的分析中针对这些独立配置对 Spark 的 RT Core 性能进行进一步测试,并针对代表性机器人操作场景检查渲染和其他工作负载。

Vibe 编码革命

前特斯拉人工智能总监兼 OpenAI 创始成员 Andrej Karpathy 创造了“氛围编码”(vibe coding)一词,用来描述一种借助人工智能进行快速软件开发的新兴方法。氛围编码并非逐行细致地编写代码,而是利用法学硕士(LLM)作为交互式结对编程人员:用自然语言描述功能,生成实现框架,通过对话式改进进行迭代,并快速构建功能原型。这种工作流程将编码从刻意构建转变为与理解上下文、API 和架构模式的人工智能进行引导式对话,使个人开发者能够以前所未有的速度构建极其复杂的系统。

人工智能辅助编码的采用规模体现在 OpenRouter 的使用排名, 其中,以编码为中心的模型始终占据推理量的主导地位。技术专业人员是主要的氛围编码人群,他们通常作为高级用户,在不同环境中并行运行多个编码代理。随着开放权重模型越来越接近专有替代方案, 关键基准, 开发人员正在探索本地推理部署,以消除速率限制,确保关键开发窗口期间的可用性,并维护专有项目的代码机密性。

r/LocalLLaMA 社区展示了令人印象深刻的定制配置,从多 GPU 工作站到运行本地模型的管道式服务器,从跨消费级硬件的分布式推理,到支持持续高吞吐量计算的精密冷却解决方案,应有尽有。然而,这些配置也存在诸多挑战:资本支出通常超过数万美元,功耗巨大,散热管理挑战重重,需要专用空间而非标准办公环境,并且需要大量的配置、优化和故障排除技术专业知识。

Spark 从根本上改变了这一价值主张。它售价 3,999 美元,配备 128 GB 统一内存,在安静、紧凑、节能且功耗仅为 240 瓦的设备上提供令人印象深刻的模型推理性能。希望建立本地编码助手基础设施的用户不再需要耗费大量电能并产生大量热量的复杂家庭实验室。经过验证的设备方法与预配置的 DGX 操作系统相结合,消除了之前限制本地 LLM 部署的配置复杂性,而这种复杂性此前仅限于拥有深厚 Linux 和 CUDA 专业知识的用户。

除了消除基础设施摩擦之外,Spark 还解决了代码隐私和模型定制方面的关键问题。云端编码助手必须将源代码传输到远程服务器,这对于处理专有算法、安全关键基础设施或受监管数据的组织来说,根本行不通。Spark 上的本地推理功能可确保代码始终保持开发环境的完整性。此外,128 GB 的内存容量支持对编码模型进行全面的参数微调,让经验丰富的开发人员能够在内部代码库上进行模型的专门化。对于使用领域特定语言、自定义框架或架构模式(这些模式在公共训练数据中缺乏充分体现)的组织而言,此功能尤为宝贵。

使用 NVIDIA NeMo 在 DGX Spark 上进行微调

DGX Spark 的 128 GB 统一内存支持对 8B 模型进行完整的参数微调,而这传统上需要昂贵的多 GPU 云设置。使用标准 Adam 优化对 Qwen3 8B 进行完整微调需要大约 132 GB(16 GB 模型权重、96 GB 优化器状态、16 GB 梯度以及激活),超过了双 H100 80 GB 配置。使用内存高效的 8 位 Adam 可将需求降低到 70 GB 左右(具体取决于批次大小),可以轻松容纳在 Spark 的内存池中。这一点很重要,因为在复杂的推理任务上,完整微调的准确率比 LoRA 高 4-6%。基于云端的 2× H100 80 GB 设置的成本约为每小时 5 美元,并且具有分布式训练复杂性,而 Spark 只需一次性投资 3,999 美元即可提供单系统训练。

NVIDIA NeMo Automodel 为任何 Hugging Face 模型提供无需检查点转换的 Day-0 支持,从而消除了企业训练框架的摩擦。直接从 HuggingFace Hub 加载 Qwen3 8B,并通过指定数据集来源、优化器设置和 LoRA 目标的 YAML 文件配置微调。NeMo 可自动执行分布式检查点操作,并兼容安全张量 (safetensor),实现融合 CUDA 内核以实现 2-5 倍加速,并处理梯度累积。

使用舒适的 UI 生成图像

ComfyUI 提供基于节点的图形界面,将稳定扩散及相关扩散模型转换为高度可定制的创意流程。与传统的网页界面将复杂性抽象为简化参数滑块不同,ComfyUI 采用可视化图形架构,用户通过连接离散的功能节点来构建工作流,每个节点代表特定的操作,例如模型加载、即时编码、潜在扩散采样、VAE 解码或升级转换。这种模块化设计能够对整个生成流程进行精细控制,使每个计算步骤透明且可调整。它还允许用户链接多个模型、实现自定义采样计划或集成 ControlNet 制导等高级技术,而这些在简化的界面中是无法实现的。

在 DGX Spark 上,ComfyUI 利用 Blackwell GPU 的 Tensor Core 加速扩散采样,通常可在 15-30 秒内完成生成,具体取决于采样复杂度。128GB 的​​统一内存架构尤其具有优势,可在内存中同时维护多个检查点模型、LoRA 适配器和 VAE 解码器,从而消除了 VRAM 受限系统所面临的重新加载开销。用户可以在本地生成几乎无限的 AI 艺术作品,无需担心 API 速率限制、每次生成的云成本以及专有创意工作流程相关的隐私问题。工作流持久化模型提升了运营价值:完整的流水线序列化为 JSON 文件,这些文件可以进行版本控制、跨团队共享或作为元数据直接嵌入到生成的图像中,从而实现可重复性,这对于构建合成数据集流水线或在生成的资源中保持一致艺术风格的组织至关重要。

NVIDIA DGX Spark 性能测试

vLLM 在线服务 – LLM 推理测试

vLLM 是目前最流行的高吞吐量 LLM 推理和服务引擎。vLLM 在线服务基准测试是一个性能评估工具,旨在衡量该推理引擎在处理并发请求时的实际服务能力。它通过向正在运行的 vLLM 服务器发送请求来模拟生产工作负载,这些请求的参数可配置,例如请求速率、输入/输出长度和并发客户端数量。该基准测试测量了吞吐量等关键指标,例如每秒令牌数、第一个令牌生成时间以及每个输出令牌的时间,从而帮助用户了解 vLLM 在不同负载条件下的性能。

我们测试了代表当今生产部署中最流行的架构和模型类型的综合模型的推理性能。

混合专家模型

我们评估了 Qwen3 Coder 30B-A3B,它是目前最流行的本地推理部署编码模型之一。这种稀疏架构在 BF16 精度下保持 3 亿参数的完整模型大小,同时每个生成的 token 仅激活 30 亿参数。我们对 Qwen 的原版模型和 FP8 量化版本进行了基准测试。FP8 量化模型展现出显著的性能提升:并发数为 1 时达到 46.5 tok/s,批量大小为 64 时可扩展至惊人的 482.6 tok/s。原版 BF16 模型在并发数为 1 时达到 27.8 tok/s,批量大小为 64 时达到 166.2 tok/s,性能提升近 3 倍。

密集模型

密集模型代表了传统的 LLM 架构,其中所有参数和激活函数都会在推理过程中被调用,因此与稀疏模型相比,其计算量更大。为了全面评估不同模型规模和量化策略下的性能特征,我们对五种密集模型配置进行了基准测试。

我们的测试套件包括 Mistral AI 的 Mistral Small 3.1 24B(精度为 BF16),以及 RedHat AI 的 Mistral Small 3.1 24B FP8 动态量化版本。动态量化采用选择性权重量化技术来优化性能与精度之间的权衡,策略性地降低精度,同时最大限度地减少模型性能下降。我们针对这些规模更大的密集模型,在三种精度格式下使用了 Meta Llama 3.1 8B 进行评估:标准 BF16 配置,以及 NVIDIA 的 FP8 和 FP4 量化版本。这种模型选择策略能够跨模型规模直接比较性能,同时隔离渐进式量化对推理吞吐量的影响。

性能分析:大型密集模型

Mistral Small 3.1 24B 在 BF16 精度下,在并发数为 1 时,基准吞吐量为 5.3 tok/s,在并发请求数为 128 时,可扩展至 158.9 tok/s。FP8 动态量化版本在较低并发数下的性能提升不大,仅为 8.8 tok/s,但在规模化后,性能提升高达 2 倍,在并发数为 128 时,性能提升高达 319.7 tok/s,充分体现了动态量化在高吞吐量服务场景下的有效性。

性能分析:紧凑密集模型

Llama 3.1 8B 架构在不同量化策略下展现出显著的性能特征差异。在 BF16 精度下,该模型在并发级别 1 下的性能为 13.6 tok/s,在 128 个并发请求下可扩展至 408.6 tok/s。转换到 FP8 量化后,在并发级别 1 和 128 下的性能分别达到 23.2 tok/s 和 752.8 tok/s,这意味着大规模吞吐量提升了 84%。FP4 配置进一步提升了性能,在相同并发级别下的性能分别达到 34.1 tok/s 和 924.1 tok/s,这表明积极的量化策略可以在保持模型质量的同时,将性能提升至基准精度的 2.3 倍,以满足多种生产工作负载的需求。

微尺度数据类型

微尺度化是一种先进的量化方法,它将细粒度的缩放因子应用于小块权重,而不是对大型参数组进行统一量化。NVIDIA 的 NVFP4 格式通过分块浮点表示实现了这项技术,其中每个包含 8-32 个值的微尺度块共享一个公共指数作为缩放因子。这种精细方法在实现 4 位表示的同时保留了数值精度,从而保持了 Transformer 架构所需的动态范围。该格式与 NVIDIA 的 Tensor Core 架构集成,可在矩阵运算过程中实现高效的混合精度计算和动态解压缩。

我们使用 NVFP4 量化方法,在 20B 和 120B 参数规模下评估了 OpenAI 的 GPT OSS 模型。20B 参数模型在并发数为 1 时达到 39.7 tok/s,在并发请求数为 128 时可扩展至 611.7 tok/s。120B 参数模型在并发数为 1 时达到 31.4 tok/s,在并发请求数为 64 时达到 162.7 tok/s。

注意: 输出吞吐量是跨请求的吞吐量,而不是每个请求的吞吐量。

由于时间有限,我们无法完成 TensorRT 测试,请关注 spark 的后续文章,我们将在其中探索更多推理框架的性能。

预填充和解码重推理

LLM 推理可以从根本上分解为两个不同的计算阶段,每个阶段都表现出截然不同的性能特征和资源利用模式。预填充阶段通过单个并行操作处理整个输入提示,同时在所有输入 token 上计算注意力机制,这是一个计算密集型操作,会完全饱和张量核心和计算单元。相反,解码阶段以自回归的方式生成输出 token,通过顺序操作一次生成一个 token。这些操作计算强度较低,但对内存带宽要求很高,因为模型必须反复访问权重和不断增长的键值缓存。这会产生根本不同的瓶颈特征:预填充操作通常受计算限制,而解码操作则需要占用大量内存带宽,因此特别容易受到内存子系统的限制。

我们针对两种不同的工作负载配置进行了全面测试:解码密集型推理(512 个输入令牌和 8,192 个输出令牌)以及预填充密集型推理(8,192 个输入令牌和 512 个输出令牌)。性能表征揭示了预期的架构权衡:Spark 在预填充密集型工作负载(计算资源仍然是主要瓶颈)上展现出具有竞争力的吞吐量,但在解码密集型场景下性能有所下降。这种性能差异与内存带宽限制恰好吻合。解码操作的顺序性和密集的内存访问模式直接暴露了 Spark 架构固有的带宽限制。这些结果为下一节中 MAMF 测量结果的解读提供了关键背景,因为两个基准测试套件都一致认为内存带宽是实际推理部署中性能限制的根本因素。

最大可实现 Matmul FLOPS (MAMF)

MAMF(最大可实现矩阵乘法 FLOPS)是一种实用的性能指标,旨在衡量机器学习加速器在矩阵乘法运算过程中可实现的实际峰值每秒浮点运算次数,它比硬件规格中经常宣传的理论峰值 FLOPS 提供了更准确的基准。我们使用 Stas Beckman 的 mamf-f​​inder 基准测试。

在 BF16 精度下,我们观察到 MAMF 为 99.8 TFLOP,而 FP8 (E4M3) 的 MAMF 为 207.7 TFLOP。由于时间限制,我们无法对 FP4 MAMF 进行全面的表征;然而,根据观察到的基于精度的扩展模式推断,我们预计其性能将比 FP8 提升 2 倍,在密集 FP4 运算中可实现约 400 TFLOP。考虑到 2:1 结构化稀疏性优化,这相当于理论 FP4 性能的约 80%,在稀疏计算工作负载下可实现约 800 TFLOP。需要注意的是,由于多种原因,这些 MAMF 测量值可能低于理论上的宣传规格,我们将不会在本次评测中详述。

GPU 直接存储

我们在 Spark 上进行的测试之一是 MagnumIO GPU 直接存储 (GDS) 测试。GDS 是 NVIDIA 开发的一项功能,允许 GPU 在访问存储在 NVMe 驱动器或其他高速存储设备上的数据时绕过 CPU。GDS 无需通过 CPU 和系统内存路由数据,而是支持 GPU 和存储设备之间的直接通信,从而显著降低延迟并提高数据吞吐量。

GPU 直接存储的工作原理

传统上,当 GPU 处理存储在 NVMe 驱动器上的数据时,数据必须先经过 CPU 和系统内存,然后才能到达 GPU。这个过程会造成瓶颈,因为 CPU 会成为中间人,增加延迟并消耗宝贵的系统资源。GPU 直接存储通过使 GPU 能够通过 PCIe 总线直接从存储设备访问数据,消除了这种低效率。这种直接路径减少了与数据移动相关的开销,从而实现了更快、更高效的数据传输。

AI 工作负载(尤其是涉及深度学习的工作负载)是高度数据密集型的。训练大型神经网络需要处理数 TB 的数据,数据传输的任何延迟都可能导致 GPU 利用率不足和训练时间延长。GPU Direct Storage 通过确保尽快将数据传送到 GPU、最大限度地减少空闲时间并最大限度地提高计算效率来解决这一挑战。

此外,GDS 对于涉及流式传输大型数据集的工作负载(例如视频处理、自然语言处理或实时推理)尤其有益。通过减少对 CPU 的依赖,GDS 可加速数据移动并释放 CPU 资源以用于其他任务,从而进一步提高整体系统性能。

GDSIO – 内部 4 TB M.2

NVIDIA DGX Spark 的存储选择颇具趣味。考虑到小巧机箱内的尺寸,NVIDIA 选择了不太常见的 Gen5 2242 M.2 SSD。对于不熟悉这类 SSD 的读者来说,它是一款较短的 42 毫米版本,而台式机中更常见的是 80 毫米版本。硬盘选择较少,4 TB 是该尺寸的最高容量。不过,主要问题在于性能。小型 SSD(例如 2242 和 2230 型号)优先考虑尺寸,其次才是硬盘速度。它们常见于便携式游戏机、平板电脑和一些笔记本电脑。

2230 和 2242 SSD PCB 上空间有限,导致控制器、DRAM 和 NAND 封装的空间不足。我们在测试中观察到了一些这样的权衡。在 1 TB 或 128 GB 的内存中应用 GDSIO 工作负载时,SSD 会锁定,需要重新镜像 Spark。将测试内存降低到 64 GB,并降低线程数,可以解决这个问题。这些问题通常不会出现在更常见的高性能 80mm SSD 上。

查看内部驱动器的顺序读取性能,我们发现在 1M 块大小和 16 个线程的情况下吞吐量最高,达到 11.4 GiB/s。

从顺序写入性能来看,该驱动器在 32k 块大小和 128 个线程的情况下实现了最高吞吐量。在更大的块大小下,性能似乎趋于稳定,平均约为 8.3 GiB/s。

对于希望购买 NVIDIA DGX Spark 进行更繁重开发工作的买家,尤其是可能利用它们构建小型集群的企业,我们强烈建议利用板载 200Gb NVIDIA ConnectX-7 NIC。

GDSIO – 基于 RDMA 的 NVMe-oF

为了使用 NVIDIA DGX Spark 进行 NVMe-oF RDMA 测试,我们利用 PEAK:AIO 软件在 Dell PowerEdge R770 上创建了一个 NVMe-oF 目标,该目标配备了六块美光 9550 3.84TB SSD,并通过 RDMA 连接。如前所述,Spark 的 CX7 网卡存在一些问题,由于时间限制,我们只能使用 100G 连接来测试 Spark。Spark 和 PEAK:AIO 都能达到更高的性能。我们将在后续文章中对 Spark 进行额外的存储和网络测试。

查看内部驱动器的顺序读取性能,我们发现在 128k 块大小和 32 个线程的情况下吞吐量最高,达到 12.1 GiB/s。

从顺序写入性能来看,该驱动器在 128k 块大小和 16 个线程的情况下实现了最高吞吐量。在更大的块大小下,性能似乎趋于稳定,平均约为 11.3 GiB/s。

这些结果存在很多细微差别,由于前面提到的时间和网络方面的原因,我们只看到了理论最大值的一半。此外,128k 块大小下的最高吞吐量受多种因素影响,例如我们使用的企业级硬盘或 PEAK:AIO 如何处理此类 IO,您的实际结果可能会有所不同,我们计划在未来通过 Spark 进行更多测试。

Day-One 软件生态系统

NVIDIA 和其他供应商在软件准备方面投入了大量资金,这与典型的硬件发布截然不同,早期采用者往往面临文档不完整和工具缺失的问题。Spark 发布了涵盖常见工作流程的全面手册:用于扩散模型的 ComfyUI、用于优化推理的 TRT-LLM、用于本地模型服务的带有 Open WebUI 的 Ollama、用于微调的 Unsloth 以及基于 LangGraph 的多智能体架构。

这种软件成熟度彻底改变了评估体验。开发人员无需花费数天时间配置环境,只需运行代表性工作负载即可立即评估 Spark 是否满足其需求。 剧本 不仅提供说明,还提供容器化环境、样本数据集和预期性能指标。

可用性和 OEM 系统

NVIDIA Founders Edition 4TB 版售价 3,999 美元,将于 10 月 15 日正式发售。除了 NVIDIA 自己的产品外,几款来自大型 OEM 厂商的 GB10 台式机也即将上市。所有 OEM 厂商的核心硬件将非常相似,但它们之间可能存在一些差异化的空间,不过大部分价格差异可能来自存储选择。我们已经看到许多新品发布,包括搭载 GB10 的戴尔 Pro Max、联想 ThinkStation PGX、宏碁 Veriton GN100 和华硕 Ascent GX10。

资料来源:Nvidia

结语

NVIDIA DGX Spark 代表着先进 AI 计算基础设施可及性范式的一个根本性转折点。通过将 GB10 Grace Blackwell 超级芯片的功能(包括 128 GB 统一内存、1 petaFLOP 稀疏 FP4 性能、第四代 RT 核心和 ConnectX-7 网络)整合到一台售价 3,999 美元、功率 240W、容量 1.13 升的设备中,NVIDIA 有效地打破了数据中心级 AI 能力与个人研究人员和小型开发团队之间长期以来的壁垒。

经过验证的设备方法解决了 AI 基础架构部署中一个持续存在的摩擦点:维护自定义配置的运营开销。部署 Spark 单元的组织受益于 NVIDIA 对整个堆栈(包括 DGX 操作系统、CUDA 工具包、框架容器和硬件固件)的全面测试和验证,从而消除了困扰自定义工作站构建的配置负担。DGX Dashboard 的集成更新管理、系统监控和 JupyterLab 配置进一步减轻了运营负担,而 NVIDIA Sync 的自动 SSH 密钥分发和隧道管理则使远程访问真正变得顺畅无阻。对于正在扩展的组织而言,这意味着显著加快入职速度:新研究人员将获得标准化硬件,通过经过验证的双节点集群配置连接到现有基础架构,并在数小时内(而不是数天)开始高效工作,以解决驱动程序冲突或网络结构配置问题。

DGX Spark 已在紧凑、安静的设备中提供真正的 AI 性能,我们的早期结果已表明,它对于那些希望获得强大功能且无需数据中心开销的团队至关重要。故事才刚刚开始。我们计划使用 200G 架构、NVMe-oF 目标和多节点集群扩展测试,以探索扩展效率、更大的模型占用空间和共享存储架构。随着软件和合作伙伴生态系统的成熟,我们预计 Spark 部署将从强大的单节点设置发展为紧密集成的高吞吐量微型集群,从而进一步增强该平台的性能。

产品页

Spark 演示

参与 StorageReview

资讯订阅 | YouTube | 播客 iTunes/Spotify | Instagram | Twitter(现为X) | TikTok | RSS订阅

迪维扬什·贾恩

机器学习工程师、家庭实验室爱好者和技术发烧友。在 Storage Review,我负责人工智能和新兴工作负载测试,旨在提供实用见解和性能分析。