我们在评测NVIDIA DGX Spark时发现,存储是该平台最明显的缺陷,而且这首先是外形尺寸的问题。Spark 的内部插槽支持短款 M.2 固态硬盘,即 2230 和 2242 规格,这种规格的固态硬盘虽然尺寸小巧,但容量却有限。而客户端 SSD 市场的高端产品是全尺寸的 2280 固态硬盘,目前市面上已有 8TB 的型号,Spark 却根本没有地方安装。这就导致这台专为严肃的 AI 工作而设计的机器,其存储容量上限却更适合轻薄笔记本电脑,而且内部也没有其他解决方案。Luisuantech GP Spark 正是针对这一问题而设计的:一个 0.58 升的四盘位扩展盒,支持全尺寸 M.2 固态硬盘,通过线缆连接到 Spark 的 100GbE 端口,无需驱动程序或格式化即可被识别为原生 NVMe 设备,并以接近线速的速度处理 GPU Direct Storage 流量。
这款产品主打简洁易用和经济实惠的客户端硬盘方案。GP Spark 的四个硬盘位可安装普通的 M.2 2280 或 22110 NVMe SSD(Spark 本身不支持这种规格),并通过专用芯片上的硬件卸载引擎,以 NVMe-oF RDMA 协议传输这些 SSD。Luisuantech 的规格表显示,目前支持最大 4TB 的硬盘,每个机箱最多可支持 16TB。不过,这些硬盘位也用于存储 8TB 的客户端硬盘,因此实际容量上限更多取决于规格表的验证,而非硬件本身的限制。这款产品无需企业级阵列,无需授权,也无需学习任何存储操作系统。只需将 DAC 或 AOC 线缆连接到 GP Spark 和 DGX Spark,在 Spark 的 Ubuntu 系统上运行 `modprobe nvme-rdma` 命令,硬盘就会显示为 `/dev/nvme` 设备,即可通过 GDS 访问。
设计与建造
GP Spark 是一款尺寸为 150mm x 150mm x 26mm 的小型机箱,比 Spark 本身体积更小。它采用穿孔金属外壳,只有一个电源按钮,该按钮同时也是状态指示灯:绿色表示正常,红色表示故障。电源通过 USB-C PD 协议从 20V/5.4A 的外部适配器供电,整个设备的额定功率(包括硬盘)低于 100W。后面板共有三个接口:USB-C 电源输入接口、USB-C 工厂调试端口和 QSFP28 100GbE 数据端口,后者可连接铜缆 DAC 或光模块。内部配备专用数据处理器和协处理器,用于处理 NVMe-oF 卸载,四个 M.2 插槽位于顶盖下方。
后面板设计简洁实用:左侧是 USB-C 电源和调试接口,右侧是 QSFP28 插槽,透过它们之间的通风口可以看到一排铜质散热鳍片。散热方式完全是被动式。
打开顶盖,可以看到四个 M.2 插槽并排排列,这里安装的是我们的 KIOXIA XG8 测试硬盘。顶盖本身就是硬盘散热器:其底部的蓝色导热垫将每个 SSD 与构成机箱顶部的鳍片式散热片连接起来,这种简洁的被动式散热方案适用于那些不会长时间处于企业级负载的客户端硬盘。
在公布具体数据之前,需要说明一点:我们评测的这台是原型机。底部标签显示型号为GP-Spark-1000,标明设备为原型机,禁止转售,并标注了2026年XNUMX月的生产日期,品牌为绿算技术(Luisuantech)旗下的Swingsoon。量产机型在外观和做工上可能有所不同,但我们测试的平台性能与路易科技目前寄送给评测人员的机型一致。关于开箱体验还有两点需要说明。我们评测的这台机器附带了两份全是中文的纸质说明书,初始设置似乎需要通过Wi-Fi连接完成。这两点对于这款产品的目标用户来说都不是问题,但如果要在西方市场推出,则需要提供英文文档。
设置和架构
该设备没有板载 RAID 控制器和存储抽象层:GP Spark 本质上是一个 JBOF(JVMe-oF 接口),它将每个安装的 SSD 都暴露为独立的 NVMe-oF 命名空间。在我们的配置中,四个硬盘在主机上显示为四个 /dev/nvme 设备。冗余或条带化由主机负责。厂商规格表列出了一个 100GbE 端口,速度为 10GB/s,IOPS 为 270 万;产品报告则单独提及了双 100GbE 配置,速度最高可达 24GB/s,Luisuantech 确认该数据为读写总速度。我们的测试设备和测试均采用单端口配置。
Luisuantech GP Spark 规格
| 规格 | Luisuantech GP Spark |
|---|---|
| 平台概述 | |
| 驱动器托架 | 4 个 M.2 NVMe (2280 / 22110) 支持混合容量,单盘最大容量可达 4TB。 |
| 网络 | QSFP28 100GbE(DAC 或光纤) RDMA 要求 |
| 操作流程概述 | NVMe-oF RDMA GPU 直接存储 (GDS) |
| 性能(厂商声明) | |
| 生产能力 | 每个 100GbE 端口 10GB/s 最高可达 24GB/s 的聚合读取和写入速度 |
| IOPS | 2.7M |
| 访问延迟 | 小于20微秒 |
| 力量和体能 | |
| 电力 | 总功率低于100瓦 20V/5.4A USB-C PD 外置适配器 |
| 尺寸 | 150毫米 x 150毫米 x 26毫米(0.58升) |
| 工作温度 | 0至40C |
| 兼容性 | NVIDIA DGX Spark DGX站 配备支持 RDMA 功能的网卡的工作站和服务器 |
性能
我们的测试配置将GP Spark与技嘉DGX Spark通过100GbE直连连接,硬盘位上安装了四块1TB的铠侠XG8客户端NVMe SSD。需要注意的是,您选择的硬盘会对测试性能产生显著影响。我们使用的是第五代客户端SSD;某些型号,尤其是企业级SSD,可能提供更高的持续写入性能。我们对4K和64K随机读写以及1M顺序读写工作负载进行了FIO扫描,逐步调整iodepth和numjobs以覆盖所有性能范围。结果反映了应用Luisuantech的MTU指导后的最终复测结果,该指导改善了我们最初测试的传输性能。
4K随机性能
小块读取是卸载引擎真正展现其价值的地方。4K随机读取性能随队列深度增加而提升,峰值达到2.43百万IOPS,传输速率为9,475, 2.7 MiB/s,接近厂商宣称的100百万IOPS,并且有效地利用了4GbE链路的带宽进行XNUMXK传输。对于一个被动供电的四盘位设备,用于连接桌面AI 系统,这无疑是一个惊人的数字。
写入性能曲线大致呈半峰状,峰值达到1.19百万IXNUMXPS。在我们运行的所有工作负载中,读取和写入性能峰值之间的差距都保持一致。性能与底层硬盘直接相关,因此结果会因配置不同而有所差异。
在低队列深度下,读取延迟平均最低为 65.3 微秒。这高于厂商宣称的低于 20 微秒的延迟,但实际结果会因硬盘选择和网络配置而异。网络往返延迟也占一部分;在链路达到饱和之前,延迟保持稳定且可预测。
写入延迟是规格表声明唯一成立的地方:最小深度下平均为 20.4 微秒,正好是供应商宣称的低于 20 微秒的数字,而且低到应用程序实际上感觉不到网络的存在。
64K随机性能
在 64K 数据块大小下,带宽成为关键。随机读取峰值速度可达 9,503 MiB/s,与 4K 和 1M 数据块大小下的峰值速度基本一致。无论工作负载的数据块大小如何,GP Spark 都能提供相同的性能:100GbE 端口的全线速。
64K 随机写入速度稳定在 4,742 MiB/s,这是我们在其他所有块大小下测得的上限。
1M 顺序性能
大块顺序读取(模型加载和数据集流式传输的典型特征)的速率可达 9,496 MiB/s,并且在队列深度适中时也能保持在该水平。这正是 GP Spark 所擅长的工作负载,并且能够以极高的速度进行传输。
顺序写入速度为 4,742 MiB/s,约为读取吞吐量的一半,并且在我们测试的每个块大小下,该上限都相同。我们在测试期间向 Luisuantech 指出了这种不对称性,并与该公司进行了一轮调优,包括更改 MTU;此处的数据代表了该平台在当前单端口配置下的最佳性能,Luisuantech 也确认这些数据与其写入路径的规格一致。对于该设备的目标读取主导型工作负载(例如模型加载、数据集流式传输和 RAG 检索),其性能表现微乎其微;对于大量数据摄取,请相应地调整预期。
结语
GP Spark 的功能单一但实现方式简洁:它为一台或多台 DGX Spark 提供平台处理繁重任务所需的存储空间。只需连接线缆,加载内核模块,即可获得近 10GB/s 的 GDS 可访问闪存,无需安装驱动程序、存储操作系统或支付企业账单。其核心在于使用客户端 M.2 固态硬盘填充容量;由于该设备兼容各种 2280 或 22110 SSD,因此容量成本相对较低,而卸载引擎则负责处理硬盘无需处理的协议工作。
我们认为,与其说这是一项突破性的创新,不如说它是一款设计精良、执行到位的附加组件。读取速度达到单链路的线速,写入速度则约为其一半。价格目前仍是个未知数:GP Spark 尚未在美国或中国上市,我们测试的样机是原型机,绿算技术也未公布价格。其价值在于,其价格远低于企业级 NVMe-oF 设备,这得益于其客户端驱动器设计。对于那些遇到内部存储瓶颈的 Spark 用户(我们之前的评测表明,很多用户都会遇到这个问题),这提供了一种无需从大型企业存储系统中划出空间即可轻松解决该问题的方案。




Amazon