存储评论网

宏碁 Veriton GN100 评测:NVIDIA Spark 生态系统中的佼佼者

电子消费品  ◇  打标工作站

宏碁 Veriton GN100 AI 迷你工作站是我们正在评估的几款基于 Spark 的系统之一,它们都采用 NVIDIA 的 GB10 Grace Blackwell 超级芯片。与其他系统一样,GN100 的设计目标是将数据中心级的 AI 计算能力融入紧凑的桌面设备中,使开发人员和研究人员能够在本地运行和优化模型,而无需完全依赖云基础设施。

宏碁 Veriton GN100 AI 前面板

在此配置中,GN100 搭载了 20 核 Arm 架构的 GB10 处理器和集成式 Blackwell 显卡,可提供高达 1 petaFLOP 的 FP4 AI 性能。它配备 128GB LPDDR5x 统一内存和 4TB PCIe Gen5 NVMe SSD,能够提供大型语言模型、生成式 AI 工作流程和数据密集型实验所需的内存带宽和存储吞吐量。

与该系列的其他 Spark 系统一样,GN100 支持本地 AI 执行,同时可通过集成的 NVIDIA ConnectX-7 智能网卡实现系统间扩展。两台设备可以连接起来,以支持超出单台设备规模的大型模型工作负载。

该系统预装了 NVIDIA DGX 操作系统和完整的 AI 软件栈,可立即部署到开发和研究环境中。

宏碁 Veriton GN100 AI 规格

        规格         宏碁 Veriton GN100 AI (GB10)
尺寸和重量
高度 2 in
宽度 5.9 in
深度 5.9 in
重量 2.65磅
处理器
处理器类型 NVIDIA GB10(Grace Blackwell Superchip)(20 核)
集成显卡 NVIDIA Blackwell GPU(集成显卡)
内存
内存类型 LPDDR5x(统一系统内存)
内存配置 128 GB LPDDR5x 统一系统内存
内存带宽 273 GB/s (8533 MT/s)
运行系统
支持的操作系统 NVIDIA DGX 操作系统
外部端口和插槽
网络端口 一个 RJ45 (10GbE)
NVIDIA ConnectX-7 网卡(200G × 2 QSFP)
USB端口 三个 USB 3.2 Gen 2×2 Type-C (20Gbps)
一个支持PD的USB 3.2 Gen 2×2 Type-C接口
视频端口 一个 HDMI 2.1a 接口
电源适配器端口 USB Type-C(PD 输入)
安全槽 肯辛顿锁一号
无线耳机
WiFi WiFi 7(AW-EM637,2×2)
蓝牙 蓝牙5.4
存放
存储选项 最高支持 4 TB NVMe SSD(PCIe Gen5)
电源适配器
类型 240W 外置适配器(USB Type-C)

宏碁 Veriton GN100 AI 构建与设计

Veriton GN100 的正面最引人注目的是一排横跨整个机身宽度的垂直格栅。一条水平装饰线贯穿格栅,使其外观与我们之前评测过的其他基于 Spark 的系统相比独具特色。

宏碁 Veriton GN100 AI 后置摄像头

所有主要I/O接口均位于系统后部。宏碁配备了四个USB 3.2 Type-C接口,其中一个支持供电,以及一个用于显示输出的HDMI 2.1b接口。网络方面,配备了一个RJ-45以太网接口和一个NVIDIA ConnectX-7智能网卡,可实现高带宽连接和系统互联。无线连接方面,支持Wi-Fi 7和蓝牙5.1或更高版本。此外,还配备了Kensington锁槽,用于物理安全防护。

宏碁 Veriton GN100 AI 后盖拆卸

这里可以看到覆盖整个机箱的金属屏蔽罩和结构板,它既起到加固框架的作用,又起到散热片的作用。左下角是一个方便使用的 M.2 2242 NVMe SSD 插槽,用一颗螺丝固定,部分隐藏在金属板下方。

要打开宏碁主机底部,请拧下周围的螺丝,即可轻松取下底板。打开后,内部布局简洁明了,散热组件、存储区域和主板组件一目了然。底板本身厚实坚固,有助于提升机箱的整体刚性。

Acer Veriton GN100 AI底部储物区

与我们评测过的其他 Spark 系统相比,宏碁这次采用了略有不同的设计。它没有采用 Founders Edition 和一些 OEM 版本上常见的精致喷漆金属底板,而是使用了未经处理的铸造金属底板。虽然表面处理略显粗糙,铸造纹理清晰可见,但底板依然厚实且结构稳固。从功能上看,它仍然起到加固框架和辅助散热片的作用,但这种制造工艺的选择显然体现了不同的设计和成本理念。

宏碁 Veriton GN100 AI 散热测试

为了测试宏碁 Veriton GN100 AI 的散热性能,我们将其与 Founders Edition 版本以及戴尔、华硕和技嘉等 OEM 厂商的产品进行了比较。我们在Spark 散热测试论文中对此进行了更深入的探讨。

宏碁 Veriton GN100 AI 带 OEM Sparks

我们对整个技术栈进行了监控,在给定的时间段内,工作负载分为三个阶段,利用率在大约一小时内逐步提升。这使我们能够观察设备在长时间使用和不同工作负载阶段的性能。我们监控了 CPU、GPU、网络、NVMe 的温度以及总功耗。

CPU温度

在CPU散热测试中,宏碁系统在执行高强度预填充操作时,最高温度达到74.7°C。这是对比组中观察到的最低最高CPU温度之一,表明其散热设计非常保守或高效。

随着工作负载过渡到 ISL/OSL 均衡模式以及持续的解码密集型阶段,CPU 温度始终保持在良好控制范围内,没有出现剧烈的升温。与某些竞品系统常见的 80°C 以上高温不同,宏碁这款产品保持了较低的持续运行温度,这体现了其在长时间计算负载下强大的散热能力。

在低负载情况下,CPU 的最低温度为 37.8°C。这一基准温度与整个处理器系列的基准温度相符,并进一步证实了宏碁的散热解决方案在待机和负载状态下均能有效工作。

总体而言,Acer 在峰值功率和持续功率阶段都提供了同组产品中最凉爽的 CPU 散热性能之一。

GPU温度

GPU 温度也呈现类似的平稳趋势。在预填充重加速期间,GPU 最高温度达到 69°C,显著低于几款竞品在突发运行时的温度。

随着工作负载进入均衡ISL/OSL和解码密集型阶段,GPU温度稳定在一个可控范围内,没有出现明显的温度峰值。系统在持续解码下表现出良好的稳定性,始终远低于运行上限。

在较轻的阶段,记录到的最低 GPU 温度为 35°C,是该堆栈中最低的空闲基线之一。

综合来看,Acer 在突发负载和持续负载下都展现出了最出色的 GPU 实现之一。

NVIDIA DGX Spark GPU 温度

NVMe温度

测试过程中,存储设备的温度始终保持在规格范围内。在负载较高的阶段,NVMe 固态硬盘的最高温度为 56.8°C,远低于常见的降频阈值,与该组其他存储设备较为温和的测试结果相符。

在空闲或轻度使用时,NVMe 温度降至 36.8°C,表明存储子系统在低负载下不受热限制。

总体而言,宏碁保持了具有竞争力的 NVMe 散热性能,在保证较低持续温度的同时,也实现了稳定的基准性能。

NVIDIA DGX Spark 固态硬盘温度

NIC 温度

在负载较高阶段,网卡温度峰值达到 61°C。这是对比组中观察到的网卡最高温度较低的情况之一,表明机箱内部气流流通良好或组件布局合理。

在光照较强的阶段,记录到的最低 NIC 温度为 39°C,再次反映了其较强的基线热行为。

在整个测试过程中,网络控制器与工作负载需求成比例地进行跟踪,没有过度扩展。

GPU功耗

在预填充重载转换期间,GPU 功耗峰值达到 69.18W。这使得 Acer 的功耗略低于 GB10 系列处理器中观察到的最高功耗上限。

较低的峰值功率分配与宏碁更凉爽的GPU散热特性直接相关。宏碁并没有一味追求功率上限,而是在性能和​​散热效率之间寻求平衡,从而在峰值功率输出阶段保持较低的组件温度。

在持续解码工作负载期间,功耗会根据工作负载需求趋于稳定,并保持可预测性。

热力总结

在对 CPU、GPU、NVMe 和网卡进行全面温度监测后,Acer GB10 在对比组中展现出最佳的整体散热性能。在负载高峰时段,CPU 最高温度为 74.7°C,GPU 最高温度为 69°C,而 NVMe 温度始终低于 57°C,网卡最高温度为 61°C。GPU 最高功耗为 69.18W,略低于其他机型的最高值。

总体而言,宏碁的实现方案优先考虑散热效率和持续稳定性,在激烈的工作负载转换过程中保持充足的余量,同时在长时间负载下提供稳定的性能。

宏碁 Veriton GN100 性能测试

为了评估宏碁 Veriton GN100,我们使用 vLLM Online Serving 基准测试对 Spark 单元进行了测试。vLLM Online Serving 基准测试是目前应用最广泛的大型语言模型高吞吐量推理和服务引擎。该基准测试通过向运行中的 vLLM 服务器发送并发请求来模拟真实生产环境中的工作负载,并测量关键指标,包括总令牌吞吐量(每秒令牌数)、首令牌到达时间和每个输出令牌的生成时间,并考察不同负载条件下的性能。

我们的测试涵盖了从密集架构到微扩展数据类型的各种模型。测试评估了三种工作负载场景下的性能:均衡 ISL/OSL、预填充密集型和解码密集型。这些场景代表了不同的实际服务模式,从均衡的输入输出负载到计算密集型的提示符处理和内存带宽受限的令牌生成。

除了宏碁 Veriton GN100 之外,我们还以 NVIDIA Founders Edition Spark 作为参考基准,同时测试了来自华硕、戴尔和技嘉的 OEM 系统。这使我们能够将宏碁的测试结果置于更广泛的竞争格局中,并了解其在不同型号和工作负载类型中处于领先地位、与竞争对手并驾齐驱或落后于竞争对手的程度。

GPT-OSS-120B

在 ISL/OSL 相等的情况下,Acer 处理器在整个批次扫描过程中吞吐量从 69.65 提升至 713.18 tok/s。在批次较小时,吞吐量存在一定波动,之后趋于稳定,并从第 8 批次开始持续增长,直至第 64 批次。

预填充重型设备从 303.61 tok/s 开始,到批次大小 64 时攀升至 2,777.56 tok/s。整个过程规模增长强劲且稳步提升,尤其是在第 8 个批次时增长尤为迅猛,并且在更大的批次规模下持续增长。

解码重任务的处理速度范围为 38.38 至 292.41 tok/s,在整个批次扫描过程中呈现渐进且稳定的增长。较小的批次大小在吞吐量稳定之前会出现一些波动,并从第 16 个批次开始稳步增长。

GPT-OSS-20B

在 ISL/OSL 相等的测试条件下,Acer 处理器的处理能力从 91.91 tok/s 提升至 1,565.62 tok/s,在整个批次扫描过程中均保持强劲且稳定的增长。吞吐量从第 1 批次到第 4 批次大约翻了一番,然后在第 32 批次和第 64 批次继续攀升。

Prefill Heavy 从 1,637.72 tok/s 开始,随着批次大小增加到 64,攀升至 4,317.73 tok/s。增长在第 2 批次时强劲,在中期趋于平缓,然后在第 32 批次和第 64 批次时再次加速。

解码重任务的速度范围为 50.55 至 674.26 tok/s,在整个批次扫描过程中,速度逐渐且稳定地提升。

 

Qwen3 程序员 30B A3B FB8

在 ISL/OSL 相等的情况下,Acer 处理器的处理能力从 104.64 tok/s 提升至 1,273.47 tok/s,并在整个批次扫描过程中保持稳定增长。处理能力在第 16 个批次之前每一步都大约翻一番,然后在第 32 个和第 64 个批次中继续攀升。

预填充重型设备从 429.86 tok/s 开始,到批次大小 64 时增长到 2,034.76 tok/s。扩展性在第 8 批次之前很强,然后随着工作负载在第 32 批次和第 64 批次接近平台期而趋于缓和。

解码重任务的速度范围为 55.94 至 478.59 tok/s,在整个批次扫描过程中,速度逐渐且稳定地提升。

Qwen3 编码器 30B A3B 基地

在 ISL/OSL 相等的情况下,Acer 的吞吐量从 60.71 到 681.18 tok/s 不等,在所有批次大小下,其吞吐量都明显低于 FP8 版本。虽然在整个测试过程中吞吐量保持稳定增长,但随着批次大小的增加,与 FP8 的差距也随之扩大。

Prefill Heavy 的初始吞吐量为 260.11 tok/s,批量大小为 64 时,吞吐量攀升至 1,610.56 tok/s。在整个扫描过程中,吞吐量保持稳定,但无论批量大小,吞吐量都远低于 FP8 的对应吞吐量。

解码重码的速度范围为 33.31 至 342.79 tok/s,在整个扫描过程中,其输出均低于 FP8 变体。所有批次大小的增长都较为平缓且稳定。

Llama 3.1 8B 指令 FP4

在 ISL/OSL 相等的情况下,Acer 的性能从 77.15 tok/s 提升至 2,834.70 tok/s,在所有批次大小下均比 FP8 版本具有明显的吞吐量优势。性能提升在第 32 批次之前平滑线性,并在第 64 批次时继续保持强劲增长。

预填充重型设备从 321.54 tok/s 开始,在第 32 批次时攀升至 2,539.85 tok/s,然后在第 64 批次时略微稳定在 2,516.13 tok/s。在中等和较大批次规模下,FP4 型号的吞吐量均高于其 FP8 型号。

解码重码的速率范围为 41.21 至 585.63 tok/s,在所有批次大小下,其输出均显著高于 FP8 变体。整个扫描过程中,速率增长保持稳定。

Llama 3.1 8B 指令 FP8

在 ISL/OSL 相等的测试环境中,Acer 处理器在整个批次扫描过程中吞吐量从 55.93 tok/s 提升至 2,262.73 tok/s,且每一步都保持稳定增长。吞吐量从第 1 批次到第 8 批次几乎翻了一番,并在第 32 批次和第 64 批次中持续攀升,未出现饱和迹象。

预填充重型设备从 237.62 tok/s 开始,到批次大小 64 时增长到 2,376.88 tok/s。整个批次扫描过程中,产能持续增长,扩展性强劲且稳步提升。

解码重任务的速度范围为 30.39 至 538.18 tok/s,在整个批次扫描过程中持续增长。

GPU 直接存储

我们在 Spark 上进行的测试之一是 MagnumIO GPU 直接存储 (GDS) 测试。GDS 是 NVIDIA 开发的一项功能,允许 GPU 在访问存储在 NVMe 驱动器或其他高速存储设备上的数据时绕过 CPU。GDS 无需通过 CPU 和系统内存路由数据,而是支持 GPU 和存储设备之间的直接通信,从而显著降低延迟并提高数据吞吐量。

宏碁 Veriton GN100 AI 内部使用了 4TB 三星 PM9E1 Gen5 SSD,这是我们迄今为止在市场上见过的速度最快的 2242 M.2 硬盘。

GPU 直接存储的工作原理

传统上,当GPU处理存储在NVMe驱动器上的数据时,数据必须先经过CPU和系统内存才能到达GPU。由于CPU充当中间人,这个过程会造成性能瓶颈,增加延迟并消耗宝贵的系统资源。GPU直接存储(GPU Direct Storage)通过允许GPU直接通过PCIe总线访问存储设备中的数据,消除了这种低效。这种直接路径减少了数据传输的开销,从而实现了更快、更高效的数据传输。

AI 工作负载(尤其是涉及深度学习的工作负载)是高度数据密集型的。训练大型神经网络需要处理数 TB 的数据,数据传输的任何延迟都可能导致 GPU 利用率不足和训练时间延长。GPU Direct Storage 通过确保尽快将数据传送到 GPU、最大限度地减少空闲时间并最大限度地提高计算效率来解决这一挑战。

此外,GDS 对于涉及流式传输大型数据集的工作负载(例如视频处理、自然语言处理或实时推理)尤其有益。通过减少对 CPU 的依赖,GDS 可加速数据移动并释放 CPU 资源以用于其他任务,从而进一步提高整体系统性能。

GDSIO 读取吞吐量 16k

从 GDSIO 16K 读取吞吐量来看,Acer 平台在单线程时吞吐量为 0.07 GiB/s,并随着线程数的增加呈线性增长,双线程(0.13 GiB/s)、四线程(0.26 GiB/s)和八线程(0.57 GiB/s)的吞吐量也随之增加。在 16 线程(1.16 GiB/s)、32 线程(2.16 GiB/s)和 64 线程(4.34 GiB/s)时,吞吐量继续攀升。在 128 线程时,吞吐量达到 6.91 GiB/s,这是本次测试中观察到的最高值,且没有明显的饱和点,表明该平台在小 I/O 规模下仍能保持良好的性能。

GDSIO 读取平均延迟 16K

从 GDSIO 读取平均延迟 (16K) 来看,Acer 的延迟在 1 个线程时约为 0.22 毫秒,并在整个测试过程中保持了惊人的稳定性:2 个线程时为 0.23 毫秒,4 个线程时为 0.24 毫秒,8 个线程时为 0.22 毫秒。延迟在 16 个线程 (0.21 毫秒)、32 个线程 (0.23 毫秒) 和 64 个线程 (0.22 毫秒) 时也保持相对平稳,直到 128 个线程时才略微上升至 0.28 毫秒。这种在所有线程数下都保持近乎平稳的延迟特性,反映了吞吐量持续的扩展性。

GSDIO 写入吞吐量 16K

从 GDSIO 16K 写入吞吐量来看,Acer 的吞吐量在 1 线程时为 0.07 GiB/s,随着线程数的增加,在 2 线程(0.14 GiB/s)、4 线程(0.28 GiB/s)和 8 线程(0.55 GiB/s)时有所提升。在 16 线程(1.13 GiB/s)、32 线程(2.81 GiB/s)和 64 线程(5.23 GiB/s)时,吞吐量增长速度加快。在 128 线程时,吞吐量达到峰值 6.60 GiB/s,再次表明吞吐量没有明显的饱和现象,并且在小数据块大小下仍能持续提升。

GDSIO 写入平均延迟 16K

从 GDSIO 写入平均延迟(16K)来看,Acer 的延迟在 1 个线程时约为 0.22 毫秒,在 2 个线程(0.21 毫秒)、4 个线程(0.22 毫秒)和 8 个线程(0.22 毫秒)时保持稳定。在 32 个线程时,延迟略微下降至 0.17 毫秒,然后在 64 个线程时小幅上升至 0.19 毫秒。在 128 个线程时,延迟攀升至 0.30 毫秒,与 1M 的结果相比仍然相对较低,这与在这种较小的 I/O 规模下持续的扩展特性一致。

GDSIO 读取吞吐量 1M

从 GDSIO 读取吞吐量 1M 测试来看,Acer 平台在单线程下初始吞吐量为 2.64 GiB/s,双线程下为 5.10 GiB/s,四线程下为 9.80 GiB/s。八线程时吞吐量达到 11.23 GiB/s,之后平台性能基本达到饱和。在 16 线程(11.22 GiB/s)、32 线程(11.21 GiB/s)和 64 线程(11.15 GiB/s)下,性能保持稳定,呈现平台期。在 128 线程时,吞吐量稳定在 11.19 GiB/s,证实了整个测试范围内性能已达到饱和上限。

GDSIO 读取平均延迟 1M

从 GDSIO 读取平均延迟(1M)来看,Acer 的延迟在 1 个线程时约为 0.37 毫秒,在 2 个线程(0.38 毫秒)和 4 个线程(0.40 毫秒)时也保持相近水平。延迟随着并发量的增加而增加,在 8 个线程时上升至 0.70 毫秒,16 个线程时上升至 1.39 毫秒,32 个线程时上升至 2.79 毫秒。延迟在 64 个线程时继续上升(5.60 毫秒),并在 128 个线程时达到 11.17 毫秒,这与峰值并发量相对应,而吞吐量基本保持稳定。

GDSIO 写入吞吐量 1M

从 GDSIO 写入吞吐量 1M 测试来看,Acer 平台在单线程下初始吞吐量为 2.79 GiB/s,并随着线程数的增加而显著提升,在双线程下达到 5.84 GiB/s,在四线程下达到 10.72 GiB/s。当线程数达到 8 时,吞吐量达到 12.20 GiB/s,平台性能基本达到饱和。在 16 线程(12.25 GiB/s)、32 线程(12.24 GiB/s)和 64 线程(12.23 GiB/s)下,性能保持稳定,呈现平稳状态。然而,当线程数达到 128 时,吞吐量显著下降至 8.94 GiB/s,表明在最高并发级别下出现了资源争用或资源耗尽的情况。

GDSIO 写入平均延迟 1M

从 GDSIO 写入平均延迟(1M)来看,Acer 的延迟在 1 个线程时约为 0.35 毫秒,在 2 个线程(0.33 毫秒)和 4 个线程(0.36 毫秒)时也保持较低水平。延迟随着并发数的增加而上升,在 8 个线程时达到 0.64 毫秒,16 个线程时达到 1.28 毫秒,32 个线程时达到 2.55 毫秒。这种上升趋势在 64 个线程时继续(5.11 毫秒),并在 128 个线程时急剧攀升至 13.98 毫秒,这与在最大并发数下观察到的吞吐量下降相一致。

结语

在我们的Spark对比测试中,宏碁Veriton GN100的整体散热表现最佳。在密集型预填充转换和持续解码工作负载下,它的CPU和GPU峰值温度始终低于其他测试机型。在负载运行时,它的温度并没有像其他机型那样飙升至80°C以上,而是在长时间运行过程中保持在较为稳定的温度范围内,这表明其散热设计和电源调校都非常出色。

宏碁 Veriton GN100 AI 侧盖拆卸

存储性能是另一大优势。GN100 配备了 4TB 三星 PM9E1 Gen5 SSD,在同组产品中实现了最强的 GPU 直接存储 (GPU Direct Storage) 小块数据扩展。在 16K 数据块大小下,读写延迟在不同线程数下保持了极低的水平,而吞吐量则平滑地提升至图表顶部。在 1 万次传输时,该平台迅速达到性能饱和,并在中等并发水平下保持了极具竞争力的性能上限,之后在高线程数下性能有所下降。

在 vLLM 推理测试中,其性能与更广泛的 Spark 生态系统保持高度一致,这符合预期,因为它们都基于 GB10 架构。性能差异并非体现在原始计算输出上,而是体现在负载下的散热和存储行为上。

Spark 产品线架构的一致性确保了推理性能的紧密衔接。GN100 在此轮测试中脱颖而出,其持续低温度运行特性以及强大的第五代 NVMe 性能使其成为我们迄今为止测试过的散热效率最高、存储性能最强的产品之一。

产品页面 – Acer Veritron GN 100 AI

排行榜:在我们的“最佳本地 AI 台式机”排行榜上,Acer Veriton GN100 占据了“最佳 GB10 实现”的宝座。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

迪伦·多尔蒂

IT 专业人士,专长于网络管理,同时也是 StorageReview 的撰稿人。