存储评论网

AMD Ryzen AI Halo 评测:双系统、200 亿参数台式机挑战 DGX Spark

电子消费品  ◇  打标工作站

AMD的芯片或许是先行者:早在NVIDIA进入市场之前,Strix Halo迷你PC和笔记本电脑就已经配备了128GB的统一内存。但本地AI桌面这一概念实际上是NVIDIA开创的,当时他们将一颗Grace Blackwell超级芯片装进一个一升大小的盒子里,并命名为DGX Spark。其理念很简单:一台面向开发者的机器,拥有足够的统一内存来运行强大的模型,可以放在桌面上,而不是像DGX Spark那样按流量计费。AMD Ryzen AI Halo正是AMD对标DGX Spark的回应。AMD于2026年5月与Ryzen AI Max PRO 400系列一同发布了这款产品;6月起,Micro Center独家开启预售,7月10日正式发售。Ryzen AI Halo拥有类似的尺寸、128GB的统一内存、3,999美元的售价,以及一些使其与Spark截然不同的设计。

AMD Ryzen AI Halo 正面图。

AMD 将 Halo 定位为其首款 AI 开发平台,旨在为开发者提供快速便捷的本地 AI 构建和运行途径。其核心搭载 Ryzen AI Max+ 395 处理器,这是一款 16 核 32 线程的“Zen 5”架构处理器,集成 Radeon 8060S 显卡(40 个 RDNA 3.5 计算单元)和一颗 50 TOPS 的 XDNA 2 NPU,AMD 宣称该平台可提供高达 126 TOPS 的综合 AI 吞吐量。128GB 的​​ LPDDR5x 内存运行频率为 8000 MT/s,提供 256 GB/s 的带宽,整个平台通过一个 120W 的 USB-C 接口供电。AMD 表示,该内存池足以容纳高达 200 亿个参数的模型。它是一个完整的 x86 迷你工作站,而这正是其最关键的差异所在。

区别就在于Windows系统。Spark运行的是NVIDIA基于Linux的DGX操作系统,除此之外别无其他;而Halo在相同的硬件上可以启动Windows 11或AMD的Linux开发者镜像。原生Windows支持是我们从关注Spark的用户那里听到的最普遍的需求,这也重新定义了这款产品的目标用户群体。AMD自身的定位也印证了这一点:Windows和Linux双系统,而Spark目前仅支持Linux(至少目前如此)。

Halo 与 Spark 的区别还在于三项决策,每一项都针对我们之前收到的关于 Spark 的投诉。Halo 采用的是标准的 M.2 2280 SSD,而非 Spark 使用的不太常见的 2242 固态硬盘,这为想要更换硬盘的用户提供了更丰富的第三方选择,包括 8TB 容量。Halo 出厂时,可变显存 (VGA) 已预设为在两种操作系统下的最大分配量,因此无需手动调整即可加载大型模型。此外,Halo 的机箱周围还环绕着一个带指示灯的状态环,这弥补了部分用户收到的 Spark 机型(具体情况取决于 OEM 厂商)的暗淡无光设计。AMD 这种设计的成本体现在机箱背面,那里没有高速互连,只有 10GbE 接口,这限制了多节点集群的功能。这些都是权衡取舍,也决定了这台机器在任何基准测试运行之前所针对的工作负载。

AMD Ryzen AI Halo 拆解。

价格方面,细节至关重要。配备 2TB SSD 的 Halo 售价为 3,999 美元,与入门级 Spark 系统的市场价基本持平。但具体价格取决于你指的是哪款 Spark。NVIDIA 自家的 DGX Spark 配备更大容量的硬盘,售价接近 4,700 美元,这与 LPDDR5X 和 NAND 闪存的供应紧张有关。华硕和其他厂商的入门级 Grace Blackwell 系统售价仍在 4,000 美元左右,目前在亚马逊上仍有售(关联链接)。与同类产品相比,Halo 的价格处于同级水平,其优势在于上述因素,而非价格上的竞争优势。

我们在 Windows 和 Linux 系统上使用 StorageReview 的本地 AI 套件对 Halo 进行了测试,并将测试结果与设计和软件分析一起呈现在本评测中。

关键精华

  • 双操作系统的x86方案: Ryzen AI Halo 是 Spark 类别中唯一一款可以在完整的 x86 平台上启动 Windows 11 或 Linux 的盒子,售价 3,999 美元,配备 2TB SSD,而 DGX Spark Founders Edition 的售价为 4,699 美元。
  • 用于存储大型模型的内存: 128GB LPDDR5x-8000 统一内存,速度为 256GB/s,支持本地高达 200 亿个参数的模型,可变图形内存经过预调校,因此大型模型无需手动配置即可加载。
  • 我们测试过的最强 Ryzen AI Max+ 395: Halo 在几乎所有 Windows 工作负载中都胜过了 HP Z2 Mini G1a 和 ZBook Ultra G1a,包括 Cinebench R23 多核 37,316 分、7-Zip 184.2 GIPS,以及领先的 Procyon AI 文本生成 (Phi 1,192) 和图像生成 (SD 1.5 FP16 937) 分数。
  • CPU优势,推理劣势(相对于Spark): 在 Linux 系统上,Halo 在 CPU 性能方面完全胜过 DGX Spark,在 7-Zip 中压缩速度快 11%,解压缩速度快 38%,LLVM 编译速度也快了 14%,但在大多数 vLLM 服务场景中,在高并发情况下,Halo 的性能落后于 DGX Spark 2 到 4 倍,在预填充量大的 GPT OSS 120B 工作中,性能差距甚至达到了 8.8 倍。
  • 存储功能尚可,网络性能一般: 标准的 M.2 2280 插槽允许后续升级到 8TB,但该平台的设计会将内置的 Gen5 Micron 4600 协商到 Gen4,而且由于没有高速交换矩阵,单个 10GbE 端口无法实现 Spark 的 200G ConnectX-7 所支持的多节点集群。

规格

规格 AMD Ryzen AI Halo 系统
处理器
中央处理器 AMD Ryzen™ AI Max+ 395 处理器
16 核/32 线程(Zen 5 架构)
GPU AMD Radeon™ 8060S 集成显卡
40 个计算单元(RDNA™ 3.5 架构)
NPU AMD XDNA™ 2 NPU
内存
内存类型 LPDDR5x
内存容量 128GB
记忆体速度 8000MT /秒
内存带宽 256GB /秒
存放
存放 2TB M.2 NVMe SSD (SED)
网络与连接
以太网(EtherNet) 1 × 10GbE
Wi-Fi WiFi7
蓝牙 蓝牙5.4
I / O
USB 3 个 USB-C 接口,1 个 USB-C 接口(电源输入)
显示输出 1×HDMI 2.1b
系统
TDP 120W
运行系统 Linux 或 Windows 11
尺寸 150×150×45.4毫米(5.9×5.9×1.79英寸)
重量 小于 1.2 公斤(2.65 磅)

AMD Ryzen AI Halo 的构建和设计

AMD Ryzen AI Halo 系统采用类似 NVIDIA Spark 的紧凑型设计,尺寸仅为 150 × 150 × 45.4 毫米,重量不足 1.2 千克(2.65 磅)。铝制机箱顶部和正面采用醒目的几何通风图案,不仅赋予系统独特的外观,还能最大限度地提高散热系统的气流效率。尽管体积小巧,但该平台被设计成功能齐全的桌面 AI 工作站,能够处理工作站应用程序、本地 LLM 推理和 AI 开发工作负载。

面前

系统正面设计简洁,几乎完全由一块横跨机箱宽度的网状通风格栅构成。AMD并没有在正面设置接口,而是将这部分空间用于气流流通,让冷空气通过大面积的网状进气口进入系统,同时保持正面的整洁。机箱底部的银色装饰条与哑光黑色的外壳形成微妙的视觉对比。

后端I / O

AMD Ryzen AI Halo 后部连接。

所有外部接口均位于系统后部。从左到右,后面板包括以下部件:

  • USB-C 电源输入
  • 支持 DisplayPort Alt Mode 的 USB-C 端口
  • 两个额外的 USB-C 端口
  • HDMI 2.1b 输出
  • 10GbE RJ45 以太网
  • Kensington 安全锁插槽

该系统提供三个 USB-C 数据端口和一个专用的 USB-C 电源接口,可同时连接多个高速外设和显示器。HDMI 2.1b 提供原生显示输出,而集成的 10GbE 以太网接口使该平台非常适合高速 NAS 连接、AI 数据集传输和本地开发环境。

内部设计

Ryzen AI Halo 的底部有一个大的穿孔通风口,可以吸入空气来冷却安装在主板底部的组件,四个角上的橡胶脚垫使设备在桌子或架子上保持稳定。

AMD Ryzen AI Halo 底部。

拧下固定底盖的四颗螺丝,即可看到 M.2 SSD 插槽和一些系统下部主板组件,包括 Wi-Fi 网卡接口。在我们评测的这台机器中,该插槽安装了一块 Micron 4600 2TB Gen5 x4 SSD,而黑色胶贴则将主板的其他部分与裸露的底面隔开。

AMD Ryzen AI Halo 底盖已移除。

在散热方面,AMD 采用了与 NVIDIA DGX Spark 类似的方法,使用双风扇将空气吸入散热片,然后从机箱后部排出。

AMD Ryzen AI Halo散热器和风扇。

拆下散热组件后,主板便映入眼帘,中央是APU核心,两侧是内存封装,左侧边缘则是VRM电路。核心上可见的银色方块并非液态金属或膏状导热材料,而是AMD在核心与散热器之间涂覆的固体导热垫或涂层的残留物。这解释了它为何呈现均匀干燥的外观,而非膏状或液态金属通常留下的湿漉漉的痕迹。

AMD Ryzen AI Halo 主板。

翻转散热器即可看到其冷板的底部,那里有一块镜面抛光区域与芯片直接接触。同时,周围的内存和供电区域都预先贴有厚度不一的导热垫。

AMD Ryzen AI Halo散热器底部视图。

AMD Ryzen AI Halo 性能测试

我们对 AMD Ryzen AI Halo 平台在 Windows 和 Linux 系统上的性能进行了评估,以考察其在工作站应用和 AI 相关工作负载中的性能。在 Windows 测试中,我们将 AMD Ryzen AI Halo 系统与两款搭载 Ryzen AI Max+ PRO 395 处理器的商用系统进行了比较:一款是紧凑型台式工作站 HP Z2 Mini G1a,另一款是移动工作站 HP ZBook Ultra G1a 14 英寸。由于这三款系统采用相同的底层处理器架构和 Radeon 8060S 集成显卡,因此这些比较突显了 Halo 平台在不同散热环境和系统设计下的性能表现。

AMD Ryzen AI Halo 顶盖拆卸后的后视图。

在 Linux 测试中,我们转向了 AI 开发和存储工作负载,将 Ryzen AI Halo 系统与 NVIDIA DGX Spark 进行了比较。这些测试侧重于 FIO 存储基准测试和 vLLM 推理性能,比较了 AMD 基于 Ryzen AI Halo 的开发者平台与 NVIDIA 专为本地大型语言模型推理而构建的 AI 开发系统。

测试单元

UL Procyon:人工智能计算机视觉

Procyon AI 计算机视觉基准测试能够深入剖析 AI 推理引擎在专业级的性能表现。它整合了多家厂商的引擎,提供的性能评分能够准确反映设备的实际能力。该基准测试通过比较不同硬件类型(包括 CPU、GPU 和 NPU)的 AI 加速性能,评估最先进的神经网络模型,使用户能够评估其在各种工作负载和条件下的相对效率。

为了反映真实世界的AI工作负载,该基准测试使用了六种不同的神经网络模型,每种模型都因其与现代计算机视觉任务的相关性而被选中。MobileNet V3 是一款紧凑的、专注于移动设备的模型,专为图像中的主体识别而设计;而 Inception V4 则以更深、更复杂的架构执行相同的任务。

YOLO V3(You Only Look Once)专注于通过估计目标概率进行实时目标检测。基于 MobileNet V2 构建的 DeepLab V3 则侧重于语义图像分割和像素聚类。Real-ESRGAN 是计算量最大的测试模型,它将图像从 250×250 分辨率放大到 1,000×1,000 分辨率。最后,ResNet 50 是一种鲁棒的分类模型,能够更有效地训练深度神经网络。

Ryzen AI Halo平台在CPU和GPU工作负载下均展现出强劲的AI推理性能。在CPU测试中,其总分为216分,略低于HP Z2 Mini的227分,并轻松超越HP ZBook Ultra的186分。GPU推理表现更为出色,Halo系统以553分的总分位居榜首,领先于ZBook Ultra(528分)和Z2 Mini(528分)。此外,它还创下了最快MobileNet V3推理速度,仅需0.38毫秒,并在185.08毫秒内完成了高要求的REAL-ESRGAN工作负载测试,而Z2 Mini和ZBook Ultra的测试时间分别为211.76毫秒和200.40毫秒。

UL Procyon:AI 计算机视觉推理(越低越好) AMD Ryzen AI Halo(Ryzen AI Max+ 395 | Radeon 8060S) HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
CPU 时间
AI计算机视觉总体评分(越高越好) 216 227 186
移动网络 V3 0.73毫秒 0.75毫秒 1.09毫秒
残差网络 50 6.02毫秒 5.99毫秒 6.84毫秒
盗梦空间V4 17.18毫秒 17.12毫秒 19.80毫秒
深实验室V3 29.21毫秒 21.20毫秒 28.27毫秒
优洛V3 35.60毫秒 36.58毫秒 41.64毫秒
真爱斯甘 1,931.13毫秒 1,892.10毫秒 2,138.97毫秒
GPU时代
AI计算机视觉总体评分(越高越好) 553 528 583
移动网络 V3 0.38毫秒 0.42毫秒 0.46毫秒
残差网络 50 4.04毫秒 3.85毫秒 3.27毫秒
盗梦空间V4 13.26毫秒 15.15毫秒 11.62毫秒
深实验室V3 12.72毫秒 10.98毫秒 10.72毫秒
优洛V3 11.17毫秒 12.64毫秒 10.57毫秒
真爱斯甘 185.08毫秒 211.76毫秒 200.40毫秒

UL Procyon:AI 文本生成

Procyon AI 文本生成基准测试通过提供简洁一致的评估方法,简化了 AI LLM 性能测试。它支持对多个 LLM 模型进行重复测试,同时最大限度地降低了大型模型规模和可变因素带来的复杂性。该基准测试由 Procyon 与 AI 硬件领域的领先企业合作开发,优化了本地 AI 加速器的使用,从而实现更可靠、更高效的性能评估。以下结果使用 TensorRT 进行测量。

在Procyon AI文本生成测试中,Ryzen AI Halo参考平台在所有测试的语言模型中表现最佳。其Phi总分高达1,192分,远超HP Z2 Mini的965分和HP ZBook Ultra的922分。Mistral也表现出色,得分998分,领先于850分和829分。Llama3的得分为847分,也优于其他两款得分分别为766分和756分的竞争系统。Halo平台还缩短了所有型号的首令牌生成时间,仅需0.996秒即可生成第一个Phi令牌,延迟几乎是HP系统的一半。虽然Z2 Mini在令牌生成吞吐量方面略胜一筹,但Halo平台显著更低的启动延迟使其获得了最佳的整体基准测试成绩。

UL Procyon:AI 文本生成 AMD Ryzen AI Halo
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
菲总分 1,192 965 922
Phi 输出时间到第一个标记 0.996秒 1.898秒 1.956秒
每秒输出 Phi 令牌数 55.271 个代币/秒 68.967 个代币/秒 64.986 个代币/秒
Phi 总时长 56.237秒 52.666秒 55.501秒
米斯特拉尔总成绩 998 850 829
Mistral 输出第一个令牌的时间 1.603秒 2.734秒 2.783秒
每秒 Mistral 输出代币数 35.027 个代币/秒 43.358 个代币/秒 41.992 个代币/秒
米斯特拉尔总持续时间 88.582秒 81.716秒 84.065秒
Llama3 总体评分 847 766 756
Llama3 输出第一个标记的时间 1.963秒 2.545秒 2.578秒
Llama3 每秒输出令牌数 34.630 个代币/秒 36.752 个代币/秒 36.243 个代币/秒
Llama3 总时长 92.026秒 91.987秒 93.200秒
Llama2 总体评分 936 929
Llama2 输出第一个标记的时间 不适用秒 3.813秒 3.860秒
Llama2 每秒输出令牌数 N/A 代币/秒 24.685 个代币/秒 24.619 个代币/秒
Llama2 总时长 不适用秒 136.077秒 136.720秒

UL Procyon: 人工智能图像生成

Procyon AI 图像生成基准测试提供了一种一致且准确的方法,用于衡量从低功耗 NPU 到高端 GPU 等各种硬件的 AI 推理性能。它包含三项测试:针对高端 GPU 的 Stable Diffusion XL (FP16)、针对中等性能 GPU 的 Stable Diffusion 1.5 (FP16) 以及针对低功耗设备的 Stable Diffusion 1.5 (INT8)。该基准测试会针对每个系统使用最佳推理引擎,从而确保结果的公平性和可比性。

图像生成被证明是 Ryzen AI Halo 最强的工作负载之一。在 Stable Diffusion 1.5 FP16 测试中,Halo 平台获得了 937 分的总分,而 Z2 Mini 和 ZBook Ultra 的得分分别为 725 分和 648 分;同时,Halo 的图像生成时间也缩短至 106.7 秒,而 Z2 Mini 和 ZBook Ultra 的生成时间分别为 137.8 秒和 154.2 秒。Stable Diffusion XL 测试同样展现了强大的优势,Halo 系统仅用时 878.5 秒就完成了测试,比 Z2 Mini 快了约 174 秒,比 ZBook Ultra 快了超过 450 秒。此外,该平台还以 9,158 分的总分完成了 Stable Diffusion 1.5 INT8 基准测试,而 HP 的两款对比系统均未提供此测试。

UL Procyon:人工智能图像生成 AMD Ryzen AI Halo
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
稳定扩散 1.5 (FP16) – 总体得分 937 725 648
稳定扩散 1.5 (FP16) – 总时间 106.7秒 137.815秒 154.203秒
稳定扩散 1.5 (FP16) – 图像生成速度 6.670 秒/图像 8.613 秒/图像 9.638 秒/图像
稳定扩散 1.5 (INT8) – 总体得分 9,158
稳定扩散 1.5 (INT8) – 总时间 27.298秒
稳定扩散 1.5 (INT8) – 图像生成速度 3.412 秒/图像
稳定扩散 XL (FP16) – 总体得分 682 570 451
稳定扩散 XL (FP16) – 总时间 878.493秒 1,052.468秒 1,329.592秒
稳定扩散 XL (FP16) – 图像生成速度 54.906 秒/图像 65.779 秒/图像 83.100 秒/图像

规格工作站 4

SPECworkstation 4.0 基准测试是一款综合性工具,用于评估工作站性能的所有关键方面。它提供 CPU、图形、加速器和磁盘性能的实际测量数据,为专业人士提供所需的数据,以便他们做出明智的硬件投资决策。该基准测试包含一套专门针对 AI 和 ML 工作负载的测试,例如数据科学任务和基于 ONNX 运行时的推理测试,这反映了 AI/ML 在工作站环境中日益增长的重要性。它涵盖七个行业垂直领域和四个硬件子系统,能够提供对当今工作站性能的详细且相关的衡量标准。

SPECworkstation 4 测试凸显了 Ryzen AI Halo 平台均衡的工作站性能。它在金融服务 (2.92)、媒体与娱乐 (2.97)、产品设计 (2.22) 以及生产力与开发 (1.27) 四个类别中均取得了最高分,超越了 HP Z2 Mini 和 HP ZBook Ultra。Z2 Mini 在能源 (2.50 对 2.35) 和生命科学 (2.60 对 2.33) 两个类别中略占优势。总体而言,Halo 参考平台在基准测试的专业工作负载中表现出色,并在所有测试类别中都保持了竞争力。

SPECworkstation 4.0.0(越高越好) AMD Ryzen AI Halo
(Ryzen AI Max+ 395 | Radeon 8060S)
 

HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S)

 

HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
新能源 2.35 2.50 2.20
金融服务 2.92 2.35 1.60
生命科学 2.33 2.60 2.20
媒体与娱乐 2.97 2.22 1.90
产品设计 2.22 2.00 1.74
生产力与发展 1.27 1.00 1.03

乐士马克

Luxmark 是一款 GPU 基准测试软件,它使用开源光线追踪渲染器 LuxRender 来评估系统在处理高精度 3D 场景时的性能。该基准测试软件可用于评估服务器和工作站的图形渲染能力,尤其适用于视觉特效和建筑可视化应用,因为在这些应用中,精确的光照模拟至关重要。

Luxmark 的测试结果显示,三款搭载 Ryzen AI Max+ 395 处理器的平台之间的性能差异微乎其微。Halo 参考系统在 Food 测试中取得了最高的 4,158 分,略高于 Z2 Mini (3,943) 和 ZBook Ultra (3,915)。在 Hallbench 工作负载测试中,其得分为 8,014,略低于 Z2 Mini 的 8,477 分,但高于 ZBook Ultra 的 7,833 分。总体而言,测试结果表明,无论采用何种外形尺寸,搭载 Radeon 8060S 显卡的系统都能提供非常相似的光线追踪性能。

Luxmark(越高越好) AMD Ryzen AI Halo
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
大厅长凳 8,014 8,477 7,833
食品 4,158 3,943 3,915

7-Zip 压缩

7-Zip 压缩基准测试评估 CPU 在压缩和解压缩过程中的性能,以 GIPS(每秒千兆指令数)和 CPU 使用率来衡量性能。更高的 GIPS 和更高效的 CPU 使用率表明性能更优。

在 7-Zip 基准测试中,Ryzen AI Halo 平台在所有主要类别中均名列前茅。其压缩率高达 176.7 GIPS,远超 HP Z2 Mini 的 139.3 GIPS 和 ZBook Ultra 的 139.6 GIPS。解压缩性能同样强劲,达到 191.6 GIPS,超过了 Z2 Mini 的 164.0 GIPS 和 ZBook Ultra 的 174.0 GIPS。综合来看,Halo 平台取得了 184.2 GIPS 的最高综合评分,比竞争对手高出约 20%,在归档创建和提取工作负载方面展现了卓越的整数吞吐量。

7-Zip 压缩基准(越高越好) AMD Ryzen AI Halo
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
压缩
当前 CPU 使用率 2,741% 2,734% 2,868%
电流额定值/使用 6.370 吉普斯 5.136 吉普斯 4.883 吉普斯
额定电流 174.589 吉普斯 140.405 吉普斯 140.061 吉普斯
产生的 CPU 使用率 2,751% 2,718% 2,855%
结果评级/使用 6.424 吉普斯 5.126 吉普斯 4.890 吉普斯
结果评级 176.742 吉普斯 139.298 吉普斯 139.617 吉普斯
解压
当前 CPU 使用率 2,568% 2,343% 2,904%
电流额定值/使用 7.670 吉普斯 6.805 吉普斯 6.029 吉普斯
额定电流 196.986 吉普斯 159.451 吉普斯 175.104 吉普斯
产生的 CPU 使用率 2,469% 2,414% 2,887%
结果评级/使用 7.766 吉普斯 6.793 吉普斯 6.028 吉普斯
结果评级 191.645 吉普斯 163.969 吉普斯 174.046 吉普斯
总评分
总 CPU 使用率 2,610% 2,566% 2,871%
总评分/使用情况 7.095 吉普斯 5.959 吉普斯 5.459 吉普斯
总评分 184.194 吉普斯 151.634 吉普斯 156.832 吉普斯

搅拌机基准

Blender 是一款开源的 3D 建模应用程序。此基准测试使用 Blender Benchmark 工具运行。得分以每分钟采样数衡量,数值越高表示性能越好。

CPU渲染是Ryzen AI Halo的另一大优势。在Monster场景中,其每分钟采样数达到244.7,领先于HP Z2 Mini(224.3)和HP ZBook Ultra(189.3)。Junkshop场景紧随其后,每分钟采样数为159.4,高于149.5和129.4。Classroom场景的每分钟采样数为131.6,比Z2 Mini(116.3)高出约13%,比ZBook Ultra(94.1)高出近40%。这些结果表明,Ryzen AI Max+ 395尽管体积小巧,却能提供出色的多线程渲染性能。

Blender 基准 CPU(每分钟样本数,越高越好) AMD Ryzen AI Halo
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
怪物 244.7 个样本/米 224.3 个样本/米 189.29 个样本/米
旧货店 159.4 个样本/米 149.5 个样本/米 129.42 个样本/米
课堂 131.6 个样本/米 116.3 个样本/米 94.14 个样本/米

各系统间的GPU渲染结果非常接近。Halo参考平台在Monster场景下的渲染速度为每分钟704.2个采样点,略低于Z2 Mini(745.6),但高于ZBook Ultra(661.5)。Junkshop场景的渲染速度在Halo平台(366.6)和Z2 Mini(366.5)之间基本持平。同时,Halo系统在Classroom场景的渲染速度最高,达到每分钟361.5个采样点,略高于Z2 Mini(359.0)和ZBook Ultra(333.3)。结果表明,Radeon 8060S在不同实现方式下均能提供极其稳定的GPU渲染性能。

Blender 基准 GPU(每分钟样本数,越高越好) AMD Ryzen AI Halo
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
怪物 704.2 个样本/米 745.55 个样本/米 661.50 个样本/米
旧货店 366.6 个样本/米 366.54 个样本/米 341.92 个样本/米
课堂 361.51 个样本/米 359.01 个样本/米 333.26 个样本/米

y 粉碎机

y-cruncher 是一款多线程、可扩展的程序,能够计算圆周率和其他数学常数,精度可达万亿位小数。自 2009 年发布以来,它已成为超频玩家和硬件爱好者常用的基准测试和压力测试工具。

y-cruncher 的测试结果随计算规模而变化。在 10 亿位和 2.5 亿位的计算中,三款系统的完成时间相差无几秒,其中 HP 系统略胜一筹。随着工作负载的增加,Halo 逐渐拉开差距,以 71.948 秒完成 1 亿位的计算,而 Z2 Mini 和 ZBook Ultra 的完成时间分别为 75.021 秒和 78.19 秒。在 5 亿位的计算中,Halo 的完成时间为 151.409 秒,比 Z2 Mini 快约 6%,比 ZBook Ultra 快约 12%,这表明随着运行时间的延长,台式机机箱能够更好地承受繁重的多线程负载。

Y-Cruncher(总计算时间) AMD Ryzen AI Halo
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
1亿 13.193秒 12.965秒 12.93秒
2.5亿 34.578秒 34.533秒 34.91秒
5亿 71.948秒 75.021秒 78.19秒
10亿 151.409秒 160.252秒 171.72秒

Geekbench 6

Geekbench 6 是一款跨平台基准测试软件,用于衡量系统整体性能。

Geekbench 6 测试结果进一步印证了 Halo 平台均衡的性能表现。其单核得分高达 2,986 分,领先于 HP Z2 Mini (2,862) 和 ZBook Ultra (2,825)。多核性能同样以 18,068 分领跑。Radeon 8060S 显卡在 OpenCL GPU 测试中取得了 92,883 分的最高分,略微超过 Z2 Mini (91,591),并轻松超越 ZBook Ultra (85,337)。CPU 和 GPU 测试的持续领先优势,充分展现了 Ryzen AI Max+ 395 平台的全面性能。

Geekbench 6(越高越好) AMD Ryzen AI Halo
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
CPU单核 2,986 2,862 2,825
CPU 多核 18,068 17,210 17,562
GPU OpenCL 92,883 91,591 85,337

Cinebench R23

Cinebench R23 是一款广受认可的基准测试软件,用于评估 CPU 在 3D 渲染工作负载中的性能。它基于 Cinema 4D 引擎,能够衡量处理器处理单线程和多线程任务的能力,从而深入了解其整体响应速度和并行处理能力。

Cinebench R23 测试显示,两款搭载 Ryzen AI Max+ 395 处理器的桌面级产品之间的竞争非常激烈。Halo 参考平台的多核得分为 37,316,略微领先于 HP Z2 Mini 的 37,156,而两款产品均轻松超越了 HP ZBook Ultra 的 29,112。单核性能也呈现出同样的趋势,Halo 平台得分为 2,047,而 Z2 Mini 和 ZBook Ultra 的得分分别为 2,020 和 1,984。尽管与 Z2 Mini 的差距不大,但 Halo 系统始终在基准测试中名列前茅。

Cinebench R23(越高越好) AMD Ryzen AI Halo
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
多核 37,316 37,156 29,112
单核 2,047 2,020 1,984

Cinebench 2024

Cinebench 2024 在 R23 的基础上引入了基于 GPU 的渲染测试,同时仍然专注于 CPU 性能。在本部分,我们仅考察 CPU 得分,以便更深入地了解各个系统处理现代 3D 渲染任务的能力。

最新的 Cinebench 2024 基准测试结果与 R23 的结果相符。Ryzen AI Halo 的多核得分最高,达到 1,916 分,略微领先于 HP Z2 Mini(1,906 分),并大幅领先于 HP ZBook Ultra(1,579 分)。单核性能方面,Halo 平台同样表现出色,得分为 116 分,而 Z2 Mini 和 ZBook Ultra 分别为 112 分和 111 分。虽然各台式机系统之间的差距仍然很小,但测试结果再次证明了 Ryzen AI Max+ 395 能够持续提供顶级的 CPU 渲染性能。

Cinebench 2024(越高越好) AMD Ryzen AI Halo
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a(锐龙 AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14 英寸(锐龙 AI Max+ PRO 395 | Radeon 8060S)
多核 1,916 1,906 1,579
单核 116 112 111

Phoronix 基准测试

Phoronix 测试套件是一个开源的自动化基准测试平台,支持超过 450 种测试配置文件和 100 多个测试套件(通过 OpenBenchmarking.org)。它能够处理从安装依赖项到运行测试和收集结果的所有步骤,因此非常适合性能比较、硬件验证和持续集成。我们将重点关注 Stream、7-Zip 和 LLVM 测试中的性能表现。

通过 Phoronix 基准测试套件,我们发现 AMD Ryzen AI Halo 平台和 NVIDIA DGX Spark 的性能表现相当接近。Ryzen AI Halo 系统在以 CPU 为中心的工作负载中始终领先,在 7-Zip 压缩测试中比 DGX Spark 快 11%,在 7-Zip 解压缩测试中快 38%,并且在 LLVM 编译测试中也快了 14%。另一方面,DGX Spark 展现了更强的持续内存带宽,在 STREAM Scale、Triad 和 Add 测试中分别领先 17%、13% 和 15%。Halo 在 STREAM Copy 基准测试中保持了 18% 的优势,这表明虽然两款系统都性能强劲,但 Ryzen AI Halo 平台更擅长通用计算性能,而 DGX Spark 在以内存带宽为中心的工作负载中展现了更高的吞吐量。

《测试》(Test) AMD Ryzen AI Halo NVIDIA DGX Spark 优胜者
7-Zip 压缩(MIPS) 186,921 169,052 光环(+11%)
7-Zip 解压缩(MIPS) 146,109 106,084 光环(+38%)
流式复制(MB/s) 145,363 123,730 光环(+18%)
流规模(MB/s) 110,611 128,970 火花(+17%)
STREAM Triad (MB/s) 107,105 121,433 火花(+13%)
流添加(MB/s) 107,022 122,815 火花(+15%)
LLVM 编译(Make,秒) 431.8 504.3 Halo(速度提升 14%)

FIO性能基准

为了衡量存储性能在行业通用指标上的表现,我们使用 fio。我们传统的 SSD 测试会预先将每个硬盘装满两盘数据作为辅助硬盘进行预处理;而在这里,我们直接在文件系统层面测试每个硬盘。我们之前使用 GDSIO 测试过 NVIDIA 系统,但 AMD 没有提供类似的 GPU 直接存储测试,因此在两个平台上运行文件系统级别的 fio 测试可以使它们处于公平的竞争环境中,这比单独测试硬盘的性能更为重要。

NVIDIA DGX Spark(创始版)和 AMD Ryzen AI Halo 都配备了 PCIe Gen5 固态硬盘,因此理论上这两个平台的原始硬盘带宽上限相同。然而,实际上,在这个系统中,Halo 的固态硬盘以 PCIe Gen4 链路速度运行,这使得可用带宽远低于硬盘本身的带宽能力。在本节中,务必牢记这一链路速度限制,因为它是造成两个平台带宽差距的重要原因之一。

在本节中,我们重点关注以下 FIO 基准:

  • 128K 连续
  • 64K随机
  • 16K 连续
  • 16K随机
  • 4K随机

128K 顺序读取

在单线程、深度队列的 128K 顺序读取(64/1)测试中,NVIDIA DGX Spark 的读写速度达到了 13,399.6 MB/s,几乎是 AMD Ryzen AI Halo 的 6,897.5 MB/s 的两倍。延迟也呈现出同样的趋势:Spark 在此深度下的平均延迟为 0.597 毫秒,而 Halo 则为 1.159 毫秒,尽管数据传输量只有 Spark 的一半,但每次请求的速度几乎是 Spark 的两倍。这是整个测试过程中差距最明显的一次,表明 Spark 的存储堆栈专为在此数据块大小下更高的持续顺序吞吐量而设计。

128K 顺序写入

写入性能方面也呈现出类似的趋势。在 IODepth 16/1 下,Spark 的写入速度达到了 2,984.4 MB/s,而 Halo 仅为 1,392.4 MB/s,NVIDIA 的优势高达 114%。延迟方面,Spark 也更胜一筹,仅为 0.67 毫秒,而 Halo 则为 1.436 毫秒。结合读取测试结果,128K 顺序写入是 Spark 相对于 Halo 最强劲的表现。

64K 随机读取

Halo 在低队列深度下的延迟优势在此得以充分展现。在 1/1 队列深度下,Halo 的响应时间仅为 0.051 毫秒,而 Spark 则为 0.275 毫秒,单个未完成请求的响应速度快了 5 倍以上。这种差距在低到中等队列深度下依然存在,Halo 的延迟远低于 0.2 毫秒,而 Spark 在大部分测试范围内则徘徊在 0.2 到 0.45 毫秒之间。

然而,规模扩大后情况就截然不同了。当队列深度和线程数超过大约 16/4 时,Spark 的带宽开始下降,从 8/16 开始稳定在 9.8 GB/s 左右,在 32/8 时达到峰值 10,019.1 MB/s(160.3K IOPS)。Halo 则从未达到过这个上限:它的带宽饱和在 6.0–6.9 GB/s 之间,在 4/8 时达到峰值 6,926.5 MB/s(110.8K IOPS)。它的带宽曲线明显更加不稳定,根据队列深度和线程数的组合,带宽会在大约 2 到 6.8 GB/s 之间波动,而不是平滑上升。

在完全饱和状态下,延迟也对 Spark 更有利:在 32/16 时,Halo 的平均延迟膨胀到 5.185 毫秒,而 Spark 为 3.204 毫秒,这意味着 Halo 为其低队列深度响应速度付出的代价是,一旦队列完全加载,其尾部行为就会变差。

64K 随机写入

随机 64K 写入带宽在两个平台上的差距比读取带宽要小,尽管曲线形状截然不同。Halo 的带宽波动更大:它会反复跃升至 2.5 GB/s 以上(在 32/4 时峰值达到 2,929.1 MB/s / 46.9K IOPS),然后在相邻的组合下回落至 1.1–1.5 GB/s 的范围内。Spark 则相对稳定,在大部分测试中都保持在 1.7–2.0 GB/s 的范围内,并在 2/16 时达到峰值 2,106.6 MB/s(33.7K IOPS)。

延迟与 64K 读取模式相符:在低队列深度下,Halo 的速度明显更快(1/1 时为 0.054 毫秒,而 Spark 为 0.217 毫秒),但随着队列深度和线程数达到两位数,两款硬盘的性能都急剧下降。在完全饱和(32/16)时,Halo 的延迟达到 19.611 毫秒,而 Spark 为 17.857 毫秒。此时两款硬盘都明显承受着较大的写入放大压力,Halo 在曲线顶端的表现再次略逊一筹。

16K 顺序读取

在大部分测试过程中,带宽都保持在较高水平,两款硬盘的读写速度均在 1-8 GB/s 之间波动,具体数值取决于读写深度和线程数的组合。Spark 的峰值略高,在 32/1 的读写深度下达到 8,069.3 MB/s(516.4K IOPS),而 Halo 在 8/4 的读写深度下最高达到 6,715.8 MB/s(429.8K IOPS)。

除了队列最顶端之外,Halo 在所有情况下都保持着更低的延迟。在 1/1 队列中,Halo 的响应时间为 0.027 毫秒,而 Spark 为 0.214 毫秒,并且在大部分队列扫描过程中,Halo 的延迟都保持较低。只有在队列深度最深时,两者的差距才会缩小。在 32/16 队列中,Halo 的平均延迟为 1.441 毫秒,略低于 Spark 的 1.599 毫秒,这使得 Halo 的延迟曲线在饱和状态下没有超过 Spark 的少数几个点之一。

16K 顺序写入

带宽方面也相差无几:Spark 在 16/1 时达到峰值 2,141.6 MB/s (137.1K IOPS),Halo 在 1/8 时也紧随其后,达到 1,970.9 MB/s (126.1K IOPS)。

延迟是两者性能差异最为显著的地方。在队列深度较低时,Halo 的延迟表现远超 Spark(1/1 时为 0.022 毫秒,而 Spark 为 0.231 毫秒),但随着队列深度的增加,Halo 的延迟曲线会急剧上升。到 32/16 时,Halo 的平均延迟已攀升至 6.967 毫秒,远高于 Spark 在同一位置的 4.306 毫秒。此外,Halo 的延迟曲线也更难以预测,在一些中等队列深度组合下会出现明显的峰值,而 Spark 的延迟曲线则相对平稳。

16K 随机读取

这是 Halo 表现较好的一次。在 32/16 配置下,它的峰值带宽达到了 6,609.4 MB/s(423.0K IOPS),高于 Spark 在相同配置下的 6,082.6 MB/s(389.3K IOPS)。

延迟方面,Halo 的初始延迟优势非常明显(1/1 队列时为 0.047 毫秒,而 Spark 为 0.222 毫秒)。然而,Halo 的延迟曲线在整个测试过程中波动更大,在 8/1、16/1、8/4 和 8/8 队列深度处出现明显的峰值,远高于 Spark 相对平滑(尽管基线更高)的曲线。在队列深度最高时,Halo 的峰值延迟为 1.971 毫秒(16/16 队列深度),超过了 Spark 的峰值延迟 1.315 毫秒(32/16 队列深度),因此 Halo 牺牲了稳定性,换取了低队列深度下的极快速度。

16K 随机写入

带宽方面,Spark 更胜一筹,在 32/1 的内存配置下,其带宽可达 2,074.1 MB/s(132.7K IOPS),而 Halo 在 8/4 的内存配置下仅为 1,503.5 MB/s(96.2K IOPS)。Spark 的带宽曲线也更加稳定,在初始上升期之后的大部分测试时间内,带宽都保持在 1.6–2.0 GB/s 的范围内。相比之下,Halo 的带宽在不同内存配置下波动较大,大约在 0.1 到 1.5 GB/s 之间。

延迟是本次测试的亮点:Halo 在 1/1 线程时延迟较低(0.154 毫秒 vs. 0.224 毫秒),但在 8/16 线程时,其平均延迟飙升至惊人的 20.698 毫秒,几乎是 Spark 在整个测试过程中最差延迟(4.664 毫秒)的 4.5 倍。除了这个峰值之外,Halo 的延迟表现尚可,但对于任何可能在该特定线程深度/线程组合下运行的工作负载而言,这都是一个值得注意的显著异常值。

4K 随机读取

在低队列深度下,Halo 的响应速度明显更快(1/1 时为 0.04 毫秒,而 Spark 为 0.215 毫秒),并且在测试的大部分中低延迟范围内都保持着延迟优势。但 Spark 在大规模吞吐量方面则遥遥领先:其在 32/16 队列深度下的峰值 IOPS 达到 1,750.7K(6,838.8 MB/s),远超 Halo 在 32/8 队列深度下的峰值 1,050.4K IOPS(4,103.2 MB/s)。

有趣的是,在高队列深度下,延迟情况发生了逆转。即使队列深度和线程数增加,Spark 的延迟曲线仍然相对稳定,峰值仅为 0.292 毫秒。相比之下,Halo 在队列深度为 16/16 时(0.513 毫秒)和 32/16 时(1.009 毫秒)出现急剧上升,超过其稳态基线值的 3 倍以上,这意味着其在低队列深度下出色的响应能力并不能延续到队列深度达到饱和状态。

4K 随机写入

这是本次测试中 IOPS 差距最大的一次。Spark 的随机 4K 写入性能随着队列深度和线程数的增加而迅速提升,在 8/16 时达到 490.4K IOPS (1,915.6 MB/s)。而 Halo 的性能则更早达到瓶颈,且峰值也低得多,在 4/4 时仅为 125.6K IOPS (490.7 MB/s),之后在剩余的测试中从未超过 110-115K IOPS。Spark 的性能几乎是 Halo 的四倍。

在低队列深度下,Halo 的延迟优势再次显现(1/1 时为 0.079 毫秒,而 Spark 为 0.235 毫秒)。到了 32/16 队列深度,Halo 的平均延迟攀升至 4.546 毫秒,而 Spark 的延迟则相对稳定在 1.792 毫秒。结合 IOPS 的差距,本次测试中 Spark 的优势最为显著,且在整个队列深度/线程范围内都保持稳定。

vLLM 在线服务 – LLM 推理性能

vLLM 是 LLM 领域最流行的高吞吐量推理和服务引擎之一。vLLM 在线服务基准测试评估了该推理引擎在并发请求下的实际服务性能。它通过向运行中的 vLLM 服务器发送请求来模拟生产环境的工作负载,并可配置请求速率、输入输出长度和并发客户端数量等参数。该基准测试测量关键指标,包括吞吐量(每秒令牌数)、首令牌时间 (TTF) 和单次输出令牌时间 (TPOT),帮助用户了解 vLLM 在不同负载条件下的性能。

我们测试了涵盖各种架构、参数规模和量化策略的一系列模型的推理性能,以评估不同并发配置下的吞吐量。

GPT OSS 120B

相等的 ISL/OSL (256/256):Halo 在批处理大小为 64 时可扩展至 222 tok/s,而 Spark 则达到 701(大约落后 3.2 倍)。

预填充重型(8k/1k):Halo 的吞吐量在第 32 批次达到峰值(427 tok/s),然后在第 64 批次下降到 314,而 Spark 则飙升至 2,760(约 8.8 倍)——这是该组中差距最大的。

解码重型数据(1k/8k):Halo 的解码速度达到了 127 tok/s,而 Spark 在批量大小为 64 时达到了 305 tok/s(大约是 2.4 倍)。

GPT OSS 20B

ISL/OSL 相等 (256/256):Spark 在每个批次中都领先,在第 64 批次时扩展到 1,917 tok/s 对比 617 tok/s(Spark 领先约 3.1 倍)。

预填充重型 (8k/1k):Spark 的领先优势最大,在批次大小为 64 时达到 3,672 tok/s,而 881 tok/s(Spark 领先约 4.2 倍)。

解码重型数据(1k/8k):Spark 始终领先,在第 64 批次达到 728 tok/s,而其他数据为 330 tok/s(Spark 领先约 2.2 倍)。

Qwen3 编码器 30B A3B 指令

相等 ISL/OSL (256/256):Halo 在批处理大小为 64 时扩展到 376 tok/s,大约是 Spark 的 729 的一半(约 1.9 倍)——这是比较紧凑的相等 ISL/OSL 结果之一。

预填充重型(8k/1k):Halo 在第 32 批次达到峰值(408 tok/s),然后在第 64 批次下降到 362,落后于 Spark 的 1,663(大约 4.6 倍)。

解码重型数据(1k/8k):Halo 的解码速度达到了 188 tok/s,而 Spark 在批量大小为 64 时达到了 357 tok/s(大约是 1.9 倍)。

Mistral Small 3.1 24B 指令

ISL/OSL 相等 (256/256):Halo 在第 1 批次中实际上领先 (9 对 8 tok/s),然后在第 64 批次稳定在 202 tok/s,而 Spark 为 498(大约落后 2.5 倍)。

预填充重型(8k/1k):Halo 在第 32 批次达到峰值(188 tok/s),在第 64 批次略微下降到 164,落后于 Spark 的 540(大约 3.3 倍)。

解码重型 (1k/8k):几乎全程持平,Halo 在第 64 批次达到了 119 tok/s,而 Spark 达到了 132 tok/s(相差约 11%)。

骆驼 3.1 8B 指导

ISL/OSL 相等 (256/256):Halo 的性能从第 1 批次的 25 tok/s 稳步提升到第 64 批次的 407 tok/s,在第 4 批次之前与 Spark 的性能非常接近,之后 Spark 的性能超过了 Halo,达到了 1,330(Halo 在峰值时落后约 3.3 倍)。

预填充重型(8k/1k):Halo 在批次大小为 64 时达到了 546 tok/s,大约是 Spark 的 1,059 的一半。

解码重型(1k/8k):Halo 最具竞争力的场景,在 64 的批次大小下,速度达到 235 tok/s,而 Spark 的速度为 263 tok/s(相差约 12%)。

Llama 3.1 8B 指令 FP4

ISL/OSL 相等 (256/256):Halo 在批处理大小为 64 时峰值达到 267 tok/s,远远落后于 Spark 的 3,573——FP4 显示差距最大(约 13.4 倍)。

预填充重型(8k/1k):Halo 在批量大小为 64 时达到了 457 tok/s,而 Spark 则达到了 2,713(约 5.9 倍)。

解码重型数据(1k/8k):Halo 的解码速度为 146 tok/s,而 Spark 在批量大小为 64 时解码速度为 588 tok/s(大约是 4 倍)。

结语

AMD Ryzen AI Halo 进入了 NVIDIA 凭借 DGX Spark 开创的领域,但它并没有试图在 Spark 的主场与其竞争。在我们的 vLLM 测试中,Spark 在大多数高并发场景下都拥有 2 到 4 倍的吞吐量优势,在预填充密集型 GPT OSS 120B 工作中,优势甚至高达 8.8 倍,仅在两次解码密集型测试中差距缩小到约 10%。此外,Spark 的存储子系统在饱和状态下几乎赢得了所有 fio 测试。Halo 的优势在于,它以相近的体积提供了相同的 128GB 统一内存和 200 亿参数上限,售价为 3,999 美元,而 Spark Founders Edition 的售价为 4,699 美元(尽管一些 OEM 厂商将其售价低于 4,000 美元)。Halo 是一款完整的 x86 架构机器,可以启动 Windows 11 或 Linux 系统,而不仅仅是 DGX OS。

AMD Ryzen AI Halo主板俯视图。

撇开 Spark 不谈,Halo 是我们测试过的最强 Ryzen AI Max+ 395 实现。在几乎所有我们测试的 Windows 工作负载中,它都超越了 HP Z2 Mini G1a 和 ZBook Ultra G1a:Cinebench R23 多核测试得分 37,316,7-Zip 压缩速度达到 184.2 GIPS(HP 分别为 151.6 和 156.8),Procyon AI 文本和图像生成得分最高,5 亿位和 10 亿位数字的 y-cruncher 运算速度也最快。在 Linux 系统下,Halo 在 CPU 密集型的 Phoronix 测试中完胜 Spark,7-Zip 压缩速度提升 11%,LLVM 编译速度提升 14%。Halo 首先是一款紧凑型工作站,AI 开发功能是在此基础上叠加的,而非取代。

对于需要最大每秒本地令牌数或计划通过高速网络集群节点的开发者来说,Spark 仍然是最佳选择;Halo 的 10GbE 带宽和 vLLM 上限与 Spark 相比仍有差距。对于使用 ROCm 构建应用的开发者、需要 Windows 系统集成的团队,或者任何希望一台设备即可满足专业工作负载和本地模型工作需求的用户来说,Halo 更为合适。其标配的 M.2 2280 插槽和预调校的可变显存解决了 Spark 用户最常抱怨的两大问题。AMD 还表示,该平台将在第三季度推出搭载 Ryzen AI Max PRO 400 系列处理器的版本,最高支持 192GB 统一显存,因此追求更大显存容量的用户无需更换平台即可轻松升级。

产品页面 – AMD Ryzen AI Halo

排行榜: AMD Ryzen AI Halo 在我们的“最佳本地 AI 台式机”排行榜中占据“最佳 x86 替代方案”的位置。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

布赖恩·比勒

Brian 位于俄亥俄州辛辛那提市,是 StorageReview.com 的首席分析师兼总裁。