MSI XpertStation WS300 基于 NVIDIA 最新的 DGX Station 架构,这是迄今为止性能最强的一代,将完整的 GB300 Grace Blackwell Ultra 节点置于您的办公桌旁。其核心性能是 20 petaFLOPS 的 FP4 计算能力,由单个 Blackwell Ultra GPU 通过 900GB/s 的 NVLink-C2C 链路连接到 72 核 Grace CPU 提供。两个处理器共享一个 748GB 的内存池:252GB HBM3e 和 496GB LPDDR5X,足以在本地内存中驻留一个万亿参数的模型。
DGX Station 还支持使用其 ConnectX-8 超级网卡将多个单元集群化,该网卡提供两个 400GbE 端口,可提供 800Gb/s 的带宽。最终打造出一台数据中心级别的设备,无需占用服务器机房,即可在家中或办公室运行。
NVIDIA DGX Station 技术规格
XpertStation WS300 是 MSI 对 NVIDIA GB300 DGX Station 平台的实现。NVIDIA 提供 Grace Blackwell Ultra 主板和软件环境,而 MSI 则提供机箱、液冷散热、电源供应、存储布局、外部 I/O 接口以及服务模式,从而将该平台打造成为一套完整的桌面系统。由于 Grace CPU、Blackwell Ultra GPU、NVLink-C2C 互连和 ConnectX-8 网络是固定的,因此真正的 OEM 差异化体现在周边系统如何有效地支持、管理和利用这些硬件。
| 规格 | 信息 |
|---|---|
| 卓越 | |
| 中央处理器 | NVIDIA Grace,72 核 Arm Neoverse V2 |
| GPU | NVIDIA Blackwell Ultra (B300) |
| 张量核心 | 5th代 |
| CPU-GPU互连 | NVLink-C2C,900 GB/s 双向 |
| 内存 | |
| 连贯记忆 | 截至748 GB |
| GPU内存 | 最高支持 252 GB HBM3e |
| GPU内存带宽 | 7.1 TB / s |
| CPU内存 | 最高可达 496 GB LPDDR5X (4 x SOCAMM) |
| CPU内存带宽 | 396 GB /秒 |
| 存放 | |
| 引导驱动器 | 2 个 M.2 2280 PCIe 5.0 x4 NVMe 插槽(CPU 直插式),分别安装了 2 块 2TB 硬盘,组成 RAID 1 阵列。 |
| 扩张驱动 | 2 个 M.2 2280 PCIe 5.0 x4 NVMe 插槽(已连接 ConnectX-8),出厂时已打开 |
| 社交 | |
| 网卡 | NVIDIA ConnectX-8 SuperNIC,2 x 400G QSFP112(总传输速率 800 Gb/s) |
| 以太网(EtherNet) | 1 个 10GBase-T RJ45 接口(Marvell AQC113) |
| 管理端口 | 1 个 1000Base-T RJ45 接口(专用带外接口) |
| 无线耳机 | M.2 2230 Key-E 插槽、PCIe 2.0 x1(Wi-Fi 6E / Wi-Fi 7、蓝牙) |
| 扩展 | |
| PCIe插槽 | 1 个 PCIe 5.0 x16 FHFL 双宽插槽;2 个 PCIe 5.0 x16 FHFL 单宽插槽(x8 信号) |
| 支持的独立显卡 | NVIDIA RTX PRO 2000 Blackwell、RTX PRO 4000 Blackwell SFF、RTX PRO 6000 Blackwell 工作站/Max-Q |
| 前面板/顶部 I/O | |
| USB | 2 个 USB 3.2 Gen 2 Type-A 接口;2 个 USB 3.2 Gen 2 Type-C 接口(5V/3A) |
| 音频 | 2 个插孔(线路输出/麦克风) |
| 后端I / O | |
| USB | 4 个 USB 10Gbps Type-A 接口;1 个 Micro-USB COM(串口控制台)接口 |
| 展示 | 1 个 Mini DisplayPort 接口(BMC 视频,最大分辨率 1024 x 768,不支持 DP++) |
| 音频 | 3 个插孔(线路输入/线路输出/麦克风) |
| 管理与安全 | |
| BMC | ASPEED AST2600,配备 AMI MegaRAC 固件、IPMI 2.0 和 Redfish,以及 eMMC 本地存储。 |
| 安保防护 | TPM 2.0、机箱入侵检测、Microchip CEC1736 硬件信任根 (ERoT) |
| 散热器 | |
| 液体冷却 | 适用于 1400W CPU + GPU 的液冷模块,GPU、CPU、内存和 ConnectX-8 均配备散热块。 |
| 散热器/风扇 | 2 个 360 毫米散热器;1 个 12025 系统风扇 |
| 电力 | |
| 电源 | 1 x 1600W ATX,80 PLUS 白金认证(150 x 86 x 210 毫米) |
| 交流输入 | 100-114Vac,15A,47-63Hz(最大输出功率1300W);115-240Vac,15-8A,47-63Hz(最大输出功率1600W) |
| 外形 | |
| 尺寸 | 245.7 x 529.0 x 570.4 毫米(9.67 x 20.83 x 22.46 英寸),宽 x 高 x 深 |
设计与建造
乍一看,XpertStation 就像一台外观时尚、设计专业的标准现代工作站。但取下侧面板后,相似之处就仅限于此了。
GB300 Grace Blackwell Ultra Desktop Superchip
WS300 的核心是我们的明星产品:NVIDIA 的 B300 GPU,它基于 Blackwell Ultra 架构。

来源:NVIDIA,由 StorageReview 注释
B300 是目前最先进的 GPU 之一,采用基于台积电 4NP 工艺的双光罩设计。两个芯片通过 NVIDIA 的 10TB/s NV-HBI 芯片间接口连接,使 GPU 能够作为单个 CUDA 加速器运行。DGX Station 中使用的 B300 基于拥有 208 亿个晶体管的 Blackwell Ultra 设计,最多可配备 160 个 SM 单元和 640 个第五代 Tensor Core。它还配备了 252GB 的 HBM3e 显存,内存带宽高达 7.1TB/s。作为数据中心级产品,B300 缺少常规显示输出和 NVENC 硬件编码器。但它包含七个 NVDEC 引擎和七个 nvJPEG 解码器。该 GPU 还支持 MIG 技术,允许将其划分为多达七个独立的实例。在计算方面,B300 提供:
| 平台精度 | 峰值性能 |
|---|---|
| B300 计算性能 | |
| NVFP4 张量核心 | 20 PFLOPS 稀疏模型 / 15 PFLOPS 密集模型 |
| FP8 / FP6 张量核心 | 10 浮点数 |
| INT8 张量核心 | 330 TOPS |
| FP16 / BF16 张量核心 | 5 浮点数 |
| TF32 张量核心 | 2.5 浮点数 |
| FP32 | 80 TFLOPS |
| FP64 / FP64 张量核心 | 1.3 TFLOPS |
| 峰值速率取决于 GPU 加速频率。除非另有说明,Tensor Core 规格均采用稀疏性。 | |
与 B300 搭配的是 NVIDIA 的首款数据中心 CPU Grace。它采用 72 个 Arm Neoverse V2 核心,但其周围的处理器组件均为 NVIDIA 自主设计,包括缓存层次结构、内存控制器、系统 I/O、可扩展一致性架构 (SCL) 和 NVLink-C2C 接口。Grace 提供 72 个核心和 72 个硬件线程,每个核心均采用 Armv9 架构,并带有加密扩展和四个 128 位 SVE2 向量单元。该核心配备一个六路指令解码器,每个时钟周期最多可分派八条指令;六个标量 ALU;64KB 的 L1 指令缓存和数据缓存;以及 1MB 的私有 L2 缓存。整个芯片上的 CPU 共享 114MB 的 L3 缓存。
核心和 L3 缓存切片通过 NVIDIA 的可扩展一致性架构 (Scalable Coherency Fabric) 连接,这是一种网状互连架构,具有 3.2TB/s 的二分带宽。该架构还将 CPU 核心连接到内存、系统 I/O 和 NVLink-C2C 接口,为 Grace 提供维持 B300 正常运行所需的数据传输带宽。在 WS300 中,Grace 负责处理加速器周围的 CPU 端工作:GPU 内核启动、数据加载、预处理、标记化和模型编排。下面的拓扑图清晰地展示了单路设计,其中包含一个 72 核 Grace CPU 以及围绕其连接的平台设备。
Grace 搭载 496GB LPDDR5X 内存,提供 396GB/s 的带宽。DGX Station 没有将内存直接焊接在底板上,而是采用了四个 SOCAMM 模块。SOCAMM(片上系统高级内存模块)将 LPDDR5X 内存封装在紧凑、可拆卸的外形尺寸中。这使得该平台既能保持 LPDDR5X 的带宽和能效优势,又能实现内存的可维护性。只需更换故障模块,无需更换整个底板。
Grace 和 B300 之间通过 NVIDIA 的 NVLink-C2C 接口连接,这是一种封装级互连,可提供 900GB/s 的双向带宽,约为 PCIe Gen5 x16 连接的七倍。更重要的区别在于内存一致性。在传统工作站中,CPU 和独立 GPU 维护着各自独立的内存空间,数据通过 PCIe 在它们之间复制。而借助 NVLink-C2C,Grace 和 B300 共享一个一致的地址空间,使得每个处理器都可以直接访问连接到对方的内存。
最终得到的是一个748GB的连贯地址空间,而不是一块748GB的HBM内存。B300拥有252GB的HBM3e,读写速度为7.1TB/s,而Grace内存则提供496GB的LPDDR5X,读写速度为396GB/s。Grace内存中的数据仍然需要通过C2C链路传输,因此HBM仍然是频繁访问的模型权重、张量和缓冲区的最佳存储位置。Grace内存则作为一个大容量内存层,允许超出B300 252GB本地内存容量的工作负载保留在单个系统上,而不是分散到多个GPU上。我们将在后续的测试部分评估使用第二层内存对性能的影响。
系统拓扑
从 GB300 封装中取出,MSI 的框图展示了系统其余部分如何围绕 Grace 核心连接。CPU 位于 I/O 拓扑结构的中心,两个 PCIe 5.0 x4 M.2 插槽直接连接到它。MSI 为这两个插槽配备了两块 2TB 的Micron 4600 SSD,并配置为 RAID 1,用于安装操作系统和 NVIDIA 软件栈。三个全尺寸扩展插槽也直接连接到 Grace 核心,包括一个 PCIe 5.0 x16 插槽和两个 PCIe 5.0 x8 插槽。
MSI 还为这款机箱预留了安装大型独立显卡的空间。预装的 12V HPWR 电源线位于机箱前部,方便用户连接,无需再额外布线。用于加固机箱的垂直金属支架还集成了防下垂支架,能够支撑较长较重的 RTX PRO 显卡。
Grace 芯片侧的 USB 控制器负责系统的主要前置和后置 USB 端口以及音频编解码器。Grace 还连接到 ASPEED AST2600 BMC,后者提供一个专用的 1GbE 管理端口、一个分辨率限制为 1024 x 768 的 Mini DisplayPort 输出端口以及一个 Micro-USB 串口控制台端口。Mini DisplayPort 端口仅用于初始设置和故障排除,并非作为系统的主要显示输出端口。任何计划将 WS300 用作传统台式机的用户仍然需要选购 RTX PRO 扩展卡。
另一大分支是NVIDIA的ConnectX-8 SuperNIC。它最显著的特点是后面板上的两个400GbE QSFP112端口,可提供高达800Gb/s的聚合网络带宽。ConnectX-8还集成了一个48通道的PCIe交换机;其上行链路支持PCIe Gen6,但其下行端口仅支持PCIe 5.0,这使得MSI可以将其用作辅助I/O集线器,而不仅仅是一个网络适配器。
ConnectX-8 的两条 PCIe 5.0 x4 链路为剩余的 M.2 2280 插槽供电,MSI 将这些插槽预留用于扩展。同一条链路还通过 PCIe 2.0 x1 连接了 M.2 2230 Wi-Fi 和蓝牙插槽、用于 10GBase-T 端口的 Marvell AQC113 控制器,以及为额外的前面板 USB 接口提供服务的第二个 USB 控制器。
电源和冷却
WS300 由一个 1,600W 80 PLUS 白金认证的 ATX 电源供电,该电源采用 C19 输入接口。对于北美地区的安装,DGX Station 需要一条专用的 20A 电路才能满足系统的全部功率需求。
1,600W 的额定功率是整个系统的上限。Grace、B300、存储设备、水泵、风扇以及任何可选的 RTX PRO 显卡都使用同一个电源。添加高功率显卡可以扩展 WS300 的性能,但它并不会使用额外的电源。当 B300 和 RTX 显卡同时处于高负载运行时,它们必须共享现有的电源,这可能会降低 B300 GPU 的性能。
MSI采用定制水冷系统来应对由此产生的散热负载,该系统覆盖B300主板、Grace CPU、SOCAMM内存、ConnectX-8接口以及光驱笼。热量通过两个360mm冷排排出,同时一个独立的120mm风扇负责机箱其他部分的散热。MSI官方标称该散热系统可为CPU和GPU提供高达1,400W的功率。在我们的测试中,B300主板的最高温度为71℃,而CPU在GPU功耗高达1292W的情况下,温度从未超过65℃。
电力晃动
NVIDIA 通过 vsloshd 服务管理共享预算。在默认的动态模式下,该服务会实时监控 GB300 模块和可选的 RTX PRO 显卡的功耗,并在两者之间灵活分配可用预算,而不是将每个设备的功耗限制在固定值。根据当前的策略,RTX 显卡享有优先权,因此当它需要更多电力时,系统会先降低 GB300 的功耗上限,然后再提高 RTX 的功耗上限。如果没有安装 RTX 显卡,则 GB300 模块仍可获得全部预算。
这意味着可选的 RTX PRO 6000 并非只是在 B300 的基础上增加性能。当两块 GPU 都处于高负载运行时,分配给 RTX 显卡的电力会直接从 GB300 的预算中扣除,这可能会降低 B300 的频率和性能。
该平台还包含一个硬件功率制动器,用于应对系统检测到供电下降的情况。我们在实际测试中就遇到了这种情况:电源连接器松动导致 WS300 降低功率限制,而不是关机或继续通过受损的连接以全功率运行。机器以低功耗状态保持在线,直到连接问题得到解决。
连接方式
在继续介绍机箱之前,不妨先快速看一下前置和后置I/O接口。前置I/O接口包括两个USB 3.2 Gen 2 Type-A接口、两个USB 3.2 Gen 2 Type-C接口、独立的线路输出和麦克风接口,以及电源和重启控制按钮。
后面板分为工作站接口和下方的服务器硬件两部分。ConnectX-8 提供两个 400GbE QSFP112 端口,一个独立的 10GBase-T 端口用于处理常规主机网络连接,一个专用的 1GbE 端口连接到 BMC。四个 10Gbps USB Type-A 端口和三个音频接口用于连接本地外设。BMC 还提供一个 Micro-USB 串口控制台和一个 Mini DisplayPort 接口。C19 电源接口位于机箱底部,可通过内部的 M.2 2230 Key-E 插槽添加支持蓝牙的 Wi-Fi 6E 或 Wi-Fi 7 模块。
桌面上的数据中心工作负载
以上内容主要介绍了DGX Station的功能;对于买家而言,更重要的问题是XpertStation能为团队带来哪些功能。WS300的价值在于,它不仅是一个高容量推理系统,更是一个开发平台。其B300 GPU、Grace CPU、MIG支持、可选的RTX PRO显卡以及数据中心软件栈,将通常依赖于共享集群硬件的多种工作流程移植到了单个本地节点上。
MIG 作为开发工具
想象一下,在同一块 GPU 上同时运行多个完全独立的作业,每个作业都与其他作业完全隔离。这就是多实例 GPU (MIG) 的工作原理:它在硬件层面上将 B300 分割成多达七个大小相等的切片,即实例。每个实例都拥有自己固定的 SM、HBM、缓存和内存带宽份额,拥有独立的设备标识,并且在 CUDA 中被视为一个独立的 GPU。
这使得开发、测试和验证多 GPU 工作负载;训练脚本;以及为 Dynamo、LLM-D 等工具进行开发成为可能。
为了进行测试,我们在 B300 上配置了 3 个 MIG 实例,并使用它们在不同的 CUDA 可见设备上启动 NVIDIA Dynamo 组件。这与我们构建基准测试工具的方式非常相似:验证其行为是否完全符合预期,意味着需要反复在真实硬件上进行迭代测试。拥有一个可以随时划分和重新配置的本地 B300,无需占用共享服务器的时间,也无需承受机架带来的功耗、发热和噪音,这大大降低了此类迭代工作的开销。
Isaac GR00T 和物理人工智能循环
另一个特别适合 DGX Station 的工作流程是物理人工智能。
我们之前测试过这种工作流程,但它需要多台配备不同类型GPU的系统。DGX Station将以前这些独立的步骤整合到一台桌面设备上。
整个流程始于远程操控:操作员引导机器人完成任务,以采集少量真实场景演示数据。这些数据随后进入 Isaac GR00T 工作流程。可选的 RTX PRO GPU 负责处理 Isaac Sim 的图形和光线追踪需求,而 Isaac Lab 和 GR00T-Mimic 则将原始演示数据扩展为更大规模、更符合物理规律的合成轨迹集合。最后,B300 使用真实场景和合成场景相结合的数据集对 GR00T 模型进行微调。

资料来源:英伟达
经过微调后,最终的策略可以在部署到机器人上进行实际评估之前,先在仿真环境中进行验证。这形成了一个紧凑的开发循环:捕获真实演示,在仿真环境中重现并调整演示参数,重新训练模型,然后在硬件上测试更新后的策略。对于那些机器人、操作人员或数据采集窗口有限的团队来说,将仿真、合成数据生成和模型训练整合到一个桌面系统中,可以显著减少每次迭代的阻力。
Blackwell Ultra 内核开发
然而,DGX Station 的最佳应用场景无疑是内核优化。当团队为 Blackwell Ultra 编写 CUDA 或 Triton 内核时,在目标架构上运行是必不可少的。WS300 将 B300 和 252GB HBM3e 内存放置在开发人员旁边,使他们能够分析实际工作负载、检查内存行为、调整 Tensor Core 路径、融合操作并进行迭代,而无需占用八 GPU 服务器或机架级系统的时间。
大型系统仍然重要,但可以专门用于真正需要它们的工作:例如 NVLink 扩展、NCCL 集体计算、通信内核、多 GPU 推理以及最终吞吐量验证。WS300 在本地处理单 GPU 内核工作,从而使那些昂贵的共享系统能够用于扩展测试。对于专注于 Blackwell Ultra 优化的团队来说,这几乎是市场上最直接的开发机器了。
如果 DGX Station 与首批 Blackwell Ultra 系统一同发售,我们估计首批产品会立即被 AI 实验室、编译器团队、推理引擎开发者以及其他争相为 B300 优化软件的团队抢购一空。即便现在,直接访问目标 GPU 或许仍然是企业购买 DGX Station 的最直接原因。
性能
测试说明:测试在 MSI 提供的远程系统上进行,StorageReview 在整个评估过程中控制了所有软件环境。测试系统未安装 RTX PRO GPU 或任何其他 PCIe 扩展卡。因此,GB300 Superchip 在整个测试过程中都能充分利用系统的加速器功率。
最大可实现 Matmul FLOPS (MAMF)
首先,为了更好地理解 B300 的计算能力,我们在三台 Blackwell 架构的系统上运行了 MAMF 测试。MAMF(最大可达矩阵乘法 FLOPS)是一种实用的性能指标,旨在衡量机器学习加速器在矩阵乘法运算中实际可达到的峰值浮点运算速度,它比硬件规格中通常宣传的理论峰值 FLOPS 更准确。
在本测试中,我们对 BF16、FP8 和 NVFP4 中的 3 个系统分别进行扫描,并报告每个精度下最佳的持续(密集)结果。
GB300 在所有精度下都遥遥领先。在《战地16》测试中,其性能达到 1,967 TFLOPS,而RTX PRO 6000和DGX Spark分别为 412 TFLOPS 和 104 TFLOPS。FP8的性能表现也类似:分别为 3,909、763 和 211 TFLOPS。NVFP4 性能使 GB300 达到 6,134 TFLOPS,RTX PRO 6000 为 1,449 TFLOPS,Spark 为 364 TFLOPS。在所有三种精度下,性能比都非常稳定:GB300 比 RTX PRO 6000 领先 4 到 5 倍,比 Spark 领先 17 到 19 倍,而 RTX PRO 6000 则始终保持着比 Spark 大约 4 倍的优势。
NVB 带宽
只有当加速器能够持续为其执行单元提供数据时,原始计算吞吐量才有意义。这对于人工智能推理尤为重要,因为在解码阶段生成令牌通常更多地受限于内存带宽,而非可用的浮点运算次数。
在 GB300 超级芯片上,这种层级结构涵盖了 B300 的本地 HBM3e 显存、Grace 的 LPDDR5X 显存以及连接它们的 NVLink-C2C 互连。NVIDIA 的 NVBandwidth 工具会测试这些组件之间的不同数据复制路径,从而显示 GPU 内部的可用带宽以及在 GPU 和 CPU 内存域之间传输数据的成本。
前四项测试测量了B300的252GB HBM3e显存内的数据传输速度。设备本地读取速度达到6,875 GB/s,约合6.9 TB/s,与GPU标称的7.1 TB/s显存带宽仅相差几个百分点。设备本地写入速度达到6,009 GB/s。
HBM 到 HBM 的复制操作速度较慢,因为每次复制都会消耗两次带宽:一次用于读取源数据,一次用于写入目标数据。专用复制引擎的速度可达 3,100 GB/s,而张量内存加速器 (Tensor Memory Accelerator) 的速度为 2,527 GB/s。
剩余的测试通过 NVLink-C2C 连接,并访问 Grace 的 496GB LPDDR5X 内存。从 Grace 内存到 B300 HBM 的传输速度达到 390 GB/s,反向传输速度达到 382 GB/s。尽管 NVLink-C2C 可在 CPU 和 GPU 之间提供高达 900 GB/s 的相干带宽,但测得的传输速度受限于 Grace 396 GB/s 的 LPDDR5X 内存带宽。双向传输进一步暴露了这一限制。使用基于 SM 的复制方式,并发流量达到 253 GB/s;而通过复制引擎,并发流量达到 192 GB/s。
推理
完成底层测试后,我们接下来进行LLM推理。此时,重点将从峰值数量转移到每秒令牌数、首次令牌到达时间以及负载下的延迟,从而更好地了解WS300作为服务系统的性能。
我们先来看看GB300 Superchip的核心优势:它能够支持容量介于B300 252GB HBM3e内存上限两侧的模型。而其748GB的一致性内存池正是在此发挥着至关重要的作用。测试流程分为五个阶段:首先是两个可以轻松装入HBM内存的模型;其次是一个勉强能装下但运行时缓存和键值缓存空间不足的模型;最后是两个必须将大部分计算量转移到Grace内存的模型。
注:文中提及的模型均采用推测性解码以提高解码吞吐量,并将强制接受令牌的数量设置为推测性解码令牌的数量。因此,结果展示的是最佳情况下的性能;在实际服务中,吞吐量是动态的,并且取决于推测性解码令牌的质量。
完全符合 HBM 的模型
DeepSeek v4 Flash (0731)
首先测试的是广受欢迎的 DeepSeek v4 Flash (0731),它作为原生 FP8 检查点占用 14+6GB 内存。该型号以其高效易用而著称,我们在 DGX Station 上也体验到了这一点。在 512/512 工作负载下,并发数为 1 时输出吞吐量为每秒 149 个令牌,并发数为 32 时迅速攀升至每秒 1,766 个令牌。预填充密集型工作负载的输出吞吐量则从每秒 146 个令牌扩展到每秒 949 个令牌。
总代币吞吐量同步增长,其中 512/512 工作负载从每秒 298 个代币增长到 3,532 个代币,而预填充密集型工作负载则从每秒 1,311 个代币增长到 8,537 个代币。
MiniMax M2.7 (NVFP4)
接下来是 MiniMax M2.7,这是我们最喜欢的型号之一,使用 NVIDIA 的 NVFP4 量化算法进行测试,占用 125GB 显存。在 512/512 工作负载下,输出吞吐量在并发数为 1 时为每秒 193 个令牌,并迅速扩展到并发数为 128 时的每秒 4,801 个令牌。预填充密集型工作负载的输出吞吐量从并发数为 1 时的每秒 195 个令牌增加到并发数为 64 时的每秒 1,743 个令牌。总令牌吞吐量则呈现相反的趋势,预填充密集型工作负载的输出吞吐量从并发数为 64 时的每秒 1,754 个令牌攀升至每秒 15,684 个令牌,而 512/512 工作负载的输出吞吐量则从并发数为 128 时的每秒 424 个令牌扩展到每秒 9,602 个令牌。
总令牌吞吐量呈现相反的趋势,预填充密集型工作负载在并发数为 64 时从每秒 1,754 个令牌攀升至每秒 15,684 个令牌,而 512/512 工作负载在并发数为 128 时从每秒 424 个令牌扩展到每秒 9,602 个令牌。
勉强符合 HBM 的模型
MiniMax M3 (NVFP4)
MiniMax M3 展示了实际应用中“勉强够用”的典型情况。其 233GB 的 NVFP4 检查点小于 B300 的 252GB HBM,但该型号仍然需要空间来存储运行时和键值缓存。最终,它占用了 223GB 的 HBM,其中 21GB 的专家数据被卸载到 Grace 缓存中。测试中使用了 EAGLE3-GQA 推测性解码算法,合成接受长度为 3 个 token。在 512/512 工作负载下,输出吞吐量在并发数为 1 时为每秒 197 个 token,并稳步提升至并发数为 32 时的每秒 1,041 个 token。预填充密集型工作负载的输出吞吐量从并发数为 1 时的每秒 171 个 token 增加到并发数为 2 时的峰值每秒 278 个 token,然后下降到并发数为 4 时的每秒 241 个 token。
总令牌吞吐量也呈现类似的趋势,512/512 工作负载从每秒 395 个令牌上升到 2,082 个令牌,而预填充密集型工作负载在并发数为 2 时达到每秒 2,506 个令牌的峰值,之后在并发数为 4 时下降到每秒 2,169 个令牌。
不符合 HBM 的模型
GLM-5.2 (NVFP4)
使用 NVIDIA 的 NVFP4 量化处理器对 GLM-5.2 进行了测试。其 433GB 的检查点使用了 218GB 的 HBM,并将 216GB 的专家权重卸载到 Grace 内存中。测试采用 MTP 推测解码,合成接受长度为 3 个 token。在 512/512 工作负载下,输出吞吐量从并发数为 1 时的每秒 36 个 token 提升至并发数为 32 时的每秒 139 个 token。8,192/1,024 工作负载紧随其后,从每秒 35 个 token 提升至每秒 118 个 token。两种工作负载的相似结果表明,模型生成主要受限于在 Grace 内存和 GPU 之间移动卸载的专家权重。由于剩余的 HBM 内存不足以支持额外的上下文信息,因此在并发数达到 32 时停止了测试。
总令牌吞吐量也遵循同样的模式,512/512 工作负载从每秒 72 个令牌增加到 277 个令牌,预填充密集型工作负载从每秒 314 个令牌增加到 1,062 个令牌;在这里,较长的提示最终将两种情况区分开来,因为预填充令牌本身也计入总数。
Nemotron-3-Ultra 550B (NVFP4)
Nemotron-3-Ultra 550B 是我们运行过的最大模型,也是最能直接利用完整一致性池的模型。它是一个 307GB 的 NVFP4 混合 Transformer-Mamba 模型,对于 HBM 来说容量过大,因此将其 114GB 的权重卸载到了 Grace 内存中。我们使用了 MTP 推测性解码,合成接受长度为 5 个 token。在 512/512 工作负载下,输出吞吐量在并发数为 1 时为每秒 43 个 token,并在并发数为 32 时攀升至每秒 168 个 token。预填充密集型工作负载的情况则更为有趣:吞吐量从并发数为 1 时的每秒 44 个 token 上升到并发数为 2 时的峰值每秒 122 个 token,但随后由于较长的提示填满了有限的 KV 缓存,吞吐量在并发数为 4 时回落至每秒 78 个 token。与 GLM-5.2 类似,这两个性能曲线非常接近,再次表明限制因素是 Grace 和 GPU 之间的专业数据迁移,而不是计算能力。扫描在并发数达到 32 时结束,原因相同:没有足够的 HBM 来提供更多上下文。
总令牌吞吐量随后出现,预填充密集型工作负载在并发数为 2 时达到每秒 2,506 个令牌的峰值,然后在并发数为 4 时下降到每秒 2,169 个令牌,而 512/512 工作负载从每秒 85 个令牌扩展到每秒 336 个令牌。
WS300 对比 Blackwell RTX PRO 6000 对比 DGX Spark
在本推理测试的这一部分中,我们将 WS300 与另外两种将 Blackwell 放在桌面上或附近的方案进行了比较:一种是 Blackwell RTX PRO 6000,NVIDIA 的 600W 工作站显卡,它安装在我们之前评测过的Dell Pro Max Tower T2中;另一种是基于 GB10 的 DGX Spark,这里以Acer Veriton GN100为代表。每个系统在两种场景下运行相同的 vLLM 实时推理工作负载:一种是输入 512 个输入和 512 个输出标记的均衡工作负载,另一种是输入 8,192 个输入和 1,024 个输出标记的预填充密集型工作负载,并发级别从 1 到 128。我们绘制了所有三个系统均可共同运行的每个模型的聚合输出和总吞吐量图表:原生 MXFP4 架构的 GPT-OSS-20B 和 GPT-OSS-120B,BF16、FP8 和 NVFP4 架构的 Llama 3.1 8B,以及 BF16 和 FP8 架构的 Mistral Small 24B 和 Qwen3 Coder 30B。
GPT-OSS-20B
GPT-OSS-20B 是这组测试中最友好的,它能轻松适配所有三款系统。在相同的工作负载下,WS300 在 128 个并发流的情况下,输出令牌速度可达每秒 22,161 个,约为 RTX PRO 6000(9,000 个)的 2.5 倍,以及 DGX Spark(1,469 个)的 15 倍。单流测试结果也印证了这一点:工作站每秒输出令牌 530 个,显卡每秒输出令牌 244 个,而 Spark 每秒输出令牌 50 个。
预填充操作会进一步拉开各显卡之间的差距。在发送 8,192 个令牌提示的情况下,WS300 的峰值输出令牌数仍高达每秒 9,572 个,加上预填充操作,总输出令牌数超过每秒 86,000 个,而 RTX PRO 6000 的最高输出令牌数为每秒 2,892 个,Spark 则为每秒 468 个。
GPT-OSS-120B
升级到 GPT-OSS-120B 后,三款系统都能加载该模型,但内存层次结构开始变得重要。在相同工作负载下,WS300 的峰值输出令牌速度达到每秒 9,294 个,是 RTX PRO 6000(3,384 个)的 2.7 倍,几乎是 DGX Spark(500 个)的 19 倍。
在预填充密集型任务中,小型系统的性能瓶颈就显现出来了。RTX PRO 6000 在 64 个并发流下输出令牌速度降至每秒 872 个,Spark 则为 199 个,而 WS300 在 128 个流下仍在持续提升,最终达到 5,038 个,比前者高出近 6 倍。长时间的请求会迅速占用大量键值缓存,内存余量较小的系统在 Station 之前就会耗尽批处理空间。
羊驼 3.1 8B
Llama 3.1 8B 的体积足够小,我们可以在每台系统上分别以 BF16、FP8 和 NVFP4 三种精度运行它,从而最清晰地展现量化在每台机器上带来的性能提升。在相同工作负载下,128 个并发流的测试结果显示,WS300 的输出令牌数从 BF16 的每秒 17,278 个提升至 NVFP4 的每秒 28,698 个,提升幅度达 66%。RTX PRO 6000 的提升幅度为 114%,从 5,720 个提升至 12,269 个,而 DGX Spark 的提升幅度则高达 143%,从 828 个提升至 2,009 个。值得注意的是:机器越小,量化带来的优势就越明显。
预填充大量结果压缩了整个字段,WS300 的 NVFP4 运行峰值达到每秒 6,744 个输出令牌,而该卡为每秒 2,064 个,Spark 为每秒 317 个。
米斯特拉尔小型 24B
Mistral Small 24B 测试结果显示,各测试平台之间的差距最大。在相同工作负载下,FP8 模式下,WS300 的峰值输出令牌数为每秒 11,157 个,是 RTX PRO 6000(3,779 个)的三倍,是 DGX Spark(585 个)的 19 倍。在单流模式下,Station 的每秒令牌数为 169 个,比 Spark 的每秒令牌数(9 个)更接近交互式舒适度。
在预填充重负载下,RTX PRO 6000 的峰值仅为每秒 32 个并发流和 560 个输出令牌,之后便开始下降,而 WS300 则继续保持每秒 2,316 个并发流和 128 个输出令牌。
Qwen3编码器30B
Qwen3 Coder 30B 是一款混合专家模型,其活动参数数量较少。在这项测试中,小型系统缩小了单流性能差距。在相同工作负载下,RTX PRO 6000 在单并发请求中每秒输出 208 个令牌,而 WS300 为 310 个,这是本次对比中与 Station 最接近的结果,即使是 Spark 也达到了可用的 55 个令牌。批量处理则恢复了通常的排名:在 128 个流的情况下,Station 在 FP8 模式下每秒输出 12,425 个令牌,是 RTX PRO 6000 的 2.4 倍,几乎是 Spark 的 16 倍。
预填充重型芯片的测试遵循既定模式,WS300 的输出速度达到每秒 3,851 个代币,而该卡的峰值为每秒 1,077 个代币,Spark 的峰值为每秒 146 个代币。
在五个共享模型中,WS300 的吞吐量是 Blackwell RTX PRO 6000 的 2.3 到 3 倍,是 DGX Spark 在满并发时的 14 到 19 倍,当长时间的提示信息使 KV 缓存压力增大时,其性能优势甚至可达显卡的 6 倍。这三台机器运行相同的 CUDA 堆栈和相同的量化路径;工作站的优势在于内存容量和带宽,这体现在并发余量和长时间上下文容错能力上。同样重要的是,这些图表无法显示:上述各节中提到的所有前沿规模模型都无法在其他两台系统上加载。
GDSIO
现代人工智能工作负载依赖于将数据批次、模型权重和检查点从存储设备快速移动到 GPU 内存,以确保加速器始终处于满负荷运行状态。NVIDIA GPUDirect Storage 摒弃了传统的双重拷贝路径,即数据首先从 SSD 读取到系统内存,然后再复制到 GPU 内存。
GB300 DGX Station 的实现方式与传统的 PCIe GPU 服务器不同。我们测试中使用的 Micron 4600 固态硬盘连接到集成在 ConnectX-8 中的 PCIe 交换机。ConnectX-8 上游连接到 Grace CPU,而 B300 GPU 则通过 NVLink-C2C 连接到 Grace。SSD 和 GPU 并不位于同一个 PCIe 交换机下。存储流量会先经过 ConnectX-8 交换机,进入 Grace PCIe 根复合体,穿过 Grace 一致性架构,然后通过 NVLink-C2C 到达 B300 的 HBM3e 显存。
借助 GPUDirect Storage,cuFile 会将 B300 HBM3e 中分配的缓冲区注册为存储 I/O 的源或目标。读取操作时,Micron 4600 的控制器使用 DMA 将数据放入 HBM3e;写入操作时,它从 HBM3e 中检索数据。这两个操作都遵循上述 Grace 和 NVLink-C2C 路径,而无需将有效负载暂存在 Grace 的 LPDDR5X 内存中。Grace 仍然管理文件系统和 NVMe 控制平面,包括命令提交和地址转换,但它不会复制数据。因此,即使流量在 SSD 和 B300 内存之间传输时仍然会经过 Grace,GPUDirect Storage 也省去了系统内存暂存步骤。对于 AI 工作负载,顺序读取对应于数据集流式传输、模型加载和检查点恢复,而顺序写入对应于检查点保存和其他传输回存储的操作。
从 GDSIO 顺序读取性能来看,该单元在线程数和块大小方面均表现出稳定的扩展性。在 16K 块大小下,吞吐量从单线程时的 16MiB/s 提升至 16 线程时的 250MiB/s,并在 128 线程时达到 2.0GiB/s。更大的块大小提升速度更快,256K 块大小在 64 线程时达到 11.8GiB/s,并在 128 线程时达到峰值 12.9GiB/s。最佳性能出现在 512K 和 1M 块大小下,吞吐量最高可达 13.1GiB/s,其中 1M 块大小的工作负载仅需 32 个线程即可达到该水平,并在 128 个线程时仍能保持该水平。
在 GDSIO 顺序写入性能方面,该单元在线程数和块大小方面均表现出稳定的扩展性。在 16K 块大小下,吞吐量从单线程时的 16MiB/s 提升至 16 线程时的 250MiB/s,并在 128 线程时达到 2.0GiB/s。更大的块大小提升速度更快,256K 块大小在 32 线程时达到 7.5GiB/s,在 64 线程时达到 12.0GiB/s。1M 块大小的工作负载表现最为出色,仅需 16 个线程即可达到 12.0GiB/s 的峰值,并在 128 个线程时仍能保持该性能。
MSI XpertStation WS300 的目标用户是谁?
WS300 适用于需要直接访问 Blackwell Ultra 但不希望每次实验都从集群预订或云请求开始的组织。人工智能实验室、推理引擎开发人员、框架和编译器团队、机器人团队以及企业人工智能团队都可以将其用作上述工作流程的本地开发节点。MIG 允许开发人员针对多 GPU 设置进行测试和开发,而 BMC 则使系统能够进行远程管理。
对于需要即插即用系统的经验丰富的AI开发者来说,这套系统也极具吸引力。其价值不仅在于B300主机本身,更在于围绕它构建的完整平台:252GB HBM3e显存、Grace协议、496GB LPDDR5X内存、ConnectX-8接口、镜像启动存储、液冷散热、远程管理以及MSI官方支持,所有这些都集成在一个机箱内。实际的限制在于Arm架构的主机、需要专用的20A电路,以及安装大型RTX PRO显卡时需要共享1,600W的电源预算。
充分发挥 WS300 的性能还取决于其配套软件。NVIDIA 提供了一系列丰富的操作手册和部署指南,旨在帮助团队快速上线系统并充分利用其资源。我们将在后续报道中探讨其中的几款工具,包括 Brev。Brev 可以简化工作站的共享访问,提高资源利用率,避免如此昂贵的资源闲置。
至于价格,微星尚未公布,而且这类机器通常都没有标价;这需要与销售团队进行深入洽谈,而不是简单地点击“加入购物车”按钮就能确定。真正值得比较的不是与其他工作站,而是人工智能团队目前已经投入的成本:预留的集群时间、云端GPU的使用承诺,以及等待共享硬件的进度成本。
结语
MSI XpertStation WS300 是我们评测过的功能最强大的工作站,它是一款罕见的能够彻底改变单个从业者工作方式的产品。通常需要集群预留空间才能运行的前沿级检查点、433GB 的 GLM-5.2 以及拥有 550 亿个参数的 Nemotron-3-Ultra,现在只需一台放在办公桌旁的服务器即可加载和运行,私密且随时可用。这正是我们对这套系统如此兴奋的原因。
DGX Station 的目标用户是开发者:包括面向 Blackwell Ultra 的内核开发者、推理引擎和框架团队、运行完整 Isaac 循环的机器人团队,以及那些因共享硬件而苦恼于实验安排的用户。除了这些特定群体之外,购买这些系统的理由相当有限。Arm 主机将无法使用某些工具链;在 120V 电路中,20A 电路是安装的必要条件;没有独立显卡就没有显示输出;而且 RTX PRO 6000 工作站的价格要低得多,足以满足单用户处理 96GB 内存容量范围内的模型的需求。
经济因素也决定了合适的部署规模。一台 WS300 很容易就能在预留的集群时间内得到合理利用,每团队配备两台也同样合理。但进一步堆叠到一定规模后就不再划算了:例如,当一个组织需要购买四台 GB300 塔式服务器时,同样的预算完全可以购买一台八路 B300 服务器,它拥有更大的 GPU 内存、更密集的 MIG 分区以及 GPU 之间的 NVLink 连接。最佳方案是在办公桌上放置一台,实验室里放置两台,作为数据中心投资的补充。
NVIDIA 提供底板,因此 OEM 厂商之间的差异主要体现在实现方式上,而 MSI 在这方面做得非常出色。1,400W 的水冷散热系统为 B300 主板、Grace 控制器、SOCAMM 内存和 ConnectX-8 连接线提供冷却,整个平台在整个测试过程中保持稳定。我们将在后续文章中更深入地探讨 GB300 的散热性能。1,600W 的功率预算会自动分配给各个组件,当我们测试硬件电源断路器时,即使连接出现故障,它也会降低频率而不是直接关机。预装的 12V HPWR 电源线和防下垂支架为 RTX PRO 扩展提供了支持。我们测试了首台到货的 GB300 DGX Station,可以说 XpertStation WS300 为该平台树立了很高的标准。
XpertStation WS300 现在在我们“最佳本地 AI 台式机”排行榜上占据了最佳 GB300 系统位置,并且在我们的“用于智能 AI 的 RAM、GPU 和存储”指南中,它也是内存讨论的核心。


















Amazon