StorageReview.com

MSI XpertStation WS300 리뷰: 748GB의 Coherent 메모리와 20페타플롭스의 성능을 책상 위에서 경험하세요

소비자  ◇  워크 스테이션

MSI XpertStation WS300은 NVIDIA의 최신 DGX Station 아키텍처를 기반으로 제작되었으며, 이는 NVIDIA 역사상 가장 강력한 세대로, GB300 Grace Blackwell Ultra 노드를 책상 바로 옆에 배치한 것과 같습니다. 핵심 성능은 20페타플롭스(petaFLOPS)의 FP4 연산 능력으로, 900GB/s의 NVLink-C2C 링크를 통해 연결된 단일 Blackwell Ultra GPU와 72코어 Grace CPU에서 제공됩니다. 두 프로세서는 748GB의 단일 메모리 풀(252GB의 HBM3e와 496GB의 LPDDR5X)을 공유하여, 수조 개의 파라미터를 가진 모델을 로컬 메모리에 상주시킬 수 있는 충분한 용량을 제공합니다.

모니터와 키보드가 놓인 책상 위에 MSI XpertStation WS300 GB300 DGX 워크스테이션이 있고, 측면 패널을 제거하면 구리 액체 냉각판이 보입니다.

DGX 스테이션은 ConnectX-8 SuperNIC을 사용하여 여러 장치를 클러스터링할 수 있으며, 이 SuperNIC은 800Gb/s 패브릭을 위한 두 개의 400GbE 포트를 제공합니다. 결과적으로 데이터센터급 성능을 갖춘 장비를 서버실이 아닌 가정이나 사무실에서 운영할 수 있습니다.

NVIDIA DGX 스테이션 기술 사양

XpertStation WS300은 NVIDIA의 GB300 DGX 스테이션 플랫폼을 MSI가 구현한 제품입니다. NVIDIA는 Grace Blackwell Ultra 메인보드와 소프트웨어 환경을 제공하고, MSI는 섀시, 수랭 쿨링 시스템, 전원 공급 장치, 스토리지 구성, 외부 I/O, 그리고 서비스 모델을 제공하여 이 플랫폼을 완벽한 데스크톱 시스템으로 완성합니다. Grace CPU, Blackwell Ultra GPU, NVLink-C2C 인터커넥트, 그리고 ConnectX-8 네트워킹은 고정되어 있기 때문에, OEM 간의 진정한 차별화는 주변 시스템이 이러한 하드웨어를 얼마나 효율적으로 지원, 관리, 그리고 활용하는가에 달려 있습니다.

스펙 세부 정보
아키텍처
CPU NVIDIA Grace, 72코어 Arm Neoverse V2
GPU NVIDIA 블랙웰 울트라(B300)
텐서 코어 5th 생성
CPU-GPU 상호 연결 NVLink-C2C, 900GB/s 양방향
메모리
일관된 기억 GB를 748까지
GPU 메모리 최대 252GB HBM3e
GPU 메모리 대역폭 7.1 TB / 초
CPU 메모리 최대 496GB LPDDR5X (SOCAMM 4개)
CPU 메모리 대역폭 396 GB / 초
스토리지
부트 드라이브 CPU에 장착된 2개의 M.2 2280 PCIe 5.0 x4 NVMe 슬롯에 2TB 용량의 SSD 2개를 RAID 1로 구성했습니다.
확장 드라이브 2 x M.2 2280 PCIe 5.0 x4 NVMe (ConnectX-8 연결됨), 공장에서 개봉됨
네트워킹
NIC NVIDIA ConnectX-8 SuperNIC, 2 x 400G QSFP112 (총 800Gb/s)
Ethernet 1 x 10GBase-T RJ45 (Marvell AQC113)
관리 포트 1 x 1000Base-T RJ45 (전용 대역 외 포트)
Wireless M.2 2230 Key-E 슬롯, PCIe 2.0 x1(Wi-Fi 6E/Wi-Fi 7, Bluetooth)
확장
PCIe 슬롯 PCIe 5.0 x16 FHFL 더블 와이드 1개, PCIe 5.0 x16 FHFL 싱글 와이드 2개(x8 신호)
지원되는 추가 GPU NVIDIA RTX PRO 2000 블랙웰, RTX PRO 4000 블랙웰 SFF, RTX PRO 6000 블랙웰 워크스테이션/맥스-Q
전면/상단 I/O
USB USB 3.2 Gen 2 Type-A 포트 2개, USB 3.2 Gen 2 Type-C 포트 2개 (5V/3A)
오디오 잭 2개 (라인 출력/마이크)
후면 I / O
USB USB 10Gbps 타입 A 포트 4개, 마이크로 USB COM(직렬 콘솔) 포트 1개
디스플레이 미니 디스플레이포트 1개 (BMC 비디오, 최대 1024 x 768 해상도, DP++ 미지원)
오디오 잭 3개 (라인 입력/라인 출력/마이크)
관리 및 보안
BMC ASPEED AST2600 (AMI MegaRAC 펌웨어, IPMI 2.0 및 Redfish, eMMC 로컬 스토리지 탑재)
보안 TPM 2.0, 섀시 침입, Microchip CEC1736 하드웨어 루트 오브 트러스트(ERoT)
냉각
액체 냉각 CPU와 GPU를 합쳐 1400W 정격의 액체 냉각 모듈로, GPU, CPU, 메모리 및 ConnectX-8에 블록이 장착되어 있습니다.
라디에이터/팬 360mm 라디에이터 2개, 12025 시스템 팬 1개
출력
전원 공급 장치 1 x 1600W ATX, 80 PLUS Platinum (150 x 86 x 210 mm)
AC 입력 100-114Vac, 15A, 47-63Hz (최대 출력 1300W); 115-240Vac, 15-8A, 47-63Hz (최대 출력 1600W)
폼 팩터
크기 가로 245.7 x 세로 529.0 x 깊이 570.4 mm (세로 9.67 x 세로 20.83 x 깊이)

설계 및 구축

MSI XpertStation WS300 타워형 외관, 메쉬 전면 패널 및 MSI 브랜드 로고
언뜻 보면 XpertStation은 세련된 전문가용 디자인을 갖춘 일반적인 최신 워크스테이션처럼 보입니다. 하지만 측면 패널을 제거하는 순간, 그 유사점은 끝납니다.

MSI XpertStation WS300 내부: GB300 슈퍼칩 위의 구리 냉각판, 라디에이터 팬, 그리고 수직 지지대

GB300 그레이스 블랙웰 울트라 데스크탑 슈퍼칩

WS300의 중심에는 NVIDIA의 Blackwell Ultra 아키텍처 기반의 B300 GPU가 자리 잡고 있습니다.

MSI XpertStation WS300의 GB300 메인보드에 장착된 NVIDIA B300 Blackwell Ultra GPU 패키지의 근접 사진입니다.
StorageReview에서 주석을 달아놓은 NVIDIA Blackwell Ultra B300 GPU 다이어그램

출처: NVIDIA, StorageReview에서 주석 추가

B300은 TSMC의 4NP 공정 기반의 듀얼 레티클 디자인을 채택한, 현재 사용 가능한 가장 진보된 GPU 중 하나입니다. 두 개의 다이는 NVIDIA의 10TB/s NV-HBI 다이 간 인터페이스로 연결되어 GPU가 단일 CUDA 가속기로 작동할 수 있도록 합니다. DGX Station에 사용된 B300은 2,080억 개의 트랜지스터로 구성된 Blackwell Ultra 설계를 기반으로 하며, 최대 160개의 SM과 640개의 5세대 Tensor 코어를 갖추고 있습니다. 또한 7.1TB/s의 메모리 대역폭을 제공하는 252GB의 HBM3e를 탑재하고 있습니다. 데이터 센터용 부품인 B300은 일반 디스플레이 출력과 NVENC 하드웨어 인코더를 지원하지 않습니다. 하지만 7개의 NVDEC 엔진과 7개의 nvJPEG 디코더를 포함하고 있습니다. 또한 MIG를 지원하여 최대 7개의 독립적인 인스턴스로 분할할 수 있습니다. 컴퓨팅 성능 측면에서 B300은 다음과 같은 기능을 제공합니다.

정밀성 최고 성능
B300 컴퓨팅 성능
NVFP4 텐서 코어 20 PFLOPS 희소 구조 / 15 PFLOPS 밀집 구조
FP8 / FP6 텐서 코어 10PFLOPS
INT8 텐서 코어 330 상단
FP16/BF16 텐서 코어 5PFLOPS
TF32 텐서 코어 2.5PFLOPS
FP32 80 TFLOPS
FP64 / FP64 텐서 코어 1.3 TFLOPS
최대 처리 속도는 GPU 부스트 클럭을 기준으로 합니다. 텐서 코어 사양은 별도의 언급이 없는 한 희소성을 사용합니다.

B300과 함께 제공되는 Grace는 NVIDIA의 첫 번째 데이터 센터 CPU입니다. Grace는 72개의 Arm Neoverse V2 코어를 사용하지만, 캐시 계층 구조, 메모리 컨트롤러, 시스템 I/O, 확장 가능한 일관성 패브릭(Scalable Coherency Fabric) 및 NVLink-C2C 인터페이스를 포함한 주변 프로세서는 NVIDIA 자체 설계입니다. Grace는 72개의 코어와 72개의 하드웨어 스레드를 제공하며, 각 코어는 암호화 확장 기능과 4개의 128비트 SVE2 벡터 유닛을 갖춘 Armv9를 구현합니다. 이 코어는 클럭당 최대 8개의 명령어를 처리할 수 있는 6방향 명령어 디코더, 6개의 스칼라 ALU, 각각 64KB의 L1 명령어 및 데이터 캐시, 그리고 1MB의 전용 L2 캐시를 갖추고 있습니다. CPU는 다이 전체에서 114MB의 L3 캐시를 공유합니다.

MSI XpertStation WS300에 장착된 NVIDIA GB300 메인보드로, SOCAMM 메모리 모듈과 PCIe 슬롯이 보입니다.

코어와 L3 캐시 슬라이스는 NVIDIA의 확장 가능한 일관성 패브릭(Scalable Coherency Fabric)을 통해 연결됩니다. 이 패브릭은 3.2TB/s의 바이섹션 대역폭을 제공하는 메시 인터커넥트입니다. 또한 CPU 코어를 메모리, 시스템 I/O 및 NVLink-C2C 인터페이스에 연결하여 Grace가 B300에 데이터를 원활하게 공급하는 데 필요한 데이터 이동 대역폭을 제공합니다. WS300에서 Grace는 가속기와 관련된 CPU 측 작업, 즉 GPU 커널 실행, 데이터 로딩, 전처리, 토큰화 및 모델 오케스트레이션을 처리합니다. 아래 토폴로지 보기는 72코어 Grace CPU 하나와 그 주변에 연결된 플랫폼 장치로 구성된 단일 소켓 설계를 명확하게 보여줍니다.

MSI XpertStation WS300 시스템 토폴로지 다이어그램은 Grace CPU, PCIe 레인 및 플랫폼 장치를 보여줍니다.
Grace는 496GB의 LPDDR5X 메모리와 결합되어 396GB/s의 대역폭을 제공합니다. DGX Station은 메모리를 베이스보드에 직접 납땜하는 대신 4개의 SOCAMM 모듈을 사용합니다. SOCAMM(System-on-Chip Advanced Memory Module)은 LPDDR5X를 소형의 탈착식 폼팩터로 패키징합니다. 이를 통해 플랫폼은 LPDDR5X의 대역폭 및 전력 효율성 이점을 유지하면서 메모리를 쉽게 교체할 수 있습니다. 고장난 모듈은 전체 베이스보드를 교체하지 않고도 교체할 수 있습니다.

Grace와 B300을 연결하는 것은 NVIDIA의 NVLink-C2C 인터페이스입니다. 이 패키지 레벨 인터커넥트는 900GB/s의 양방향 대역폭을 제공하며, 이는 PCIe Gen5 x16 연결보다 약 7배 빠른 속도입니다. 더 중요한 차이점은 메모리 일관성입니다. 기존 워크스테이션에서는 CPU와 외장 GPU가 별도의 메모리 공간을 유지하고 PCIe를 통해 데이터를 주고받습니다. 하지만 NVLink-C2C를 사용하면 Grace와 B300은 일관된 주소 공간을 공유하므로 각 프로세서가 다른 프로세서에 연결된 메모리에 직접 접근할 수 있습니다.

결과적으로 748GB의 HBM 블록이 아니라 748GB의 일관된 주소 공간이 생성됩니다. B300은 7.1TB/s의 속도를 제공하는 252GB의 HBM3e를 탑재하고 있으며, Grace는 396GB/s의 속도를 제공하는 496GB의 LPDDR5X를 추가로 제공합니다. Grace 메모리에 저장된 데이터는 여전히 C2C 링크를 거쳐야 하므로, 자주 액세스되는 모델 가중치, 텐서 및 버퍼에는 HBM이 여전히 최적의 위치입니다. Grace 메모리는 대용량 계층 역할을 하여 B300의 252GB 로컬 메모리 용량을 초과하는 워크로드를 여러 GPU로 분산시키지 않고 하나의 시스템에 유지할 수 있도록 합니다. 두 번째 메모리 계층으로 전환했을 때의 성능 영향은 테스트 섹션 후반부에서 측정할 것입니다.

시스템 토폴로지

GB300 패키지에서 벗어나 MSI의 블록 다이어그램을 살펴보면, 그레이스(Grace)를 중심으로 나머지 시스템 구성 요소들이 어떻게 연결되는지 알 수 있습니다. CPU는 I/O 토폴로지의 중심에 위치하며, 두 개의 PCIe 5.0 x4 M.2 슬롯이 직접 연결되어 있습니다. MSI는 이 슬롯에 운영 체제와 NVIDIA 소프트웨어 스택을 위해 RAID 1로 구성된 2TB Micron 4600 SSD 두 개를 장착했습니다. 또한, 세 개의 풀 사이즈 확장 슬롯도 그레이스에서 직접 연결되며, PCIe 5.0 x16 링크 하나와 PCIe 5.0 x8 링크 두 개로 구성됩니다.

MSI XpertStation WS300에 탑재된 NVIDIA RTX Pro 2000

MSI는 대형 GPU 확장을 위한 섀시 설계도 고려했습니다. 12V HPWR 전원 케이블이 섀시 전면에 편리하게 배치되어 있어 별도의 케이블을 연결할 필요가 없습니다. 또한, 섀시의 강성을 높이는 수직 금속 지지대에는 길고 무거운 RTX PRO 카드를 안정적으로 받쳐주는 처짐 방지 브래킷이 내장되어 있습니다.

Grace 측의 USB 컨트롤러는 시스템의 전면 및 후면 메인 USB 포트와 오디오 코덱을 제어합니다. Grace는 또한 ASPEED AST2600 BMC에 연결되어 전용 1GbE 관리 포트, 1024 x 768 해상도로 제한된 Mini DisplayPort 출력, 그리고 Micro-USB 시리얼 콘솔을 제공합니다. Mini DisplayPort는 초기 설정 및 문제 해결용으로 설계되었으며, 시스템의 기본 디스플레이 출력으로는 적합하지 않습니다. WS300을 일반 데스크톱처럼 사용하려면 별도의 RTX PRO 확장 카드가 필요합니다.

MSI XpertStation GB300 블록 다이어그램은 ConnectX-8이 보조 I/O 허브 역할을 하는 것을 보여줍니다.
The other major branch is NVIDIA’s ConnectX-8 SuperNIC. Its most visible feature is the pair of 400GbE QSFP112 ports on the rear panel, providing up to 800Gb/s of aggregate network bandwidth. ConnectX-8 also includes an integrated PCIe switch with 48 lanes; its upstream link is PCIe Gen6 capable, but the downstream ports it exposes to devices run at PCIe 5.0, allowing MSI to use it as a secondary I/O hub rather than simply a network adapter.
MSI XpertStation WS300 M.2 슬롯에 방열판 아래에 장착된 2TB Micron 4600 NVMe SSD 두 개.

ConnectX-8에서 나오는 두 개의 PCIe 5.0 x4 링크는 나머지 M.2 2280 슬롯에 연결되며, MSI는 이 슬롯들을 확장용으로 비워두었습니다. 동일한 분기 회로는 PCIe 2.0 x1을 통해 M.2 2230 Wi-Fi 및 Bluetooth 슬롯, 10GBase-T 포트용 Marvell AQC113 컨트롤러, 그리고 전면 패널의 추가 USB 경로를 제공하는 두 번째 USB 컨트롤러에도 연결됩니다.

전력 및 냉각

WS300은 C19 입력 단자를 갖춘 1,600W 80 PLUS Platinum ATX 파워 서플라이 하나로 전원을 공급받습니다. 북미 지역 설치 시, DGX 스테이션은 시스템에 필요한 최대 전력을 공급하기 위해 20A 전용 회로가 필요합니다.

MSI XpertStation WS300은 1,600W 80 PLUS Platinum 등급의 전원 공급 장치를 통해 안정적인 전력을 공급합니다.

1,600W 정격은 시스템 전체의 최대 전력 소비량입니다. Grace 메인보드, B300, 저장 장치, 펌프, 팬, 그리고 옵션으로 장착하는 RTX PRO 그래픽 카드까지 모두 동일한 전원 공급 장치에서 전력을 끌어옵니다. 고성능 그래픽 카드를 추가하면 WS300의 성능이 향상되지만, 별도의 전원 공급 장치를 사용하는 것은 아닙니다. B300과 RTX 카드가 모두 부하가 걸리면 기존에 사용 가능한 전력을 공유해야 하므로 B300 GPU의 성능이 저하될 수 있습니다.

MSI는 B300 메인보드, Grace CPU, SOCAMM 메모리, ConnectX-8 및 광학 드라이브 케이지를 포함하는 전체 섀시를 냉각하는 맞춤형 수랭 루프를 통해 발생하는 열 부하를 효과적으로 관리합니다. 열은 두 개의 360mm 라디에이터를 통해 외부로 전달되며, 별도의 120mm 팬이 섀시 내부의 나머지 공간에 공기를 순환시킵니다. MSI는 이 쿨링 시스템이 CPU와 GPU를 합쳐 최대 1,400W의 전력을 처리할 수 있다고 밝혔습니다. 테스트 결과, B300 메인보드의 온도는 최고 71°C를 기록했으며, CPU 온도는 GPU가 1292W의 전력을 소모하는 동안에도 65°C를 넘지 않았습니다.

MSI XpertStation WS300 내부에 있는 액체 냉각 라디에이터, 팬 및 편조 튜브

파워 슬로싱

NVIDIA는 vsloshd 서비스를 통해 공유 전력 예산을 관리합니다. 기본 동적 모드에서 이 서비스는 GB300 모듈과 옵션으로 제공되는 RTX PRO 카드의 실시간 전력 소모량을 모니터링하여 각 장치의 전력 소비량을 고정된 한도로 유지하는 대신, 사용 가능한 여유 전력을 두 장치 간에 조정합니다. 현재 정책에서는 RTX 카드가 우선 순위를 가지므로, RTX 카드에 더 많은 전력이 필요할 경우 시스템은 먼저 GB300의 전력 제한을 낮춘 후 RTX의 전력 제한을 높입니다. RTX 카드가 설치되지 않은 경우에는 전체 전력 예산이 GB300 모듈에 할당됩니다.

즉, 옵션 사양인 RTX PRO 6000은 B300의 성능 향상에 그치는 것이 아닙니다. 두 GPU가 모두 작동 중일 때, RTX 카드에 할당된 전력은 B300의 전력 예산에서 직접 차감되어 B300의 클럭 속도와 성능을 저하시킬 수 있습니다.

이 플랫폼에는 전원 공급 상태가 저하될 경우를 대비한 하드웨어 전원 차단 기능도 포함되어 있습니다. 실제 테스트 과정에서 전원 커넥터가 헐거워지면 WS300이 완전히 꺼지거나 연결 불량으로 인해 최대 전력을 계속 소모하는 대신 전력 제한을 낮추는 것을 확인했습니다. 연결 문제가 해결될 때까지 장비는 저전력 상태로 계속 작동했습니다.

입/출력 라인

본체를 살펴보기 전에 전면 및 후면 I/O 포트를 간단히 살펴보겠습니다. 전면 I/O 포트는 USB 3.2 Gen 2 Type-A 포트 2개, USB 3.2 Gen 2 Type-C 포트 2개, 별도의 라인 출력 및 마이크 잭, 그리고 전원 및 리셋 버튼으로 구성되어 있습니다.

MSI XpertStation WS300의 전면 패널로, USB Type-A 및 Type-C 포트, 오디오 잭, 전원 제어 버튼이 있습니다.

후면 패널은 워크스테이션 연결 포트와 그 아래에 있는 서버 하드웨어로 나뉘어져 있습니다. ConnectX-8은 두 개의 400GbE QSFP112 포트를 제공하며, 별도의 10GBase-T 포트는 일반 호스트 네트워킹을 처리하고, 전용 1GbE 포트는 BMC에 연결됩니다. 4개의 10Gbps USB Type-A 포트와 3개의 오디오 잭은 로컬 주변 장치를 지원합니다. BMC에는 Micro-USB 시리얼 콘솔과 Mini DisplayPort도 있습니다. C19 전원 입력 단자는 섀시 하단에 있으며, 내부 M.2 2230 Key-E 슬롯을 통해 Wi-Fi 6E 또는 Bluetooth 기능이 있는 Wi-Fi 7을 추가할 수 있습니다.

MSI XpertStation WS300의 후면 패널에는 듀얼 400GbE QSFP112 포트, 10GBase-T, BMC 관리 및 USB 포트가 있습니다.

데스크톱에서 처리하는 데이터센터 워크로드

지금까지 설명한 내용은 DGX Station이 무엇인지에 대한 것입니다. 구매자에게 더 중요한 질문은 XpertStation을 통해 팀이 무엇을 할 수 있는지입니다. WS300의 가치는 단순히 고용량 추론 시스템이 아닌 개발 플랫폼으로 생각할 때 더욱 분명해집니다. B300 GPU, Grace CPU, MIG 지원, 옵션으로 제공되는 RTX PRO 그래픽 카드, 그리고 데이터센터 소프트웨어 스택을 통해 일반적으로 공유 클러스터 하드웨어에 의존하는 여러 워크플로우를 단일 로컬 노드에서 구현할 수 있습니다.

MIG는 개발 도구로서

하나의 GPU에서 완전히 분리된 여러 작업을 동시에 실행한다고 상상해 보세요. 각 작업은 다른 작업과 완전히 차단됩니다. 이것이 바로 멀티 인스턴스 GPU(MIG)가 하는 일입니다. MIG는 하드웨어에서 B300을 최대 7개의 동일한 크기의 슬라이스, 즉 인스턴스로 공간적으로 분할합니다. 각 인스턴스는 SM, HBM, 캐시 및 메모리 대역폭을 고정된 비율로 할당받고, 고유한 장치 ID를 가지며, CUDA에서는 별도의 GPU로 인식됩니다.

이를 통해 멀티 GPU 워크로드를 개발, 테스트 및 검증하고, 스크립트를 학습시키고, Dynamo, LLM-D 등의 도구를 위한 개발을 수행할 수 있습니다.

MSI XpertStation WS300의 터미널 출력은 GB300이 세 개의 MIG 2g.63gb 인스턴스로 분할되어 있으며, 각 인스턴스는 k3s의 Dynamo에서 vLLM 엔진을 실행하고 있음을 보여줍니다.

테스트를 위해 B300에 3개의 MIG 인스턴스를 구성하고, 이를 사용하여 각각의 CUDA 지원 장치에서 NVIDIA Dynamo 컴포넌트를 실행했습니다. 이는 저희 벤치마크 툴 개발 방식과 유사합니다. 툴이 의도한 대로 정확하게 작동하는지 검증하려면 실제 하드웨어에서 반복적으로 테스트를 진행해야 합니다. 공유 서버에 시간을 할애할 필요도 없고, 전력 소모, 발열, 소음 문제도 없는 로컬 B300 환경을 활용하여 필요에 따라 재구성할 수 있기 때문에 이러한 반복적인 작업에 드는 시간과 노력을 상당히 줄일 수 있습니다.

아이작 GR00T와 물리적 AI 루프

DGX Station에 특히 잘 맞는 또 다른 워크플로는 물리적 AI입니다.

이와 같은 워크플로우를 이전에 테스트해 본 적이 있지만 , 당시에는 서로 다른 등급의 GPU가 장착된 여러 시스템이 필요했습니다. DGX Station은 이전에 분리되어 있던 이러한 단계를 하나의 데스크톱 장비로 통합합니다.

이 과정은 원격 조작으로 시작됩니다. 조작자가 로봇을 조종하여 작업을 수행하고 실제 환경에서의 소규모 시뮬레이션 데이터를 수집합니다. 이렇게 수집된 데이터는 Isaac GR00T 워크플로우에 입력됩니다. 옵션 사양인 RTX PRO GPU는 Isaac Sim의 그래픽 및 레이 트레이싱 요구 사항을 처리하고, Isaac Lab과 GR00T-Mimic은 초기 시뮬레이션 데이터를 확장하여 물리적으로 타당한 훨씬 더 많은 수의 합성 궤적을 생성합니다. 마지막으로, B300은 실제 데이터와 합성 데이터를 결합하여 GR00T 모델을 미세 조정합니다.

NVIDIA Isaac GR00T N 모델의 워크플로 다이어그램: 데이터 생성 및 학습 후 단계부터 시뮬레이션 및 하드웨어 인 더 루프 테스트를 거쳐 Jetson Thor 로봇에 배포하기까지의 과정

출처: NVIDIA

미세 조정을 거친 후, 생성된 정책은 실제 로봇에 적용하여 평가하기 전에 시뮬레이션에서 검증할 수 있습니다. 이는 실제 시연을 캡처하고, 시뮬레이션에서 이를 재현 및 변형하고, 모델을 재학습시키고, 업데이트된 정책을 하드웨어에서 테스트하는 긴밀한 개발 루프를 구축합니다. 로봇, 운영자 또는 데이터 수집 시간이 제한적인 팀의 경우, 시뮬레이션, 합성 데이터 생성 및 모델 학습을 단일 데스크톱 시스템에 통합함으로써 각 반복 작업의 효율성을 크게 향상시킬 수 있습니다.

블랙웰 울트라 커널 개발

하지만 DGX Station의 가장 큰 장점은 단연 커널 최적화라고 할 수 있습니다. 블랙웰 울트라용 CUDA 또는 Triton 커널을 개발하는 팀에게는 타겟 아키텍처에서 직접 실행하는 것만큼 좋은 방법이 없습니다. WS300은 개발자에게 B300과 252GB의 HBM3e 메모리를 제공하여, 8개의 GPU가 탑재된 서버나 랙 규모 시스템을 예약하지 않고도 실제 워크로드를 프로파일링하고, 메모리 동작을 검사하고, Tensor Core 경로를 최적화하고, 연산을 통합하고, 반복 작업을 수행할 수 있도록 해줍니다.

대규모 시스템은 여전히 ​​중요하지만, NVLink 확장, NCCL 콜렉티브, 통신 커널, 멀티 GPU 추론 및 최종 처리량 검증과 같이 대규모 시스템이 필요한 작업에만 사용할 수 있습니다. WS300은 단일 GPU 커널 작업을 로컬에서 처리하므로 비용이 많이 드는 공유 시스템을 확장 테스트에 사용할 수 있습니다. Blackwell Ultra 최적화에 집중하는 팀에게 WS300은 시장에서 제공하는 가장 직관적인 개발 환경 중 하나입니다.

만약 DGX 스테이션이 최초의 블랙웰 울트라 시스템과 함께 출시되었다면, 초기 물량은 AI 연구소, 컴파일러 팀, 추론 엔진 개발자, 그리고 B300용 소프트웨어 최적화에 열중하는 다른 그룹들로 순식간에 빠져나갔을 것으로 예상됩니다. 지금도 DGX 스테이션을 구매하는 가장 확실한 이유는 타겟 GPU에 직접 접근할 수 있다는 점일 것입니다.

성능

테스트 참고 사항: 테스트는 MSI에서 호스팅하는 시스템에서 원격으로 진행되었으며, StorageReview가 평가 기간 동안 전체 소프트웨어 환경을 제어했습니다. 시스템에는 RTX PRO GPU 또는 기타 PCIe 확장 카드가 설치되지 않은 상태로 테스트가 수행되었습니다. 따라서 GB300 Superchip은 테스트 기간 내내 시스템에서 사용 가능한 최대 가속기 전력을 활용할 수 있었습니다.

최대 달성 가능 Matmul FLOPS(MAMF)

먼저, B300의 연산 능력을 비교하기 위해 세 가지 블랙웰 세대 시스템에서 MAMF(Maximum Achievable Matmul FLOPS) 테스트를 실행했습니다. MAMF는 머신 러닝 가속기에서 행렬 곱셈 연산 중에 실제로 달성할 수 있는 최대 부동 소수점 연산 처리량을 측정하도록 설계된 실용적인 성능 지표로, 하드웨어 사양에 흔히 명시되는 이론적인 최대 FLOPS보다 더 정확한 벤치마크를 제공합니다.

이 테스트에서는 BF16, FP8 및 NVFP4에서 3개 시스템 각각에 대해 스캔을 수행하고 정밀도별로 가장 우수한 지속적인(밀집된) 결과를 보고합니다.

MAMF 벤치마크 차트: GB300과 RTX PRO 6000 및 DGX Spark의 BF16, FP8 및 NVFP4에서의 최대 매트릭스 연산 TFLOPS 비교

GB300은 모든 정밀도에서 우위를 점합니다. BF16에서 GB300은 1,967 TFLOPS를 기록하며 RTX PRO 6000 의 412 TFLOPS, DGX Spark 의 104 TFLOPS를 크게 앞섭니다. FP8에서도 마찬가지로 3,909 TFLOPS, 763 TFLOPS, 211 TFLOPS를 보여줍니다. NVFP4에서는 GB300이 6,134 TFLOPS를 기록하며 RTX PRO 6000의 1,449 TFLOPS, Spark의 364 TFLOPS를 크게 앞섭니다. 세 가지 정밀도 모두에서 성능 비율은 놀라울 정도로 안정적입니다. GB300은 RTX PRO 6000보다 4~5배, Spark보다 17~19배 높은 성능을 유지하는 반면, RTX PRO 6000은 Spark보다 약 4배 높은 성능을 보입니다.

NV대역폭

컴퓨팅 처리량은 가속기가 실행 장치에 지속적으로 데이터를 공급할 수 있을 때만 유용합니다. 이는 특히 AI 추론에서 중요한데, 디코딩 단계에서 토큰 생성은 사용 가능한 FLOPS보다 메모리 대역폭에 의해 제한되는 경우가 많기 때문입니다.

GB300 슈퍼칩에서 이러한 계층 구조는 B300의 로컬 HBM3e, Grace의 LPDDR5X 메모리, 그리고 이들을 연결하는 NVLink-C2C 인터커넥트에 걸쳐 있습니다. NVIDIA의 NVBandwidth 유틸리티는 이러한 구성 요소들 간의 다양한 복사 경로를 테스트하여 GPU 내부에서 사용 가능한 대역폭과 GPU 및 CPU 메모리 영역 간 데이터 이동 비용을 모두 보여줍니다.

GB300의 NVBandwidth 결과: HBM3e 로컬 대역폭 및 Grace LPDDR5X 메모리로의 NVLink-C2C 전송

처음 네 가지 테스트는 B300의 252GB HBM3e 메모리 내 데이터 이동 속도를 측정합니다. 장치 로컬 읽기 속도는 6,875GB/s(약 6.9TB/s)에 달하며, 이는 GPU의 정격 메모리 대역폭인 7.1TB/s에 몇 퍼센트 차이밖에 나지 않습니다. 장치 로컬 쓰기 속도는 6,009GB/s에 도달했습니다.

HBM 간 복사 작업은 모든 복사 과정에서 대역폭을 두 번 소모하기 때문에 속도가 더 느립니다. 한 번은 소스를 읽는 데, 또 한 번은 대상에 쓰는 데 사용됩니다. 전용 복사 엔진은 최대 3,100GB/s의 속도를 낼 수 있으며, Tensor Memory Accelerator는 2,527GB/s를 기록했습니다.

나머지 테스트는 NVLink-C2C를 통해 Grace의 496GB LPDDR5X 메모리에 접근하는 방식으로 진행되었습니다. Grace 메모리에서 B300 HBM으로의 데이터 전송 속도는 390GB/s에 달했고, 반대 방향으로의 전송 속도는 382GB/s에 달했습니다. NVLink-C2C는 CPU와 GPU 간에 최대 900GB/s의 일관성 있는 대역폭을 제공하지만, 측정된 전송 속도는 Grace의 396GB/s LPDDR5X 메모리 대역폭에 의해 제한되었습니다. 양방향 전송을 통해 이러한 제약 조건이 더욱 명확하게 드러났습니다. 동시 트래픽 속도는 SM 기반 복사 방식을 사용할 경우 253GB/s, 복사 엔진을 사용할 경우 192GB/s에 도달했습니다.

추론

저수준 테스트를 마쳤으므로 이제 LLM 추론으로 넘어갑니다. 여기서는 최대 처리량에서 초당 토큰 수, 첫 번째 토큰 수신 시간, 부하 시 지연 시간으로 초점을 옮겨 WS300이 서비스 시스템으로서 어떻게 작동하는지 더 잘 파악할 수 있습니다.

GB300 슈퍼칩의 핵심 기능부터 살펴보겠습니다. 바로 B300의 252GB HBM3e 용량 제한을 기준으로 양쪽의 모델을 모두 지원할 수 있다는 점입니다. 여기서 748GB의 일관성 메모리 풀이 가장 중요한 역할을 합니다. 다섯 개의 체크포인트는 HBM에 여유롭게 들어가는 두 모델부터, 명목상으로는 들어가지만 런타임 및 KV 캐시를 위한 여유 공간이 부족한 한 모델, 그리고 마지막으로 상당 부분의 용량을 Grace 메모리로 옮겨야 하는 두 모델까지 순차적으로 처리합니다.

참고: 언급된 경우, 디코딩 처리량을 높이기 위해 예측 디코딩을 사용하여 모델을 실행했으며, 강제 승인 토큰 수량은 예측 디코딩 토큰 수량으로 설정했습니다. 따라서 결과는 최상의 성능을 보여줍니다. 실제 서비스 환경에서는 처리량이 동적이며 예측 디코딩 토큰의 품질에 따라 달라집니다.

HBM에 완벽하게 들어맞는 모델

DeepSeek v4 플래시(0731)

먼저, 매우 인기 있는 DeepSeek v4 Flash(0731)를 살펴보았습니다. 이 모델은 네이티브 FP8 체크포인트로 14GB+6GB의 메모리를 사용합니다. DeepSeek v4 Flash는 효율성이 매우 높고 실행이 간편하기로 유명하며, DGX Station에서도 이러한 장점을 확인할 수 있었습니다. 512/512 워크로드에서 동시 실행자 1명일 때 초당 149개의 토큰 처리량으로 시작하여 동시 실행자 32명에서는 1,766개까지 빠르게 증가했습니다. 사전 채우기 작업이 많은 워크로드에서도 초당 146개에서 949개 토큰까지 처리량이 증가했습니다.
MSI XpertStation WS300에서 DeepSeek V4 플래시 메모리의 동시 접속 수준에 따른 처리량
전체 토큰 처리량은 512/512 워크로드가 초당 298개에서 3,532개 토큰으로, 사전 채우기 작업이 많은 워크로드가 1,311개에서 8,537개로 증가하면서 동일한 속도로 확장되었습니다.
MSI XpertStation WS300에서 DeepSeek V4 플래시의 총 처리량

미니맥스 M2.7(NVFP4)

다음은 저희가 선호하는 모델 중 하나인 MiniMax M2.7입니다. NVIDIA의 NVFP4 양자화기를 사용하여 테스트했으며, 125GB의 VRAM을 사용합니다. 512/512 워크로드에서 출력 처리량은 동시 실행 1에서 초당 193 토큰으로 시작하여 동시 실행 128에서 초당 4,801 토큰까지 빠르게 증가했습니다. 사전 채우기 작업이 많은 워크로드는 동시 실행 1에서 초당 195 토큰에서 동시 실행 64에서 초당 1,743 토큰으로 증가했습니다. 총 토큰 처리량은 반대 추세를 보였는데, 사전 채우기 작업이 많은 워크로드는 동시 실행 64까지 초당 1,754 토큰에서 15,684 토큰으로 증가한 반면, 512/512 워크로드는 동시 실행 128에서 초당 424 토큰에서 9,602 토큰으로 증가했습니다.

MSI XpertStation WS300에서 MiniMax M2.7 NVFP4의 처리량
전체 토큰 처리량은 정반대의 추세를 보였는데, 사전 채우기 작업이 많은 워크로드는 동시 실행 수 64까지 초당 1,754개에서 15,684개 토큰으로 증가한 반면, 512/512 워크로드는 동시 실행 수 128에서 초당 424개에서 9,602개 토큰으로 증가했습니다.
MSI XpertStation WS300에서 MiniMax M2.7의 총 처리량

HBM에 간신히 들어맞는 모델

미니맥스 M3(NVFP4)

MiniMax M3는 실제 환경에서 용량이 얼마나 부족한지를 보여줍니다. 233GB NVFP4 체크포인트는 B300의 252GB HBM보다 작지만, 런타임과 KV 캐시를 위한 공간이 여전히 필요합니다. 최종적으로 223GB의 HBM을 사용했으며, 21GB의 전문가 캐시는 Grace로 오프로드되었습니다. EAGLE3-GQA 투기적 디코딩을 사용했으며, 합성 수용 길이는 3토큰이었습니다. 512/512 워크로드에서 출력 처리량은 동시 실행 1에서 초당 197토큰으로 시작하여 동시 실행 32에서 초당 1,041토큰까지 꾸준히 증가했습니다. 사전 채우기 작업이 많은 워크로드에서는 동시 실행 1에서 초당 171토큰으로 시작하여 동시 실행 2에서 최대 278토큰까지 증가한 후 동시 실행 4에서 241토큰으로 감소했습니다.
MSI XpertStation WS300에서 MiniMax M3 NVFP4의 처리량 (전문가들이 Grace 메모리로 작업을 오프로드한 경우)
전체 토큰 처리량도 비슷한 양상을 보였는데, 512/512 워크로드는 초당 395개에서 2,082개 토큰으로 증가했고, 사전 채우기 작업이 많은 워크로드는 동시 실행 2에서 초당 2,506개 토큰으로 정점을 찍은 후 동시 실행 4에서 2,169개로 감소했습니다.
MSI XpertStation WS300에서 MiniMax M3의 총 처리량

HBM에 맞지 않는 모델

GLM-5.2 (NVFP4)

NVIDIA의 NVFP4 양자화기를 사용하여 GLM-5.2를 테스트했습니다. 433GB 체크포인트는 218GB의 HBM을 사용했으며, 216GB의 전문가 가중치는 Grace 메모리로 오프로드되었습니다. MTP 투기적 디코딩을 사용했으며, 합성 수용 길이는 3토큰이었습니다. 512/512 워크로드에서 출력 처리량은 동시 실행 1에서 초당 36토큰에서 동시 실행 32에서 139토큰으로 증가했습니다. 8,192/1,024 워크로드도 비슷한 증가세를 보이며 초당 35토큰에서 118토큰으로 상승했습니다. 두 프로파일 간의 유사한 결과는 생성 속도가 주로 오프로드된 전문가 가중치를 Grace 메모리와 GPU 간에 이동하는 데 제한을 받았음을 보여줍니다. 추가 컨텍스트를 저장할 HBM 메모리가 부족하여 동시 실행 32에서 테스트를 종료했습니다.

전문가 가중치를 Grace 메모리로 오프로드한 상태에서 MSI XpertStation WS300에서의 GLM-5.2 NVFP4 처리량
전체 토큰 처리량도 동일한 패턴을 보였는데, 512/512 워크로드는 초당 72개에서 277개 토큰으로 증가했고, 사전 입력이 많은 워크로드는 314개에서 1,062개로 증가했습니다. 여기서는 사전 입력 토큰 자체가 전체 처리량에 포함되기 때문에, 프롬프트 시간이 길어지면서 두 프로파일이 확연히 구분되었습니다.
MSI XpertStation WS300에서 GLM-5.2의 총 처리량

네모트론-3-울트라 550B (NVFP4)

Nemotron-3-Ultra 550B는 우리가 실행한 모델 중 가장 큰 모델이며, 전체 코히런트 풀을 가장 직접적으로 활용하는 모델입니다. 이 모델은 307GB NVFP4 하이브리드 Transformer-Mamba 모델로, HBM만으로는 처리하기에는 너무 커서 114GB의 가중치를 Grace 메모리로 오프로드했습니다. MTP 투기적 디코딩을 사용했으며, 합성 수용 길이는 5토큰으로 설정했습니다. 512/512 워크로드에서 출력 처리량은 동시 실행 1에서 초당 43토큰으로 시작하여 동시 실행 32에서 168토큰까지 증가했습니다. 사전 입력이 많은 워크로드에서는 더 흥미로운 결과가 나타났습니다. 처리량은 동시 실행 1에서 초당 44토큰으로 시작하여 동시 실행 2에서 최고 122토큰까지 상승했지만, 긴 프롬프트로 인해 제한된 KV 캐시가 가득 차면서 동시 실행 4에서는 78토큰으로 다시 떨어졌습니다. GLM-5.2와 마찬가지로 두 프로파일은 서로 매우 유사한 양상을 보이며, 컴퓨팅 성능보다는 Grace와 GPU 간의 전문적인 마이그레이션이 제한 요소임을 다시 한번 보여줍니다. 테스트가 동시 실행 32에서 종료된 이유도 동일합니다. 추가적인 컨텍스트를 저장할 HBM 메모리가 부족했기 때문입니다.

Nemotron-3-Ultra 550B vLLM은 HBM과 Grace 메모리에 가중치를 분산하여 MSI XpertStation WS300에서 처리량을 제공합니다.

총 토큰 처리량은 다음과 같이 나타났습니다. 사전 채우기 작업이 많은 워크로드는 동시 실행 2에서 초당 2,506개의 토큰으로 정점을 찍은 후 동시 실행 4에서 2,169개로 감소했으며, 512/512 워크로드는 초당 85개에서 336개의 토큰으로 확장되었습니다.

Nemotron-3-Ultra는 MSI XpertStation WS300에서 두 가지 vLLM 워크로드 프로파일 모두에서 총 550B의 토큰 처리량을 달성했습니다.

WS300 vs. 블랙웰 RTX PRO 6000 vs. DGX 스파크

이번 추론 테스트의 후반부에서는 WS300을 블랙웰을 책상 위에 또는 책상 근처에 배치하는 다른 두 가지 방법, 즉 이전에 리뷰했던 Dell Pro Max Tower T2 에 탑재된 NVIDIA의 600W 워크스테이션 카드인 Blackwell RTX PRO 6000과 Acer Veriton GN100 에 탑재된 GB10 기반 DGX Spark와 비교합니다 . 각 시스템은 512개의 입력 토큰과 512개의 출력 토큰을 사용하는 동일한 워크로드와 8,192개의 입력 토큰과 1,024개의 출력 토큰을 사용하는 사전 입력 비중이 높은 워크로드, 이렇게 두 가지 시나리오에서 동일한 vLLM 실시간 추론 워크로드를 1에서 128까지의 동시 실행 수준에서 실행했습니다. 세 시스템 모두에서 공통적으로 처리할 수 있는 모든 모델(GPT-OSS-20B 및 GPT-OSS-120B(네이티브 MXFP4), Llama 3.1 8B(BF16, FP8 및 NVFP4), Mistral Small 24B 및 Qwen3 Coder 30B(BF16 및 FP8))에 대한 총 출력과 처리량을 차트로 나타냈습니다.

GPT-OSS-20B

GPT-OSS-20B는 세 시스템 모두에서 쉽게 실행할 수 있는 테스트로, 테스트 세트 중 가장 사용하기 쉬운 체크포인트입니다. 동일한 작업 부하에서 WS300은 128개의 동시 스트림에서 초당 22,161개의 출력 토큰을 처리하며 안정적인 확장성을 보여주었는데, 이는 RTX PRO 6000의 9,000개보다 약 2.5배, DGX Spark의 1,469개보다 약 15배 높은 수치입니다. 단일 스트림 결과도 비슷한 양상을 보입니다. Station에서는 초당 530개, WS300에서는 244개, DGX Spark에서는 50개의 토큰을 처리했습니다.

GPT-OSS-20B에 대한 vLLM 서비스 처리량 차트 (MSI XpertStation WS300(GB300 DGX Station), Blackwell RTX PRO 6000, DGX Spark의 동시 접속 수준별 비교)

사전 입력이 많은 시나리오에서 성능 차이는 더욱 두드러졌습니다. WS300은 8,192개의 토큰 프롬프트를 처리하는 상황에서도 최대 9,572개의 토큰을 초당 출력했으며, 사전 입력을 포함하면 총 86,000개 이상의 토큰을 초당 처리하는 셈입니다. 반면 RTX PRO 6000은 최대 2,892개, Spark는 468개에 그쳤습니다.

MSI XpertStation WS300, Blackwell RTX PRO 6000, DGX Spark의 GPT-OSS-20B vLLM 총 처리량 차트(초당 입력 및 출력 토큰 수 비교).

GPT-OSS-120B

GPT-OSS-120B로 업그레이드했을 때, 세 시스템 모두 여전히 모델을 로드할 수 있었지만 메모리 계층 구조가 중요해지기 시작했습니다. WS300은 동일한 작업 부하에서 초당 최대 9,294개의 출력 토큰을 처리했는데, 이는 RTX PRO 6000의 3,384개보다 2.7배, DGX Spark의 500개보다 거의 19배 높은 수치입니다.

GPT-OSS-120B에 대한 vLLM 서비스 처리량 차트 (MSI XpertStation WS300(GB300 DGX Station), Blackwell RTX PRO 6000, DGX Spark의 동시 접속 수준별 비교)

사전 처리량이 많은 구간에서 소형 시스템의 성능 한계가 드러납니다. RTX PRO 6000은 동시 스트림 64개에서 초당 출력 토큰 872개로 정체되었고, Spark는 199개에서 정체되었습니다. 반면 WS300은 128개 스트림에서도 계속 상승세를 보이며 최종적으로 5,038개까지 처리했는데, 이는 RTX PRO 6000보다 거의 6배나 높은 수치입니다. 긴 프롬프트는 KV 캐시를 팽창시키고, 메모리 여유 공간이 부족한 시스템은 Station보다 훨씬 빨리 배치 처리 용량이 부족해집니다.

MSI XpertStation WS300, Blackwell RTX PRO 6000, DGX Spark의 GPT-OSS-120B vLLM 총 처리량 차트(초당 입력 및 출력 토큰 수 비교).

라마 3.1 8B

Llama 3.1 8B는 크기가 작아서 모든 시스템에서 BF16, FP8, NVFP4로 실행할 수 있었고, 이를 통해 각 시스템에서 양자화가 가져오는 성능 향상을 가장 명확하게 확인할 수 있었습니다. 동일한 작업 부하에서 128개의 동시 스트림을 처리했을 때, WS300은 BF16에서 초당 17,278개의 출력 토큰을 처리하던 것이 NVFP4에서는 28,698개로 증가하여 66%의 성능 향상을 보였습니다. RTX PRO 6000은 동일한 조건에서 초당 5,720개에서 12,269개로 114%의 성능 향상을, DGX Spark는 828개에서 2,009개로 143%의 성능 향상을 기록했습니다. 여기서 주목할 점은 시스템 크기가 작을수록 양자화의 효과가 더 크다는 것입니다.

MSI XpertStation WS300, Blackwell RTX PRO 6000, DGX Spark를 비교한 Llama 3.1 8B의 BF16, FP8 및 NVFP4에서의 vLLM 서빙 처리량 차트

사전 입력량이 많은 결과는 전체 필드를 압축하며, WS300의 NVFP4 실행은 초당 최대 6,744개의 출력 토큰을 생성하는 반면, 카드는 2,064개, Spark는 317개를 생성합니다.

MSI XpertStation WS300, Blackwell RTX PRO 6000, DGX Spark를 비교한 Llama 3.1 8B의 BF16, FP8 및 NVFP4에서의 vLLM 총 처리량 차트

미스트랄 스몰 24B

Mistral Small 24B는 테스트 세트 중 가장 큰 간격을 보였습니다. 동일한 작업 부하에서 FP8 테스트 결과, WS300은 초당 최대 11,157개의 출력 토큰을 처리했는데, 이는 RTX PRO 6000의 3,779개보다 3배, DGX Spark의 585개보다 19배 높은 수치입니다. 단일 스트림 테스트에서 Station의 초당 169개 토큰은 Spark의 9개보다 훨씬 더 편안한 인터랙티브 환경에 가깝습니다.

MSI XpertStation WS300, Blackwell RTX PRO 6000, DGX Spark를 비교하여 BF16 및 FP8에서 Mistral Small 24B에 대한 vLLM 서비스 처리량 차트

사전 부하가 심한 상황에서 RTX PRO 6000은 동시 스트림 32개, 출력 토큰 560개/초에 도달한 후 성능이 저하된 반면, WS300은 128개 스트림에서 2,316개/초까지 안정적으로 작동했습니다.

MSI XpertStation WS300, Blackwell RTX PRO 6000, DGX Spark를 비교한 Mistral Small 24B의 BF16 및 FP8에서의 vLLM 총 처리량 차트

큐웬3 코더 30B

Qwen3 Coder 30B는 활성 파라미터 수가 적은 전문가 혼합 모델로, 소형 시스템들이 단일 스트림 성능 격차를 좁히는 유일한 테스트입니다. 동일한 작업 부하에서 동시 요청 하나당 RTX PRO 6000은 초당 208개의 출력 토큰을 처리했고, WS300은 310개를 처리하여 이번 비교에서 Station에 가장 근접한 결과를 보였으며, Spark조차도 55개의 유효한 토큰을 처리했습니다. 배치 처리에서는 순위가 다시 바뀝니다. 128개의 스트림에서 Station은 FP8 기준으로 초당 12,425개의 출력 토큰을 처리하여 카드보다 2.4배, Spark보다 거의 16배 빠른 성능을 보였습니다.

MSI XpertStation WS300, Blackwell RTX PRO 6000, DGX Spark를 비교한 BF16 및 FP8 환경에서 Qwen3 Coder 30B의 vLLM 서비스 처리량 차트

사전 입력량이 많은 경우 기존 패턴을 따랐으며, WS300은 초당 3,851개의 출력 토큰을 기록했고, 카드는 1,077개, Spark는 146개를 기록했습니다.

MSI XpertStation WS300, Blackwell RTX PRO 6000, DGX Spark를 비교한 Qwen3 Coder 30B의 BF16 및 FP8에서의 vLLM 총 처리량 차트

다섯 가지 공통 모델에서 WS300은 Blackwell RTX PRO 6000보다 2.3~3배, DGX Spark보다 14~19배 높은 처리량을 보였으며, 특히 긴 프롬프트로 KV 캐시에 부하가 걸릴 경우 그 차이는 최대 6배까지 벌어졌습니다. 세 시스템 모두 동일한 CUDA 스택과 양자화 경로를 사용하며, WS300은 메모리 용량과 대역폭이 더 높아 동시 처리 여유 공간과 긴 컨텍스트 처리 시간에서 성능 향상을 보였습니다. 또한, 이 차트에서 확인할 수 없는 중요한 점은, 앞서 언급한 최첨단 모델들은 다른 두 시스템에서는 아예 로드조차 되지 않는다는 것입니다.

GDSIO

최신 AI 워크로드는 가속기를 지속적으로 활용하기 위해 데이터 배치, 모델 가중치 및 체크포인트를 스토리지에서 GPU 메모리로 충분히 빠르게 이동해야 합니다. NVIDIA GPUDirect Storage는 데이터를 먼저 SSD에서 시스템 메모리로 읽은 다음 GPU 메모리로 복사하는 기존의 두 번의 복사 과정을 없애줍니다.

GB300 DGX 스테이션은 기존 PCIe GPU 서버와는 다른 방식으로 이를 구현합니다. 테스트에 사용된 Micron 4600은 ConnectX-8에 통합된 PCIe 스위치에 연결됩니다. ConnectX-8은 업스트림으로 Grace CPU에 연결되고, B300 GPU는 NVLink-C2C를 통해 Grace에 연결됩니다. SSD와 GPU는 동일한 PCIe 스위치 아래에 있지 않습니다. 스토리지 트래픽은 ConnectX-8 스위치를 통과하여 Grace PCIe 루트 컴플렉스로 ​​들어가 Grace 코히어런스 패브릭을 거쳐 NVLink-C2C를 통해 B300의 HBM3e에 도달합니다.

NVIDIA GPUDirect Storage 다이어그램은 시스템 메모리를 통한 표준 바운스 버퍼 경로와 NVMe에서 GPU 메모리로의 직접 DMA 경로를 비교합니다.

GPUDirect Storage를 사용하면 cuFile은 B300 HBM3e에 할당된 버퍼를 스토리지 I/O의 소스 또는 대상으로 등록합니다. 읽기 작업 시 Micron 4600 컨트롤러는 DMA를 사용하여 데이터를 HBM3e에 저장하고, 쓰기 작업 시에는 HBM3e에서 데이터를 검색합니다. 두 작업 모두 위에서 설명한 Grace 및 NVLink-C2C 경로를 따르지만, Grace의 LPDDR5X 메모리에 페이로드를 임시 저장하지는 않습니다. Grace는 명령 제출 및 주소 변환을 포함하여 파일 시스템과 NVMe 제어 평면을 계속 관리하지만, 데이터를 복사하지는 않습니다. 따라서 GPUDirect Storage는 SSD와 B300 메모리 사이의 트래픽이 여전히 Grace를 거치더라도 시스템 메모리 임시 저장 단계를 제거합니다. AI 워크로드의 경우 순차 읽기는 데이터셋 스트리밍, 모델 로딩 및 체크포인트 복원에 해당하고, 순차 쓰기는 체크포인트 저장 및 스토리지로의 기타 전송에 해당합니다.

GDSIO 순차 읽기 성능을 살펴보면, 이 장치는 스레드 수와 블록 크기 모두에서 일관된 확장성을 보여줍니다. 16KB 블록 크기에서 처리량은 스레드 1개에서 16MiB/s에서 16개 스레드에서 250MiB/s로 증가하고, 128개 스레드에서는 2.0GiB/s에 도달합니다. 블록 크기가 커질수록 처리량 증가 속도는 훨씬 빨라져, 256KB 블록 크기에서는 스레드 64개에서 11.8GiB/s에 도달하고 128개 스레드에서 12.9GiB/s의 최고치를 기록합니다. 가장 우수한 결과는 512KB 및 1MB 블록 크기에서 나타나는데, 처리량은 최고 13.1GiB/s에 이르며, 특히 1MB 블록 크기의 경우 스레드 32개에서 이 수준에 도달한 후 128개 스레드까지 유지됩니다.MSI XpertStation WS300에서 GPU 메모리로의 GDSIO 순차 읽기 처리량

GDSIO 순차 쓰기 성능으로 넘어가면, 이 장치는 스레드 수와 블록 크기 모두에서 일관된 확장성을 보여줍니다. 16KB 블록 크기에서 처리량은 스레드 1개에서 16MiB/s에서 16개 스레드에서 250MiB/s로 증가하고, 128개 스레드에서는 2.0GiB/s에 도달합니다. 블록 크기가 커질수록 처리량 증가 속도는 훨씬 빨라져, 256KB 블록 크기에서는 32개 스레드에서 7.5GiB/s, 64개 스레드에서 12.0GiB/s에 도달합니다. 가장 뛰어난 결과는 1MB 워크로드에서 나타나는데, 16개 스레드에서 12.0GiB/s의 최고 성능에 도달한 후 128개 스레드까지 해당 성능을 유지합니다. MSI XpertStation WS300의 GDSIO 순차 쓰기 처리량

MSI XpertStation WS300은 누구를 위한 제품인가요?

WS300은 Blackwell Ultra에 직접 액세스해야 하지만 모든 실험을 클러스터 예약이나 클라우드 요청으로 시작하고 싶지 않은 조직을 위한 제품입니다. AI 연구소, 추론 엔진 개발자, 프레임워크 및 컴파일러 팀, 로봇 공학 그룹, 그리고 기업 AI 팀은 WS300을 위의 워크플로를 위한 로컬 개발 노드로 활용할 수 있습니다. MIG를 통해 개발자는 멀티 GPU 환경에서 테스트 및 개발을 진행할 수 있으며, BMC를 통해 시스템을 원격으로 관리할 수 있습니다.

숙련된 AI 개발자에게도 바로 작업에 투입할 수 있는 시스템을 제공하기 때문에 이 제품은 합리적인 선택입니다. B300의 가치는 단순히 메인보드 자체에 있는 것이 아닙니다. 252GB의 HBM3e 메모리, Grace 칩셋, 496GB의 LPDDR5X RAM, ConnectX-8 칩셋, 미러링된 부팅 스토리지, 수랭 쿨링, 원격 관리, 그리고 MSI의 전문적인 지원까지, 이 모든 것이 하나의 타워형 메인보드에 담겨 있습니다. 다만, Arm 호스트와의 호환성, 20A 전용 회로 필요성, 그리고 대형 RTX PRO 그래픽 카드 장착 시 1,600W의 전력 제한이 있다는 점은 실질적인 제약 사항입니다.

WS300을 최대한 활용하려면 주변 소프트웨어도 중요합니다. NVIDIA는 팀이 시스템을 신속하게 구축하고 리소스를 활용할 수 있도록 다양한 플레이북과 배포 가이드를 제공합니다. 향후 기사에서는 워크스테이션 공유 액세스를 간소화하고 활용도를 높여 고가의 리소스가 유휴 상태로 방치되지 않도록 하는 Brev를 포함한 여러 도구를 자세히 살펴볼 예정입니다.

가격에 관해서는 MSI에서 공식 발표를 하지 않았으며, 이 등급의 워크스테이션은 일반적으로 정가가 정해져 있지 않습니다. 따라서 이는 영업팀과의 심도 있는 논의가 필요한 부분이며, 단순히 장바구니에 담는 버튼을 누르는 것과는 다릅니다. 진정한 비교는 다른 워크스테이션과의 비교가 아니라 AI 팀이 이미 지불하고 있는 비용, 즉 클러스터 예약 시간, 클라우드 GPU 사용료, 공유 하드웨어 대기 시간 등을 고려하는 것입니다.

맺음말

MSI XpertStation WS300은 저희가 검토해 본 워크스테이션 중 가장 뛰어난 성능을 자랑하며, 개인 임상의가 시도할 수 있는 범위를 획기적으로 확장하는 보기 드문 제품입니다. 일반적으로 클러스터 예약 뒤에 숨겨져 있어야 하는 최첨단 규모의 체크포인트, 433GB 용량의 GLM-5.2, 550억 개의 파라미터를 처리하는 Nemotron-3-Ultra 등이 책상 옆 박스에서 개인 정보 보호 및 상시 접속이 가능한 상태로 로드 및 서비스됩니다. 바로 이러한 점이 저희가 이 시스템에 열광하는 이유입니다.

측면 패널을 열어놓은 MSI XpertStation WS300이 책상 위에 놓여 있고, 구리 냉각판과 액체 냉각 시스템이 보인다.

DGX 스테이션은 개발자를 대상으로 합니다. 블랙웰 울트라를 대상으로 하는 커널 개발자, 추론 엔진 및 프레임워크 팀, 아이작(Isaac) 전체 루프를 실행하는 로봇 공학 그룹, 그리고 공유 하드웨어로 인한 실험 일정 문제에 불만을 가진 일반 사용자들이 적합합니다. 이러한 특정 사용자층 외에는 DGX 스테이션을 구매할 이유가 거의 없습니다. Arm 호스트는 일부 툴체인을 사용할 수 없게 하고, 20A 회로는 120V 회로에 설치해야 하는 필수 조건이며, 추가 그래픽 카드 없이는 디스플레이 출력을 사용할 수 없습니다. 게다가 RTX PRO 6000 워크스테이션은 훨씬 저렴하며, 96GB 메모리 용량의 모델에서 단일 사용자 작업에 충분합니다.

경제성 또한 적절한 구축 규모를 결정하는 중요한 요소입니다. WS300 한 대는 예약된 클러스터 시간을 고려했을 때 투자 가치가 충분하며, 팀당 두 대 정도는 여전히 합리적인 선택입니다. 하지만 일정 시점을 넘어서면 더 이상 추가하는 것은 비효율적입니다. 예를 들어, 조직에서 GB300 타워를 네 대 구매할 시점이라면, 그 가격으로 GPU당 메모리 용량이 더 크고, MIG 파티셔닝 밀도가 더 높으며, 모든 GPU 간 NVLink 연결을 지원하는 8웨이 B300 서버를 구매할 수 있습니다. 최적의 구성은 데스크톱에 한 대, 연구실에 두 대 정도를 배치하여 데이터센터 투자와 시너지를 내는 것입니다.

NVIDIA에서 메인보드를 제공하기 때문에 OEM 간의 차별화는 구현 방식에 달려 있으며, MSI는 이 부분에서 훌륭한 구현력을 보여줍니다. 1,400W 수랭 쿨링 시스템이 B300 메인보드, Grace 칩셋, SOCAMM 칩셋, ConnectX-8 칩셋을 냉각하며, 테스트 기간 내내 안정적인 성능을 유지했습니다. GB300의 발열 관리에 대해서는 추후 자세히 살펴보겠습니다. 1,600W의 전력 예산은 구성 요소에 자동으로 분배되며, 연결 상태가 불안정한 상태에서 하드웨어 전력 차단 기능을 테스트했을 때도 시스템이 완전히 꺼지는 대신 성능 저하(스로틀링)가 발생했습니다. 사전 배선된 12V HPWR 전원 케이블과 처짐 방지 브래킷은 RTX PRO 확장 슬롯을 안정적으로 지지합니다. 저희가 처음으로 테스트해 본 GB300 DGX 스테이션인 XpertStation WS300은 이 플랫폼의 기준을 한층 높였다고 평가할 수 있습니다.

XpertStation WS300은 현재 저희의 '로컬 AI용 최고의 데스크톱' 순위표 에서 '최고의 GB300 시스템' 자리를 차지하고 있으며, '에이전트 AI를 위한 RAM, GPU 및 스토리지 ' 가이드 에서 메모리 관련 논의의 중심 역할을 하고 있습니다.

MSI XpertStation WS300 (NVIDIA DGX 스테이션)

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

디뱐시 자이나교

머신러닝 엔지니어이자 홈랩 운영자, 그리고 기술 애호가입니다. StorageReview에서 AI 및 신흥 워크로드 테스트를 주도하며, 인사이트와 성능 분석 결과를 제공하고 있습니다.