StorageReview.com

AMD Ryzen AI Halo 리뷰: 듀얼 OS, 200B 파라미터 데스크톱으로 DGX Spark에 도전하다

소비자  ◇  워크 스테이션

AMD의 실리콘은 사실상 이 분야에 먼저 진출했습니다. NVIDIA가 등장하기 훨씬 전부터 Strix Halo 미니 PC와 노트북에 128GB의 통합 메모리를 탑재하여 출시했기 때문입니다. 하지만 로컬 AI 데스크톱이라는 카테고리는 NVIDIA가 Grace Blackwell 슈퍼칩을 1리터 크기의 상자에 담아 DGX Spark 라는 이름으로 출시하면서 사실상 개척했습니다 . NVIDIA의 전략은 간단했습니다. 클라우드에 저장되는 대신 책상 위에 놓고 사용할 수 있는, 충분한 통합 메모리를 갖춘 개발자급 PC를 만드는 것이었습니다. AMD의 Ryzen AI Halo는 바로 그 전략에 대한 AMD의 답변입니다. AMD는 2026년 5월 Ryzen AI Max PRO 400 시리즈와 함께 Ryzen AI Halo를 발표했으며, 6월부터 Micro Center 에서 독점 사전 주문을 시작했고 , 7월 10일부터 매장에서 판매를 시작했습니다. Ryzen AI Halo는 Spark와 유사한 크기, 128GB의 통합 메모리, 3,999달러의 가격을 공유하지만, 몇 가지 핵심적인 차이점을 통해 Spark와는 확연히 다른 제품으로 자리매김했습니다.

AMD 라이젠 AI 헤일로 정면 모습.

AMD는 Halo를 자사의 첫 번째 AI 개발자 플랫폼으로 소개하며, 개발자들이 빠르고 간편하게 AI를 로컬에서 구축하고 실행할 수 있도록 지원한다고 밝혔습니다. 내부에는 16코어 32스레드 "Zen 5" 프로세서인 Ryzen AI Max+ 395가 탑재되어 있으며, Radeon 8060S 통합 그래픽(40개의 RDNA 3.5 컴퓨팅 유닛)과 50 TOPS 등급의 XDNA 2 NPU가 포함되어 있습니다. AMD는 이 플랫폼의 AI 처리량을 최대 126 TOPS까지 지원한다고 홍보하고 있습니다. 128GB의 LPDDR5x 메모리는 8000 MT/s의 속도로 작동하여 256GB/s의 대역폭을 제공하며, 전체 플랫폼은 120W 정격의 USB-C 포트 하나로 전력을 공급받습니다. AMD는 이 메모리 용량이 최대 200천억 개의 파라미터를 가진 모델을 저장하기에 충분하다고 말합니다. Halo는 완벽한 x86 미니 워크스테이션이며, 이것이 바로 가장 중요한 차별점입니다.

그 차이점은 윈도우 운영체제에 있습니다. Spark는 NVIDIA의 리눅스 기반 DGX OS만 실행하는 반면, Halo는 동일한 하드웨어에서 Windows 11 또는 AMD의 리눅스 개발자 이미지를 부팅합니다. 네이티브 윈도우 지원은 Spark 구매를 고려하는 사람들이 가장 많이 요청했던 사항이며, 이로 인해 Spark의 대상 고객이 달라졌습니다. AMD의 포지셔닝 또한 같은 맥락입니다. Spark는 ( 적어도 현재로서는 ) 리눅스만 지원하는 반면, Halo는 윈도우와 리눅스를 모두 지원합니다.

Halo는 Spark와 세 가지 주요 차이점을 가지고 있으며, 각각 기존 제품에 대한 불만 사항을 해결합니다. Halo는 Spark에 탑재된 흔하지 않은 M.2 2242 드라이브 대신 표준 M.2 2280 SSD를 사용하여, 드라이브 교체를 원하는 사용자를 위해 8TB 용량을 포함한 훨씬 더 다양한 애프터마켓 옵션을 제공합니다. 또한 두 운영 체제 모두에서 가변 그래픽 메모리(VGM)가 최대 할당량으로 사전 설정되어 출고되므로, 고사양 모델도 별도의 설정 없이 바로 로드됩니다. 섀시에는 조명이 들어오는 상태 표시등이 추가되어, OEM에 따라 일부 구매자가 받았던 어둡고 조명이 없는 Spark 제품의 단점을 개선했습니다. AMD의 이러한 접근 방식에는 단점도 있습니다. 고속 패브릭이 아닌 10GbE만 지원하여 멀티 노드 클러스터링에 제약이 있습니다. 이러한 절충점들을 고려해야 하며, 이는 벤치마크 테스트를 실행하기 전에 이 시스템이 어떤 워크로드에 적합한지 결정짓는 요소입니다.

AMD 라이젠 AI 헤일로 분해 분석.

가격에 있어서는 미묘한 차이가 중요합니다. Halo는 2TB SSD 탑재 모델이 3,999달러로 책정되어 기본 Spark급 시스템의 가격대와 거의 같습니다. 하지만 어떤 Spark를 기준으로 비교하느냐에 따라 달라집니다. NVIDIA의 DGX Spark는 대용량 드라이브 탑재 모델이 현재 4,700달러에 육박하는데, 이는 LPDDR5X 및 NAND 공급 부족과 관련이 있습니다. ASUS를 비롯한 다른 회사들의 기본 Grace Blackwell 시스템은 여전히 ​​4,000달러 내외로 판매되고 있으며, 현재 아마존에서도 구매 가능합니다(제휴 링크). 카테고리 기준선으로 봤을 때, Halo는 비슷한 수준의 가격을 유지하고 있으며, 가격 경쟁력보다는 위에서 언급한 전략적인 결정들이 강점으로 작용할 것으로 보입니다.

저희는 StorageReview의 자체 AI 도구를 사용하여 Windows와 Linux 환경 모두에서 Halo를 테스트했으며, 그 결과는 이 리뷰 전반에 걸쳐 디자인 및 소프트웨어 분석과 함께 제시됩니다.

주요 요점

  • 듀얼 OS x86 대안: 라이젠 AI 헤일로는 스파크와 같은 카테고리에서 유일하게 완전한 x86 플랫폼에서 Windows 11 또는 Linux를 부팅할 수 있는 제품으로, 2TB SSD 탑재 모델은 3,999달러이며, DGX 스파크 파운더스 에디션은 4,699달러입니다.
  • 대용량 모델을 저장할 메모리: 256GB/s의 속도를 지원하는 128GB의 LPDDR5x-8000 통합 메모리는 최대 200천억 개의 파라미터를 가진 모델을 로컬에서 처리할 수 있으며, 가변 그래픽 메모리가 사전 최적화되어 있어 수동 설정 없이도 대형 모델을 로드할 수 있습니다.
  • 저희가 테스트한 Ryzen AI Max+ 395 중 가장 강력한 제품입니다. Halo는 Cinebench R23 멀티코어에서 37,316점, 7-Zip에서 184.2 GIPS, Procyon AI 텍스트 생성(Phi 1,192) 및 이미지 생성(SD 1.5 FP16 937) 점수 등 거의 모든 Windows 작업 부하에서 HP Z2 Mini G1a 및 ZBook Ultra G1a를 능가했습니다.
  • CPU 성능은 Spark 대비 우세, 추론 성능은 열세: Linux 환경에서 Halo는 CPU 작업에서 DGX Spark를 확실히 앞섰습니다. 7-Zip 압축 속도는 11%, 압축 해제 속도는 38% 더 빨랐고, LLVM 컴파일 시간도 14% 단축되었습니다. 하지만 높은 동시 접속 환경에서 대부분의 vLLM 서비스 시나리오에서는 2~4배 뒤처졌으며, 사전 채우기 작업이 많은 GPT OSS 120B 작업에서는 최대 8.8배까지 뒤쳐졌습니다.
  • 쓸만한 저장 공간, 적당한 네트워크 연결: 표준 M.2 2280 베이를 통해 애프터마켓 업그레이드를 통해 최대 8TB까지 확장할 수 있지만, 플랫폼 설계상 기본 제공되는 Gen5 Micron 4600 칩셋은 Gen4로 다운그레이드되며, 고속 패브릭이 없는 단일 10GbE 포트는 Spark의 200G ConnectX-7이 지원하는 멀티 노드 클러스터링을 불가능하게 합니다.

기술 사양

스펙 AMD 라이젠 AI 헤일로 시스템
프로세서
CPU AMD 라이젠™ AI Max+ 395 프로세서
16코어/32스레드 (젠 5 아키텍처)
GPU AMD Radeon™ 8060S 통합 그래픽
40개의 컴퓨팅 유닛(RDNA™ 3.5 아키텍처)
NPU AMD XDNA™ 2 NPU
메모리
메모리 유형 LPDDR5x
메모리 용량 128GB
메모리 속도 8000MT / s
메모리 대역폭 256GB / s
스토리지
스토리지 2TB M.2 NVMe SSD (SED)
네트워킹 및 연결
Ethernet 1 × 10GbE
Wi-Fi 인터넷 Wi-Fi (은) 7
Bluetooth Bluetooth 5.4
I / O
USB USB-C 포트 3개, USB-C 포트 1개(전원 입력)
디스플레이 출력 1×HDMI 2.1b
시스템
TDP 120W
운영체제 리눅스 또는 윈도우 11
크기 150 × 150 × 45.4mm (5.9 × 5.9 × 1.79 인치)
중량(평량) 1.2kg(2.65파운드) 미만

AMD 라이젠 AI 헤일로 조립 및 설계

AMD 라이젠 AI 헤일로 시스템은 150 × 150 × 45.4mm의 컴팩트한 크기와 1.2kg(2.65lbs) 미만의 무게를 자랑하는 "NVIDIA Spark"와 유사한 폼팩터를 채택했습니다. 알루미늄 섀시는 상단과 전면에 기하학적인 통풍 패턴을 적용하여 독특한 외관을 제공하는 동시에 냉각 시스템으로의 공기 흐름을 극대화합니다. 작은 크기에도 불구하고, 이 플랫폼은 워크스테이션 애플리케이션, 로컬 LLM 추론 및 AI 개발 워크로드를 처리할 수 있는 완벽한 데스크톱 AI 워크스테이션으로 설계되었습니다.

시스템 전면은 의도적으로 깔끔하게 디자인되었으며, 섀시 너비 전체를 차지하는 대형 메시 통풍구로 거의 완전히 구성되어 있습니다. AMD는 전면에 포트를 배치하는 대신 이 공간을 공기 흐름에 할애하여, 시원한 공기가 대형 패턴 흡입구를 통해 시스템 내부로 유입되도록 하면서도 전면을 깔끔하게 유지합니다. 섀시 하단의 은색 액센트는 무광 검정색 본체와 은은한 시각적 대비를 이룹니다.

후면 I / O

AMD 라이젠 AI Halo 후면 연결.

모든 외부 연결 단자는 시스템 후면에 있습니다. 후면 패널은 왼쪽에서 오른쪽으로 다음과 같은 구성 요소로 이루어져 있습니다.

  • USB-C 전원 입력
  • DisplayPort Alt Mode를 지원하는 USB-C 포트
  • USB-C 포트 2개 추가
  • HDMI 2.1b 출력
  • 10GbE RJ45 이더넷
  • 켄싱턴 보안 잠금 슬롯

이 시스템은 3개의 USB-C 데이터 포트와 전용 USB-C 전원 커넥터를 제공하여 여러 고속 주변 장치와 디스플레이를 동시에 연결할 수 있습니다. HDMI 2.1b는 네이티브 디스플레이 출력을 제공하며, 통합된 10GbE 이더넷 인터페이스는 고속 NAS 연결, AI 데이터 세트 전송 및 로컬 개발 환경에 적합합니다.

내부 디자인

라이젠 AI 헤일로의 하단에는 보드 하단에 장착된 부품을 냉각하기 위해 공기를 흡입하는 커다란 통풍구가 있으며, 네 모서리에 있는 고무 받침대는 책상이나 선반 위에 안정적으로 놓을 수 있도록 해줍니다.

AMD 라이젠 AI 헤일로 하단.

하단 패널을 고정하는 나사 4개를 제거하면 M.2 SSD 베이와 Wi-Fi 카드 커넥터를 포함한 시스템 하단 보드 구성 요소 몇 가지가 드러납니다. 리뷰용 제품에서는 해당 슬롯에 Micron 4600 2TB Gen5 x4 SSD가 장착되어 있으며, 검은색 접착 시트가 보드의 나머지 부분을 가려줍니다.

AMD 라이젠 AI 헤일로 하단 덮개를 제거했습니다.

냉각을 위해 AMD는 NVIDIA의 DGX Spark와 유사한 방식을 채택하여, 핀이 달린 방열판 위로 공기를 빨아들여 섀시 후면으로 배출하는 듀얼 팬을 사용합니다.

AMD 라이젠 AI 헤일로 히트싱크 및 팬.

쿨링 어셈블리를 들어 올리면 메인보드가 드러나는데, 중앙에는 APU 다이가 있고 양쪽에는 메모리 패키지가, 왼쪽 가장자리에는 VRM 회로가 자리 잡고 있습니다. 다이에 보이는 은색 사각형은 액체 금속이나 페이스트 형태의 화합물이 아니라, AMD가 다이와 방열판 사이의 접촉면에 도포한 고체 열 패드 또는 코팅의 잔여물입니다. 이 때문에 페이스트나 액체 금속이 일반적으로 남기는 축축하고 번진 흔적과는 달리 균일하고 건조한 모습을 하고 있는 것입니다.

AMD 라이젠 AI 헤일로 메인보드.

방열판을 뒤집으면 냉각판의 아랫면이 드러나는데, 거울처럼 매끄럽게 연마된 부분이 다이와 직접 접촉합니다. 동시에 주변의 메모리 및 전원 공급 영역에는 두께가 다양한 열 패드가 미리 부착되어 있습니다.

AMD 라이젠 AI Halo 쿨러 하단 모습.

AMD 라이젠 AI Halo 성능 테스트

AMD Ryzen AI Halo 플랫폼의 성능을 Windows 및 Linux 환경에서 평가하여 워크스테이션 애플리케이션과 AI 중심 워크로드에서의 성능을 분석했습니다. Windows 테스트에서는 Ryzen AI Max+ PRO 395 프로세서를 탑재한 시판 시스템 두 가지, 즉 소형 데스크톱 워크스테이션인 HP Z2 Mini G1a와 모바일 워크스테이션인 HP ZBook Ultra G1a 14인치와 비교했습니다. 세 시스템 모두 동일한 프로세서 아키텍처와 Radeon 8060S 통합 그래픽을 사용하기 때문에, 이러한 비교를 통해 Halo 플랫폼이 다양한 발열 환경과 시스템 설계에서 어떻게 다른 성능을 보이는지 확인할 수 있었습니다.

AMD 라이젠 AI 헤일로 상단 커버를 벗긴 후면 모습.

리눅스 테스트에서는 AI 개발 및 스토리지 워크로드로 전환하여 Ryzen AI Halo 시스템과 NVIDIA DGX Spark를 비교했습니다. 이 테스트는 FIO 스토리지 벤치마킹과 vLLM 추론 성능에 중점을 두고 AMD의 Ryzen AI Halo 기반 개발자 플랫폼과 NVIDIA가 로컬 대규모 언어 모델 추론을 위해 특별히 설계한 AI 개발 시스템을 비교했습니다.

테스트 완료 제품

UL Procyon: AI 컴퓨터 비전

Procyon AI 컴퓨터 비전 벤치마크는 전문가 수준에서 AI 추론 엔진의 성능을 자세히 분석합니다. 여러 벤더의 엔진을 통합하여 디바이스의 성능을 정확하게 반영하는 성능 점수를 제공합니다. 이 벤치마크는 CPU, GPU, NPU 등 다양한 하드웨어 유형에서 AI 가속 성능을 비교하여 최첨단 신경망 모델을 평가하며, 사용자가 다양한 작업 부하 및 환경에서 상대적인 효율성을 평가할 수 있도록 지원합니다.

실제 AI 워크로드를 반영하기 위해, 이 벤치마크는 현대 컴퓨터 비전 작업과의 관련성을 고려하여 선정된 6가지의 다양한 신경망 모델을 사용합니다. MobileNet V3는 이미지에서 피사체를 식별하도록 설계된 소형 모바일 중심 모델이며, Inception V4는 더 깊고 복잡한 아키텍처를 사용하여 동일한 작업을 수행합니다.

YOLO V3(You Only Look Once)는 객체 확률을 추정하여 실시간 객체 탐지에 특화되어 있습니다. MobileNet V2를 기반으로 구축된 DeepLab V3는 의미론적 이미지 분할 및 픽셀 클러스터링에 중점을 둡니다. 가장 계산 집약적인 테스트인 Real-ESRGAN은 250×250 해상도의 이미지를 1,000×1,000 해상도로 확대합니다. 마지막으로 ResNet 50은 심층 신경망의 보다 효율적인 학습을 가능하게 하는 강력한 분류 모델입니다.

라이젠 AI Halo 플랫폼은 CPU 및 GPU 워크로드 전반에 걸쳐 일관되게 뛰어난 AI 추론 성능을 제공했습니다. CPU 테스트에서 종합 점수 216점을 기록하며 HP Z2 Mini의 227점에 근소한 차이로 뒤처졌지만, HP ZBook Ultra의 186점을 크게 앞섰습니다. GPU 추론 성능은 더욱 인상적이었습니다. Halo 시스템은 종합 점수 553점으로 ZBook Ultra(528점)와 Z2 Mini(528점)를 제치고 최고 점수를 달성했습니다. 또한 MobileNet V3 추론에서 0.38ms로 가장 빠른 응답 시간을 기록했으며, 까다로운 REAL-ESRGAN 워크로드를 185.08ms 만에 완료했습니다. 이는 Z2 Mini의 211.76ms와 ZBook Ultra의 200.40ms보다 훨씬 빠른 기록입니다.

UL Procyon: AI 컴퓨터 비전 추론(낮을수록 좋음) AMD 라이젠 AI 헤일로 (라이젠 AI 맥스+ 395 | 라데온 8060S) HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
CPU 시간
AI 컴퓨터 비전 전체 점수(높을수록 좋음) 216 227 186
모바일넷 V3 0.73 MS 0.75 MS 1.09 MS
레스넷 50 6.02 MS 5.99 MS 6.84 MS
인셉션 V4 17.18 MS 17.12 MS 19.80 MS
딥랩 V3 29.21 MS 21.20 MS 28.27 MS
욜로 V3 35.60 MS 36.58 MS 41.64 MS
리얼에스간 1,931.13 MS 1,892.10 MS 2,138.97 MS
GPU 시간
AI 컴퓨터 비전 전체 점수(높을수록 좋음) 553 528 583
모바일넷 V3 0.38 MS 0.42 MS 0.46 MS
레스넷 50 4.04 MS 3.85 MS 3.27 MS
인셉션 V4 13.26 MS 15.15 MS 11.62 MS
딥랩 V3 12.72 MS 10.98 MS 10.72 MS
욜로 V3 11.17 MS 12.64 MS 10.57 MS
리얼에스간 185.08 MS 211.76 MS 200.40 MS

UL Procyon: AI 텍스트 생성

Procyon AI 텍스트 생성 벤치마크는 간결하고 일관된 평가 방법을 제공하여 AI LLM 성능 테스트를 간소화합니다. 이 벤치마크를 통해 여러 LLM 모델에 걸쳐 반복적인 테스트를 수행할 수 있으며, 대규모 모델과 다양한 변수로 인한 복잡성을 최소화할 수 있습니다. AI 하드웨어 분야의 선도 기업들과 협력하여 개발된 이 벤치마크는 로컬 AI 가속기 활용을 최적화하여 더욱 안정적이고 효율적인 성능 평가를 제공합니다. 아래 결과는 TensorRT를 사용하여 측정되었습니다.

라이젠 AI Halo 레퍼런스 플랫폼은 Procyon AI 텍스트 생성 테스트에서 모든 언어 모델 중 가장 우수한 성능을 보였습니다. HP Z2 Mini(965)와 HP ZBook Ultra(922)를 크게 앞서는 1,192점의 최고 Phi 점수를 기록했습니다. Mistral도 998점으로 850점과 829점을 기록한 HP Z2 Mini를 앞섰으며, Llama3는 847점으로 766점과 756점을 기록한 HP Z2 Mini를 제쳤습니다. Halo 플랫폼은 모든 모델에서 첫 번째 토큰 생성 시간도 단축하여 0.996초 만에 첫 번째 Phi 토큰을 생성했는데, 이는 HP 시스템의 절반에 가까운 지연 시간입니다. 토큰 생성 처리량 측면에서는 Z2 Mini가 간혹 우위를 보였지만, Halo 플랫폼의 현저히 낮은 시작 지연 시간 덕분에 전반적으로 최고의 벤치마크 점수를 얻을 수 있었습니다.

UL Procyon: AI 텍스트 생성 AMD 라이젠 AI 헤일로
(라이젠 AI 맥스+ 395 | 라데온 8060S)
HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
파이 전체 점수 1,192 965 922
첫 번째 토큰까지의 Phi 출력 시간 0.996 초 1.898 초 1.956 초
초당 Phi 출력 토큰 55.271 토큰/초 68.967 토큰/초 64.986 토큰/초
파이 전체 기간 56.237 초 52.666 초 55.501 초
미스트랄 종합 점수 998 850 829
미스트랄 출력 시간 첫 번째 토큰까지 1.603 초 2.734 초 2.783 초
초당 미스트랄 출력 토큰 35.027 토큰/초 43.358 토큰/초 41.992 토큰/초
미스트랄 전체 기간 88.582 초 81.716 초 84.065 초
Llama3 전체 점수 847 766 756
Llama3 첫 번째 토큰까지의 출력 시간 1.963 초 2.545 초 2.578 초
Llama3 초당 출력 토큰 34.630 토큰/초 36.752 토큰/초 36.243 토큰/초
라마3 전체 지속 시간 92.026 초 91.987 초 93.200 초
Llama2 전체 점수 N/A 936 929
Llama2 첫 번째 토큰까지의 출력 시간 해당 없음 초 3.813 초 3.860 초
Llama2 초당 출력 토큰 해당 없음 토큰/초 24.685 토큰/초 24.619 토큰/초
라마2 전체 지속 시간 해당 없음 초 136.077 초 136.720 초

UL 프로키온: AI 이미지 생성

Procyon AI 이미지 생성 벤치마크는 저전력 NPU부터 고성능 GPU에 이르기까지 다양한 하드웨어에서 AI 추론 성능을 일관되고 정확하게 측정할 수 있는 방법을 제공합니다. 이 벤치마크는 고성능 GPU용 Stable Diffusion XL(FP16), 중성능 GPU용 Stable Diffusion 1.5(FP16), 저전력 장치용 Stable Diffusion 1.5(INT8)의 세 가지 테스트로 구성됩니다. 각 시스템에 최적화된 추론 엔진을 사용하여 공정하고 비교 가능한 결과를 보장합니다.

이미지 생성은 Ryzen AI Halo의 가장 강력한 성능 중 하나로 입증되었습니다. Stable Diffusion 1.5 FP16 벤치마크에서 Halo 플랫폼은 937점의 종합 점수를 기록하며 Z2 Mini의 725점, ZBook Ultra의 648점을 크게 앞섰습니다. 이미지 생성 시간은 각각 137.8초와 154.2초에서 106.7초로 단축되었습니다. Stable Diffusion XL 벤치마크에서도 Halo 시스템은 878.5초 만에 완료하며 Z2 Mini보다 약 174초, ZBook Ultra보다 450초 이상 빠른 성능을 보여주었습니다. 또한, HP 비교 시스템에서는 실행할 수 없는 Stable Diffusion 1.5 INT8 벤치마크에서도 9,158점의 종합 점수를 획득했습니다.

UL Procyon: AI 이미지 생성 AMD 라이젠 AI 헤일로
(라이젠 AI 맥스+ 395 | 라데온 8060S)
HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
안정적 확산 1.5(FP16) – 전체 점수 937 725 648
안정적 확산 1.5(FP16) – 전체 시간 106.7 초 137.815 초 154.203 초
안정적 확산 1.5(FP16) – 이미지 생성 속도 6.670초/이미지 8.613초/이미지 9.638초/이미지
안정적 확산 1.5(INT8) – 전체 점수 9,158 N/A N/A
안정적 확산 1.5(INT8) – 전체 시간 27.298 초 N/A N/A
안정적 확산 1.5(INT8) – 이미지 생성 속도 3.412초/이미지 N/A N/A
Stable Diffusion XL(FP16) – 전체 점수 682 570 451
안정적 확산 XL(FP16) – 전체 시간 878.493 초 1,052.468 초 1,329.592 초
안정된 확산 XL(FP16) – 이미지 생성 속도 54.906초/이미지 65.779초/이미지 83.100초/이미지

SPEC워크스테이션 4

SPECworkstation 4.0 벤치마크는 워크스테이션 성능의 모든 핵심 요소를 평가하는 종합적인 도구입니다. CPU, 그래픽, 가속기 및 디스크 성능을 실제 사용 환경에서 측정하여 전문가들이 하드웨어 투자에 대한 정보에 입각한 결정을 내리는 데 필요한 데이터를 제공합니다. 이 벤치마크에는 데이터 과학 작업 및 ONNX 런타임 기반 추론 테스트와 같은 AI 및 ML 워크로드에 특화된 테스트 세트가 포함되어 있어 워크스테이션 환경에서 AI/ML의 중요성이 점점 커지고 있음을 반영합니다. 7개 산업 분야와 4개 하드웨어 하위 시스템을 포괄하여 오늘날 워크스테이션 성능에 대한 상세하고 관련성 높은 측정값을 제공합니다.

SPECworkstation 4 벤치마크에서 Ryzen AI Halo 플랫폼의 균형 잡힌 워크스테이션 성능이 돋보였습니다. 금융 서비스(2.92), 미디어 및 엔터테인먼트(2.97), 제품 디자인(2.22), 생산성 및 개발(1.27) 부문에서 최고 점수를 기록하며 HP Z2 Mini와 HP ZBook Ultra를 모두 앞섰습니다. Z2 Mini는 에너지(2.50 vs. 2.35)와 생명 과학(2.60 vs. 2.33) 부문에서 약간 우위를 보였습니다. 전반적으로 Halo 레퍼런스 플랫폼은 벤치마크의 모든 전문 워크로드에서 강력한 성능을 보여주었으며 테스트된 모든 부문에서 경쟁력을 유지했습니다.

SPECworkstation 4.0.0(높을수록 좋음) AMD 라이젠 AI 헤일로
(라이젠 AI 맥스+ 395 | 라데온 8060S)
 

HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S)

 

HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
에너지 2.35 2.50 2.20
금융 서비스 2.92 2.35 1.60
생명과학 2.33 2.60 2.20
미디어 및 엔터테인먼트 2.97 2.22 1.90
제품 디자인 2.22 2.00 1.74
생산성 및 개발 1.27 1.00 1.03

럭스마크

Luxmark는 오픈 소스 레이 트레이싱 렌더러인 LuxRender를 사용하여 고해상도 3D 장면에서 시스템 성능을 평가하는 GPU 벤치마크입니다. 이 벤치마크는 특히 정확한 조명 시뮬레이션이 중요한 시각 효과 및 건축 시각화 애플리케이션에서 서버 및 워크스테이션의 그래픽 렌더링 기능을 평가하는 데 유용합니다.

Luxmark 테스트 결과, 세 가지 Ryzen AI Max+ 395 플랫폼 간의 성능 차이는 미미했습니다. Halo 레퍼런스 시스템은 Food 벤치마크에서 4,158점으로 가장 높은 점수를 기록하며 Z2 Mini(3,943점)와 ZBook Ultra(3,915점)를 근소하게 앞섰습니다. Hallbench 테스트에서는 8,014점을 기록하여 Z2 Mini의 8,477점보다는 약간 낮았지만 ZBook Ultra의 7,833점보다는 높았습니다. 전반적으로, 이러한 결과는 Radeon 8060S를 기반으로 구축된 시스템이 폼팩터와 관계없이 매우 유사한 레이 트레이싱 성능을 제공한다는 것을 시사합니다.

Luxmark(높을수록 좋음) AMD 라이젠 AI 헤일로
(라이젠 AI 맥스+ 395 | 라데온 8060S)
HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
홀벤치 8,014 8,477 7,833
음식 4,158 3,943 3,915

7-Zip 압축

7-Zip 압축 벤치마크는 압축 및 압축 해제 중 CPU 성능을 평가하며, GIPS(초당 기가 명령어 처리량)와 CPU 사용률을 측정합니다. GIPS 수치가 높고 CPU 사용률이 효율적일수록 성능이 우수함을 나타냅니다.

Ryzen AI Halo 플랫폼은 7-Zip 벤치마크의 모든 주요 부문에서 선두를 차지했습니다. 압축 성능은 176.7 GIPS로, HP Z2 Mini의 139.3 GIPS 및 ZBook Ultra의 139.6 GIPS를 크게 앞섰습니다. 압축 해제 성능 또한 191.6 GIPS로 Z2 Mini의 164.0 GIPS와 ZBook Ultra의 174.0 GIPS를 모두 능가하며 강력한 성능을 보여주었습니다. 종합적으로 Halo 플랫폼은 184.2 GIPS라는 최고 성능을 기록하며 경쟁 시스템보다 약 20% 높은 수치를 달성했고, 아카이브 생성 및 압축 해제 작업에서 탁월한 정수 연산 처리량을 입증했습니다.

7-Zip 압축 벤치마크(높을수록 좋음) AMD 라이젠 AI 헤일로
(라이젠 AI 맥스+ 395 | 라데온 8060S)
HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
압축
현재 CPU 사용량 2,741% 2,734% 2,868%
현재 등급/사용 6.370 깁스 5.136 깁스 4.883 깁스
현재 평가 174.589 깁스 140.405 깁스 140.061 깁스
결과 CPU 사용량 2,751% 2,718% 2,855%
결과 등급/사용 6.424 깁스 5.126 깁스 4.890 깁스
결과 등급 176.742 깁스 139.298 깁스 139.617 깁스
압축 해제
현재 CPU 사용량 2,568% 2,343% 2,904%
현재 등급/사용 7.670 깁스 6.805 깁스 6.029 깁스
현재 평가 196.986 깁스 159.451 깁스 175.104 깁스
결과 CPU 사용량 2,469% 2,414% 2,887%
결과 등급/사용 7.766 깁스 6.793 깁스 6.028 깁스
결과 등급 191.645 깁스 163.969 깁스 174.046 깁스
총 평점
총 CPU 사용량 2,610% 2,566% 2,871%
총 등급/사용량 7.095 깁스 5.959 깁스 5.459 깁스
총 평점 184.194 깁스 151.634 깁스 156.832 깁스

블렌더 벤치마크

Blender는 오픈 소스 3D 모델링 애플리케이션입니다. 이 벤치마크는 Blender Benchmark 유틸리티를 사용하여 실행되었습니다. 점수는 분당 샘플 수로 측정되며, 값이 높을수록 성능이 우수함을 나타냅니다.

CPU 렌더링 성능 또한 Ryzen AI Halo가 뛰어난 성능을 보여준 영역 중 하나입니다. Monster 장면에서 분당 244.7개의 샘플을 처리하며 HP Z2 Mini(224.3개)와 HP ZBook Ultra(189.3개)를 앞섰습니다. Junkshop 장면에서는 분당 159.4개의 샘플을 기록하며 Z2 Mini(149.5개)와 ZBook Ultra(129.4개)를 능가했고, Classroom 장면에서는 분당 131.6개의 샘플을 처리하며 Z2 Mini(116.3개)보다 약 13%, ZBook Ultra(94.1개)보다 거의 40% 높은 성능을 보여주었습니다. 이러한 결과는 Ryzen AI Max+ 395가 컴팩트한 워크스테이션 크기에도 불구하고 탁월한 멀티스레드 렌더링 성능을 제공한다는 것을 입증합니다.

블렌더 벤치마크 CPU(분당 샘플 수, 높을수록 좋음) AMD 라이젠 AI 헤일로
(라이젠 AI 맥스+ 395 | 라데온 8060S)
HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
몬스터 244.7 샘플/m 224.3 샘플/m 189.29 샘플/m
정크샵 159.4 샘플/m 149.5 샘플/m 129.42 샘플/m
교실 131.6 샘플/m 116.3 샘플/m 94.14 샘플/m

GPU 렌더링 결과는 시스템 간에 훨씬 더 유사했습니다. Halo 레퍼런스 플랫폼은 Monster 장면을 분당 704.2개의 샘플로 렌더링하여 Z2 Mini(745.6개)에는 미치지 못했지만 ZBook Ultra(661.5개)보다는 앞섰습니다. Junkshop 장면에서는 Halo 플랫폼(366.6개)과 Z2 Mini(366.5개)가 거의 동일한 성능을 보였습니다. 동시에 Halo 시스템은 Classroom 장면에서 분당 361.5개의 샘플로 가장 높은 점수를 기록하며 Z2 Mini(359.0개)와 ZBook Ultra(333.3개)를 근소한 차이로 앞섰습니다. 이러한 결과는 Radeon 8060S가 다양한 환경에서 매우 일관된 GPU 렌더링 성능을 제공한다는 것을 보여줍니다.

Blender 벤치마크 GPU(분당 샘플 수, 높을수록 좋음) AMD 라이젠 AI 헤일로
(라이젠 AI 맥스+ 395 | 라데온 8060S)
HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
몬스터 704.2 샘플/m 745.55 샘플/m 661.50 샘플/m
정크샵 366.6 샘플/m 366.54 샘플/m 341.92 샘플/m
교실 361.51 샘플/m 359.01 샘플/m 333.26 샘플/m

y-크런처

y-cruncher는 멀티스레딩을 지원하는 확장 가능한 프로그램으로, 파이(π)를 비롯한 다양한 수학 상수를 수조 자리까지 계산할 수 있습니다. 2009년 출시 이후 오버클러커와 하드웨어 애호가들에게 인기 있는 벤치마킹 및 스트레스 테스트 도구로 자리 잡았습니다.

y-cruncher 테스트 결과는 계산 규모에 따라 나뉘었습니다. 10억 및 2.5억 자릿수 계산에서는 세 시스템 모두 몇 십분의 일 초 차이로 완료되었으며, HP 시스템이 약간 앞섰습니다. 작업 부하가 커짐에 따라 Halo는 격차를 벌려 1억 자릿수 계산을 71.948초 만에 완료했는데, Z2 Mini는 75.021초, ZBook Ultra는 78.19초가 걸렸습니다. 5억 자릿수에서는 Halo가 151.409초 만에 완료하여 Z2 Mini보다 약 6%, ZBook Ultra보다 약 12% 앞섰습니다. 이는 데스크톱 섀시가 실행 시간이 길어질수록 멀티스레드 작업 부하를 더 잘 처리한다는 것을 시사합니다.

Y-Cruncher(총 계산 시간) AMD 라이젠 AI 헤일로
(라이젠 AI 맥스+ 395 | 라데온 8060S)
HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
1 억 13.193 초 12.965 초 12.93 초
2.5 억 34.578 초 34.533 초 34.91 초
5 억 71.948 초 75.021 초 78.19 초
10 억 151.409 초 160.252 초 171.72 초

Geekbench 6

Geekbench 6는 시스템의 전반적인 성능을 측정하는 크로스 플랫폼 벤치마크 프로그램입니다.

Geekbench 6 벤치마크 테스트에서 Halo 플랫폼의 균형 잡힌 성능이 다시 한번 입증되었습니다. 싱글 코어 점수는 2,986점으로 HP Z2 Mini(2,862점)와 ZBook Ultra(2,825점)를 제치고 1위를 차지했습니다. 멀티 코어 성능 또한 18,068점으로 최고 수준을 기록했습니다. Radeon 8060S는 OpenCL GPU 점수에서 92,883점으로 Z2 Mini(91,591점)를 근소한 차이로 앞섰고, ZBook Ultra(85,337점)보다는 훨씬 우수한 성능을 보여주었습니다. CPU와 GPU 테스트 전반에 걸쳐 일관되게 높은 점수를 기록한 것은 Ryzen AI Max+ 395 플랫폼의 뛰어난 성능을 입증하는 결과입니다.

Geekbench 6 (높을수록 좋음) AMD 라이젠 AI 헤일로
(라이젠 AI 맥스+ 395 | 라데온 8060S)
HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
CPU 단일 코어 2,986 2,862 2,825
CPU 멀티 코어 18,068 17,210 17,562
GPU 오픈CL 92,883 91,591 85,337

Cinebench R23

Cinebench R23은 3D 렌더링 작업 부하에서 CPU 성능을 평가하는 데 널리 사용되는 벤치마크입니다. Cinema 4D 엔진으로 구동되는 이 벤치마크는 프로세서가 단일 스레드 및 멀티 스레드 작업을 얼마나 잘 처리하는지 측정하여 전반적인 응답성과 병렬 처리 기능을 파악할 수 있도록 도와줍니다.

Cinebench R23 벤치마크 결과, 두 Ryzen AI Max+ 395 데스크톱 시스템 간의 성능 경쟁이 매우 치열했습니다. Halo 레퍼런스 플랫폼은 멀티코어 점수 37,316점을 기록하며 HP Z2 Mini의 37,156점을 근소하게 앞섰고, 두 시스템 모두 HP ZBook Ultra의 29,112점을 여유 있게 상회했습니다. 싱글코어 성능에서도 비슷한 양상을 보였는데, Halo 플랫폼은 2,047점을 기록했고, Z2 Mini는 2,020점, ZBook Ultra는 1,984점을 기록했습니다. Z2 Mini와의 격차는 크지 않았지만, Halo 시스템은 벤치마크 테스트에서 꾸준히 상위권을 차지했습니다.

Cinebench R23(높을수록 좋음) AMD 라이젠 AI 헤일로
(라이젠 AI 맥스+ 395 | 라데온 8060S)
HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
멀티 코어 37,316 37,156 29,112
싱글 코어 2,047 2,020 1,984

Cinebench 2024

Cinebench 2024는 R23의 기반 위에 GPU 기반 렌더링 테스트를 도입하면서도 CPU 성능에 대한 집중도를 유지합니다. 이 부분에서는 CPU 점수만을 분석하여 각 시스템이 최신 3D 렌더링 작업을 얼마나 잘 처리하는지 최신 정보를 제공합니다.

최신 Cinebench 2024 벤치마크 결과는 R23 결과와 유사했습니다. Ryzen AI Halo는 멀티코어 점수 1,916점으로 가장 높은 점수를 기록하며 HP Z2 Mini(1,906점)를 근소한 차이로 앞섰고, HP ZBook Ultra(1,579점)와의 격차는 여전히 컸습니다. 싱글코어 성능에서도 Halo 플랫폼이 우세했는데, Z2 Mini(112점)와 ZBook Ultra(111점)에 비해 Halo가 116점을 기록했습니다. 데스크톱 시스템 간의 차이는 크지 않았지만, 이 결과는 Ryzen AI Max+ 395가 최고 수준의 CPU 렌더링 성능을 꾸준히 제공할 수 있음을 다시 한번 입증합니다.

Cinebench 2024(높을수록 좋음) AMD 라이젠 AI 헤일로
(라이젠 AI 맥스+ 395 | 라데온 8060S)
HP Z2 Mini G1a(Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14인치(Ryzen AI Max+ PRO 395 | Radeon 8060S)
멀티 코어 1,916 1,906 1,579
싱글 코어 116 112 111

포로닉스 벤치마크

Phoronix Test Suite는 오픈 소스 자동 벤치마킹 플랫폼으로, OpenBenchmarking.org를 통해 450개 이상의 테스트 프로파일과 100개 이상의 테스트 스위트를 지원합니다. 종속성 설치부터 테스트 실행 및 결과 수집까지 모든 과정을 처리하므로 성능 비교, 하드웨어 검증 및 지속적 통합에 이상적입니다. 본 테스트에서는 Stream, 7-Zip 및 LLVM 테스트의 성능을 살펴보겠습니다.

포로닉스 벤치마크 스위트 결과를 살펴보면 AMD 라이젠 AI 헤일로 플랫폼과 NVIDIA DGX 스파크의 성능이 거의 비슷하게 나타났습니다. 라이젠 AI 헤일로 시스템은 CPU 중심 워크로드에서 꾸준히 우위를 점하며 7-Zip 압축에서 DGX 스파크보다 11%, 7-Zip 압축 해제에서 38% 높은 성능을 보였고, LLVM 컴파일 테스트에서는 14% 더 빠른 속도를 기록했습니다. 반면 DGX 스파크는 지속적인 메모리 대역폭에서 강점을 보이며 STREAM Scale, Triad, Add 테스트에서 각각 17%, 13%, 15% 더 높은 성능을 나타냈습니다. STREAM Copy 벤치마크에서는 헤일로가 18%의 우위를 유지했는데, 이는 두 시스템 모두 뛰어난 성능을 자랑하지만 라이젠 AI 헤일로 플랫폼은 범용 컴퓨팅 성능에 더 유리하고, DGX 스파크는 메모리 대역폭에 초점을 맞춘 워크로드에서 더 높은 처리량을 보여준다는 것을 의미합니다.

Test AMD 라이젠 AI 헤일로 엔비디아 DGX 스파크 승자
7-Zip 압축(MIPS) 186,921 169,052 헤일로 (+11%)
7-Zip 압축 해제(MIPS) 146,109 106,084 헤일로 (+38%)
스트림 복사(MB/s) 145,363 123,730 헤일로 (+18%)
스트림 규모(MB/s) 110,611 128,970 스파크(+17%)
스트림 트라이어드(MB/s) 107,105 121,433 스파크(+13%)
스트림 추가(MB/s) 107,022 122,815 스파크(+15%)
LLVM 컴파일 (제작 시간, 초) 431.8 504.3 헤일로 (14% 더 빠름)

FIO 성능 벤치마크

업계에서 일반적으로 사용되는 지표를 기준으로 스토리지 성능을 측정하기 위해 fio를 사용합니다. 기존 SSD 테스트에서는 각 드라이브를 보조 드라이브로 두 번 완전히 채워 사전 조건화했지만, 이번에는 파일 시스템을 통해 시스템 내에서 각 드라이브를 테스트했습니다. 이전에 NVIDIA 시스템은 GDSIO를 사용하여 테스트했지만, AMD는 이와 유사한 GPU 직접 스토리지 테스트를 제공하지 않으므로 두 플랫폼 모두에서 파일 시스템 수준의 fio를 실행하여 동일한 조건에서 비교하는 것이 드라이브를 개별적으로 벤치마킹하는 것보다 더 중요합니다.

NVIDIA DGX Spark(파운더스 에디션)와 AMD Ryzen AI Halo는 모두 PCIe Gen5 드라이브를 탑재하고 있어 이론상으로는 두 플랫폼의 드라이브 대역폭 최대치가 동일합니다. 하지만 실제로는 Halo의 드라이브가 이 시스템에서 PCIe Gen4 링크 속도로 작동하여 드라이브 자체의 최대 대역폭보다 훨씬 낮은 대역폭을 사용하게 됩니다. 이러한 링크 속도 제한은 두 플랫폼 간 대역폭 차이의 상당 부분을 차지하므로 이 섹션 전체에서 염두에 두어야 합니다.

이 섹션에서는 다음 FIO 벤치마크에 초점을 맞춥니다.

  • 128K 순차
  • 64K 랜덤
  • 16K 순차
  • 16K 랜덤
  • 4K 랜덤

128K 순차 읽기

단일 스레드, 128K 블록 크기의 심층 큐 순차 읽기(64/1) 테스트에서 NVIDIA DGX Spark는 13,399.6MB/s의 속도를 기록하며 AMD Ryzen AI Halo의 6,897.5MB/s보다 거의 두 배 빠른 성능을 보였습니다. 지연 시간 역시 비슷한 양상을 보였습니다. Spark의 평균 지연 시간은 0.597ms였지만, Halo는 1.159ms로, 절반의 데이터만 처리했음에도 불구하고 요청당 거의 두 배나 느렸습니다. 이는 전체 테스트에서 가장 뚜렷한 성능 차이로, Spark의 스토리지 스택이 이 블록 크기에서 더 높은 지속적인 순차 처리량을 제공하도록 설계되었음을 시사합니다.

128K 순차 쓰기

쓰기 성능도 비슷한 양상을 보입니다. IODepth 16/1에서 Spark는 2,984.4MB/s를 기록한 반면, Halo는 1,392.4MB/s에 그쳐 NVIDIA가 114% 우위를 점했습니다. 지연 시간 또한 Spark가 0.67ms로 Halo의 1.436ms보다 빨랐습니다. 읽기 결과와 종합해 보면, 128K 순차 쓰기 성능은 Halo 대비 Spark의 가장 강력한 성능으로 나타납니다.

64K 랜덤 읽기

바로 이 부분에서 Halo의 낮은 대기열 깊이에서의 지연 시간 우위가 두드러집니다. 1/1 대기열에서 Halo는 단 0.051ms 만에 응답한 반면 Spark는 0.275ms를 기록하여 단일 대기 요청 처리 속도가 5배 이상 빨랐습니다. 이러한 격차는 대기열 깊이가 낮거나 중간 정도인 구간에서도 유지되며, Halo는 0.2ms 미만의 응답 시간을 기록하는 반면 Spark는 대부분의 구간에서 0.2~0.45ms 범위에 머무릅니다.

하지만 규모가 커지면 상황은 완전히 달라집니다. Spark는 큐 깊이와 스레드 수가 대략 16/4를 넘어서면서 대역폭이 급격히 증가하여 8/16부터는 약 9.8GB/s에서 안정화되고, 32/8에서는 10,019.1MB/s(160.3 IOPS)까지 도달합니다. 반면 Halo는 이러한 최대치에 도달하지 못하고 6.0~6.9GB/s 범위에서 포화 상태에 머무르며, 4/8에서 6,926.5MB/s(110.8 IOPS)로 최고치를 기록합니다. Halo의 대역폭 곡선은 Spark처럼 부드럽게 상승하는 것이 아니라 큐 깊이와 스레드 수 조합에 따라 약 2~6.8GB/s 사이에서 톱니 모양으로 불규칙하게 변동합니다.

최대 부하 시 지연 시간 또한 Spark가 더 우수합니다. 32/16 구성에서 Halo의 평균 지연 시간은 5.185ms로 급증하는 반면 Spark는 3.204ms에 그칩니다. 즉, Halo는 대기열 깊이가 얕을 때의 빠른 응답성을 제공하지만, 대기열이 완전히 채워지면 꼬리 부분에서의 성능이 저하되는 단점이 있습니다.

64K 랜덤 쓰기

랜덤 64K 쓰기 대역폭은 읽기 대역폭보다 두 플랫폼 간의 차이가 적지만, 곡선 형태는 매우 다릅니다. Halo의 대역폭은 더 불규칙적인 양상을 보입니다. 2.5GB/s를 반복적으로 넘어서며(32비트/4비트에서 2,929.1MB/s/46.9K IOPS로 최고치를 기록), 인접한 조합에서는 1.1~1.5GB/s 범위로 떨어집니다. Spark는 상대적으로 안정적이며, 대부분의 구간에서 1.7~2.0GB/s 대역을 유지하고 2비트/16비트에서 2,106.6MB/s(33.7K IOPS)로 최고치를 기록합니다.

지연 시간은 64K 읽기 패턴과 유사한 양상을 보입니다. Halo는 큐 깊이가 낮을 때(1/1에서 0.054ms, Spark는 0.217ms) Spark보다 훨씬 빠르며, 큐 깊이와 스레드 수가 두 자릿수로 증가함에 따라 두 드라이브 모두 성능이 급격히 저하됩니다. 최대 포화 상태(32/16)에서 Halo의 지연 시간은 19.611ms에 도달하는 반면 Spark는 17.857ms입니다. 이 시점에서 두 드라이브 모두 쓰기 증폭으로 인한 상당한 스트레스를 받고 있으며, Halo는 곡선의 최상단에서 다시 한번 약간 더 나쁜 성능을 보입니다.

16K 순차 읽기

대부분의 테스트 구간에서 대역폭은 높은 수준을 유지했으며, 두 드라이브 모두 처리 깊이/스레드 조합에 따라 약 1~8GB/s 사이에서 톱니 모양으로 변동했습니다. Spark는 32/1에서 8,069.3MB/s(516.4K IOPS)의 최고 속도를 기록하며 Halo보다 약간 앞섰고, Halo는 8/4에서 6,715.8MB/s(429.8K IOPS)의 최고 속도를 기록했습니다.

대기열 최상단을 제외한 모든 구간에서 Halo가 Spark보다 지연 시간이 짧습니다. 1/1 조합에서 Halo는 0.027ms의 응답 속도를 보이는 반면 Spark는 0.214ms를 기록하며, Halo는 대부분의 구간에서 더 낮은 지연 시간을 유지합니다. 격차가 좁혀지는 것은 가장 깊은 조합에서만입니다. 32/16 조합에서 Halo의 평균 지연 시간은 1.441ms로 Spark의 1.599ms보다 약간 낮습니다. 이는 Halo의 지연 시간 곡선이 포화 상태에서 Spark의 지연 시간을 크게 넘어서지 않는 몇 안 되는 지점 중 하나입니다.

16K 순차 쓰기

대역폭 성능도 여기서 비슷합니다. Spark는 16/1에서 최대 2,141.6MB/s(137.1K IOPS)를 기록하고, Halo도 1/8에서 1,970.9MB/s(126.1K IOPS)로 크게 뒤처지지 않습니다.

지연 시간은 두 제품의 성능 차이가 극명하게 드러나는 부분입니다. Halo는 대기열 깊이가 낮을 때(1/1 조합에서 0.022ms, Spark는 0.231ms) Spark보다 훨씬 앞서지만, 대기열이 차오를수록 지연 시간 곡선이 급격하게 상승합니다. 32/16 조합에 이르면 Halo의 평균 지연 시간은 6.967ms까지 올라가 Spark의 동일 시점 지연 시간인 4.306ms를 훨씬 넘어섭니다. 또한 Halo의 지연 시간 곡선은 중간 범위의 여러 조합에서 급격한 상승세를 보이는 반면 Spark는 비교적 평탄한 곡선을 유지하는 등 예측하기 어렵습니다.

16K 랜덤 읽기

이는 Halo의 뛰어난 성능 중 하나입니다. 실제로 32/16 구성에서 최대 대역폭이 6,609.4MB/s(423.0 IOPS)로 Spark의 동일 조합(6,082.6MB/s, 389.3 IOPS)보다 높습니다.

지연 시간은 Halo가 Spark보다 훨씬 빠른 출발을 보입니다(1/1에서 Halo 0.047ms, Spark 0.222ms). 하지만 Halo의 지연 시간 곡선은 전체 구간에서 훨씬 더 변동성이 크며, 8/1, 16/1, 8/4, 8/8에서 급격한 상승세를 보여 Spark의 비교적 매끄러운(비록 기준선은 더 높지만) 곡선을 크게 벗어납니다. 대기열 맨 위에서는 Halo의 최고 지연 시간인 1.971ms(16/16)가 Spark의 최고 지연 시간인 1.315ms(32/16)를 초과하므로, Halo는 일관성을 희생하는 대신 대기열 깊이가 얕은 곳에서의 빠른 처리 속도를 택한 것입니다.

16K 랜덤 쓰기

대역폭 측면에서는 Spark가 우위를 점합니다. Spark는 32/1 설정에서 2,074.1MB/s(132.7 IOPS)를 기록하는 반면, Halo는 8/4 설정에서 1,503.5MB/s(96.2 IOPS)에 그칩니다. Spark의 대역폭 곡선은 초기 증가 이후 대부분의 구간에서 1.6~2.0GB/s 범위를 유지하며 훨씬 더 안정적입니다. 반면 Halo는 설정에 따라 약 0.1GB/s에서 1.5GB/s 사이를 크게 오갑니다.

이 테스트에서 가장 눈에 띄는 부분은 지연 시간입니다. Halo는 1/1(0.154ms 대 0.224ms)에서 낮은 지연 시간으로 시작하지만, 8/16에서는 평균 지연 시간이 극단적으로 20.698ms까지 치솟습니다. 이는 Spark의 최악의 경우인 4.664ms의 거의 4.5배에 달하는 수치입니다. 이 단일 급증 현상을 제외하면 Halo의 지연 시간은 대체로 양호하지만, 특정 깊이/스레드 조합에서 발생하는 심각한 이상치이므로 해당 워크로드에 주의해야 합니다.

4K 랜덤 읽기

큐 깊이가 낮을 때는 Halo가 Spark보다 훨씬 빠른 응답 속도(1/1에서 0.04ms 대 Spark의 0.215ms)를 보이며, 대부분의 저-중 범위에서 지연 시간 측면에서 우위를 유지합니다. 하지만 대규모 처리량에서는 Spark가 확실한 우위를 점합니다. Spark의 최대 IOPS는 32/16에서 1,750.7K(6,838.8MB/s)에 달하며, Halo의 32/8에서의 최대 IOPS 1,050.4K(4,103.2MB/s)를 크게 앞섭니다.

흥미롭게도, 큐 깊이가 높아질수록 지연 시간 양상이 반전됩니다. Spark의 지연 시간 곡선은 큐 깊이와 스레드 수가 증가하더라도 비교적 안정적인 상태를 유지하며, 최고점은 0.292ms에 불과합니다. 반면 Halo는 16/16(0.513ms)과 32/16(1.009ms)에서 급격히 증가하여 정상 상태 기준선보다 3배 이상 높아집니다. 이는 Halo의 뛰어난 저큐 깊이 응답성이 최대 포화 상태까지 유지되지 않음을 의미합니다.

4K 랜덤 쓰기

이는 테스트에서 가장 큰 IOPS 격차입니다. Spark의 4K 랜덤 쓰기 성능은 큐 깊이와 스레드 수가 증가함에 따라 급격히 상승하여 8/16에서 490.4K IOPS(1,915.6MB/s)에 도달합니다. 반면 Halo는 훨씬 일찍, 그리고 훨씬 낮은 수준에서 성능이 정체되어 4/4에서 125.6K IOPS(490.7MB/s)를 최고치로 찍고 나머지 테스트 기간 동안에는 약 110~115K IOPS를 넘지 못합니다. Spark는 여기서 Halo의 최대 성능보다 거의 4배 높은 성능을 보여주고 있습니다.

대기 시간 측면에서는 큐 깊이가 낮을 때 Halo가 다시 우위를 보입니다(1/1에서 0.079ms 대 0.235ms). 하지만 32/16에서는 Halo의 평균 대기 시간이 4.546ms까지 상승하는 반면, Spark는 1.792ms로 비교적 안정적인 수준을 유지합니다. IOPS 차이와 함께 고려했을 때, 이 테스트는 Spark의 우위가 전체 큐 깊이/스레드 범위에서 가장 두드러지고 일관되게 나타나는 구간입니다.

vLLM 온라인 제공 – LLM 추론 성능

vLLM은 LLM(로지스틱 회귀 모델)을 위한 가장 인기 있는 고처리량 추론 및 서비스 엔진 중 하나입니다. vLLM 온라인 서비스 벤치마크는 동시 요청 환경에서 이 추론 엔진의 실제 서비스 성능을 평가합니다. 실행 중인 vLLM 서버에 요청을 전송하여 프로덕션 워크로드를 시뮬레이션하며, 요청 속도, 입력 및 출력 길이, 동시 클라이언트 수 등의 매개변수를 구성할 수 있습니다. 이 벤치마크는 처리량(초당 토큰 수), 첫 번째 토큰 출력 시간, 출력 토큰당 시간(TPOT) 등의 주요 지표를 측정하여 사용자가 다양한 부하 조건에서 vLLM의 성능을 파악할 수 있도록 지원합니다.

우리는 다양한 아키텍처, 파라미터 규모 및 양자화 전략을 포괄하는 광범위한 모델 제품군에 걸쳐 추론 성능을 테스트하여 다양한 동시성 프로파일에 따른 처리량을 평가했습니다.

GPT OSS 120B

동일한 ISL/OSL(256/256): Halo는 배치 크기 64에서 222 tok/s까지 확장된 반면 Spark는 701 tok/s에 도달했습니다(약 3.2배 뒤처짐).

프리필 헤비(8k/1k): Halo의 처리량은 32번째 배치에서 최고치(427 tok/s)를 기록한 후 64번째 배치에서 314로 떨어졌고, Spark는 2,760(약 8.8배)까지 급증하여 전체 측정 장비 중 가장 큰 차이를 보였습니다.

디코드 헤비(1k/8k): Halo는 배치 크기 64에서 127 tok/s를 기록한 반면 Spark는 305 tok/s를 기록했습니다(약 2.4배).

GPT OSS 20B

동일한 ISL/OSL(256/256): Spark는 모든 배치에서 선두를 차지했으며, 64번째 배치에서는 1,917 tok/s 대 617 tok/s로 확장되었습니다(Spark가 약 3.1배 앞섰습니다).

프리필 헤비(8k/1k): Spark가 가장 큰 격차를 보이며 배치 크기 64에서 3,672 tok/s 대 881 tok/s로 상승했습니다(Spark가 약 4.2배 앞서 있음).

디코드 헤비(1k/8k): Spark가 전반적으로 앞서며, 배치 64에서 728 tok/s 대 330 tok/s를 기록했습니다(Spark가 약 2.2배 앞서 있음).

Qwen3 Coder 30B A3B 지시

동일 ISL/OSL(256/256): Halo는 배치 크기 64에서 376 tok/s로 확장되었는데, 이는 Spark의 729 tok/s의 약 절반(약 1.9배)에 해당하며, 비교적 유사한 ISL/OSL 결과 중 하나입니다.

프리필 헤비(8k/1k): 헤일로는 32번째 배치에서 최고치(408 tok/s)를 기록한 후 64번째 배치에서 362로 떨어져 스파크의 1,663(약 4.6배)에 미치지 못했습니다.

디코드 헤비(1k/8k): Halo는 배치 크기 64에서 188 tok/s를 기록한 반면, Spark는 357 tok/s를 기록했습니다(약 1.9배).

미스트랄 스몰 3.1 24B 지시

동일한 ISL/OSL(256/256): Halo는 실제로 1차 배치에서 앞섰지만(초당 9 대 8 토크), 64차 배치에서는 202 토크로 안정되었고, Spark는 498 토크로 약 2.5배 뒤처졌습니다.

프리필 헤비(8k/1k): Halo는 32번째 배치에서 최고치(188 tok/s)를 기록했고, 64번째 배치에서는 164로 약간 떨어져 Spark의 540(약 3.3배)에 미치지 못했습니다.

디코드 헤비(1k/8k): 거의 비슷한 성능을 보였으며, Halo는 64번째 배치에서 Spark의 132 tok/s에 비해 119 tok/s를 기록했습니다(약 11% 차이).

라마 3.1 8B 지시

동일 ISL/OSL(256/256): Halo는 1차 배치에서 25 tok/s에서 64차 배치에서 407 tok/s까지 깔끔하게 확장되었으며, 4차 배치까지 Spark를 바짝 추격하다가 이후 Spark가 1,330까지 앞서 나갔습니다(Halo는 최고점에서 약 3.3배 뒤처졌습니다).

프리필 헤비(8k/1k): Halo는 배치 크기 64에서 546 tok/s에 도달했으며, Spark의 1,059 중 약 절반을 담을 수 있습니다.

디코드 헤비(1k/8k): Halo의 가장 경쟁력 있는 시나리오에서 배치 크기 64일 때 Spark의 263 tok/s에 비해 235 tok/s를 기록하며 (약 12% 차이) 우수한 성능을 보였습니다.

Llama 3.1 8B 명령어 FP4

동일한 ISL/OSL(256/256): Halo는 배치 크기 64에서 최대 267 tok/s를 기록했는데, 이는 Spark의 3,573 tok/s에 비해 훨씬 뒤처지는 수치입니다. FP4에서 가장 큰 격차(약 13.4배)가 나타났습니다.

프리필 헤비(8k/1k): Halo는 배치 크기 64에서 457 tok/s에 도달했으며, Spark는 2,713 tok/s(약 5.9배)에 도달했습니다.

디코드 헤비(1k/8k): Halo는 배치 크기 64에서 146 tok/s까지 확장되었으며, Spark는 588 tok/s를 기록했습니다(약 4배).

맺음말

AMD Ryzen AI Halo는 NVIDIA가 DGX Spark로 사실상 개척한 영역에 진입했지만, Spark를 정면으로 꺾으려 하지는 않습니다. vLLM 테스트에서 Spark는 높은 동시 접속 환경에서 대부분의 시나리오에서 2~4배의 처리량 우위를 보였고, 프리필 작업이 많은 GPT OSS 120B 작업에서는 최대 8.8배의 우위를 기록했으며, 디코딩 작업이 많은 두 가지 테스트에서만 약 10%의 차이로 좁혀졌습니다. 또한 Spark의 스토리지 서브시스템은 포화 상태에서 거의 모든 fio 테스트에서 우위를 보였습니다. Halo는 Spark Founders Edition과 유사한 크기에 128GB의 통합 메모리와 200억 개의 파라미터를 지원하며, 가격은 Spark Founders Edition의 4,699달러보다 낮은 3,999달러(일부 OEM은 4,000달러 미만으로 판매)입니다. 또한 Halo는 DGX OS만 사용하는 것이 아니라 Windows 11 또는 Linux를 부팅할 수 있는 완전한 x86 시스템입니다.

AMD 라이젠 AI 헤일로 메인보드 상단 모습.

Spark를 제외하면, Halo는 우리가 테스트한 Ryzen AI Max+ 395 구현 중 가장 강력한 제품입니다. HP Z2 Mini G1a 및 ZBook Ultra G1a와 비교했을 때 거의 모든 Windows 워크로드에서 최고 점수를 기록했습니다. Cinebench R23 멀티코어에서 37,316점, 7-Zip에서 184.2 GIPS(HP 제품은 151.6 GIPS, ZBook Ultra G1a는 156.8 GIPS)를 기록했고, Procyon AI 텍스트 및 이미지 생성 점수와 y-cruncher 50억 및 100억 자리 연산에서도 가장 빠른 처리 시간을 보였습니다. Linux 환경에서는 Spark를 상대로 CPU 성능에 특화된 Phoronix 테스트에서 압도적인 승리를 거두었는데, 7-Zip 압축 속도는 11% 더 빠르고 LLVM 컴파일 시간도 14% 더 단축되었습니다. Halo는 컴팩트한 워크스테이션으로서의 기능을 우선시하며, AI 개발자의 역할을 대체하는 것이 아니라 그 위에 얹어주는 형태입니다.

초당 최대 로컬 토큰 처리량이 필요하거나 고속 패브릭을 통해 노드 클러스터링을 계획하는 개발자라면 Spark를 구매하는 것이 좋습니다. Halo의 10GbE 및 vLLM 성능은 Spark에 비해 한참 떨어집니다. ROCm 기반 개발, Windows 운영 체제 사용, 또는 전문적인 워크로드와 로컬 모델링 작업을 하나의 장비로 처리하려는 사용자에게는 Halo가 더 적합하며, 기본 제공되는 M.2 2280 베이와 사전 튜닝된 가변 그래픽 메모리는 Spark 사용자들의 가장 일반적인 불만 사항 두 가지를 해결해 줍니다. AMD는 또한 3분기에 최대 192GB의 통합 메모리를 탑재한 Ryzen AI Max PRO 400 시리즈 칩셋을 Halo 플랫폼에 적용할 예정이라고 밝혔으므로, 더 높은 성능의 모델을 원하는 사용자는 플랫폼을 변경하지 않고도 업그레이드할 수 있는 확실한 선택지가 있습니다.

제품 페이지 – AMD 라이젠 AI 헤일로

순위표: AMD Ryzen AI Halo는 로컬 AI용 최고의 데스크톱 순위표에서 최고의 x86 대체품 자리를 차지했습니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

브라이언 빌러

Brian은 오하이오주 신시내티에 있으며 StorageReview.com의 수석 분석가이자 사장입니다.