NVIDIA DGX Spark를 리뷰했을 때 , 스토리지는 플랫폼의 가장 명확한 설계 결함이었으며, 이는 무엇보다도 폼팩터 문제였습니다. Spark의 내부 슬롯은 M.2 2230 및 2242급의 짧은 드라이브를 사용하는데, 이는 공간 효율성 때문에 용량이 제한되는 구조입니다. 클라이언트 SSD 시장의 고용량 제품은 현재 8TB 모델이 출시되는 풀사이즈 2280 드라이브인데, Spark에는 이를 장착할 공간이 없습니다. 그 결과, 고성능 AI 작업을 위해 설계된 기기임에도 불구하고 스토리지 용량은 얇고 가벼운 노트북에나 적합한 수준에 머물러 있으며, 이를 해결할 내부 솔루션도 없습니다. Luisuantech GP Spark는 바로 이 문제를 해결하기 위한 제품입니다. 0.58리터 크기의 4베이 박스로, 풀사이즈 M.2 드라이브를 장착할 수 있으며, Spark의 100GbE 포트에 연결하여 드라이버나 포맷 없이 네이티브 NVMe 장치로 인식되고, 거의 회선 속도로 GPU Direct Storage 트래픽을 처리합니다.
GP Spark의 핵심은 단순함과 클라이언트 드라이브의 경제성입니다. GP Spark의 4개 베이는 일반적인 M.2 2280 또는 22110 NVMe SSD를 지원하며, Spark 자체에서는 해당 폼팩터를 지원하지 않지만, 전용 칩에 탑재된 하드웨어 오프로드 엔진을 통해 NVMe-oF RDMA 방식으로 드라이브를 제공합니다. Luisuantech의 사양서에 따르면 현재 최대 4TB, 인클로저당 16TB까지 지원하지만, 이는 이미 8TB 클라이언트 드라이브가 탑재된 슬롯과 동일하므로 실제 최대 용량은 기계적인 한계보다는 사양 검증의 문제입니다. 엔터프라이즈급 스토리지 어레이도 아니고, 라이선스도 필요 없으며, 별도의 스토리지 운영 체제를 학습할 필요도 없습니다. GP Spark와 DGX Spark 사이에 DAC 또는 AOC 케이블을 연결하고 Spark의 Ubuntu 기반 시스템에서 `modprobe nvme-rdma` 명령을 실행하면 드라이브가 GDS에 액세스할 수 있는 `/dev/nvme` 장치로 인식됩니다.
설계 및 구축
GP Spark는 150mm x 150mm x 26mm 크기의 박스형 케이스로, Spark 본체보다 작은 크기입니다. 천공 처리된 금속 섀시에 전원 버튼 하나만 있으며, 이 버튼은 상태 표시등 역할도 겸합니다. 정상 작동 시에는 녹색, 오류 발생 시에는 빨간색으로 켜집니다. 전원은 20V/5.4A 외부 어댑터에서 USB-C PD를 통해 공급되며, 드라이브를 포함한 전체 소비 전력은 100W 미만입니다. 후면 패널에는 USB-C 전원 입력 단자, USB-C 공장 디버그 포트, 그리고 구리 DAC 또는 광 모듈을 지원하는 QSFP28 100GbE 데이터 포트 등 세 개의 커넥터가 있습니다. 내부에는 전용 데이터 프로세서와 보조 프로세서가 NVMe-oF 오프로드 처리를 담당하며, 상단 덮개 아래에는 4개의 M.2 베이가 있습니다.
후면 패널은 기능성을 강조한 디자인입니다. 왼쪽에는 USB-C 전원 및 디버그 포트가 있고, 오른쪽에는 QSFP28 케이지가 있으며, 그 사이 통풍구를 통해 구리 방열판이 보입니다. 냉각은 전적으로 패시브 방식입니다.
상단 덮개를 열면 4개의 M.2 베이가 일렬로 배열되어 있으며, 여기에는 KIOXIA XG8 테스트 드라이브가 장착되어 있습니다. 덮개 자체가 드라이브 쿨러 역할을 하는데, 덮개 아래쪽의 파란색 열 패드가 각 SSD를 섀시 상단의 방열판에 연결하여 지속적인 기업용 작업 부하에 노출되지 않는 클라이언트 드라이브에 적합한 깔끔한 패시브 냉각 솔루션을 제공합니다.
본격적인 리뷰에 앞서 몇 가지 공지사항을 알려드립니다. 저희 제품은 프로토타입입니다. 하단 라벨에는 GP-Spark-1000이라는 표기와 함께 "프로토타입, 재판매 금지"라는 문구, 그리고 Luisuantech에서 하드웨어에 사용하는 Swingsoon 브랜드로 2026년 2월에 제작되었다는 표시가 있습니다. 양산품은 마감이나 외관 면에서 차이가 있을 수 있지만, 저희가 테스트한 플랫폼 동작은 Luisuantech에서 현재 리뷰어들에게 제공하는 제품과 동일합니다. 제품 개봉 후 사용 경험에 대한 추가 사항 두 가지를 말씀드리겠습니다. 저희 제품에는 중국어로 된 설명서 두 부가 동봉되어 있었고, 초기 설정은 Wi-Fi를 통한 온보딩으로 진행되는 것으로 보입니다. 이 제품의 주요 사용자층에게는 큰 문제가 되지 않겠지만, 서구권 출시를 위해서는 영어 설명서가 필요할 것입니다.
설정 및 아키텍처
GP Spark에는 RAID 컨트롤러나 스토리지 추상화 기능이 내장되어 있지 않습니다. 말 그대로 JBOF(Joint Base Operate) 방식으로, 설치된 각 SSD를 자체 NVMe-oF 네임스페이스로 노출합니다. 저희 구성에서는 4개의 드라이브가 호스트에서 4개의 /dev/nvme 장치로 나타났습니다. 이중화 또는 스트라이핑은 호스트에서 처리합니다. 제조사 사양서에는 10GB/s 및 2.7M IOPS의 단일 100GbE 포트가 명시되어 있으며, 제품 보고서에는 2x100GbE 구성과 최대 24GB/s의 성능이 별도로 언급되어 있습니다. Luisuantech는 이 수치가 읽기/쓰기 합계 속도임을 확인했습니다. 저희 테스트에서는 단일 포트 구성을 사용했습니다.
루이수안테크 GP 스파크 사양
| 스펙 | 루이수안테크 GP 스파크 |
|---|---|
| 플랫폼 개요 | |
| 드라이브 베이 | 4 x M.2 NVMe (2280 / 22110) 혼합 용량 지원, 드라이브당 최대 4TB까지 지원 |
| 네트워크 | QSFP28 100GbE (DAC 또는 광) RDMA 필요 |
| 프로토콜 | NVMe-oF RDMA GPU 직접 저장(GDS) |
| 성능 (공급업체 제공) | |
| 맞춤형 설비 | 100GbE 포트당 10GB/s 읽기 및 쓰기 합계 최대 24GB/s |
| IOPS | 2.7M |
| 접근 지연 시간 | 20마이크로초 이하 |
| 힘과 신체 | |
| 출력 | 총 100W 미만 20V/5.4A USB-C PD 외장 어댑터 |
| 크기 | 150mm x 150mm x 26mm(0.58L) |
| 작동 온도 | 0 ~ 40C |
| 호환성 | 엔비디아 DGX 스파크 DGX 역 RDMA 기능을 갖춘 NIC가 있는 워크스테이션 및 서버 |
성능
저희 테스트 구성은 GP Spark와 GIGABYTE DGX Spark를 100GbE 직접 연결로 결합하고, 4개의 1TB KIOXIA XG8 클라이언트 NVMe SSD를 베이에 장착했습니다. 드라이브 선택이 측정된 성능에 상당한 영향을 미친다는 점을 유념해야 합니다. 저희는 클라이언트 Gen5 SSD를 사용했는데, 일부 모델, 특히 엔터프라이즈 SSD는 지속적인 쓰기 성능이 더 높을 수 있습니다. 4K 및 64K 랜덤, 1M 순차 워크로드에 대해 읽기 및 쓰기 모두에서 FIO 스윕을 실행했으며, 전체 범위를 매핑하기 위해 iodepth와 numjobs를 단계적으로 조정했습니다. 결과는 Luisuantech의 MTU 가이드라인을 적용한 후 재테스트한 최종 결과를 반영하며, 이를 통해 초기 실행보다 전송 성능이 향상되었습니다.
4K 랜덤 성능
스몰 블록 읽기에서 오프로드 엔진의 진가가 드러납니다. 4K 랜덤 읽기는 큐 깊이에 따라 확장되어 9,475MiB/s의 속도에서 최대 2.43만 IOPS를 기록했는데, 이는 제조사가 주장하는 270만 IOPS에 근접한 수치이며 4K 전송으로 100GbE 링크를 사실상 포화 상태로 만든 것입니다. 데스크톱 AI 시스템에 데이터를 공급하는 수동 전원 방식의 4베이 장비에서 이 정도 성능은 놀라운 수치입니다.
쓰기 작업도 대략 절반 높이에서 동일한 형태를 보이며, 최고 1.19만 IOPS에 도달합니다. 읽기 및 쓰기 성능 상한선 간의 차이는 실행한 모든 워크로드에서 일관적입니다. 성능은 기본 드라이브와 직접적인 관련이 있으므로 구성에 따라 결과가 달라질 수 있습니다.
읽기 지연 시간은 큐 깊이가 낮을 때 평균 65.3마이크로초까지 떨어집니다. 이는 제조사에서 제시한 20마이크로초 미만보다는 높지만, 드라이브 선택 및 네트워크 구성에 따라 결과는 달라질 수 있습니다. 네트워크 왕복 시간 또한 이 수치에 영향을 미치며, 링크가 포화 상태에 도달하기 전까지는 지연 시간이 일정하고 예측 가능한 수준을 유지합니다.
쓰기 지연 시간은 사양서의 주장과 일치하는 유일한 부분입니다. 최소 깊이에서 평균 20.4마이크로초로, 공급업체가 제시한 20마이크로초 미만 수치와 정확히 일치하며, 애플리케이션에서 패브릭이 사실상 보이지 않을 정도로 매우 낮습니다.
64K 랜덤 성능
64K 블록 크기에서는 대역폭이 핵심이 됩니다. 랜덤 읽기 속도는 최대 9,503MiB/s로, 4K 및 1M 블록 크기에서의 최고 속도와 통계적으로 동일합니다. 워크로드의 블록 크기가 어떻든 GP Spark는 100GbE 포트의 최대 회선 속도를 그대로 제공합니다.
64K 블록 크기의 임의 쓰기 속도는 4,742MiB/s에서 안정화되는데, 이는 다른 모든 블록 크기에서 측정한 최대 속도와 동일합니다.
1M 순차 성능
대용량 블록 순차 읽기(모델 로딩 및 데이터셋 스트리밍과 같은 작업)는 9,496MiB/s에 도달하며, 큐 깊이가 적당해지면 그 수준을 유지합니다. 이것이 바로 GP Spark가 존재하는 이유이며, 네트워크 대역폭을 최대한 활용하여 실행됩니다.
순차 쓰기 속도는 4,742 MiB/s로 읽기 처리량의 약 절반 수준이며, 테스트한 모든 블록 크기에서 동일한 최대값을 보였습니다. 테스트 중 Luisuantech에 이러한 비대칭성을 지적하고 MTU 변경을 포함한 튜닝 작업을 진행했습니다. 여기에 제시된 수치는 현재 단일 포트 구성에서 플랫폼이 제공하는 최상의 성능을 나타내며, Luisuantech는 쓰기 경로 사양과 일치함을 확인했습니다. 이 장비가 대상으로 하는 모델 로딩, 데이터셋 스트리밍, RAG 검색과 같은 읽기 중심 워크로드에서는 이러한 성능 차이가 큰 문제가 되지 않지만, 대용량 데이터 수집 시에는 그에 따른 성능 기대치를 고려해야 합니다.
맺음말
GP Spark는 한 가지 기능만 깔끔하게 수행합니다. 바로 하나 이상의 DGX Spark에 플랫폼이 고성능 작업을 처리하는 데 필요한 스토리지를 제공하는 것입니다. 케이블을 연결하고 커널 모듈을 로드하면 드라이버 설치, 스토리지 운영 체제 설치, 추가 비용 없이 거의 10GB/s의 GDS 접근 가능 플래시 메모리가 제공됩니다. 핵심은 클라이언트 M.2 드라이브로 채우는 것입니다. GP Spark는 보유한 모든 2280 또는 22110 SSD를 지원하므로 용량 확보 비용이 상대적으로 저렴해지고, 오프로드 엔진이 드라이브가 처리하지 않는 프로토콜 작업을 처리합니다.
저희 생각에는 이것은 획기적인 제품이라기보다는 깔끔하고 잘 구현된 추가 기능입니다. 읽기 속도는 단일 링크의 회선 속도에 고정되고, 쓰기 속도는 그 절반 정도에 고정됩니다. 가격은 아직 미지수입니다. GP Spark는 아직 미국이나 중국에서 소매 판매되지 않고 있으며, 저희 테스트 장치는 프로토타입이고, Luisuantech는 가격을 공개하지 않았습니다. 하지만 이 제품의 가치는 클라이언트 드라이브 설계 덕분에 엔터프라이즈급 NVMe-oF 대안보다 훨씬 저렴하게 출시될 수 있다는 점에 있습니다. 내부 스토리지 용량 부족에 직면한 Spark 사용자(저희 초기 리뷰에서 많은 사용자가 이러한 문제를 겪을 것으로 예상했습니다)에게 이 제품은 대규모 엔터프라이즈 스토리지 환경에서 스토리지를 따로 떼어내지 않고도 문제를 해결할 수 있는 간편한 방법입니다.




아마존