StorageReview.com

DapuStor R6060 122TB 리뷰: 읽기 작업이 많은 환경에 최적화된 Gen5 QLC 스토리지 (대규모 사용 환경)

기업  ◇  SSD

DapuStor R6060은 DapuStor의 DP800 컨트롤러와 3D QLC NAND를 기반으로 구축된 PCIe Gen5 엔터프라이즈 QLC SSD입니다. 이 시리즈는 U.2, E3.L, E1.L 폼팩터를 지원하며, 15.36TB, 30.72TB, 61.44TB, 122.88TB 용량에 더해 최고 사양인 245TB 모델도 제공합니다. 인터페이스는 PCIe 5.0 x4 또는 2x2 듀얼 포트와 NVMe 2.0을 지원합니다. 본 리뷰 제품은 122.88TB E3.L 2T 모델로, DapuStor는 이 제품을 고밀도 AI 인프라, 클라우드 환경, 대규모 스토리지 풀 등 플래시 메모리 용량이 중요한 환경에 적합하다고 홍보하고 있습니다. 성능 프로필은 높은 순차 읽기 대역폭과 훨씬 낮은 쓰기 처리량을 결합하여 해당 역할에 적합하므로 R6060은 소규모 블록 트랜잭션 워크로드보다는 읽기 중심 데이터 세트 및 용량 중심 스토리지 계층에 더 적합합니다.

DapuStor R6060 122TB 상단 모습

DapuStor는 R6060 제품군 전체의 순차 읽기 처리량을 최대 14GB/s, 순차 쓰기 처리량을 4GB/s로 명시하고 있습니다. 랜덤 읽기 성능은 15.36TB 및 30.72TB 모델의 경우 최대 3만 IOPS, 61.44TB 및 122.88TB 모델의 경우 2.8만 IOPS로 명시되어 있습니다. 랜덤 쓰기 성능은 훨씬 낮아, 용량이 작은 모델에서는 16KB에서 40만 IOPS, 122.88TB 모델에서는 32KB에서 20만 IOPS입니다. 따라서 R6060은 특히 대용량 데이터 세트나 고밀도 스토리지 계층과 같이 사용 가능한 용량이 작은 블록 쓰기 속도보다 더 중요한 요소인 환경에서 읽기 작업에 특화되어 있습니다.

R6060은 엔터프라이즈급 드라이브에 기대되는 다양한 기능을 갖추고 있으며, 특히 QLC에 중요한 기능 중 하나인 NVMe 2.0 FDP(Flexible Data Placement)를 지원합니다. FDP는 호스트가 데이터 기록 위치를 더욱 정밀하게 제어할 수 있도록 하여 쓰기 증폭을 줄이고 플래시 메모리를 효율적으로 활용할 수 있도록 합니다. DapuStor는 이 드라이브의 DWPD(데이터 쓰기 지연 시간)를 0.6으로 평가했으며, OCP 2.5 규격 준수, NVMe-MI 1.2, 엔드투엔드 데이터 보호, 보안 부팅, 펌웨어 검증, 데이터 삭제 지원, 원격 측정, 지연 시간 모니터링, 경로 이중화가 필요한 시스템을 위한 듀얼 포트 지원 등의 기능을 제공한다고 명시하고 있습니다.

DapuStor R6060 122TB 후면 모습

DapuStor는 R6060에 대해 5년 보증을 제공하며, 최대 전력 소비는 25W, 대기 전력 소비는 5W로 명시하고 있습니다. 랜덤 지연 시간은 읽기/쓰기 각각 80/25µs, 순차 지연 시간은 7/8µs, 평균 무고장 시간(MTBF)은 250만 시간입니다.

DapuStor R6060 122TB 사양

측정항목/필드 15.36TB 30.72TB 61.44TB 122.88TB
일반
PCN R6060
용량(TB) 15.36 30.72 61.44 122.88
폼 팩터  U.2/E3.L 2T/E1.L
인터페이스 PCIe 5.0×4 / 2×2, NVMe 2.0
플래시 타입 3D 엔터프라이즈 QLC NAND 플래시
성능
128KB에서의 읽기 대역폭(MB/s) 14000 14000 14000 14000
쓰기 대역폭(128KB 기준, MB/s) 4000 4000 4000 4000
랜덤 읽기 @4KB 키옵스 3000 3000 2800 2800
랜덤 쓰기 키오프 40@16KB 40@16KB 40@16KB 20@32KB
랜덤 읽기/쓰기 지연 시간(µs) 80/25
순차 읽기/쓰기 지연 시간(µs) 7/8
출력
최대 출력(W) 25
유휴 전력(W) 5
신뢰성
지구력 0.6 DWPD
MTBF 2.5 백만 시간
우버 1^10비트 읽기당 18섹터
품질 보증 저희 가족은 5년 이상 프리미엄 한식 BBQ용 고기만을 전문으로 다뤄왔습니다. 로스앤젤레스에서 최고 평점을 받은 정육점으로서 쌓아온 경험과 신뢰를 바탕으로, 한식 BBQ의 진정한 맛과 정성을 고객님께 전하고 있습니다. 모든 고기에는 세대를 이어온 정성과 열정이 담겨 있으며, 단순한 음식이 아닌 저희의 정체성을 보여줍니다.

다푸스토르 R6060 성능

드라이브 테스트 플랫폼

본 리뷰에서는 모든 워크로드 테스트를 위해 Ubuntu 22.04.2 LTS가 설치된 Dell PowerEdge R760 서버를 테스트 플랫폼으로 사용했습니다. Serial Cables Gen5 JBOF를 장착하여 U.2, E1.S, E3.S 및 M.2 SSD와 폭넓은 호환성을 제공합니다. 시스템 구성은 아래와 같습니다.

  • 2 x Intel Xeon Gold 6430(32코어, 2.1GHz)
  • 16 x 64GB DDR5-4400
  • 480GB 델 보스 SSD
  • 직렬 케이블 Gen5 JBOF

드라이브 비교

벤치마크 결과를 검토할 때 이러한 드라이브의 위치를 ​​염두에 두는 것이 중요합니다. 모든 드라이브가 배포 시나리오에서 직접적으로 경쟁하는 것은 아니지만, 용량과 시장 초점이 충분히 겹치기 때문에 DapuStor R6060 122.88TB가 현재 고용량 엔터프라이즈 SSD 시장에서 어떤 위치를 차지하는지 이해하는 데 유용한 맥락을 제공합니다.

비교 대상 제품군은 엔터프라이즈 플래시 스토리지 확장에 대한 다양한 접근 방식을 보여줍니다. TLC 기반의 Micron 6550 ION 61.44TB는 Gen5의 높은 순수 성능을 강조하는 반면, Solidigm P5336 122.88TB와 Solidigm P5336 61.44TB는 QLC NAND를 통해 밀도와 비용 효율성을 극대화하는 데 중점을 둡니다. DapuStor J5060 61.44TB는 또 다른 Gen4 U.2 기준점을 제공하며, R6060은 122.88TB 용량으로 최신 Gen5 E3.L 세그먼트에 진입합니다.

이러한 드라이브를 포함함으로써, 벤더들이 고용량 엔터프라이즈 스토리지 플랫폼을 지속적으로 발전시켜 나가는 가운데, R6060이 성능 중심 설계와 밀도 중심 설계 모두에서 어떻게 비교되는지에 대한 더 폭넓은 시각을 제공합니다.

DapuStor R6060 122TB 커넥터 측면 모습

FIO 성능 벤치마크

일반적인 업계 지표에서 각 SSD의 스토리지 성능을 측정하기 위해 FIO를 활용합니다. 각 드라이브는 동일한 테스트 프로세스를 거치는데, 여기에는 순차적 쓰기 워크로드를 사용하여 두 번의 전체 드라이브 채우기를 수행하는 사전 조정 단계와 그 후 정상 상태 성능 측정이 포함됩니다. 측정되는 각 워크로드 유형이 변경됨에 따라, 새로운 전송 크기에 대한 사전 조정 채우기를 다시 실행합니다.

이 섹션에서는 다음 FIO 벤치마크에 초점을 맞춥니다.

  • 128K 순차
  • 64K 랜덤
  • 16K 랜덤
  • 4K 랜덤

128K 순차 쓰기(IODepth 16 / NumJobs 1)

DapuStor R6060 122.88TB 드라이브는 128K 순차 쓰기 테스트에서 3,920.6MB/s의 속도를 기록하며 해당 그룹에서 2위를 차지했습니다. Micron 6550 ION 61.44TB는 10,456.4MB/s로 훨씬 앞섰지만, R6060은 Solidigm P5336 122.88TB(3,152.5MB/s), DapuStor J5060 61.44TB(2,883.1MB/s), Solidigm P5336 61.44TB(2,503.5MB/s)보다도 높은 속도를 보였습니다.

128K 순차 쓰기 대기 시간(IODepth 16 / NumJobs 1)

DapuStor R6060 122.88TB는 128K 순차 쓰기 지연 시간에서 509.7µs를 기록하며 전체 2위를 차지했습니다. Micron 6550 ION 61.44TB가 191.0µs로 가장 빠른 속도를 보였고, 나머지 제품들은 R6060보다 낮은 속도를 기록했습니다. Solidigm P5336 122.88TB는 634.0µs, DapuStor J5060 61.44TB는 693.3µs, Solidigm P5336 61.44TB는 798.4µs를 기록했습니다. Micron이 여전히 큰 격차를 보였지만, R6060은 나머지 드라이브 중에서 가장 우수한 결과를 보여주었습니다.

128K 순차 읽기(IODepth 64 / 작업 수 1)

DapuStor R6060 122.88TB는 128K 순차 읽기 테스트에서 11,554.0MB/s를 기록했으며, 이는 13,979.7MB/s를 기록한 Micron 6550 ION 61.44TB에 이어 2위를 차지한 것입니다.

이 두 제품을 제외하면 나머지 비교 대상 제품들의 속도는 급격히 떨어졌는데, Solidigm P5336 61.44TB는 7,132.3MB/s, Solidigm P5336 122.88TB는 7,121.6MB/s, DapuStor J5060 61.44TB는 7,126.8MB/s를 기록했습니다. R6060은 Micron 모델을 제외하고 이 테스트에서 11GB/s를 넘은 유일한 드라이브였습니다.

128K 순차 읽기 대기 시간(IODepth 64 / NumJobs 1)

DapuStor R6060 122.88TB는 128K 순차 읽기 지연 시간에서 692.1µs를 기록하여 해당 그룹에서 두 번째로 우수한 성능을 보였습니다. Micron 6550 ION 61.44TB는 571.9µs로 가장 낮은 지연 시간을 기록했고, Solidigm P5336 122.88TB는 1123.0µs로 가장 높은 지연 시간을 기록했습니다. Solidigm P5336의 두 모델(122.88TB, 61.44TB, 1121.3µs)은 거의 동일한 지연 시간을 보였으며, DapuStor J5060은 1122.1µs로 중간 정도의 성능을 나타냈습니다.

R6060은 다른 제품들과의 격차를 꾸준히 유지했지만, 마이크론은 여전히 ​​최고 성적을 기록했습니다.

 

64K 랜덤 쓰기

DapuStor R6060 122.88TB는 64K 랜덤 쓰기 테스트에서 거의 변동 없는 성능을 보였습니다. 1/1 설정에서 3,477.9MB/s의 쓰기 속도와 55.6K IOPS로 시작하여 1/2 설정에서 3,915.2MB/s의 쓰기 속도와 62.6K IOPS로 상승했습니다. 그 이후로는 거의 변화가 없었습니다. 대부분의 테스트 구간에서 3,913.7MB/s에서 3,916.9MB/s 사이의 속도를 유지했으며, 최고 결과는 4/1 설정에서 3,916.9MB/s의 쓰기 속도와 62.7K IOPS였습니다. 더 높은 설정에서도 32/4 설정에서 3,914.6MB/s, 16/8 설정에서 3,913.8MB/s, 그리고 32/8 설정에서 3,914.0MB/s의 속도를 유지했습니다. 따라서 하단의 1/1 시작점을 제외하면 R6060은 전체 스윕 기간 동안 기본적으로 고정된 평탄한 구간에 머물렀습니다.

차트에 있는 다른 드라이브들을 살펴보면, Micron 6550 ION 61.44TB는 훨씬 높은 수준의 성능을 보여주며 약 2.4GB/s에서 최대 10.3GB/s를 약간 넘는 속도까지 올라갔습니다. R6060 다음으로는 Solidigm P5336 122.88TB가 약 3.0GB/s, DapuStor J5060 61.44TB가 대부분 2.8GB/s, 그리고 Solidigm P5336 61.44TB가 2.5GB/s에서 2.6GB/s 사이의 속도를 유지했습니다. 따라서 R6060은 Micron을 제외한 다른 제품들과 상당한 격차를 보이며 2위를 차지했습니다.

Dapustor 122TB는 64k 쓰기 스케일링으로 작동했습니다.

64K 임의 쓰기 지연 시간

지연 시간은 R6060이 1/1 부하에서 18µs, 1/2 및 2/1 부하에서 31µs, 1/4, 2/2 및 4/1 부하에서 63µs, 그리고 2/4, 4/2 및 8/1 부하에서 127µs를 기록하는 등 일정한 패턴을 보였습니다. 부하가 증가함에 따라 1/8, 2/8, 8/2 및 16/1 부하에서 255µs, 그리고 4/8, 8/4 및 32/1 부하에서 510µs로 증가했습니다. 가장 높은 부하에서는 8/8, 16/4 및 32/2 부하에서 1,021µs, 16/8 및 32/4 부하에서 2,043µs를 기록했으며, 32/8 부하에서 최고 4,087µs를 기록했습니다.

마이크론 드라이브는 32/8 테스트에서 약 1,600µs를 기록하며 압도적으로 가장 낮은 지연 시간을 보였습니다. 그 다음으로 R6060이 4,087µs를 기록했습니다. 솔리디그 P5336 122.88TB는 약 5,100µs, J5060은 약 5,500µs, 솔리디그 P5336 61.44TB는 6,000µs를 약간 넘는 지연 시간을 보였습니다. 따라서 R6060은 지연 시간 측면에서 마이크론에 크게 못 미쳤지만, 테스트 부하가 높아지면서 다른 세 드라이브보다 우수한 성능을 보였습니다.

Dapustor 122TB는 64k 쓰기 지연 시간으로 확장되었습니다.

64K 랜덤 읽기

DapuStor R6060 122.88TB는 64K 랜덤 읽기에서 전반적으로 균일하지 않은 곡선을 보였지만, 마지막에는 최고의 성능을 발휘했습니다. 1/1 로드에서 381.4MB/s의 읽기 속도와 6.1K IOPS를 기록한 후, 1/2 로드에서 748.2MB/s, 2/2 로드에서 1,007.1MB/s, 1/4 로드에서 1,431.8MB/s, 그리고 2/4 로드에서 2,343.8MB/s까지 성능이 향상되었습니다. 1/8 박자에서 2,767.5MB/s, 4/4 박자에서 3,668.5MB/s, 16/2 박자에서 4,060.2MB/s, 2/8 박자에서 4,750.0MB/s, 8/4 박자에서 6,433.3MB/s, 그리고 4/8 박자에서 7,495.3MB/s까지 꾸준히 증가했습니다. 그 후 32/2 박자에서 8,428.0MB/s, 16/4 박자에서 9,827.5MB/s, 8/8 박자에서 10,782.5MB/s, 16/8 박자에서 12,798.2MB/s에 도달했고, 32/8 박자에서 최고 13,274.8MB/s를 기록했습니다.

아래 차트에서 볼 수 있듯이, 마이크론 6550 ION 61.44TB는 테스트 기간 내내 선두를 유지하며 최고 13.0GB/s에 육박하는 속도를 기록했지만, R6060은 마지막 순간에 마이크론을 약간 앞섰습니다.Dapustor 122TB는 64k 읽기 스케일링으로 실행되었습니다.

64K 랜덤 읽기 대기 시간

R6060은 초반에는 다른 드라이브보다 다소 불안정한 모습을 보였지만, 테스트 후반에는 뛰어난 성능을 보여주었습니다. 1/1에서 163µs로 시작하여 1/2에서 167µs, 1/4에서 174µs, 1/8에서 180µs, 2/8에서 217µs, 2/4에서 220µs, 2/2에서 249µs, 2/1에서 260µs, 4/8에서 287µs, 4/4에서 290µs, 그리고 8/4에서 352µs를 기록했습니다. 중간 대역은 8/1에서 446µs, 16/2에서 505µs, 32/2에서 531µs, 16/1에서 574µs, 32/1에서 595µs, 16/8에서 700µs, 32/4에서 738µs, 그리고 32/8에서 1,285µs의 피크를 기록하며 다소 불규칙해졌다.

차트에서 마이크론은 전반적으로 낮은 수준을 유지하며 32/8에서 약 1,200µs로 마무리했습니다. R6060은 1,285µs로 마감했는데, 이는 J5060과 솔리디그 드라이브 두 제품보다 훨씬 낮은 수치이며, 이들 모두는 최종적으로 2,200µs를 넘어섰습니다.

16K 랜덤 읽기

DapuStor R6060 122.88TB는 워크로드 깊이를 증가시킨 후 16K 랜덤 읽기 테스트에서 뛰어난 성능을 보여주었습니다. 1/1에서 9.6K IOPS로 시작하여 2/1에서 18.0K, 1/4에서 37.2K, 8/1에서 58.2K, 1/8에서 72.8K까지 상승했습니다. 이후에도 지속적으로 증가하여 16/1에서 112.8K, 4/4에서 133.3K, 2/8에서 138.1K, 1/16에서 140.3K에 도달했으며, 워크로드가 깊어질수록 더욱 가파르게 상승하여 32/1에서 211.6K, 8/4에서 246.9K, 4/8에서 256.5K, 2/16에서 261.2K를 기록했습니다. 더 높은 설정에서 16/4에서 436.0K, 8/8에서 447.7K, 4/16에서 456.1K를 유지하다가 32/4에서 659.3K, 16/8에서 671.3K, 8/16에서 679.7K, 32/8에서 784.5K, 16/16에서 786.2K로 마무리되었고, 32/16에서 최고 817.7K IOPS를 기록했습니다.

다른 제품들과 비교했을 때, R6060은 전반적으로 가장 강력한 드라이브 중 하나였지만, 최고 성능은 여전히 ​​마이크론이 차지했습니다. 마이크론 6550 ION 61.44TB는 약 860K IOPS를 기록하며 최상위권에서 R6060을 앞섰습니다. 하지만 R6060은 테스트 기간 내내 솔리디그 P5336 드라이브 두 제품 모두를 크게 앞서며 최종적으로도 우위를 유지했습니다.

16K 랜덤 읽기 대기 시간

R6060의 레이턴시는 테스트 대부분 구간에서 양호한 모습을 보였지만, 마지막 부분에서는 다소 아쉬웠습니다. 1/1 설정에서 104µs로 시작하여 2/1 설정에서 110µs, 4/1 설정에서 124µs로 측정되었습니다. 더 낮은 설정과 중간 설정에서는 1/4에서 107µs, 1/8에서 109µs, 1/16에서 113µs, 2/8에서 115µs, 4/4에서 120µs, 8/4에서 130µs, 8/1에서 137µs, 16/1에서 141µs로 비교적 안정적인 값을 유지했습니다. 부하가 증가함에 따라 지연 시간은 8/8에서 143µs, 16/4에서 148µs, 32/1에서 151µs, 8/16에서 189µs, 16/8에서 193µs까지 점진적으로 증가하다가 가장 부하가 큰 조합에서는 더욱 가파르게 상승하여 32/4에서 196µs, 16/16에서 330µs, 32/8에서 336µs에 도달했고, 32/16에서 최고 642µs를 기록했습니다.

그 덕분에 R6060은 테스트 대부분 구간에서 좋은 성능을 유지했지만, 마지막 부분에서는 눈에 띄게 성능이 떨어졌습니다. 마이크론 6550 ION은 여전히 ​​전반적으로 가장 우수한 레이턴시 곡선을 보여주었고, 차트 전반에 걸쳐 훨씬 낮은 수치를 유지했습니다.

 

16K 랜덤 쓰기

DapuStor R6060 122.88TB는 이 그룹의 대부분 제품에 비해 낮은 16K 랜덤 쓰기 결과를 보였습니다. 1/1에서 42.7K IOPS로 시작하여 1/4에서 51.3K로 상승했고, 2/4에서 50.7K로 최고치를 기록했습니다. 그 후 테스트의 나머지 부분에서는 대부분 28K~46K 범위에 머물렀으며, 1/8에서 46.4K, 2/8에서 43.0K, 4/4에서 44.2K, 8/8에서 41.3K, 16/4에서 37.1K, 16/8에서 36.1K, 16/16에서 30.0K, 32/16에서 27.3K를 기록했습니다. 대역폭 측면에서 보면 최고치는 801.4MB/s였으며, 대부분의 구간은 500MB/s 중반에서 700MB/s 후반대에 머물렀습니다.

다른 제품들과 비교했을 때, R6060은 122TB Solidigm 드라이브를 제외하고는 쓰기 IOPS에서 크게 뒤처졌습니다. Micron 6550 ION 61.44TB가 단연 최고의 성능을 보여주며 테스트 내내 250K~660K 범위의 IOPS를 기록했습니다. DapuStor J5060 61.44TB는 일반적으로 175K~185K IOPS를, Solidigm P5336 61.44TB는 보통 160K 범위의 IOPS를 유지했습니다.

16K 임의 쓰기 지연 시간

R6060은 1/1에서 23µs라는 상당히 낮은 값으로 시작하여 2/1에서 51µs, 1/4에서 77µs, 4/1에서 115µs, 그리고 2/4에서 157µs로 측정되었습니다. 그 후 작업 부하가 증가함에 따라 시간이 상당히 빠르게 증가하여 2/8에서 371µs, 16/1에서 470µs, 4/8에서 779µs, 8/4에서 815µs, 2/16에서 881µs, 32/1에서 1,139µs, 8/8에서 1,548µs, 16/4에서 1,723µs, 4/16에서 1,738µs, 8/16에서 3,660µs, 32/4에서 4,133µs, 16/16에서 8,537µs, 32/8에서 8,846µs, 그리고 최종적으로 32/16에서 18,759µs에 도달했습니다.

그 결과 R6060은 테스트 최고 부하 조건에서 그룹 내 가장 높은 지연 시간을 기록했습니다. 마이크론은 테스트 전반에 걸쳐 훨씬 낮은 지연 시간을 유지했으며, J5060과 두 종류의 솔리디그 드라이브조차도 가장 부하가 심한 조합에서 R6060보다 훨씬 낮은 성능을 보였습니다.

4K 랜덤 읽기

DapuStor R6060 122.88TB는 4K 랜덤 읽기에서 뛰어난 성능을 보였으며, 테스트가 더 많은 큐 깊이와 작업 수 조합으로 진행될수록 성능이 향상되었습니다.

1/1에서 11.5K IOPS로 시작하여 2/1에서 21.5K, 1/4에서 44.0K, 2/4에서 83.2K, 1/8에서 85.4K, 2/8에서 162.2K, 그리고 1/16에서 165.0K를 거쳐 상승했습니다. 그 후 계속 증가하여 4/8에서 313.1K, 2/16에서 316.5K, 16/4에서 557.9K, 8/8에서 585.6K, 4/16에서 598.9K, 16/8에서 1.043M, 8/16에서 1.069M, 16/16에서 1.729M에 도달했고, 최종적으로 32/16에서 2.061M IOPS로 최고치를 기록했습니다. 대역폭은 최대 8,050.3MB/s를 기록했습니다.

4K 랜덤 읽기 대기 시간

읽기 지연 시간은 대부분의 테스트 구간에서 좁은 범위 내에 머물렀으며, 최고치에서만 눈에 띄게 상승했습니다. R6060은 1/1에서 0.086ms로 시작하여 2/1에서 0.092ms, 1/4에서 0.090ms, 2/4에서 0.095ms, 1/8에서 0.093ms, 2/8에서 0.098ms, 그리고 1/16에서 0.096ms를 기록했습니다. 테스트 중간 부분에서는 이와 비슷한 수준을 유지했으며, 4/4 및 4/8에서 0.101ms, 8/4에서 0.107ms, 8/8에서 0.109ms, 16/4에서 0.115ms, 8/16에서 0.119ms, 그리고 16/8에서 0.123ms를 기록했습니다. 부하가 더 높은 설정에서는 16/16에서 0.148ms, 32/8에서 0.155ms까지 상승했으며, 테스트 종료 시점에는 0.247ms로 최고치를 기록했습니다.

GPU 직접 스토리지

이 테스트벤치에서 수행한 테스트 중 하나는 Magnum IO GPU Direct Storage(GDS) 테스트였습니다. GDS는 NVIDIA에서 개발한 기능으로, GPU가 NVMe 드라이브나 다른 고속 스토리지 장치에 저장된 데이터에 액세스할 때 CPU를 우회할 수 있도록 해줍니다. GDS는 CPU와 시스템 메모리를 통해 데이터를 라우팅하는 대신 GPU와 스토리지 장치 간의 직접 통신을 가능하게 하여 대기 시간을 크게 줄이고 데이터 처리량을 개선합니다.

GPU 직접 스토리지 작동 방식

전통적으로 GPU가 NVMe 드라이브에 저장된 데이터를 처리할 때, 데이터는 GPU에 도달하기 전에 먼저 CPU와 시스템 메모리를 거쳐야 합니다. 이 과정에서 CPU가 중개자 역할을 하므로 병목 현상이 발생하고, 지연 시간이 늘어나고 귀중한 시스템 리소스가 소모됩니다. GPU Direct Storage는 GPU가 PCIe 버스를 통해 저장 장치의 데이터에 직접 액세스할 수 있도록 하여 이러한 비효율성을 제거합니다. 이러한 직접 경로는 데이터 이동 오버헤드를 줄여 더 빠르고 효율적인 데이터 전송을 가능하게 합니다.

AI 워크로드, 특히 딥 러닝과 관련된 워크로드는 매우 데이터 집약적입니다. 대규모 신경망을 훈련하려면 테라바이트 규모의 데이터를 처리해야 하며, 데이터 전송이 지연되면 GPU 활용도가 낮아지고 훈련 시간이 길어질 수 있습니다. GPU Direct Storage는 데이터가 가능한 한 빨리 GPU에 전달되도록 하여 유휴 시간을 최소화하고 계산 효율성을 극대화함으로써 이러한 과제를 해결합니다.

또한 GDS는 비디오 처리, 자연어 처리 또는 실시간 추론과 같이 대용량 데이터 세트를 스트리밍하는 작업 부하에 특히 유용합니다. GDS는 CPU에 대한 의존도를 줄임으로써 데이터 이동을 가속화하고 다른 작업을 위한 CPU 리소스를 확보하여 전반적인 시스템 성능을 더욱 향상시킵니다.

GDSIO 순차 읽기 처리량

GDSIO 순차 읽기 처리량 테스트에서 DapuStor R6060 122.88TB는 16K 전송에서 다소 불안정한 결과를 보였지만, 블록 크기가 증가함에 따라 훨씬 안정적인 성능을 나타냈습니다. 16K 블록 크기에서 단일 스레드로 663.7MiB/s의 속도를 보였고, 4개 스레드에서는 221.5MiB/s, 8개 스레드에서는 200.3MiB/s로 떨어졌다가 128개 스레드에서는 978.8MiB/s까지 회복했습니다. 이는 테스트의 작은 블록 크기 영역, 특히 중간 스레드 범위에서 다른 드라이브들에 비해 다소 뒤처지는 결과였으며, 따라서 16K 순차 읽기는 이 드라이브의 최대 성능이 발휘되는 영역은 아니었습니다.

128K에서 R6060은 훨씬 뛰어난 성능을 보였습니다. 1개 스레드에서 1.4GiB/s, 16개 스레드에서 1.7GiB/s, 32개 스레드에서 2.8GiB/s를 기록했고, 64개 스레드에서는 4.3GiB/s, 128개 스레드에서는 4.9GiB/s까지 상승했습니다. 이로써 128K 순차 읽기에서 높은 스레드 수 조건에서 DapuStor J5060 61.44TB, Micron 6550 ION 61.44TB, Solidigm P5336 122.88TB를 제치고 이 그룹에서 최고 성능을 달성했습니다. 특히 64개 및 128개 스레드에서 R6060의 성능 차이가 두드러지게 나타났습니다.

가장 큰 성능 향상은 1M 테스트에서 나타났습니다. R6060은 단일 스레드에서 1.7GiB/s로 시작하여 4개 스레드에서 3.0GiB/s, 8개 스레드에서 4.4GiB/s, 16개 스레드에서 5.2GiB/s로 급증했으며, 128개 스레드에서는 최고 5.9GiB/s를 기록했습니다. 8개 스레드부터는 비교 대상 그룹을 선도했으며, 동시 실행 스레드 수가 증가함에 따라 격차를 더욱 벌렸습니다. 따라서 R6060은 16K 테스트에서는 다소 불안정한 모습을 보였지만, 128K 및 1M 순차 읽기 테스트에서는 특히 스레드 수가 증가함에 따라 매우 뛰어난 성능을 보여주었습니다.

GDSIO 순차 읽기 IOPS

GDSIO 순차 읽기 IOPS 테스트에서 DapuStor R6060 122.88TB는 블록 크기에 따라 성능이 다소 차이가 나는 모습을 보였습니다. 16K 블록 크기에서는 단일 스레드에서 42.5K IOPS로 강력한 출발을 보였지만, 4개 스레드에서는 14.2K, 8개 스레드에서는 12.8K로 떨어졌습니다. 이후 성능은 다시 상승하여 32개 스레드에서 19.9K, 64개 스레드에서 36.6K, 128개 스레드에서 62.6K를 기록했습니다. 이러한 회복세 덕분에 최고 성능 구간에서는 Micron 6550 ION에 근접했지만, Solidigm의 ​​P5336은 128개 스레드에서 92.5K IOPS를 기록하며 이 구간에서 훨씬 앞섰습니다. 16K 블록 크기의 작업 부하에서는 R6060이 중간 스레드 범위에서 다소 불안정한 성능을 보였지만, 최종적으로는 초반의 부진보다 훨씬 강력한 성능을 보여주었습니다.

128KB에서 R6060은 더욱 강력하고 안정적인 확장 곡선을 보여주었습니다. 1개 스레드에서 11.6KB IOPS, 4개에서 6.4KB, 8개에서 8.7KB, 16개에서 14.0KB, 32개에서 23.2KB, 64개에서 35.3KB, 그리고 128개에서 40.3KB의 IOPS를 기록했습니다. 이는 최대 동시 접속자 수에서 DapuStor J5060 61.44TB(31.3KB), Solidigm P5336 122.88TB(23.3KB), Micron 6550 ION 61.44TB(19.4KB)를 앞서는 최고의 결과였습니다. 동시 접속자 수가 증가함에 따라 R6060은 이 부분에서 더욱 확실한 성능 차이를 보여주었습니다.

1M 데이터 전송 테스트 결과에서 R6060은 (차트에서 확인하기는 어렵지만) 우수한 성능을 보여주었습니다. 1.7K IOPS로 시작하여 4개 스레드에서 3.0K, 8개 스레드에서 4.5K, 16개 스레드에서 5.3K, 32개 스레드에서 5.6K, 64개 스레드에서 5.9K, 그리고 128개 스레드에서 6.0K까지 상승했습니다. 이는 1M 데이터 전송에서 비교 대상 제품 중 가장 높은 수치로, DapuStor J5060(4.3K), Solidigm P5336(4.3K), Micron 6550 ION(2.6K)을 모두 앞섰습니다. 16K 데이터 전송에서는 다소 저조한 성능을 보였지만, R6060은 특히 스레드 수가 증가함에 따라 128K 및 1M 순차 읽기 IOPS에서 매우 뛰어난 성능을 보여주었습니다.

GDSIO 순차 읽기 지연 시간

GDSIO 순차 읽기 지연 시간 테스트에서 DapuStor R6060 122.88TB는 특히 스레드 수가 증가함에 따라 이 그룹에서 가장 우수한 결과를 보여주었습니다. 16K 부하에서 스레드 1개일 때 22µs의 시작 시간을 기록한 후, 4개에서 281µs, 8개에서 623µs, 16개에서 1.1ms, 32개에서 1.6ms, 64개에서 1.7ms, 그리고 128개에서 2.0ms로 증가했습니다. 이는 가장 가벼운 16K 부하에서 가장 낮은 지연 시간을 제공했으며, 나머지 부하 범위에서도 경쟁력 있는 성능을 유지했습니다. 다만, 16K 범위의 중간 부분에서는 Micron 6550 ION과 Solidigm P5336이 약간 더 낮은 지연 시간을 보였고, 이후 상위 부하 영역에서 다시 격차가 좁혀졌습니다.

128K 테스트에서 R6060은 1개 스레드에서 85µs, 4개 스레드에서 621µs, 8개 스레드에서 923µs, 16개 스레드에서 1.1ms, 32개 스레드에서 1.4ms, 64개 스레드에서 1.8ms, 128개 스레드에서 3.2ms를 기록하며 우수한 성능을 보여주었습니다. 32개 이상의 스레드에서는 최고 수준의 성능을 유지했으며, 부하가 높아짐에 따라 지연 시간이 다소 증가했지만 다른 드라이브들과 비교했을 때 여전히 양호한 성능을 보였습니다. 128K 테스트의 최고 성능 구간에서는 Micron 6550 ION이 훨씬 높은 성능을 기록했고, DapuStor J5060과 Solidigm P5336 또한 128개 스레드에서 R6060보다 높은 성능을 보였습니다.

가장 큰 성능 차이는 1M 워크로드에서 나타났는데, R6060은 스레드 1개에서 587µs, 4개에서 1.3ms, 8개에서 1.8ms, 16개에서 3.0ms, 32개에서 5.8ms, 64개에서 10.8ms, 그리고 128개에서 21.3ms를 기록했습니다. 이 수치는 1M 워크로드 전체 구간에서 Micron 6550 ION보다 우수했고, 스레드 수가 많은 구간에서는 Solidigm P5336보다도 낮았습니다. 다만, DapuStor J5060은 64개와 128개 스레드에서 여전히 우위를 점했습니다. 전반적으로 R6060은 전송 크기와 동시 접속자 수가 증가함에 따라 순차 읽기 지연 시간을 효과적으로 제어했으며, 특히 테스트의 부하가 높은 부분에서 뛰어난 결과를 보여주었습니다.

GDSIO 순차 쓰기 처리량

GDSIO 순차 쓰기 처리량 테스트에서 DapuStor R6060 122.88TB는 대부분의 테스트 범위에서, 특히 128K 및 초기 1M 테스트에서 우수한 결과를 보여주었습니다. 16K 테스트에서는 0.67GiB/s로 시작하여 4개 스레드에서 1.18GiB/s, 8개 스레드에서 1.37GiB/s까지 상승했고, 16개 스레드에서 1.47GiB/s로 최고치를 기록한 후 128개 스레드에서 1.20GiB/s로 감소했습니다. 이는 Micron 6550 ION과 경쟁력 있는 수준으로, 16K 중간 스레드 범위에서 약간 더 높은 결과를 보였습니다.

R6060은 블록 크기가 128KB로 커지자 훨씬 강력한 성능을 보여주었습니다. 초기 응답 속도는 2.79GiB/s였으며, 4개 스레드에서 3.82GiB/s까지 상승한 후 16개 스레드까지 그 범위를 유지하다가 3.83GiB/s에 도달했습니다. 이후 32개 스레드에서 3.71GiB/s, 64개 스레드에서 3.80GiB/s, 128개 스레드에서 3.28GiB/s를 기록했습니다. 이는 128KB 블록 크기 범위에서 거의 모든 구간에서 다른 드라이브들을 능가하는 성능이며, 가장 높은 스레드 수에서만 약간의 성능 저하가 나타났음을 의미합니다.

1M 테스트에서 R6060은 낮은 스레드 수와 중간 스레드 수 영역에서 다시 한번 선두를 차지했습니다. 1개의 스레드에서 3.81GiB/s, 4개에서 3.73GiB/s, 8개에서 3.79GiB/s, 16개에서 3.49GiB/s의 속도를 기록한 후, 32개에서 3.31GiB/s, 64개에서 3.06GiB/s, 128개에서 2.93GiB/s로 속도가 점차 감소했습니다. Micron 6550 ION은 1M 테스트의 더 높은 스레드 수 영역에서 결국 선두를 차지하며 32개 스레드에서 3.90GiB/s의 최고 속도를 기록했고, Solidigm P5336은 3GiB/s 초반대를 유지했으며, DapuStor J5060은 테스트 전반에 걸쳐 2.8GiB/s에 가까운 속도를 유지했습니다. 전반적으로 R6060은 이 그룹에서 가장 우수한 순차 쓰기 처리량 프로파일을 보여주었으며, 128K에서 최고의 성능을 발휘했고 1M 워크로드에서 강력한 초기 확장성을 보였습니다.

GDSIO 순차 쓰기 IOPS

GDSIO 순차 쓰기 IOPS 테스트에서 DapuStor R6060 122.88TB는 16K 구간에서 강력한 성능을 보여주며 대부분의 구간에서 상위권을 유지했습니다. 단일 스레드에서 43.5K IOPS로 시작하여 4개 스레드에서 76.9K, 8개 스레드에서 89.4K, 16개 스레드에서 95.9K까지 상승했고, 32개 스레드에서 98.4K로 최고치를 기록한 후 64개 스레드에서 89.8K, 128개 스레드에서 78.7K로 떨어졌습니다. Micron 6550 ION은 16K 구간 중간에서 32개 스레드에서 100K IOPS, 64개 스레드에서 97.5K를 기록하며 약간 더 높은 성능을 보였지만, R6060은 가장 높은 스레드 수에 도달하기 전까지는 매우 근접한 성능을 유지했습니다. 그러나 최고 스레드 수에서는 J5060과 Solidigm P5336이 R6060을 약간 앞섰습니다.

128,000 클럭에서 R6060은 처음부터 끝까지 이 그룹에서 가장 강력한 성능을 보여주었습니다. 단일 스레드에서 22,800 IOPS, 4개에서 31,300 IOPS, 8개에서 31,300 IOPS, 16개에서 31,400 IOPS, 32개에서 30,300 IOPS, 64개에서 31,200 IOPS, 그리고 128개에서 26,900 IOPS를 기록했습니다. 이는 중간 클럭 범위에서 30,000 IOPS 부근을 유지하다가 20,000 IOPS 초반대로 떨어진 Micron 6550 ION을 앞섰을 뿐만 아니라, 128,000 클럭 범위 대부분에서 더 큰 격차로 뒤처진 J5060과 Solidigm P5336보다도 훨씬 우수한 결과였습니다.

1M 구간에서는 네 개의 드라이브 모두 성능 차이가 크지 않았지만, R6060은 여전히 ​​상위권에 머물렀습니다. 1개 스레드에서 3.9K IOPS, 4개 스레드에서 3.8K, 8개 스레드에서 3.9K, 16개 스레드에서 3.6K, 32개 스레드에서 3.4K, 64개 스레드에서 3.1K, 128개 스레드에서 3.0K의 IOPS를 기록했습니다. 이는 저속 스레드에서는 J5060보다 약간 앞서고, 고속 스레드에서는 Solidigm P5336과 거의 비슷한 수준이며, 32개 및 64개 스레드에서는 Micron 6550 ION이 잠시 앞섰던 것을 의미합니다. 전반적으로 R6060은 128K에서 최고 성능을 기록하며 강력한 순차 쓰기 IOPS 프로파일을 보여주었고, 전체 스레드 범위에서 비교 대상 그룹 중 가장 우수한 성능을 나타냈습니다.

GDSIO 순차 쓰기 대기 시간

GDSIO 순차 쓰기 지연 시간 테스트에서 DapuStor R6060 122.88TB는 테스트의 낮은 부하 및 중간 부하 영역에서 우수한 결과를 보였지만, 스레드 수가 증가함에 따라 다소 성능이 저하되었습니다. 16K 부하에서 측정된 지연 시간은 스레드 1개에서 22µs, 4개에서 51µs, 8개에서 88µs, 16개에서 165µs, 32개에서 323µs, 64개에서 709µs, 128개에서 1.6ms였습니다. 전반적으로 매우 우수한 수치이며, 이러한 성능 덕분에 R6060은 16K 부하 테스트 대부분에서 상위권을 유지했습니다. Micron 6550 ION은 가장 높은 16K 부하에서 약간 낮은 성능을 보였고, J5060과 Solidigm P5336은 더 높은 성능을 기록했습니다.

128K 클럭에서도 R6060은 경쟁력 있는 성능을 보여주었는데, 1스레드에서 43µs, 4스레드에서 126µs, 8스레드에서 254µs, 16스레드에서 508µs, 32스레드에서 1.1ms, 64스레드에서 2.0ms, 128스레드에서 4.8ms의 지연 시간을 기록했습니다. 특히 64스레드에서는 비교 대상 중 가장 낮은 지연 시간을 보였습니다. 최고 클럭에서 R6060보다 약간 낮은 지연 시간을 보인 것은 Micron 6550 ION뿐이었으며, J5060과 Solidigm P5336은 128스레드에서 R6060보다 높은 성능을 보였습니다.

가장 큰 차이는 1M 전송 구간에서 나타났는데, R6060은 단일 스레드에서 255µs, 4개 스레드에서 1.0ms, 8개 스레드에서 2.1ms, 16개 스레드에서 4.5ms, 32개 스레드에서 9.5ms, 64개 스레드에서 20.5ms, 128개 스레드에서 42.7ms를 기록했습니다. 이는 부하가 높은 영역에서 Micron 6550 ION보다 낮은 수치이며, Solidigm P5336보다는 약간 높은 수준입니다. 반면 J5060은 최고 부하 영역에서 이 그룹 중 가장 높은 지연 시간을 보였습니다. 따라서 R6060은 16K 및 128K까지의 순차 쓰기 지연 시간에서는 우수한 성능을 보였지만, 1M 전송과 같이 동시 실행 수가 많아질수록 지연 시간이 급격히 증가하는 경향을 나타냈습니다.

DLIO 체크포인팅 벤치마크

AI 학습 환경에서 SSD의 실제 성능을 평가하기 위해 데이터 및 학습 입력/출력(DLIO) 벤치마크 도구를 사용했습니다. 아르곤 국립 연구소에서 개발한 DLIO는 딥러닝 워크로드의 I/O 패턴을 테스트하도록 특별히 설계되었습니다. 이 도구는 스토리지 시스템이 체크포인트, 데이터 수집 및 모델 학습과 같은 문제를 처리하는 방식을 파악하는 데 도움을 줍니다. 테스트는 각 드라이브에 모든 체크포인트가 저장되도록 설계되었으며, 용량이 큰 SSD일수록 더 많은 체크포인트를 저장할 수 있습니다. 아래 차트는 99개의 체크포인트(122TB 드라이브는 198개)에 걸쳐 두 드라이브가 이 프로세스를 어떻게 처리하는지 보여줍니다. 머신러닝 모델을 학습할 때 체크포인트는 모델의 상태를 주기적으로 저장하여 중단이나 정전 시 학습 진행 상황 손실을 방지하는 데 필수적입니다. 이러한 스토리지 요구 사항은 특히 지속적이거나 집중적인 워크로드 환경에서 강력한 성능을 필요로 합니다. 본 연구에서는 2024년 8월 13일 출시된 DLIO 벤치마크 버전 2.0을 사용했습니다.

실제 시나리오를 반영하는 벤치마킹을 위해 LLAMA 3.1 405B 모델 아키텍처를 기반으로 테스트를 진행했습니다. torch.save() 함수를 사용하여 모델 파라미터, 옵티마이저 상태, 레이어 상태를 저장하는 체크포인트를 구현했습니다. 8개의 GPU를 사용하는 시스템을 시뮬레이션했으며, 4방향 텐서 병렬 처리와 2방향 파이프라인 병렬 처리를 8개의 GPU에 분산하는 하이브리드 병렬 처리 전략을 적용했습니다. 이 구성으로 체크포인트 크기는 1,636GB가 되었으며, 이는 최신 대규모 언어 모델 학습 요구 사항을 반영한 수치입니다.

DLIO 체크포인트 통과 평균 테스트에서 DapuStor R6060 122TB를 Solidigm P5336 122.88TB, Solidigm P5336 61.44TB 및 Micron 6550 ION 61.44TB와 비교했습니다.

DapuStor R6060은 첫 번째 테스트에서 465.33초로 가장 빠른 기록을 세우며 강력한 출발을 보였습니다. 그러나 이후 테스트에서는 성능이 크게 떨어져 두 번째 테스트에서는 934.50초, 세 번째 테스트에서는 965.27초를 기록했습니다. 결국 최종적으로는 Solidigm P5336 122.88TB(757.31초), Solidigm P5336 61.44TB(639.63초), Micron 6550 ION 61.44TB(585.03초)에 이어 최하위를 기록했습니다.

 

DLIO 체크포인트 벤치마크에서 DapuStor R6060 122TB는 워크로드가 진행됨에 따라 가장 급격한 성능 변화를 보였습니다. 테스트 초반에는 Micron 6550 ION 61.44TB와 함께 460초 중반대의 매우 일관된 성능을 유지하며 Solidigm 드라이브 두 제품보다 앞서는 가장 강력한 성능을 보여주었습니다. 그러나 체크포인트 수가 증가함에 따라 R6060의 처리 시간이 상당히 길어져 남은 체크포인트의 상당 부분에서 900~1000초대에 이르렀습니다.

맺음말

DapuStor R6060 122.88TB는 설계 의도에 부합하는 성능을 보여주었습니다. 대용량 블록 읽기, 순차 전송 및 GPU Direct Storage 워크로드에서 일관되게 우수한 성능을 나타냈지만, 소용량 블록 랜덤 쓰기는 분명한 약점이었습니다. FIO 테스트에서 R6060은 128K 순차 읽기에서 11,554MB/s, 128K 순차 쓰기에서 3,920.6MB/s를 기록했고, 64K 랜덤 쓰기에서는 3,913MB/s에서 3,916MB/s 사이의 안정적인 속도를 유지했으며, 64K 랜덤 읽기에서 13,274.8MB/s에 도달했고, 16K 랜덤 읽기에서 817,700 IOPS, 4K 랜덤 읽기에서 206만 1천 IOPS의 최고치를 기록했습니다. 16K 랜덤 쓰기 결과는 이 드라이브의 약점으로, 쓰기 성능에 특화된 다른 SSD들에 비해 크게 뒤처졌습니다.

DapuStor R6060 122TB 전면 모습

GDSIO도 비슷한 양상을 보였습니다. R6060은 16K 읽기 영역에서는 다소 불안정한 성능을 보였지만, 전송 크기가 커지자 강력한 성능을 발휘하여 스레드 수가 많은 환경에서 128K 및 1M 순차 읽기 처리량 모두에서 비교 그룹을 선도했습니다. 1M 순차 읽기 처리량에서는 5.9GiB/s를 기록했고, 전체 스레드 범위에서 128K 순차 쓰기 IOPS에서도 최고 성능을 보였습니다. 대용량 블록 GPU 직접 테스트에서의 지연 시간 또한 전반적으로 양호했습니다.

DapuStor는 U.2, E3.L, E1.L 폼팩터를 비롯하여 15.36TB부터 122.88TB까지 다양한 용량의 R6060을 제공하며, 최상위 모델로는 245TB SKU를 제공합니다. 이러한 폭넓은 선택지는 시스템 통합업체에게 유연성을 제공하지만, 동시에 사전 호환성 확인의 중요성을 강조합니다. 저희가 테스트한 122.88TB E3.L 2T 변형 모델은 대부분의 데이터 센터에서 사용하는 주류 U.2 및 E3.S 구성과는 다르며, EDSFF(Electronic Data Storage Frame) 구성에서는 드라이브 베이, 두께, 길이, PCIe 레인 할당 등을 주문 전에 꼼꼼히 확인해야 합니다. 2T 드라이브는 1T 슬롯에 장착할 수 없으며, E3.L 드라이브는 E3.S 베이에 장착할 수 없습니다. 이는 오늘날 EDSFF 통합에서 일반적인 사항이지만, 이러한 고밀도 변형 모델을 처음 도입하는 경우 주의해야 할 사항입니다.

R6060은 해당 스토리지 계층에 맞춰 설계되었으며, 뛰어난 성능을 보여주어 DapuStor에 신뢰할 수 있는 고용량 Gen5 QLC 옵션을 제공합니다.

제품 페이지 – DapuStor R6060 122TB

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

라일 스미스

라일은 StorageReview의 작가로, 일반 사용자 및 기업 IT 관련 다양한 주제를 다루고 있습니다.