StorageReview.com

Solidigm D7-PS1030 리뷰: KV 캐시 등급에서 제 역할을 톡톡히 해낸 3개의 DWPD Gen5

기업  ◇  SSD

Solidigm D7-PS1030은 Solidigm의 ​​첫 번째 PCIe 5.0 데이터 센터 제품군 중 중간 내구성 모델로, D7-PS1010과 동일한 플랫폼을 사용하며 3 DWPD 등급과 최대 800K IOPS의 랜덤 쓰기 성능을 제공합니다. 이는 표준 내구성 모델인 D7-PS1010의 두 배에 달하는 성능입니다. 이 제품군은 1.6TB부터 12.8TB까지 E3.S 및 U.2 규격으로 제공되며, 176레이어 TLC NAND 플래시 메모리를 사용하여 최대 14,500MB/s의 순차 읽기 및 10,000MB/s의 순차 쓰기 성능을 제공합니다. Solidigm은 OLTP, 메타데이터 로깅, HPC, AI/ML 파이프라인과 같이 쓰기 부하가 지속적인 쓰기 중심 및 혼합 워크로드를 목표로 합니다. 본 리뷰 제품은 12.8TB E3.S 모델입니다.

StorageReview 연구실에 세워져 있는 Solidigm D7-PS1030 12.8TB E3.S SSD

Solidigm D7-PS1030 12.8TB는 E3.S 7.5mm 바디에 담겨 있습니다.

이 드라이브를 사용한 것은 이번이 처음은 아니지만, 단일 드라이브의 벤치마크를 진행한 것은 이번이 처음입니다. 동일한 12.8TB 드라이브 8개를 사용하여 Dell PowerEdge XE7740에서 KV 캐시 오프로드 작업을 수행했는데 , 이 어레이는 24시간 내내 1.9GB/s의 연속 KV 쓰기 속도를 유지했습니다. 이는 미러링 구성 시 드라이브당 하루 약 3.2회 쓰기, RAID0 스트라이핑 구성 시 약 1.6 DWPD에 해당하는 듀티 사이클입니다. PS1030의 3 DWPD 등급은 바로 이러한 작업 부하를 감당하도록 설계되었습니다. KV 오프로드는 용량이나 최고 속도가 아닌 내구성이 중요한 작업 부하입니다. Gen5 히트싱크의 주요 특징인 읽기 집약적인 작업 환경에서는 이러한 작업 부하로 인해 1 DWPD의 용량을 빠르게 소진하게 될 것입니다.

StorageReview 연구실에서 Dell PowerEdge XE7740 앞에 놓인 Solidigm D7-PS1030 12.8TB E3.S SSD

KV 캐시 오프로드 테스트를 진행했던 Dell PowerEdge XE7740 서버 앞에 설치된 PS1030입니다.

12.8TB 용량의 Solidigm 드라이브는 4K 랜덤 읽기 IOPS 2.75만, 랜덤 쓰기 IOPS 80만(최대)을 제공하며, 동일 용량대의 최대 랜덤 읽기 IOPS는 310만입니다. 소비 전력은 일반 23W, 유휴 5W로 Gen5 제품군과 동일하며, 랙 용량 제한에 맞춰 5W에서 25W까지 5단계로 전력 설정을 조절할 수 있습니다. Solidigm은 또한 주목할 만한 두 가지 장점을 내세웁니다. 동급 드라이브 대비 최대 70% 향상된 에너지 효율과 드라이브 수명 전반에 걸쳐 최대 90%의 IOPS 일관성을 제공합니다. 내구성 또한 우수합니다. 동일한 미디어를 3년 동안 사용하면 DWPD(데이터 웨이트 파워/일)를 지원하며, 12.8TB 모델은 양방향으로 70PB의 쓰기 성능을 제공합니다. 신뢰성 사양은 동급 제품에 걸맞게 250만 시간의 MTBF(평균 무고장 시간), 5년 보증, 그리고 1E-18 등급의 UBER Solidigm 테스트를 통과했습니다. 보안 옵션으로는 TCG Opal 2.02 SED 트림, FIPS 140-3 레벨 2 인증 하드웨어, OCP 표준 보안 부팅 및 펌웨어 서명, 장치 인증 및 키 폐기 기능이 포함됩니다.

Solidigm D7-PS1030 E3.S 드라이브가 드라이브 캐디에 장착되어 있으며 EDSFF 에지 커넥터가 보입니다.

E3.S 델 케이스에 들어 있습니다.

Solidigm D7-PS1030 사양

스펙 Solidigm D7-PS1030 (12.8TB E3.S, 제품군 표기됨)
플랫폼 개요
용량 1.6TB
3.2TB
6.4TB
12.8TB (테스트 결과 기준)
폼 팩터 E3.S 7.5mm (테스트 결과)
U.2 15mm
인터페이스/프로토콜 PCIe 5.0 x4, NVMe
낸드 Solidigm 176층 TLC 3D NAND
성능 (최대, 공급업체 평가 기준)
순차 읽기(128K) 14,500MB/s (가족용)
순차 쓰기(128K) 10,000MB/s (가족용)
임의 읽기(4K) 2,750K IOPS(12.8TB)
최대 3,100K IOPS(가족 최고 성능)
임의 쓰기(4K) 800K IOPS
힘과 지구력
전력(활성/대기) 23W(일반) / 5W(일반)
5W에서 25W까지 5단계로 전력 조절 가능
지구력 3.0 DWPD (5년 기준)
4.98 DWPD (3년 기준)
12.8TB에서 70 PBW
안정성과 보안
MTBF / 우버 2,500,000 시간
1E-18까지 테스트 완료
보안 TCG 오팔 2.02 (SED 변형)
FIPS 140-3 레벨 2 인증 가능
OCP 표준 보안 부팅 및 펌웨어 서명
기기 인증, 키 폐기
품질 보증 5 년

 

StorageReview 서버 랙 앞쪽에 Solidigm D7-PS1030 드라이브 두 개가 E3.S 슬레드에 장착되어 있습니다.

E3.S 버전의 PS1030 유닛이며, U.2 버전도 출시됩니다.

솔리드다임 D7-PS1030 성능

다음 차트의 맥락은 PS1030이 최근 Gen5 드라이브 리뷰를 주도해 온 읽기 중심 드라이브에 대한 균형추 역할을 하는 혼합 용도 드라이브로 비교 대상에 포함되었다는 점입니다. 6월에 리뷰했던 KIOXIA CD9P-R 과 비교했을 때 , PS1030은 정격 순차 읽기 속도(14,500MB/s vs 14,800MB/s)는 다소 낮지만, 정격 랜덤 쓰기 속도(800K IOPS vs 450K IOPS)는 거의 두 배에 달하고 쓰기 용량(DWPD)은 세 배(3 DWPD vs 1 DWPD)입니다. 이 그룹에서 가장 유사한 경쟁 제품은 3 DWPD를 지원하는 또 다른 드라이브인 Micron 7600 MAX 이며, Micron 9550 MAX는 동일한 12.8TB 용량에서 성능 면에서 가장 치열한 혼합 용도 경쟁을 벌이고 있습니다.

드라이브 테스트 플랫폼

본 리뷰에서는 모든 워크로드 테스트를 위해 Ubuntu 22.04.2 LTS가 설치된 Dell PowerEdge R760 서버를 테스트 플랫폼으로 사용했습니다. Serial Cables Gen5 JBOF를 장착하여 U.2, E1.S, E3.S 및 M.2 SSD와 폭넓은 호환성을 제공합니다. 시스템 구성은 아래와 같습니다.

  • 2 x Intel Xeon Gold 6430(32코어, 2.1GHz)
  • 16 x 64GB DDR5-4400
  • 480GB 델 보스 SSD
  • 직렬 케이블 Gen5 JBOF
  • 엔비디아 L4

드라이브 비교

DLIO 체크포인팅 벤치마크

AI 학습 환경에서 SSD의 실제 성능을 평가하기 위해 데이터 및 학습 입출력(DLIO) 벤치마크 도구를 활용했습니다. 아르곤 국립 연구소에서 개발한 DLIO는 딥러닝 워크로드의 I/O 패턴을 테스트하도록 특별히 설계되었습니다. 이 도구는 스토리지 시스템이 체크포인트, 데이터 수집 및 모델 학습과 같은 문제를 어떻게 처리하는지에 대한 통찰력을 제공합니다.

아래 표는 각 드라이브의 3회 패스에 걸친 평균 체크포인트 완료 시간을 보여줍니다. 값이 낮을수록 좋습니다. 이 데이터에 대한 참고 사항: 실행 시 체크포인트 수는 각 드라이브의 용량에 비례하므로 용량이 큰 드라이브일수록 더 많은 체크포인트를 기록합니다. 따라서 체크포인트별 결과는 용량이 다른 드라이브 간에 정확히 일치하지 않습니다. 이러한 이유로 각 드라이브의 실행 결과를 직접 비교 가능한 수치로 정규화한 패스 평균값을 게시합니다. 머신러닝 모델을 학습할 때 체크포인트는 모델의 상태를 주기적으로 저장하여 중단이나 정전 시 학습 진행 상황 손실을 방지하는 데 필수적입니다. 이러한 스토리지 요구 사항은 특히 지속적이거나 집중적인 워크로드 환경에서 강력한 성능을 필요로 합니다. 본 연구에서는 2024년 8월 13일 릴리스된 DLIO 벤치마크 버전 2.0을 사용했습니다.

실제 시나리오를 반영하는 벤치마킹을 위해 LLAMA 3.1 405B 모델 아키텍처를 기반으로 테스트를 진행했습니다. torch.save() 함수를 사용하여 모델 파라미터, 옵티마이저 상태, 레이어 상태를 저장하는 체크포인트를 구현했습니다. 8개의 GPU를 사용하는 시스템을 시뮬레이션했으며, 4방향 텐서 병렬 처리와 2방향 파이프라인 병렬 처리를 8개의 GPU에 분산하는 하이브리드 병렬 처리 전략을 적용했습니다. 이 구성으로 생성된 체크포인트 크기는 1,636GB로, 최신 대규모 언어 모델 학습에 필요한 크기를 반영합니다.

드라이브 패스 1 평균 (초) 패스 2 평균 (초) 패스 3 평균 (초)
샌디스크 DC SN861 7.68TB 461.3 558.6 553.3
마이크론 9550 MAX 12.8TB 462.8 558.9 555.3
마이크론 9550 프로 7.68TB 461.4 577.9 559.7
솔리드다임 PS1010 7.68TB 458.8 561.1 564.6
마이크론 7600 MAX 6.4TB 464.2 581.5 567.3
키옥시아 CD9P-R 7.68TB 464.7 575.6 570.6
키옥시아 CM9-R 15.36TB 462.8 571.9 580.9
솔리드다임 PS1030 12.8TB 462.3 578.0 599.2

 

각 테스트 구간의 평균값을 살펴보면, Solidigm PS1030은 1차 테스트에서 462.3초로 출발하여 비교 대상 제품들 중 가장 빠른 속도를 기록했습니다. 비교 대상 제품들은 대략 459초에서 465초 사이의 7초 범위에 속했습니다. 하지만 이후부터는 차이가 벌어지기 시작했습니다. 2차 테스트에서 PS1030은 578.0초로 기록이 향상되었는데, 이는 SanDisk SN861의 558.6초부터 Micron 7600 MAX의 581.5초까지 분포된 제품들 중 상위권에 해당합니다. 3차 테스트에서는 599.2초까지 기록하며 비교 대상 제품 중 가장 높은 평균값을 보였고, 나머지 제품들은 SN861의 553.3초와 KIOXIA CM9-R의 580.9초 사이의 값을 기록했습니다.

Solidigm PS1030 DLIO 체크포인트

PS1030 자체 체크포인트 로그는 이러한 편차의 형태를 보여줍니다. PS1030은 465.3초에 체크포인트를 시작하여 5번째 체크포인트까지 약 461초를 유지하다가 이후 증가했습니다. 전환 후에는 대략 553초에서 593초 사이의 범위를 보였고, 12번째 체크포인트는 614.7초에 완료되었으며, 최근 체크포인트는 최대 629.0초까지 상승했습니다. 이 결과는 새로운 문제가 아니라 드라이브의 기존 약점과 일치합니다. DLIO 체크포인트는 128K 단일 워커 FIO 테스트에서 지적된 것과 같은 대규모 순차 쓰기 버스트 현상입니다. 차이는 존재하지만 제한적이며, 3번째 패스 평균에서 KIOXIA CD9P-R 대비 약 5% 수준이며, PS1030은 패스 전반에 걸쳐 변동이 심한 것이 아니라 예측 가능한 수준으로 확장되었습니다.

FIO 성능 벤치마크

일반적인 업계 지표에서 각 SSD의 스토리지 성능을 측정하기 위해 FIO를 활용합니다. 각 드라이브는 동일한 테스트 프로세스를 거치는데, 여기에는 순차적 쓰기 워크로드를 사용하여 두 번의 전체 드라이브 채우기를 수행하는 사전 조정 단계와 그 후 정상 상태 성능 측정이 포함됩니다. 측정되는 각 워크로드 유형이 변경됨에 따라, 새로운 전송 크기에 대한 사전 조정 채우기를 다시 실행합니다.

이 섹션에서는 다음 FIO 벤치마크에 초점을 맞춥니다.

  • 128K 순차
  • 64K 랜덤
  • 16K 순차
  • 4K 랜덤

128K 순차 쓰기(IODepth 16 / NumJobs 1)

FIO 128K 순차 쓰기 대역폭 막대 그래프는 Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD를 비교합니다. Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 FIO 128K 순차 쓰기 평균 지연 시간 막대 차트

PS1030은 128K 순차 쓰기 테스트에서 다른 SSD에 비해 다소 약점을 보였습니다. 이 드라이브는 6,370.3MB/s의 대역폭과 313.7µs의 지연 시간을 기록하며, 테스트 그룹에서 가장 낮은 대역폭과 가장 높은 지연 시간을 보였습니다. 읽기 성능이 뛰어난 KIOXIA CD9P-R(6,912.4MB/s)에도 미치지 못했습니다. Micron 9550 MAX가 10,957.9MB/s로 가장 높은 성능을 보였고, 9550 Pro가 10,354.6MB/s, KIOXIA CM9-R이 8,668.1MB/s로 그 뒤를 이었습니다. PS1030의 형제 제품인 PS1010(7,126.5MB/s)과 SanDisk DC SN861(7,116.5MB/s)이 중간 순위를 차지했으며, Micron 7600 MAX는 6,960.6MB/s를 기록했습니다.

중요한 점은 이것이 단일 작업 워크로드이며, PS1030의 쓰기 아키텍처는 특정 작업 스트림에서 우위를 점하기보다는 작업을 분산하도록 설계되었다는 것입니다. 아래의 임의 쓰기 섹션은 병렬 처리가 도입되면 동일한 드라이브가 훨씬 더 많은 데이터를 처리하는 것을 보여주는데, 이는 대상 워크로드가 생성하는 액세스 패턴과 일치합니다.

128K 순차 읽기(IODepth 64 / 작업 수 1)

FIO 128K 순차 읽기 대역폭 막대 그래프는 Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD를 비교합니다. Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 FIO 128K 순차 읽기 평균 지연 시간 막대 차트

읽기 성능에서는 결과가 완전히 뒤집혔습니다. PS1030은 564.8µs의 응답 속도에서 14,156.4MB/s를 기록하며, 형제 모델인 PS1010(14,163.3MB/s)과 거의 동일한 성능을 보였고, 그룹 내 최고 성능을 자랑하는 CD9P-R(14,235.9MB/s)과는 0.6% 이내의 차이를 보였습니다. Micron 9550 Pro(14,050.1MB/s)와 9550 MAX(14,047.5MB/s)는 200MB/s 범위 내에서 Gen5 인터페이스의 최대 성능을 발휘하며 5개 드라이브 그룹의 나머지 두 자리를 차지했습니다. SN861은 12,631.2MB/s, 7600 MAX는 11,240.5MB/s를 기록했고, 쓰기 테스트에서 뛰어난 성능을 보였던 CM9-R은 단일 작업 구성에서 9,974.6MB/s로 가장 낮은 성능을 보였습니다. 쓰기 성능을 중시하는 드라이브임에도 불구하고 대용량 읽기 성능에서 전혀 뒤처지지 않는다는 점은 이 차트에서 조용히 얻어지는 승리입니다.

64K 랜덤 쓰기

FIO 64K 랜덤 쓰기 대역폭을 큐 깊이 및 작업 조합에 따라 나타낸 그래프 (Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개 Gen5 엔터프라이즈 SSD) Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 FIO 64K 랜덤 쓰기 평균 지연 시간 그래프

PS1030의 진가는 64K 랜덤 쓰기 스윕에서 드러납니다. 이 드라이브는 최고 7,224.0MB/s의 속도를 기록하며 Micron 9550 MAX(10,878.1MB/s), KIOXIA CM9-R(9,635.3MB/s), Micron 9550 Pro(9,069.4MB/s)에 이어 그룹 내 4위를 차지했고, Micron 7600 MAX(6,960.5MB/s)를 비롯한 다른 제품들보다 앞섰습니다. PS1030의 차별점은 최고 속도가 IODepth 2 / NumJobs 2에서 단 34.3µs의 지연 시간으로 달성되었다는 점입니다. 대부분의 제품이 최고 속도를 내기 위해 긴 큐를 필요로 했던 것과 대조적입니다. 이 드라이브는 거의 즉시 포화 상태에 도달한 후 스윕이 끝날 때까지 안정적인 속도를 유지하는데, 이는 적당한 동시성으로 24시간 내내 안정적인 쓰기 성능을 유지하는 데 이상적인 프로파일입니다. 형제 모델과의 차이점은 성능 면에서 드러나는 내구성에서도 나타납니다. PS1010은 최대 5,873.9MB/s의 대역폭을 기록했는데, 이는 PS1030보다 23% 낮은 수치입니다.

지연 시간 측면에서 PS1030은 IODepth 1 / NumJobs 1일 때 21.1µs로 시작하여 CM9-R의 18.4µs에 이어 두 번째로 우수했으며, 전체 테스트에서 최악의 지점은 2,831µs로 PS1010의 5,987µs 최고치보다 절반에도 미치지 못했습니다. 9550 MAX는 높은 동시 접속 환경에서도 가장 안정적인 성능을 보였으며, 최대 지연 시간은 1,714µs였습니다.

64K 랜덤 읽기

FIO 64K 랜덤 읽기 대역폭을 큐 깊이 및 작업 조합에 따라 나타낸 그래프 (Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개 Gen5 엔터프라이즈 SSD) Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 FIO 64K 랜덤 읽기 평균 지연 시간 라인 차트

PS1030은 64K 랜덤 읽기 최고 속도인 14,162.9MB/s(IODepth 32 / NumJobs 8)를 기록하며 Micron 9550 Pro(14,049.9MB/s), 9550 MAX(14,049.7MB/s), PS1010(14,013.6MB/s)을 근소한 차이로 앞섰으며, CM9-R(13,402.4MB/s)과 CD9P-R(12,036.0MB/s)은 그보다 뒤처졌습니다. 낮은 큐 깊이에서의 성능은 KIOXIA 드라이브의 강점입니다. CD9P-R 리뷰에서도 마찬가지였습니다. CM9-R은 IODepth 1 / NumJobs 1에서 1,359.0MB/s, CD9P-R은 1,334.0MB/s의 응답 속도를 보였으며, 이는 약 45µs의 지연 시간 수준입니다. 반면 PS1030은 768.4MB/s의 응답 속도와 81.0µs의 지연 시간으로 중간 정도의 성능을 보였습니다. PS1030은 단일 스트림 응답 속도가 아닌 확장성 측면에서 이 차트의 최상위에 위치합니다.

16K 순차 쓰기

테스트 자체에 대한 참고 사항: 이번 비교 그룹부터 16K 테스트는 무작위가 아닌 순차 방식으로 진행되었으며, 이는 저희가 마이크론 9550 MAX 리뷰 에서 처음 선보인 워크로드 입니다. 중간 규모의 순차 스트림은 특히 AI 파이프라인과 같이, 드라이브 전체에 무작위로 데이터를 분산시키는 방식이 아니라, 순서대로 학습 데이터를 입력하고, 중간 결과를 출력하고, 추론 단계에 데이터를 제공하는 환경에서 이러한 드라이브가 실제로 작동하는 방식을 더 잘 나타냅니다.

Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 큐 깊이 및 작업 조합별 FIO 16K 순차 쓰기 대역폭 라인 차트 Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 FIO 16K 순차 쓰기 평균 지연 시간 그래프

무작위 스윕 결과와 비교했을 때 순위 변동이 있었습니다. Micron 9550 MAX가 10,970.8MB/s(IODepth 32 / NumJobs 4)로 선두를 차지했고, KIOXIA CM9-R이 10,812.2MB/s로 거의 비슷한 성능을 보였으며, 9550 Pro는 9,772.8MB/s로 3위를 기록했습니다. PS1030은 5,977.7MB/s(IODepth 8 / NumJobs 4)로 7위를 기록했으며, SanDisk DC SN861(5,772.5MB/s)보다 앞섰고, PS1010(6,271.7MB/s)보다는 약간 뒤처졌습니다. 하지만 스윕 패턴은 무작위 테스트에서 나타난 것과 동일한 특징을 보였습니다. PS1030은 IODepth 2 / NumJobs 4에서 이미 5,856.7MB/s의 속도와 21.1µs의 지연 시간을 기록했으며, 이후 매트릭스의 나머지 부분에서는 약 4,700~6,000MB/s 사이의 평탄한 속도를 유지했습니다. 단일 워커 지연 시간은 10.9µs로, CM9-R(10.4µs) 및 CD9P-R(11.0µs)과 함께 선두 그룹에 속했으며, Micron 제품(15.1~17.8µs)보다 훨씬 낮았습니다. 쓰기 작업에 특화된 드라이브임을 감안하면 최고 성능은 다소 낮지만, 최소한의 큐 깊이와 마이크로초 단위의 지연 시간에서 도달하는 수치입니다. 이는 지속적인 캐시 또는 스테이징 계층이 작동하는 지점이며, 당사의 KV 캐시 배포 환경에서 수주간 연속 순차 쓰기 스트림을 견뎌낸 것과 동일한 프로파일입니다.

16K 순차 읽기

Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 큐 깊이 및 작업 조합별 FIO 16K 순차 읽기 대역폭 라인 차트 Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 FIO 16K 순차 읽기 평균 지연 시간 그래프

읽기 속도 측면에서는 KIOXIA CD9P-R이 13,819.7MB/s로 가장 빠른 속도를 기록했고, CM9-R이 13,393.2MB/s, Micron 9550 Pro가 13,273.5MB/s로 그 뒤를 이었습니다. PS1030은 179.1µs의 응답 시간에서 11,142.8MB/s(IODepth 16 / NumJobs 8)의 최고 속도를 기록하며 그룹 내 7위를 차지했습니다. SN861(10,995.0MB/s)보다만 앞섰고, SN861(11,656.3MB/s) 바로 뒤에 위치하여 그룹 선두와는 약 0.2%의 차이를 보였습니다. 단일 스트림 테스트 결과는 무작위 읽기 테스트 결과와 완전히 반대되는 양상을 보입니다. 16K 읽기 순서 테스트에서 SN861은 12.5µs, Micron 드라이브는 13.9~21.3µs의 응답 속도를 보였고, Solidigm 플랫폼은 59µs 부근에서 시작했는데, 이는 두 PS 시리즈 드라이브 모두 64K 읽기에서 보였던 것과 동일한 저속 읽기 특성입니다. 중간 크기 읽기는 이 플랫폼의 성능이 가장 크게 떨어지는 영역입니다. AI 파이프라인의 스트리밍 읽기 환경에는 읽기 집약적인 드라이브가 더 적합하지만, 이 드라이브는 그러한 용도를 위해 설계된 것은 아닙니다.

4K 랜덤 쓰기

Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 큐 깊이 및 작업 조합별 FIO 4K 랜덤 쓰기 IOPS 라인 차트 Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 FIO 4K 랜덤 쓰기 평균 지연 시간 그래프

3 DWPD 드라이브의 주요 성능 차트에서 PS1030은 기대에 부응하는 결과를 보여주었습니다. IODepth 16 / NumJobs 8 조건에서 최고 1,595.8K IOPS를 기록하며 동급 3 DWPD 드라이브 중 1위인 Micron 7600 MAX(1,781.2K)에 이어 두 번째로 높은 성능을 보였습니다. 그 뒤를 이어 9550 MAX(1,544.2K), PS1010(1,504.7K), CM9-R(1,502.9K), 9550 Pro(1,467.6K), SN861(1,438.3K), CD9P-R(1,273.1K) 등이 있습니다. 측정된 최고 성능은 Solidigm이 고정 큐 깊이에서 명시한 정격 수치인 800K의 두 배에 달하며, 정상 상태 스윕 테스트에서는 더 높은 성능을 확인할 수 있었습니다.

지연 시간 동작이 이를 뒷받침합니다. PS1030은 IODepth 1에서 8.8µs의 오픈 시간을 기록하며 CM9-R(8.2µs) 및 PS1010(8.3µs)과 함께 선두 그룹에 속했고, 최대 처리량은 단 79.8µs에 도달했으며, 테스트 기간 내내 359.6µs를 초과하지 않았습니다. 반면 PS1010은 IODepth 32 / NumJobs 16에서야 최대 339.7µs의 지연 시간을 기록했고, 최악의 경우 735.6µs까지 떨어졌습니다. 이 드라이브가 목표로 하는 OLTP 로그 및 KV 캐시 스타일 트래픽의 경우, 400µs 미만의 최대 지연 시간을 갖는 단일 마이크로초 단위의 작은 쓰기 작업이 중요합니다.

4K 랜덤 읽기

Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 큐 깊이 및 작업 조합별 FIO 4K 랜덤 읽기 IOPS 라인 차트 Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 FIO 4K 랜덤 읽기 평균 지연 시간 라인 차트

PS1030은 쓰기 성능에 이어 그룹 내에서 두 번째로 우수한 4K 랜덤 읽기 피크인 2,255.8K IOPS(IODepth 16 / NumJobs 16, 112.8µs)를 기록하며 뛰어난 성능을 뒷받침했습니다. 이는 SanDisk SN861의 2,555.6K IOPS에 이어 두 번째로 우수한 수치이며, Micron 9550 MAX(2,217.6K IOPS)와 CD9P-R(2,165.0K IOPS)보다 앞섭니다. IODepth 1 / NumJobs 1 테스트에서 KIOXIA의 저지연 특성이 다시 한번 선두를 차지했습니다. CM9-R은 29.3µs, CD9P-R은 30.4µs를 기록했지만, PS1030은 56.8µs로 나머지 제품 중 가장 우수한 성능을 보였으며, 같은 모델인 CM9-R과 CD9P-R(약 65µs), 그리고 SN861(67.8µs)을 앞섰습니다. 읽기 작업이 많은 환경에서 4K 읽기 및 쓰기 피크 모두에서 2위를 기록한 이 혼합 용도 드라이브는 두 가지 작업 모두를 훌륭하게 수행하고 있습니다.

GPU 직접 스토리지

이 테스트벤치에서 수행한 테스트 중 하나는 Magnum IO GPU Direct Storage(GDS) 테스트였습니다. GDS는 NVIDIA에서 개발한 기능으로, GPU가 NVMe 드라이브나 다른 고속 스토리지 장치에 저장된 데이터에 액세스할 때 CPU를 우회할 수 있도록 해줍니다. GDS는 CPU와 시스템 메모리를 통해 데이터를 라우팅하는 대신 GPU와 스토리지 장치 간의 직접 통신을 가능하게 하여 대기 시간을 크게 줄이고 데이터 처리량을 개선합니다.

GPU 직접 스토리지 작동 방식

전통적으로 GPU가 NVMe 드라이브에 저장된 데이터를 처리할 때, 데이터는 GPU에 도달하기 전에 먼저 CPU와 시스템 메모리를 거쳐야 합니다. 이 과정에서 CPU가 중개자 역할을 하므로 병목 현상이 발생하고, 지연 시간이 늘어나고 귀중한 시스템 리소스가 소모됩니다. GPU Direct Storage는 GPU가 PCIe 버스를 통해 저장 장치의 데이터에 직접 액세스할 수 있도록 하여 이러한 비효율성을 제거합니다. 이러한 직접 경로는 데이터 이동 오버헤드를 줄여 더 빠르고 효율적인 데이터 전송을 가능하게 합니다.

AI 워크로드, 특히 딥 러닝과 관련된 워크로드는 매우 데이터 집약적입니다. 대규모 신경망을 훈련하려면 테라바이트 규모의 데이터를 처리해야 하며, 데이터 전송이 지연되면 GPU 활용도가 낮아지고 훈련 시간이 길어질 수 있습니다. GPU Direct Storage는 데이터가 가능한 한 빨리 GPU에 전달되도록 하여 유휴 시간을 최소화하고 계산 효율성을 극대화함으로써 이러한 과제를 해결합니다.

또한 GDS는 비디오 처리, 자연어 처리 또는 실시간 추론과 같이 대용량 데이터 세트를 스트리밍하는 작업 부하에 특히 유용합니다. GDS는 CPU에 대한 의존도를 줄임으로써 데이터 이동을 가속화하고 다른 작업을 위한 CPU 리소스를 확보하여 전반적인 시스템 성능을 더욱 향상시킵니다.

GDSIO 순차 읽기 처리량

Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 16K, 128K 및 1M 블록 크기에 따른 GDSIO 순차 읽기 처리량 라인 차트 Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대해 16K, 128K 및 1M 블록 크기에 따른 GDSIO 순차 읽기 평균 지연 시간 라인 차트

16K 블록 크기 세그먼트에서 PS1030은 단일 스레드에서 약 0.2GiB/s의 응답 속도로 그룹 내 가장 낮은 진입점을 보였으며, 이는 71.6µs의 단일 스레드 GDS 읽기 지연 시간과 일치합니다(동일한 특성을 보이는 CD9P-R은 71.1µs를 기록했습니다). PS1030은 중간 범위에서 꾸준히 성능을 향상시켜 1.6K/128에서 약 16GiB/s로 세그먼트를 마무리했으며, KIOXIA 드라이브 쌍은 약 2.0GiB/s로 해당 세그먼트에서 선두를 유지했습니다. KIOXIA 드라이브의 스레드 확장성 우위는 128K 세그먼트에서도 이어져 CD9P-R과 CM9-R이 128K/16에서 앞서 나가는 동안 PS1030은 주요 그룹과 비슷한 수준을 유지하며 128K/64에서 약 4.7GiB/s, 128K/128에서 약 5.0GiB/s를 기록했습니다.

1M 세그먼트에서 모든 제품의 성능이 수렴되었습니다. PS1030은 5.95GiB/s(1M/32)의 최고 속도를 기록하며 그룹 최고인 CD9P-R의 6.16GiB/s에 3.5% 차이로 근접했습니다. CM9-R은 6.06GiB/s, PS1010과 9550 MAX는 6.05GiB/s, 9550 Pro는 5.97GiB/s를 기록했습니다. 7600 MAX는 5.59GiB/s로 가장 낮은 성능을 보였습니다. 최대 16K IOPS에서는 KIOXIA 제품군(CM9-R 136.4K, CD9P-R 134.2K)이 선두를 차지했으며, PS1030은 101.2K로 그룹 최저치를 기록했습니다. 이는 소형 ​​블록 GPU 직접 읽기가 이 플랫폼의 강점이 아님을 보여줍니다.

GDSIO 순차 쓰기 처리량

Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 16K, 128K 및 1M 블록 크기에 따른 GDSIO 순차 쓰기 처리량 라인 차트 Solidigm D7-PS1030, KIOXIA CM9-R 및 기타 6개의 Gen5 엔터프라이즈 SSD에 대한 16K, 128K 및 1M 블록 크기에 따른 GDSIO 순차 쓰기 평균 지연 시간 선 그래프

PS1030 구매자라면 쓰기 스윕 차트를 반드시 살펴봐야 합니다. 이 차트에는 드라이브의 최상의 성능과 유일한 한계점이 모두 담겨 있기 때문입니다. 16K 구간에서는 8개의 드라이브 모두 0.5~1.5GiB/s 범위에서 비슷한 성능을 보였으며, PS1030의 단일 스레드 쓰기 지연 시간은 22.3µs로 KIOXIA 드라이브 두 개(각각 21.4µs)와 동종 제품(21.9µs)과 함께 선두권에 속했습니다. 128K 구간에서는 128K/32에서 약 3.95GiB/s까지 안정적인 성능을 보였지만, 이후 급격히 성능이 저하되어 128K/64에서는 약 2.35GiB/s, 128K/128에서는 약 1.55GiB/s를 기록했는데, 이는 해당 구간 선두 제품들의 3분의 1에도 못 미치는 수치입니다. 이는 CD9P-R 리뷰에서 PS1010에 대해 기록했던 것과 동일한 고스레드 수 쓰기 성능 저하 현상이며, PS1030에서도 거의 똑같이 재현되었습니다(PS1010은 동일한 조건에서 2.5GiB/s에서 1.65GiB/s로 떨어졌습니다). 이 문제의 원인은 내구성 등급이 아닌 플랫폼 자체에 있으며, 데이터 세트에서 가장 중요한 결함으로 남아 있습니다.

1M 구간은 다소 완화되었지만 패턴은 사라지지 않았습니다. PS1030은 1M/8에서 4.22GiB/s로 최고치를 기록하며, 같은 기종인 CM9-R의 4.17GiB/s보다만 앞섰고, 1M/128에서는 약 3.35GiB/s까지 하락했습니다. 한편 CM9-R은 5.51GiB/s의 최고치를 향해 가장 안정적인 흐름을 보였고, 9550 MAX는 5.69GiB/s로 가장 높은 최고치를 기록했지만, 1M/64에서는 2.2GiB/s 근처까지 떨어지는 등 변동성을 보였습니다. 그 뒤를 이어 9550 Pro(5.54GiB/s), 7600 MAX(5.44GiB/s), CD9P-R(4.86GiB/s), SN861(4.59GiB/s) 순으로 높은 변동성을 나타냈습니다. PS1030의 주요 구매자에게 다행스러운 점은 KV 캐시와 로그 스타일 계층이 드라이브당 적당한 스레드 수에서 쓰기 작업을 수행한다는 것입니다. 이 영역에서는 PS1030이 완벽하게 작동하지만, 64개 이상의 GPU 직접 쓰기 스레드를 사용할 때는 성능 저하가 발생합니다. 저희는 KV 캐시 환경에서 이 드라이브 8개를 몇 주 동안 사용했지만, 어레이가 병목 현상에 근접하는 경우는 없었습니다. 하지만 이 플랫폼에 대규모 멀티스레드 GDS 쓰기 스트리밍을 계획하는 사용자는 먼저 정확한 사용 패턴에 대한 벤치마킹을 수행해야 합니다.

맺음말

Solidigm D7-PS1030은 중간 내구성을 가진 Gen5 드라이브의 역할을 충실히 수행하며, 데이터는 이 드라이브가 탁월한 성능을 지니고 있음을 보여줍니다. 특히 병렬 소형 블록 처리에서 뛰어난 성능을 발휘합니다. 4K 랜덤 쓰기(1,595.8K IOPS, 동급 3 DWPD Micron 7600 MAX에 이어 두 번째)와 4K 랜덤 읽기(2,255.8K IOPS)에서 그룹 내 2위를 기록했으며, 64K 랜덤 읽기에서는 14,162.9MB/s로 그룹 내 최고 속도를, 128K 순차 읽기에서는 14,156.4MB/s로 Gen5 라인 속도에 준하는 성능을 보여줍니다. 더욱 흥미로운 점은 이러한 성능을 달성하는 방식입니다. IODepth 2 또는 NumJobs 8에서 수십 마이크로초의 지연 시간으로 최고 성능을 발휘하는 반면, 경쟁 제품들은 깊은 큐를 필요로 하며 이로 인해 지연 시간이 증가합니다. 이 드라이브는 조기에 포화 상태에 도달하고, 안정적인 성능을 유지하며, 최악의 경우 쓰기 지연 시간을 PS1010 모델의 절반 수준으로 유지합니다.

StorageReview 연구실에 있는 Dell PowerEdge XE7740 E3.S 드라이브 트레이에 Solidigm D7-PS1030 SSD 두 개가 세워진 모습입니다.

KV 캐시 오프로드 작업에서 8개의 드라이브로 구성된 PS1030 티어를 수용했던 XE7740 베이입니다.

하지만 몇 가지 단점이 있습니다. 단일 워커 128K 순차 쓰기 속도는 6,370.3MB/s로 그룹 내 최하위를 기록했고, 정확히 같은 패턴을 강조하는 DLIO 체크포인트 테스트에서는 3차 평균 599.2초로 그룹 내 최고치를 기록했습니다. 16K 순차 테스트 역시 쓰기 최고 속도 5,977.7MB/s, 읽기 최고 속도 11,142.8MB/s로 각각 8개 드라이브 중 7위에 그치며 전반적으로 뒤처졌습니다. GDSIO 쓰기 스윕 테스트에서는 PS1010의 고스레드 128K 성능 저하 현상이 거의 그대로 재현되어, 이는 일회성 문제가 아니라 플랫폼 자체의 문제임을 확인시켜 주었습니다. 또한 소형 블록 GPU 직접 읽기 테스트에서는 KIOXIA 드라이브가 압도적으로 우수한 성능을 보였습니다. 이러한 결과들이 드라이브의 본래 목적을 훼손하는 것은 아니지만, PS1030이 단일 스트림 데이터 수집에는 적합하지 않다는 점을 분명히 보여줍니다.

이 드라이브는 벤치마크 테스트보다 훨씬 더 오랜 기간 동안 그 성능을 입증해 왔습니다. 8개의 드라이브가 XE7740 추론 작업 에서 KV 캐시 오프로드 계층으로 수주 동안 사용되었으며 , 3 DWPD 정격 용량을 거의 초과하는 듀티 사이클에서 1.9GB/s의 지속적인 24시간 쓰기 작업을 처리했지만, 해당 계층은 병목 현상을 일으키지 않았습니다. 벤치마크 데이터는 그 이유를 설명해 줍니다. 쓰기 작업이 조기에 포화되는 특성, 낮은 큐 깊이에서 수 마이크로초 수준의 4K 쓰기 지연 시간, 그리고 제어된 지연 시간 상한선은 지속적으로 기록되는 캐시 또는 로그 계층에 적합한 특징입니다. 내구성이 중요하고, 지연 시간에 민감하며, 적당한 동시 쓰기 워크로드, KV 캐시 오프로드, OLTP 로깅 및 메타데이터 계층이 PS1030이 적합한 분야이며, 3 DWPD 정격 용량과 4.98 DWPD의 3년 연장 옵션을 통해 읽기 집약적인 작업 환경에서는 적합하지 않은 듀티 사이클에서도 안정적으로 작동합니다.

Solidigm D7-PS1030 제품 페이지

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

브라이언 빌러

Brian은 오하이오주 신시내티에 있으며 StorageReview.com의 수석 분석가이자 사장입니다.