StorageReview.com

Kingston DC3000ME 리뷰: 시스템 통합자 및 주류 기업을 위해 제작됨

기업  ◇  SSD

Kingston의 새로운 DC3000ME는 데이터 센터 및 서버급 워크로드를 위해 설계된 U.2 2.5인치 폼팩터의 최신 엔터프라이즈급 NVMe SSD입니다. PCIe 5.0 x4 인터페이스를 기반으로 설계된 이 제품은 고대역폭 처리량과 3D eTLC NAND를 결합하여 강력한 안정성과 용량 확장성을 제공합니다. 3.84TB, 7.68TB, 15.36TB 용량으로 제공되는 이 드라이브는 하이퍼스케일 인프라, AI 및 HPC 클러스터, 클라우드 서비스, 트랜잭션 시스템 등 수요가 높은 환경에 적합하도록 설계되었습니다.

킹스턴 DC3000ME 히어로

킹스턴 DC3000ME 성과 프로필

DC3000ME는 모든 용량에서 동일한 순차 읽기 성능을 유지하며, 각 SKU는 최대 14,000MB/s의 속도를 제공합니다. 이 속도는 선택한 용량에 관계없이 빠른 데이터 액세스에 크게 의존하는 워크로드에 이상적입니다. 하지만 순차 쓰기 속도는 제품마다 큰 차이가 있습니다. 3.84TB 모델은 5,800MB/s로 제한되는 반면, 7.68TB 모델은 10,000MB/s로 크게 향상됩니다. 15.36TB 모델은 9,700MB/s로 약간 뒤처집니다.

무작위 성능을 살펴보면, 7.68TB 모델이 가장 빠르며, 읽기 최대 2.8만 IOPS, 쓰기 최대 500,000만 IOPS를 기록합니다. 이는 읽기 최대 3.84만 IOPS를 지원하는 15.36TB 및 2.7TB 드라이브보다 빠른 속도입니다. 쓰기 측면에서는 3.84TB 모델이 300,000만 IOPS로 뒤처지고, 15.36TB 모델은 400,000만 IOPS를 기록합니다. 7.68TB 모델은 사용량이 많고 요구 사항이 높은 작업을 처리하는 데 가장 뛰어난 성능을 보입니다.

용량 대비 성능 측면에서 7.68TB 모델은 처리량과 IOPS의 균형 잡힌 조합을 제공하여 로깅, OLTP 데이터베이스 또는 활성 AI 모델 학습과 같은 쓰기 집약적인 애플리케이션에 이상적입니다. 3.84TB 모델은 용량이 중요하지 않은 읽기 집약적 또는 혼합 워크로드에 더 적합할 가능성이 높으며, 15.36TB 모델은 최대 쓰기 IOPS를 원시 스토리지 밀도로 대체합니다.

킹스턴 DC3000ME 엔터프라이즈 기능

DC3000ME는 프로덕션 시스템에 중요한 몇 가지 편리한 엔터프라이즈급 기능을 제공합니다. 갑작스러운 정전 발생 시 데이터를 보호하는 정전 보호(PLP) 기능이 내장되어 있습니다. 또한, TCG Opal을 지원하는 AES-256 암호화를 통해 저장 데이터의 보안을 강화했습니다. DC3000ME는 최대 128개의 네임스페이스를 지원하며, 이는 가상화 또는 컨테이너화된 사용 사례에 특히 유용합니다. 이러한 수준의 네임스페이스 지원은 고급 U.2 SSD에 필적하며, 대규모 가상화 환경에 특히 유용합니다. Kingston은 드라이브 상태, 미디어 마모 및 작동 온도를 추적하는 원격 측정 도구도 내장하여 관리자에게 장기적인 안정성에 대한 가시성을 제공합니다.

킹스턴 DC3000ME 뒷면

전력 소비량은 유휴 상태 8W에서 전체 쓰기 작업 시 최대 24W까지 다양하며, 이는 고부하 환경에서 고밀도 U.2 SSD에서 일반적으로 나타나는 수치입니다. Kingston은 최대 읽기 전력을 8.2W로 명시했는데, 이는 유휴 상태 수치와 거의 일치하며, 읽기 작업이 많은 작업 부하에서 전력 차이가 크지 않음을 보여줍니다. 내구성 등급은 기업용 드라이브에서 기대하는 수준이며, 7,008년 동안 하루에 한 번의 전체 드라이브 쓰기를 지원합니다. 이는 용량에 따라 28,032TBW에서 XNUMXTBW에 해당합니다.

Kingston DC3000ME는 XNUMX만 시간의 MTBF 등급과 Kingston의 XNUMX년 제한 보증, 그리고 무료 기술 지원을 제공합니다.

Kingston DC3000ME 사양

스펙 세부 정보
폼 팩터 U.2, 2.5인치 x 15mm
인터페이스 PCIe NVMe Gen5 x4(Gen4와 하위 호환 가능)
용량 3.84TB, 7.68TB, 15.36TB
NAND 형 3D eTLC 낸드
순차 읽기/쓰기(MB/s) 3.84TB – 14,000 / 5,800
7.68TB – 14,000 / 10,000
15.36TB – 14,000 / 9,700
랜덤 읽기/쓰기 IOPS(4K) 3.84TB – 2,700,000 / 300,000
7.68TB – 2,800,000 / 500,000
15.36TB – 2,700,000 / 400,000
지연 시간 QoS(99%) 읽기: <10µs, 쓰기: <70µs
정적 및 동적 웨어 레벨링 가능
전력 손실 방지 예(파워 캡)
암호화 TCG Opal 2.0, AES 256비트 암호화
네임스페이스 관리 최대 128개의 네임스페이스 지원
엔터프라이즈 진단 원격측정, 미디어 마모, 온도, 상태 등
지구력(TBW/DWPD, 5년) 3.84TB – 7,008TBW, 1DWPD
7.68TB – 14,016TBW, 1DWPD
15.36TB – 28,032TBW, 1DWPD
전력 소비 대기: 8W, 최대 읽기: 8.2W, 최대 쓰기: 24W
작동 온도 0는 ° C를 70하는 C를 °
크기 100.50mm X X 69.8mm 14.8mm
중량(평량) 3.84TB – 146.2g
7.68TB – 151.3g
15.36TB – 152.3g
진동(비작동) 10G 피크(10~1000Hz)
MTBF 2 백만 시간
보증 및 지원 무료 기술 지원이 포함된 5년 제한 보증

킹스턴 DC3000ME 성능 테스트

드라이브 테스트 플랫폼

본 리뷰에서는 모든 워크로드 테스트를 위해 Ubuntu 22.04.02 LTS가 설치된 Dell PowerEdge R760 서버를 테스트 플랫폼으로 사용했습니다. Serial Cables Gen5 JBOF를 장착하여 U.2, E1.S, E3.S 및 M.2 SSD와 폭넓은 호환성을 제공합니다. 시스템 구성은 아래와 같습니다.

      • 2 x Intel Xeon Gold 6430(32코어, 2.1GHz)
      • 16 x 64GB DDR5-4400
      • 480GB 델 보스 SSD
      • 직렬 케이블 Gen5 JBOF

드라이브 비교

CDN 성능

현실적인 혼합 콘텐츠 CDN 워크로드를 시뮬레이션하기 위해, SSD는 콘텐츠 집약적인 엣지 서버의 I/O 패턴을 재현하도록 설계된 다단계 벤치마킹 시퀀스를 거쳤습니다. 테스트 절차는 크고 작은 다양한 블록 크기를 포함하며, 무작위 및 순차 작업에 분산되어 있으며, 다양한 동시성 수준을 갖습니다.

주요 성능 테스트 전에 각 SSD는 100MB 블록을 사용하는 1% 순차 쓰기 패스로 전체 장치 채우기를 완료했습니다. 이 프로세스는 동기식 I/O와 128의 대기열 깊이를 활용하여 98.51개의 동시 작업이 가능하도록 했습니다. 이 단계는 드라이브가 실제 사용 환경을 나타내는 정상 상태 조건에 진입하도록 보장합니다. 순차 쓰기 완료 후, 128시간 동안 가중 블록 크기 분할(블록 크기/백분율) 분포를 사용하여 8차 무작위 쓰기 포화 단계를 실행했습니다. 이 단계에서는 XNUMXK 전송(XNUMX%)을 강력하게 선호했으며, 그 후 XNUMXK 미만 블록에서 XNUMXK까지의 소량의 쓰기가 이어졌습니다. 이 단계는 분산 캐시 환경에서 흔히 나타나는 단편화되고 불균일한 쓰기 패턴을 에뮬레이트합니다.

주요 테스트 제품군은 가변적인 대기열 길이와 작업 동시성 환경에서 드라이브의 동작을 측정하기 위해 확장된 무작위 읽기 및 쓰기 작업에 중점을 두었습니다. 각 테스트는 300분(XNUMX초) 동안 실행되었으며, 이후 XNUMX분간의 유휴 시간이 이어졌습니다. 이를 통해 내부 복구 메커니즘을 통해 성능 지표를 안정화할 수 있었습니다.

  • 128K(98.51%)를 선호하는 고정 블록 크기 분포를 사용하여 실행되었으며, 나머지 1.49%의 작업은 64K에서 8K 사이의 작은 전송 크기로 구성되었습니다. 각 구성은 1, 2, 4개의 동시 작업에 걸쳐 다양하게 구성되었으며, 대기열 깊이는 1, 2, 4, 8, 16, 32로 설정하여 일반적인 에지 쓰기 조건에서 처리량 확장성과 지연 시간을 프로파일링했습니다.
  • CDN 콘텐츠 검색을 모방한, 매우 혼합된 블록 크기 프로필을 사용했습니다. 128K(83.21%)의 주요 구성 요소로 시작하여 30K에서 4K까지 124개 이상의 작은 블록 크기로 구성된 긴 꼬리가 이어졌으며, 각 블록 크기는 부분적인 빈도 표현을 가졌습니다. 이러한 분포는 비디오 세그먼트 가져오기, 썸네일 액세스 및 메타데이터 조회 중에 발생하는 다양한 요청 패턴을 반영합니다. 이러한 테스트는 작업 수와 대기열 깊이의 전체 매트릭스에서도 실행되었습니다.

사전 조건화, 포화 및 혼합 크기 무작위 액세스 테스트를 조합한 이 테스트는 SSD가 지속적인 CDN 유사 환경을 처리하는 방식을 파악하도록 설계되었으며, 대역폭이 많이 필요하고 고도로 병렬화된 시나리오에서 응답성과 효율성을 강조합니다.

CDN 작업 부하 읽기 1

CDN 워크로드 읽기 테스트(1개 작업)에서 Kingston DC3000ME는 대기열 깊이 증가에 따라 효율적으로 확장되는 견고한 성능을 보였습니다. 1단계에서 940MB/s의 속도를 기록하여 SanDisk SN861보다 약 26% 뒤처졌습니다. 그러나 대기열 깊이가 증가함에 따라 DC3000ME는 격차를 좁히고 여러 Gen5 드라이브를 앞지르게 되었습니다. 4단계에서 Kingston DC3000ME는 3,390MB/s의 속도를 기록하여 Micron 42보다 약 9550%, Pascari X40P보다 200%, Solidigm PS25보다 약 1010% 빠르지만 SanDisk SN861보다는 약 2.6% 뒤처졌습니다. QD16에서 DC3000ME는 9,645MB/s의 처리량을 달성하여 Solidigm PS1010보다 약 13%, Micron 9550보다 약 20% 높은 성능을 보였습니다. 최대 테스트 심도인 QD32에서 Kingston은 14,131MB/s의 처리량을 달성하여 Micron 9550과 거의 동등했으며, Solidigm PS1010보다 약 15%, SanDisk SN861보다 거의 10% 높은 성능을 보였습니다.

Kingston DC3000ME - CDN 작업량 1개 읽기 CDN 작업 부하 읽기 2

2-작업 CDN 읽기 워크로드에서 Kingston DC3000ME는 모든 대기열 깊이에서 다시 한번 강력한 성능을 유지했습니다. 1분기(QD1,854)에서 9550MB/s를 기록했습니다. 이는 Micron 1,548(20MB/s)보다 200%, Pascari X1,519P(22MB/s)보다 1010%, Solidigm PS2,011(8MB/s)보다 약 861% 빠른 속도였지만, SanDisk SN2,487(34MB/s)보다 XNUMX% 뒤처졌습니다.

QD4에서 Kingston은 6,335MB/s를 기록했는데, 이는 Micron(5,337MB/s), Pascari(5,249MB/s), Solidigm(5,609MB/s)보다 눈에 띄게 우수한 수치였습니다. 하지만 6,996MB/s로 XNUMX위를 차지한 SanDisk에는 여전히 뒤처졌습니다.

16년 14,131분기(QD32)에는 킹스턴이 14,336MB/s를 기록하며 선두를 달렸습니다. 마지막 테스트 시점인 15,257년 15,052분기(QD6)에는 5MB/s로 소폭 상승하여 Pascari(13,619MB/s)와 Micron(13,721MB/s)보다 각각 약 XNUMX%와 XNUMX% 뒤졌지만, SanDisk(XNUMXMB/s)와 Solidigm(XNUMXMB/s)보다 확고한 우위를 유지했습니다.

CDN 작업 부하 읽기 4

3000개의 작업이 활성화된 상태에서 Kingston DC1ME는 CDN 읽기 성능에서 꾸준히 우위를 유지했습니다. 3,639분기에는 9550MB/s를 기록하여 Micron 3,070(200MB/s)과 Pascari X2,982P(22MB/s)를 능가했지만, 861MB/s로 동급 최고를 기록한 SanDisk SN4,443보다는 4% 뒤처졌습니다. 10,854분기에는 Kingston이 15MB/s를 기록하여 Micron(9,427MB/s)보다 20%, Pascari(9,070MB/s)보다 9,627%, Solidigm(11,161MB/s)보다 약간 높은 성능을 보였습니다. 하지만 SanDisk의 XNUMXMB/s보다는 여전히 뒤처졌습니다.

8분기(QD13,926)에 킹스턴은 13,619MB/s를 기록했는데, 이는 마이크론과 거의 동일하며 샌디스크(12,800MB/s)와 솔리디그(16MB/s)와 거의 비슷한 수준입니다. 32분기와 14,131분기에 킹스턴은 14,233~15,052MB/s로 정점을 찍었는데, 이는 마이크론과 파스카리(각각 15,257~13,619MB/s)보다 약간 뒤처졌지만, 샌디스크(13,721MB/s)와 솔리디그(XNUMXMB/s)보다는 여전히 앞서 있습니다.

CDN 워크로드 쓰기 1

CDN 쓰기 워크로드(1개 작업)에서 Kingston DC3000ME는 큐 크기에 따라 일관된 확장성을 보였습니다. 1분기(QD2,118)에는 9550MB/s에 도달하여 Micron 2,004(200MB/s), Pascari X1,885P(1010MB/s), Solidigm PS1,718(861MB/s)보다 빨랐고, SanDisk SN2,164(4MB/s)보다 근소하게 뒤처졌습니다. 4,318분기(QD55)에는 Kingston이 2,789MB/s를 기록하여 Solidigm(26MB/s)보다 3,437%, Pascari(10MB/s)보다 4,807% 빠르지만, Micron(19MB/s)보다 5,353%, SanDisk(XNUMXMB/s)보다 XNUMX% 느렸습니다.

16년 5,880분기에는 4,921MB/s를 기록하며 Pascari(20MB/s)를 2,664% 앞지르고 Solidigm(11MB/s)보다 두 배 이상 높았지만, 여전히 Micron(6,686MB/s)보다 15%, SanDisk(6,939MB/s)보다 32% 뒤처졌습니다. 5,987년 5,913분기에는 Kingston이 7,422MB/s를 기록하며 Pascari(7,521MB/s)와 비슷한 수준을 기록했지만, Micron(20MB/s)과 SanDisk(25MB/s)보다 각각 약 XNUMX%와 XNUMX% 뒤처졌습니다.

Kingston DC3000ME - 쓰기 성능 CDN 워크로드 1개 작업

CDN 워크로드 쓰기 2

2-Job CDN 쓰기 워크로드에서 Kingston DC3000ME는 일관된 성능을 보였지만, 일반적으로 가장 빠른 Gen5 엔터프라이즈급 SSD보다 뒤처졌습니다. 1분기에는 2,651MB/s를 기록했는데, 이는 Micron 9550(2,813MB/s)과 Pascari X200P(2,762MB/s)보다 약간 낮았고, SanDisk SN33(861MB/s)보다 약 3,972% 낮았습니다.

대기열 깊이가 증가함에 따라 DC3000ME는 속도를 유지했습니다. QD4에서 DC4,807ME는 23MB/s에 도달했는데, 이는 Micron 9550(5,902MB/s)보다 약 13% 느리고 SanDisk SN861(5,508MB/s)보다 1010% 낮았지만, Solidigm PS3,154(XNUMXMB/s)보다는 앞섰습니다.

16년 5,772분기에 Kingston은 7,896MB/s의 속도를 기록하여 Micron(6,709MB/s)과 SanDisk(1010MB/s)보다 뒤처졌지만, Solidigm PS3,820(200MB/s)과 Pascari X5,417P(32MB/s)와 같은 하위권 제품들보다는 여전히 우수한 성능을 보였습니다. 3000년 5,870분기에 DC32ME는 9550MB/s의 최고 속도를 기록하여 Micron 8,670(22MB/s)보다 약 861%, SanDisk SN7,537(1010MB/s)보다 2,817% 낮았지만, Solidigm PS4,585(XNUMXMB/s)과 Pascari(XNUMXMB/s)보다는 여전히 앞서 있었습니다.

CDN 워크로드 쓰기 4

4개 작업 CDN 쓰기 워크로드에서 Kingston DC3000ME는 모든 대기열 깊이에서 꾸준히 성능이 향상되었지만, 상위 두 Gen5 드라이브에는 전반적으로 뒤처졌습니다. 1분기에는 2,202MB/s를 기록하여 Pascari X200P(2,845MB/s), Micron 9550(2,703MB/s), SanDisk SN861(3,544MB/s)보다 낮았지만 Solidigm PS1010(2,020MB/s)보다는 높았습니다. 2분기에는 Kingston이 3,165MB/s를 기록하여 SanDisk(4,863MB/s)와 Micron(4,457MB/s)보다 낮았지만, Solidigm(2,872MB/s)보다는 여전히 앞서 있었습니다.

중간 수준의 대기열 깊이에서 Kingston DC3000ME는 QD3,647에서 4MB/s, QD4,410에서 8MB/s를 달성했습니다. 이는 상당한 확장성을 보여주었지만, 두 테스트 모두에서 Micron 드라이브(5,539MB/s 및 6,478MB/s)와 SanDisk 드라이브(5,177MB/s 및 5,575MB/s)보다 뒤처졌습니다. QD16에서 Kingston은 4,865MB/s를 기록하여 QD8보다 약간 향상되었지만, SanDisk 드라이브(6,011MB/s)와 Micron 드라이브(7,474MB/s)에는 여전히 뒤처졌습니다. QD32에서 DC3000ME는 5,307MB/s로 최고치에 도달하여 Solidigm(3,894MB/s)보다 훨씬 앞서 나갔지만, Micron(7,941MB/s)과 SanDisk(7,212MB/s)에는 크게 뒤처졌습니다. Kingston 드라이브는 성능이 뛰어나지는 않지만 일관된 확장성과 효율성을 유지했습니다.

DLIO 체크포인팅 벤치마크

AI 학습 환경에서 SSD의 실제 성능을 평가하기 위해 데이터 및 학습 입출력(DLIO) 벤치마크 도구를 활용했습니다. Argonne National Laboratory에서 개발한 DLIO는 딥러닝 워크로드에서 I/O 패턴을 테스트하도록 특별히 설계되었습니다. 이 도구는 스토리지 시스템이 체크포인팅, 데이터 수집, 모델 학습과 같은 과제를 어떻게 처리하는지에 대한 통찰력을 제공합니다. 아래 차트는 두 드라이브가 36개의 체크포인트에서 프로세스를 처리하는 방식을 보여줍니다. 머신러닝 모델을 학습할 때 체크포인트는 모델의 상태를 주기적으로 저장하여 중단이나 정전 시 진행 상황 손실을 방지하는 데 필수적입니다. 이러한 스토리지 요구는 특히 지속적이거나 집중적인 워크로드에서 강력한 성능을 요구합니다. 2.0년 13월 2024일 출시된 DLIO 벤치마크 버전 XNUMX을 사용했습니다.

벤치마킹이 실제 시나리오를 반영하는지 확인하기 위해 LLAMA 3.1 405B 모델 아키텍처를 기반으로 테스트를 진행했습니다. 모델 매개변수, 옵티마이저 상태, 계층 상태를 캡처하기 위해 torch.save()를 사용하여 체크포인팅을 구현했습니다. 4개의 GPU로 구성된 시스템을 시뮬레이션하여 2방향 텐서 병렬 처리와 1,636방향 파이프라인 병렬 처리를 XNUMX개의 GPU에 분산하는 하이브리드 병렬 처리 전략을 구현했습니다. 이 구성의 결과, 체크포인트 크기는 XNUMXGB로, 최신 대용량 언어 모델 학습 요구 사항을 충족했습니다.

DLIO 평균 패스 결과에서 Kingston DC3000ME 7.68TB는 상위 경쟁 제품들에 비해 약간 뒤처져 465.04개 드라이브 팩 중 중간 수준을 기록했습니다. 체크포인트 시간은 첫 번째 패스에서 평균 584.38초, 두 번째 패스에서 590.30초, 세 번째 패스에서 200초를 기록했습니다. 세 패스 모두에서 가장 빠른 시간을 기록한 Pascari X7.68P 674.48TB(세 번째 패스에서 3초)보다 꾸준히 빨랐지만, Kingston DC3000ME는 마지막 패스에서 9550초 미만을 유지한 Micron 7.68 1010TB와 Solidigm PS7.68 565TB보다 뒤처졌습니다.

아래 차트에서 볼 수 있듯이 Kingston DC3000ME는 초반 체크포인트 시간이 상위권 경쟁 제품들과 거의 비슷한 수준으로 강력한 출발을 보였습니다. 체크포인트 1에서는 469.27초를 기록하여 9550초를 기록한 Micron 464.01에 약간 못 미치고, 200초를 기록한 Pascari X472.65P보다 앞섰습니다. 체크포인트 2부터 4까지는 461.92초에서 465.44초 사이의 안정적인 범위를 유지하며, 9550~1010초 구간을 맴돌던 Micron 453과 Solidigm PS465과 비슷한 수준을 유지했습니다.

테스트 중반(체크포인트 5~8)에 Kingston DC3000ME의 체크포인트 시간이 크게 증가하여 체크포인트 613.01에서 7초로 최고치를 기록했습니다. 이는 Micron 9550(570.42초)과 SanDisk SN861 7.68TB(559.56초)보다 높았지만, 같은 기간 동안 최대 200초까지 기록한 Pascari X694.38P보다는 여전히 상당히 우수했습니다. 테스트 후반부에는 Kingston DC3000ME가 약간 안정세를 보이며 체크포인트 571.36에서 12초로 마무리했습니다. 이는 Micron 28보다 약 9550초 느렸지만, 200초로 마감한 Pascari X689.68P보다는 여전히 빠른 속도였습니다. 전반적으로 Kingston DC3000ME 7.68TB는 일관된 성능을 보여주었고 체크포인팅 작업 부하 전반에 걸쳐 경쟁력 있는 범위를 유지하여 중간 수준에 위치했습니다.

FIO 성능 벤치마크

일반적인 업계 지표에서 각 SSD의 스토리지 성능을 측정하기 위해 FIO를 활용합니다. 각 드라이브는 동일한 테스트 프로세스를 거치는데, 여기에는 순차적 쓰기 워크로드를 포함하는 두 번의 전체 드라이브 채우기 전처리 단계와 정상 상태 성능 측정이 포함됩니다. 측정되는 각 워크로드 유형이 변경됨에 따라, 새로운 전송 크기에 대한 전처리 채우기를 다시 실행합니다.

이 섹션에서는 다음 FIO 벤치마크에 초점을 맞춥니다.

  • 128K 순차
  • 64K 랜덤
  • 16K 랜덤
  • 4K 랜덤

대용량 전송 크기에 맞춰 설계된 고용량 QLC SSD의 경우, 쓰기 속도 테스트는 16K 랜덤 쓰기로 제한됩니다. 4K의 경우, 16K 워크로드의 사전 채워진 상태를 활용하여 4K 랜덤 읽기 성능만 측정합니다.

128K 순차적 전제 조건(IODepth 256 / NumJobs 1)

이 고밀도 큐 심도 사전 조정 테스트에서 Kingston DC3000ME는 8,944.9초 실행 시간 동안 1,000MB/s의 안정적인 쓰기 대역폭을 유지했습니다(테스트 종료 시점은 800초를 약간 넘었습니다). Kingston DC9550ME는 최고 속도(10.3GB/s)를 기록한 Micron 3000에 약간 못 미치는 수준으로 가장 빠른 것은 아니었지만, 최소한의 변동으로 일관된 처리량을 보여주었습니다.

128K 순차적 사전 조건 대기 시간(IODepth 256 / NumJobs 1)

128K 순차 쓰기 전제 조건 지연 테스트에서 Kingston DC3000ME는 평균 3.577ms의 지연 시간을 보였습니다(최소한의 변동으로 시간이 지나도 안정적으로 유지됨). 이는 Micron 드라이브에 이어 두 번째로 높은 수치입니다.

128K 순차 쓰기(IODepth 16 / NumJobs 1)

128KB 순차 쓰기 테스트에서 Kingston DC3000ME는 8,477.4MB/s의 속도를 기록하여, 9550MB/s로 선두를 달리고 있던 Micron 10,354.6 바로 뒤를 이었습니다. Kingston DC3000ME는 Pascari X200P보다 우수한 성능을 보였고, Solidigm PS1010과 SanDisk SN861보다 각각 7,100MB/s 안팎의 속도를 기록하며 확고한 우위를 유지했습니다. Kingston의 성능은 속도와 일관성 간의 균형이 잘 잡혀 있음을 보여줍니다.

128K 순차 쓰기 대기 시간(IODepth 16 / NumJobs 1)

128K 순차 쓰기 지연 시간 테스트에서 Kingston DC3000ME는 평균 235.6µs의 지연 시간으로 우수한 결과를 보였습니다. 이는 각각 861µs와 1010µs의 지연 시간을 기록한 SanDisk SN280.7과 Solidigm PS280.3보다 앞선 수치입니다. 9550µs로 선두를 달리고 있는 Micron 192.9만큼 빠르지는 않았지만, Kingston DC3000ME는 경쟁력을 유지했으며, 200µs로 Pascari X238.6P를 소폭 앞지르기도 했습니다.

128K 순차 읽기(IODepth 64 / 작업 수 1)

128 큐 깊이에서 한 가지 작업으로 64K 순차 읽기 테스트에서 Kingston DC3000ME는 13,513.8MB/s를 달성했습니다. 이는 테스트된 드라이브 중 200위에 해당하지만 여전히 강력한 처리량을 제공했습니다(실제 차이는 미미했습니다). Pascari X14,242.1P(5.1MB/s)보다 약 1010%, Solidigm PS14,163.3(4.6MB/s)보다 9550%, Micron 14,050.1(3.8MB/s)보다 약 861% 뒤처졌습니다. 또한 12,631.2MB/s의 더 낮은 속도를 달성한 SanDisk SN3000보다 훨씬 우수한 성능을 보였습니다. 그럼에도 불구하고 Kingston DCXNUMXME의 결과는 우수했으며, 상위 테스트 드라이브와 비교했을 때 속도 저하가 최소화되었습니다.

128K 순차 읽기 대기 시간(IODepth 64 / NumJobs 1)

지연 시간 측면에서 Kingston DC3000ME는 평균 591.6µs의 지연 시간을 기록하여 중간 수준을 기록했습니다. 이 결과는 Micron 5.4(9550µs)보다 569.0% 높고 Solidigm PS5.4(1010µs)보다 564.5% 낮았습니다. Pascari X200P는 561.4µs로 근소하게 앞섰고, SanDisk SN861은 633.0µs로 가장 느린 응답 속도를 보였습니다. 결과적으로 Kingston DC3000ME는 높은 대기열 깊이 읽기 조건에서도 비교적 낮은 지연 시간을 유지했습니다.

64K 랜덤 쓰기

64K 랜덤 쓰기 테스트에서 Kingston DC3000ME는 다양한 대기열 깊이와 스레드 조합에서 일관되게 높은 성능을 제공했으며, 6,649(IO 깊이)/32(작업 수) 구성에서 최대 8MB/s의 성능을 기록했습니다. 이는 모든 워크로드와 테스트 지점에서 가장 높은 결과 중 하나입니다.

차트 전체에서 Kingston DC3000ME는 4,000~5,000MB/s의 안정적인 대역폭 추세를 유지했으며, 특히 32/4(5,380MB/s) 및 16/8(5,017MB/s)과 같은 중간~높은 동시성 설정에서 뛰어난 성능을 보였습니다. 1/4 및 2/4와 같은 가벼운 조건에서도 4200MB/s 이상을 유지했습니다. 다른 드라이브와 비교했을 때, Kingston DC3000ME는 대부분의 테스트 지점에서 전반적으로 선두를 유지하거나 상위권을 유지하며 높은 최대 처리량과 일관된 성능을 모두 보여주었습니다.

64K 임의 쓰기 지연 시간

64K 랜덤 쓰기 지연 시간 테스트에서 Kingston DC3000ME는 대부분의 대기열 깊이와 작업 조합에서 일관되게 낮은 응답 시간을 제공하여, 높은 부하에서도 뛰어난 쓰기 효율성을 보여주었습니다. 예를 들어,

  • 4/1에서는 49µs를 보였습니다.
  • 8/1에서는 대기 시간이 102µs로 낮게 유지되었습니다.
  • 16/4에서는 1,486µs로 측정되었습니다.
  • 그리고 가장 높은 테스트 부하인 32/8에서는 2,402µs에 도달했습니다.

이러한 결과는 Kingston DC3000ME가 예측 가능하게 확장되어 다른 드라이브, 특히 3,000~6,000µs 이상에서 불규칙한 상승을 보인 Pascari 및 Solidigm 드라이브에서 나타나는 심각한 지연 시간 급증을 피할 수 있음을 나타냅니다(특히 16/8에서).

64K 랜덤 읽기

64K 랜덤 읽기 테스트에서 Kingston DC3000ME는 IOdepth/NumJobs 매트릭스 전체에서 강력하고 일관된 성능을 보였으며, 테스트 종료 시점에는 근소한 차이로 13,515위를 차지했습니다. 최대 대역폭은 32/4에서 16MB/s에 도달했으며, 4/13,482(32MB/s)와 8/13,512(1MB/s)에서도 유사하게 높은 처리량을 기록하여 높은 병렬 읽기 작업 부하에서 탁월한 확장성을 보여주었습니다. 4/2 및 2/3000와 같은 낮은 부하에서 Kingston DC2,298ME는 각각 2,234MB/s와 XNUMXMB/s를 기록했습니다.

64K 랜덤 읽기 대기 시간

Kingston DC3000ME 64K 지연 시간은 모든 테스트 지점에서 비교적 낮은 수준을 유지했습니다. 모든 드라이브의 성능은 유사했지만, SanDisk SN861은 테스트 종료 시점에 다른 모든 드라이브보다 눈에 띄게 높은 최고치를 기록했습니다. Kingston DC1ME는 2/3000에서 106µs, 108/1에서 4µs, 131/8에서 1µs, 133/4에서 4µs, 177/8에서 4µs를 기록했습니다. 동시성이 높아지면 305/16에서 4µs, 174/32에서 1µs, 301/32에서 2µs로 증가했고, 1,184/32에서는 8µs로 최고치를 기록하여 나머지 드라이브들과 비슷한 수준을 유지했습니다. 전반적으로 Kingston DC3000ME의 지연 프로필은 최소한의 지터나 이상치 스파이크(테스트된 모든 드라이브의 경우)로 최고 성능 제품과 긴밀하게 추적되었습니다.

16K 랜덤 쓰기

16K 랜덤 쓰기 테스트에서 Kingston DC3000ME는 전체 대기열 깊이와 스레드 수 범위에서 강력한 대역폭을 제공하여 경쟁 드라이브 중 427,592위를 차지했습니다. 32/16 구성에서 338,521 IOPS로 최고 성능을 기록했습니다. 32/8 구성에서 251,428 IOPS, 16/4 구성에서 226,606 IOPS, 1/8 구성에서 2 IOPS를 기록하며 다양한 병렬 부하 환경에서 뛰어난 컨트롤러 효율성을 보여주었습니다. 16/1 및 4/218,300 구성과 같은 중간 부하 환경에서도 이 드라이브는 각각 204,867 IOPS와 3000 IOPS를 달성했습니다. 전반적으로 Kingston DC160,000ME는 테스트 매트릭스 전체에서 XNUMX 이상의 IOPS를 지속적으로 달성했으며(일부 영역 제외), 이 작업 부하에서 가장 균형 잡힌 드라이브 중 하나가 되었습니다.

16K 임의 쓰기 지연 시간

Kingston DC3000ME 16K 쓰기 지연 성능은 매우 견고하여, Pascari 드라이브가 근소한 차이로 뒤처진 가운데 리더보드 상위권에서 테스트를 마쳤습니다. Kingston DC3000ME의 주요 특징은 14/1에서 1µs, 18/2에서 1µs, 19/1에서 4µs, 29/1에서 2µs였습니다. 부하가 증가함에 따라 Kingston은 126/8에서 4µs, 146/2에서 16µs, 254/16에서 4µs, 575/16에서 8µs로 강력한 지연 시간을 유지했습니다. 가장 무거운 구성인 32/16에서도 지연 시간은 1,197µs로 안정적으로 유지되었습니다.

16K 무작위 읽기

16K 랜덤 읽기 조건에서 Kingston DC3000ME는 8/8에 도달할 때까지 꾸준히 강력한 성능을 보였지만, 이후 약간 뒤처지기 시작했습니다. 최대 IOPS는 800분기(QD648,686)에 32개 작업으로 641K(4)에 약간 못 미치는 수준에 도달했고, 16분기(QD623)에는 16개 작업으로 3000K IOPS, XNUMX분기(QDXNUMX)에는 XNUMX개 작업으로 XNUMXK IOPS를 기록했습니다. 안타깝게도 Kingston DCXNUMXME는 SanDisk 드라이브와 함께 순위표 최하위권으로 테스트를 마감했습니다.

16K 랜덤 읽기 대기 시간

최대 처리량(QD8/8)에서 Kingston DC3000ME의 지연 시간은 99µs에 불과했으며, 대부분의 구성에서 16/8 정도까지 좁고 낮은 지연 시간 대역을 유지하다가 1/4 정도에서 불안정해지기 시작했습니다. 가장 좋은 지연 시간은 QD74/80(32µs)였으며, 대기열 깊이가 낮거나 중간 정도일 때 16µs 미만의 결과가 여러 개 나타났습니다. QD3000/826과 같이 부하가 더 높은 경우 Kingston DCXNUMXME는 XNUMXµs를 기록했는데, 이는 테스트에 사용된 다른 드라이브(SanDisk 제외)보다 상당히 높은 수치입니다.

4K 랜덤 읽기

4K 랜덤 읽기 테스트에서 Kingston DC3000ME는 테스트 범위 전반에 걸쳐 뛰어난 확장성을 보였으며, 1,957.92/16 구성에서 최대 16K IOPS를 기록했습니다. 1,923.42/32 구성에서 8K IOPS, 1,361.32/8 구성에서 16K IOPS, 1326.03/16 구성에서 8K IOPS의 높은 처리량을 유지하며 Solidigm 및 Micron과 함께 순위표 상위권을 꾸준히 유지했습니다.

4K 랜덤 읽기 대기 시간

Kingston DC3000ME는 4/60 구성에서 1µs로 시작하여 1K 랜덤 읽기 테스트 내내 낮은 지연 시간을 유지했습니다. 1/4 구성에서는 61µs로 소폭 향상되었고, 1/8 구성에서는 63µs로 일정하게 유지되었습니다. 동시성이 증가함에 따라 Kingston DC3000ME의 지연 시간은 예측 가능하게 증가했습니다. 66/2 구성에서 4µs, 67/2 구성에서 16µs, 71/4 구성에서 4µs, 80/8 구성에서 4µs였습니다. 더 무거운 구성에서는 94/16 구성에서 4µs, 99/16 구성에서 8µs, 135/32 구성에서 8µs, 그리고 266/32 구성에서 최대 16µs로 약간 증가했습니다.

4K 랜덤 쓰기

4K 랜덤 쓰기에서 Kingston DC3000ME는 979,636/32에서 최대 16 IOPS, 979.173/32에서 8 IOPS의 강력한 성능을 보였으며, 최대 200만 IOPS를 초과한 최고 성능의 Pascari X1.6P에 크게 뒤처졌습니다. 하지만 Kingston DC3000ME는 879/8에서 16K IOPS, 944/16에서 16K IOPS, 745/16에서 4K IOPS 등 중간 부하 부하에서는 괜찮은 성능을 보였습니다.

4K 임의 쓰기 지연 시간

Kingston DC3000ME는 11/1 스레드에서 1µs로 시작하여 20/50 스레드에 도달할 때까지 8~8µs 정도를 유지한 후 261/32 스레드에서 8µs, 522/32 스레드에서 16µs로 증가했습니다. Kingston DC3000ME는 가장 낮은 지연 시간은 아니었지만, Solidigm이나 Pasarci와 같은 드라이브에서 16 스레드 이상에서 더 큰 변동성을 보였던 것과 같은 급격한 증가 없이 예측 가능하고 적절한 지연 시간을 유지했습니다.

GPU 직접 스토리지

이 테스트벤치에서 수행한 테스트 중 하나는 Magnum IO GPU Direct Storage(GDS) 테스트였습니다. GDS는 NVIDIA에서 개발한 기능으로, GPU가 NVMe 드라이브나 다른 고속 스토리지 장치에 저장된 데이터에 액세스할 때 CPU를 우회할 수 있도록 해줍니다. GDS는 CPU와 시스템 메모리를 통해 데이터를 라우팅하는 대신 GPU와 스토리지 장치 간의 직접 통신을 가능하게 하여 대기 시간을 크게 줄이고 데이터 처리량을 개선합니다.

GPU 직접 스토리지 작동 방식

전통적으로 GPU가 NVMe 드라이브에 저장된 데이터를 처리할 때 데이터는 GPU에 도달하기 전에 먼저 CPU와 시스템 메모리를 거쳐야 합니다. 이 프로세스는 CPU가 중개자가 되어 지연 시간을 늘리고 귀중한 시스템 리소스를 소모하기 때문에 병목 현상이 발생합니다. GPU Direct Storage는 GPU가 PCIe 버스를 통해 스토리지 장치에서 직접 데이터에 액세스할 수 있도록 하여 이러한 비효율성을 제거합니다. 이 직접 경로는 데이터 이동과 관련된 오버헤드를 줄여 더 빠르고 효율적인 데이터 전송을 가능하게 합니다.

AI 워크로드, 특히 딥 러닝과 관련된 워크로드는 매우 데이터 집약적입니다. 대규모 신경망을 훈련하려면 테라바이트 규모의 데이터를 처리해야 하며, 데이터 전송이 지연되면 GPU 활용도가 낮아지고 훈련 시간이 길어질 수 있습니다. GPU Direct Storage는 데이터가 가능한 한 빨리 GPU에 전달되도록 하여 유휴 시간을 최소화하고 계산 효율성을 극대화함으로써 이러한 과제를 해결합니다.

또한 GDS는 비디오 처리, 자연어 처리 또는 실시간 추론과 같이 대용량 데이터 세트를 스트리밍하는 작업 부하에 특히 유용합니다. GDS는 CPU에 대한 의존도를 줄임으로써 데이터 이동을 가속화하고 다른 작업을 위한 CPU 리소스를 확보하여 전반적인 시스템 성능을 더욱 향상시킵니다.

읽기 처리량

GDSIO 순차 읽기 테스트에서 Kingston DC3000ME는 16K, 128K, 1MB 블록 크기에서 일관되고 효율적인 처리량 확장을 보였지만, 성능 추세는 전송 크기에 따라 약간씩 달랐습니다. 16K 블록에서는 스레드 수가 증가함에 따라 처리량이 꾸준히 증가했습니다. Kingston DC3000ME는 3.70스레드에서 32GiB/s로 최고치를 기록한 후 3.41스레드에서 128GiB/s로 점차 감소했습니다. 128K 전송의 경우, 드라이브는 5.88스레드에서 16GiB/s의 최고 성능을 달성했으며, 32스레드까지 이 수준을 유지한 후 5.35스레드에서 약 128GiB/s로 떨어졌습니다. 1MB 크기에서 Kingston DC3000ME 처리량은 일찍 정점에 도달하여 6.54개 스레드에서 16GiB/s를 달성한 후 5.91개 스레드에서 128GiB/s로 약간 감소했습니다.

 

읽기 대기 시간

지연 시간 측면에서 DC3000ME는 예측 가능한 확장성을 보였습니다(테스트 대상 드라이브 모두에서 동일한 결과였습니다). 스레드 수가 적을수록 모든 블록 크기에서 응답 시간이 짧아졌고, 스레드 수가 증가할수록 지연 시간은 증가했습니다. 16K에서 지연 시간은 504µs에서 시작하여 582개 스레드에서 128µs로 점진적으로 증가했습니다. 128K에서 Kingston DC3000ME의 지연 시간은 2,60µs에서 시작하여 최대 스레드 수에서 3,228µs로 증가했습니다. 1MB 블록의 경우, 페이로드가 더 무거워짐에 따라 지연 시간이 더 크게 증가했는데, 스레드가 하나일 때 2,609µs에서 시작하여 2,703개 스레드에서는 128µs로 증가했습니다.

 

쓰기 처리량

읽기 작업의 경우, 16K 블록의 평균 지연 시간은 단일 스레드에서 2,247µs로 시작하여 504개 스레드에서 128µs로 감소하여 동시성 환경에서 효율적인 확장을 보여주었습니다. 128K 블록 크기의 경우, 지연 시간은 처음에 4,035µs로 시작하여 2,601개 스레드에서 128µs로 점차 감소했습니다. 1M 블록의 경우, Kingston DC3000ME는 전체적으로 가장 낮은 지연 시간을 보였으며, 단일 스레드에서 2,609µs로 시작하여 2,500개 스레드까지 2,700~128µs 범위를 유지하여 대용량 순차 읽기에 대한 일관된 응답성을 보여주었습니다.

 

쓰기 대기 시간

평균 지연 시간은 스레드 수 1~16개까지 12,234~14,247µs로 비교적 안정적으로 유지되었습니다. 스레드 수가 32개일 때는 지연 시간이 15,559µs로 소폭 증가했고, 스레드 수가 20,944개일 때는 64µs로 급등했습니다. 스레드 수가 128개일 때는 주목할 만한 급증이 있었는데, Kingston DC3000ME의 지연 시간은 28,725µs로 이전 수준의 두 배 이상 증가했습니다.

 

맺음말

Kingston DC3000ME는 안정성, 일관된 성능, 그리고 견고한 엔터프라이즈 기능이 핵심 요건인 주류 기업 및 데이터 센터 구축을 위한 실용적인 솔루션으로 자리매김했습니다. 이 드라이브는 인프라를 구축하고 관리하는 중소기업(SMB) 및 중소기업 환경의 시스템 통합업체, 부가가치 리셀러(VAR), 그리고 IT 팀의 요구를 충족합니다. U.2 폼 팩터와 PCIe Gen5 지원은 광범위한 호환성과 미래 지향적인 대역폭을 제공하여 채널 기반 구축에 강력한 후보가 될 것입니다.

킹스턴 DC3000ME 앵글

성능 측면에서 DC3000ME는 다양한 워크로드에서 경쟁력 있는 처리량과 효율성을 제공합니다. 뛰어난 순차 읽기 성능, 우수한 쓰기 일관성, 그리고 혼합 및 랜덤 워크로드에서 일관된 지연 시간 확장성을 강점으로 꼽을 수 있습니다. 특정 고부하 CDN 또는 체크포인팅 벤치마크에서 Micron이나 SanDisk와 같은 Gen5 상위 성능 제품에 비해 다소 뒤처지긴 하지만, 특히 지속적인 혼합 부하 시나리오와 적당한 동시성 환경에서는 경쟁력을 유지합니다.

전반적으로 DC3000ME는 범용 엔터프라이즈 워크로드에 매우 적합하며, 고도로 맞춤화된 OEM 솔루션에 의존하지 않고 고성능 스토리지를 구축하려는 조직의 요구를 충족합니다. VAR 및 시스템 구축업체는 특히 실제 인프라 구축에서 비용, 성능 및 확장성의 균형을 맞추려는 경우 이 제품의 장점을 충분히 활용할 수 있을 것입니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

라일 스미스

라일은 StorageReview의 작가로, 일반 사용자 및 기업 IT 관련 다양한 주제를 다루고 있습니다.