StorageReview.com

2U에서 300GB/s: Dell PowerEdge R7725xd는 스토리지 성능에 대한 기대치를 새롭게 합니다.

기업  ◇  서버

일부 서버는 기존 서버를 확장하는 반면, 다른 서버는 기대치를 상회합니다. Dell PowerEdge R7725xd는 두 번째 범주에 속합니다. 최근 Micron 9550 PRO PCIe Gen5 NVMe SSD 24개와 2x 200GbE NIC 4개로 구성된 이 2U 서버는 이전에 측정했던 어떤 시스템보다 높은 원시 스토리지 처리량을 달성했습니다. 내부적으로 이 플랫폼은 NVMe 풀 전체에서 300GB/s 이상의 성능을 유지했습니다. 네트워크에서는 표준 RDMA를 사용하여 복잡성을 추가하지 않고도 160GB/s의 성능을 제공했습니다.

델 파워에지 R7725xd

이는 단순히 더 빠른 스토리지 서버가 아닙니다. 데이터 집약적인 컴퓨팅의 아키텍처 방식을 변화시키는 시스템입니다. 최신 AI 학습 및 추론 파이프라인은 GPU 성능보다는 데이터를 얼마나 빨리 스테이징, 스트리밍, 셔플링하고 체크포인트를 설정할 수 있는지에 따라 제약을 받는 경우가 많습니다. 스토리지가 이를 따라가지 못하면 대용량 GPU 노드는 유휴 상태가 됩니다. 팀은 캐시, 오버사이징, 그리고 복잡한 계층화를 사용하여 가속기가 비용을 정당화할 만큼 빠르게 데이터를 수신하도록 함으로써 이러한 제약을 해결합니다.

Dell PowerEdge R7725xd는 소스에서 발생하는 병목 현상을 해결합니다. 이 서버는 24베이 U.2 백플레인을 기반으로 설계되었으며, 각 드라이브는 AMD EPYC CPU 컴플렉스에 직접 연결되는 전용 PCIe Gen5 x4 링크를 수신합니다. 대역폭 팬아웃이 없으며, 동시성 감소를 위해 미드플레인 확장기를 사용하지 않습니다. 하드웨어가 경합 없이 처리량을 통합하도록 설계되어 성능이 원활하게 확장됩니다. 기존의 2소켓 구성에서는 CPU가 소켓 간 통신을 위해 4개의 XGMI 링크로 연결됩니다. R7725xd에서는 이러한 링크 중 하나가 CPU당 추가 16개의 PCIe Gen5 레인으로 재활용되어 서버에 총 160개의 PCIe Gen5 레인(전면 SSD에 96개, 후면 PCIe 슬롯 4개에 64개)이 제공됩니다. 지속적인 쓰기 작업 부하와 높은 내구성을 위해 설계된 Micron의 9550 PRO SSD와 함께 사용하면 시스템은 체크포인트 집약적 작업 부하와 지속적인 스트리밍 작업을 지원할 수 있는 고처리량 데이터 엔진이 됩니다.

우리는 병렬 제출 경로를 활용하고 동시성이 증가함에 따라 효율성을 유지하기 위해 이 아키텍처 위에 PEAK:AIO를 구축했습니다. 그 결과, 최고 성능은 물론 부하가 걸린 상황에서도 지속적인 성능을 확보할 수 있었습니다. 이 플랫폼은 전처리, 학습 또는 변환을 위한 로컬 실행 노드로 작동하거나 네트워크를 통해 여러 GPU 시스템에 걸쳐 고대역폭 스토리지를 제공할 수 있습니다. 더 나아가 두 가지 작업을 동시에 수행할 수도 있습니다.

주요 요점

  • 단일 노드에서 전례 없는 처리량: R7725xd는 300GB/s 이상의 내부 대역폭과 NVMe-oF RDMA를 통해 160GB/s의 속도를 유지하여 2U 섀시 내부의 다중 노드 스토리지 클러스터와 경쟁했습니다.
  • 진정한 Gen5 아키텍처, 스위치 없음, 팬아웃 없음: 모든 24개의 Micron 9550 PRO SSD는 CPU 복합체로부터 전용 x4 PCIe Gen5 레인을 직접 수신하여 경쟁 없이 라인 속도 확장이 가능합니다.
  • AMD EPYC 9005 시리즈 기반: 듀얼 AMD EPYC 9575F 프로세서는 지속적인 고동시성 I/O에 필요한 레인 수, 메모리 대역폭, NUMA 토폴로지를 제공합니다.
  • AI, 분석 및 체크포인트 중심 워크로드를 위해 설계됨: 이 시스템은 최신 GPU 파이프라인을 멈추게 하는 I/O 병목 현상을 제거하여 지속적이고 고대역폭의 데이터 전송을 가능하게 합니다.
  • PEAK:AIO가 완전한 병렬 처리를 실현합니다. PEAK:AIO의 소프트웨어 스택은 부하가 걸릴 때 대기열 구조를 포화 상태로 유지하여 뛰어난 GB당 비용 비율로 엔터프라이즈 성능을 제공합니다.

NVMe 처리량을 위해 특별히 제작됨

최신 서버 제품군에서 Dell은 스토리지 집약형 서버 구성에서 PCIe 스위치를 사용하지 않았습니다. PowerEdge R770 또는 R7725와 같은 모델은 최대 16개의 SSD 구성을 지원하는 PCIe Gen5 x4 베이를 제공하며, 더 큰 스토리지 백플레인 구성에서는 x2 베이로 전환합니다. PowerEdge R760과 같은 이전 세대 서버는 24베이 NVMe 구성에 PCIe 스위치를 포함했습니다. PCIe 스위치로 인한 복잡성을 제거하고 빌드를 단순화하기 위해 새로운 서버는 스토리지 집약형 빌드에서 PCIe 레인 수를 줄이는 전략을 채택했습니다. 즉, R7725xd까지는 그렇습니다.

표준 R7725와 R7725xd의 차이점은 플랫폼이 PCIe 루트 복합 리소스를 할당하는 방식에 있습니다. 기본 R7725는 PCIe 레인을 스토리지, GPU 확장 및 범용 I/O에 분산합니다. 'xd' 버전은 해당 예산을 재할당하여 NVMe 서브시스템이 PCIe 대역폭의 주요 소비자가 되도록 합니다. 24개의 U.2 베이는 CPU의 PCIe Gen5 루트에 직접 연결되며, 각 SSD는 PCIe 스위치나 리타이머 트리를 통해 노출되는 공유 업링크가 아닌 자체 x4 엔드포인트를 수신합니다. 이를 통해 모든 드라이브는 독립적인 대기열 구조와 메모리 컨트롤러로 연결되는 독립적인 DMA 경로를 갖게 됩니다.

백플레인과 라이저 토폴로지는 이러한 노력을 반영합니다. Dell은 NVMe 커넥터와 PCIe 슬롯을 두 개의 AMD EPYC 소켓에 그룹화하여 각 프로세서가 드라이브 세트의 일부를 직접 소유하도록 합니다. 실제로 이렇게 하면 로컬 지연 시간 특성과 완전한 읽기/쓰기 동시성을 가진 두 개의 대칭형 NVMe 도메인이 생성됩니다. Broadcom 듀얼 포트 200GbE NIC 4개를 추가 카드로 설치했을 때, 슬롯 배치를 통해 각 NIC가 해당 NVMe 그룹에 맞춰 정렬된 PCIe 도메인에 배치될 수 있었습니다. NVMe-over-RDMA 환경에서는 네트워크 트래픽이 관련 드라이브 I/O를 처리하는 소켓에 로컬로 유지되어, 일반적으로 지연 시간을 늘리고 부하 시 대역폭을 소모하는 소켓 간 Infinity Fabric 홉을 피할 수 있었습니다.

열적 특성 또한 지속적인 처리량을 지원합니다. U.2는 각 장치에 대해 정의된 공기 흐름 채널과 예측 가능한 방열판 표면적을 제공하기 때문에 고밀도 Gen5 구성에서 여전히 유리합니다. R7725xd의 고압 팬 모듈과 섀시 덕트는 24개 베이 전체에 걸쳐 일관된 공기 흐름을 유지하여 전체 드라이브 쓰기 워크로드를 속도 조절 없이 지속적으로 실행할 수 있습니다. 기계적 설계는 전기적 설계를 보완합니다. 플랫폼이 부하 시 24개의 Gen5 장치를 동시에 냉각하도록 설계되었기 때문에 각 드라이브는 최대 속도 성능을 유지할 수 있습니다.

루트-컴플렉스 정렬, 일관된 비균일 메모리 액세스(NUMA) 레인 레이아웃, 소켓 인식 NIC 배치, 그리고 열적으로 안정적인 U.2 패키징의 조합을 통해 시스템은 대규모 라인 속도 I/O를 구현할 수 있습니다. 이 아키텍처는 병목 현상을 방지하고 성능을 최적화합니다.

Dell PowerEdge R7725xd iDRAC 10 개요

이번 세대의 R7725xd는 저희가 평가한 다른 많은 17세대 플랫폼과 마찬가지로 원격 관리, 상태 모니터링 및 대역 외 제어의 중심점 역할을 하는 Dell의 새로운 iDRAC 10 플랫폼을 탑재하고 있습니다. 대시보드 보기는 전반적인 시스템 상태, 스토리지 상태 및 최근 활동에 대한 즉각적인 요약을 제공합니다. 테스트 장치의 경우, 시스템 및 스토리지 상태 보고서가 녹색으로 표시되어 서버가 정상적으로 작동하고 있음을 나타냅니다. 모델, 호스트 이름, BIOS 버전, iDRAC 펌웨어 수준, IP 주소 및 라이선스 정보와 같은 주요 시스템 정보는 인터페이스 오른쪽에 표시됩니다.

대시보드에는 완료, 보류 중, 진행 중인 작업을 표시하는 작업 요약 패널도 있습니다. 그 아래에는 섀시 침입 이벤트와 전원 공급 장치 메시지를 기록한 최근 로그 목록이 있어, 복잡한 메뉴로 이동하지 않고도 하드웨어 상태 변화를 빠르게 파악할 수 있습니다. 오른쪽 하단에는 KVM 전체 원격 제어를 위한 가상 콘솔 패널이 있습니다.

iDRAC 10의 스토리지 섹션은 R7725xd에 설치된 모든 물리적 디스크에 대한 전체 개요를 제공합니다. 요약 패널에는 연결된 모든 드라이브의 개수와 드라이브 상태를 보여주는 시각적 원형 차트가 함께 표시됩니다. 이 구성에서는 24개의 NVMe SSD가 활성 상태이며 준비 완료로 보고되고 있으며, 시스템에는 기본 전면 NVMe 뱅크와 별도로 두 개의 추가 부팅 장치가 있습니다.

오른쪽의 "디스크 요약" 패널은 디스크를 물리적 디스크와 연결된 가상 디스크로 구분합니다. R7725xd는 기존 RAID 컨트롤러 없이 직접 NVMe 아키텍처를 사용하므로 모든 드라이브가 비 RAID로 보고되고 개별적으로 주소 지정이 가능합니다. 이는 대규모 NVMe 풀 및 SDS 플랫폼을 위한 시스템 설계에 부합합니다.

상태 요약 아래의 최근 기록된 스토리지 이벤트 영역에는 각 PCIe SSD의 삽입 로그가 베이 및 슬롯별로 정리되어 표시됩니다. 이 기록은 모든 드라이브 베이에서 드라이브가 제대로 감지되었는지 확인하고, 장착, 케이블 연결 또는 핫스왑 작업 관련 문제를 파악하는 데 도움이 됩니다. 대규모 배포의 경우, 이러한 로그는 드라이브 프로비저닝을 추적하거나 용량이 예상대로 채워졌는지 확인하는 데 유용합니다.

마지막 스크린샷은 iDRAC10의 NVMe 장치 상세 보기를 보여줍니다. 시스템에 설치된 각 NVMe 드라이브는 상태, 용량 및 베이 위치와 함께 나열됩니다. 개별 드라이브를 선택하면 드라이브의 전체 특성 분석이 열립니다.

이 예에서 드라이브 정보 패널은 전체 모델 문자열, 장치 프로토콜, 폼 팩터, 그리고 협상된 PCIe 설정을 표시합니다. NVMe 장치는 협상된 x4 연결을 통해 32GT/s 링크 속도로 작동하며, 이는 드라이브가 시스템의 PCIe Gen5 백플레인에서 최대 대역폭으로 작동하고 있음을 보여줍니다. 또한 정보 섹션은 내구성 백분율, 사용 가능한 예비 부품 상태, 프로토콜 유형을 보고하여 관리자가 드라이브 상태 및 수명 주기 예측을 모니터링하는 데 도움을 줍니다.

이러한 세부적인 드라이브 보고 기능은 링크 폭, 협상된 속도, 미디어 상태가 워크로드 동작과 스토리지 성능에 직접적인 영향을 미치는 고밀도 NVMe 구성에서 매우 유용합니다.

전반적으로 iDRAC 10 인터페이스는 R7725xd의 NVMe 스토리지 아키텍처에 대한 명확하고 하드웨어 중심적인 뷰를 제공하여 링크 상태, 드라이브 상태 및 시스템 무결성을 한눈에 쉽게 검증할 수 있습니다.

Dell PowerEdge R7725xd 성능

테스트 전, 저희 시스템은 균형 잡히면서도 고성능을 갖춘 로드아웃으로 구성되었습니다. 이 시스템에는 각각 64개의 고주파 코어를 탑재한 AMD EPYC 9575F 프로세서 2개가 장착되어 있으며, 6400MT/s로 작동하는 32GB DDR5 DIMM 24개가 함께 제공됩니다. 스토리지의 경우, 섀시에는 전용 PCIe Gen5 x4 링크를 통해 연결된 15.36TB Micron 9550 PRO U.2 NVMe SSD 24개가 완전히 장착되어 있습니다. 이를 통해 총 368.64TB의 원시 용량을 제공하며, Micron 9550 PRO 드라이브는 최대 14,000MB/s의 순차 읽기 속도와 최대 10,000MB/s의 순차 쓰기 속도를 제공합니다. 네트워킹은 8개의 200Gb 포트를 결합한 4개의 Broadcom BCM57608 어댑터와 2개의 추가 10기가비트 포트를 제공하는 BCM57412 OCP NIC에 의해 처리됩니다.

델 파워엣지 R7725XD 전면 베이

테스트 시스템 사양

  • CPU : 2x AMD EPYC 9575F 64코어 고주파 프로세서
  • 메모리 : 24x 32GB DDR5 @ 6400MT/s
  • 스토리지 : 24개의 15.36TB Micron 9550 PRO U.2 드라이브(각각 PCIe Gen5의 4개 레인에 연결됨)는 현재 최대 128TB 드라이브를 지원하며 향후 더 큰 용량을 지원할 예정입니다.
  • 네트워크 : 4x Broadcom BCM57608 2x200G NIC, 1x BCM57412 2x10Gb OCP NIC
  • 스위치: 델 파워스위치 Z9664

FIO 성능 벤치마크

PowerEdge R7725xd의 스토리지 성능을 측정하기 위해 업계 표준 지표와 FIO 도구를 사용했습니다. 이 섹션에서는 다음 FIO 벤치마크에 중점을 둡니다.

  • 랜덤 4K – 1M
  • 순차적 4K – 1M

FIO – 로컬 – 대역폭

Dell PowerEdge R7725xd 내부의 24개 PCIe Gen5 NVMe 드라이브에 대한 로컬 액세스를 테스트할 때, 시스템은 모든 드라이브가 전체 x4 레인 PCIe Gen5 링크를 통해 CPU에 연결된 플랫폼에서 기대하는 성능을 정확히 보여줍니다. 네트워크 계층이 개입하지 않은 상태에서, 이는 Dell Gen5 스토리지 레이아웃의 순수한 내부 처리량과 AMD EPYC 플랫폼의 PCIe 대역폭이 제한 없이 작동하는 결과입니다.

순차 읽기는 4K 블록으로 184GB/s에서 시작하여 블록 크기가 증가함에 따라 빠르게 확장됩니다. 512K에서 1M까지 서버는 312~314GB/s의 일관된 속도를 유지하는데, 이는 시스템이 컨트롤러 단계 병목 현상 없이 24×4 Gen5 레인을 모두 지속적인 읽기 대역폭으로 얼마나 잘 통합할 수 있는지를 보여주는 강력한 지표입니다.

순차 쓰기는 다른 곡선을 따르지만 예상 범위 내에 안정적으로 유지됩니다. 149GB/s에서 시작하여 100GB/s 중반까지 상승하여 1만 개에서 182GB/s에 도달합니다. 이는 Micron 9550 PRO SSD의 쓰기 동작 및 여러 독립 장치에서 발생하는 고병렬 NVMe 쓰기에 내재된 오버헤드와 일치합니다.

랜덤 읽기 성능 또한 주목할 만한 부분입니다. 이 시스템은 가장 작은 블록 크기에서 거의 300GB/s의 속도를 달성하고, 중간 범위에서는 약간 떨어지다가 더 큰 블록 크기에서는 200GB/s 후반대와 300GB/s 초반대로 회복됩니다. 1M에서는 랜덤 읽기 속도가 최대 318GB/s에 도달하여, 24개 드라이브 전체에 혼합 작업을 균등하게 분산할 수 있는 플랫폼의 역량을 보여줍니다.

무작위 쓰기는 낮은 속도로 발생하는데, 이는 광범위한 NVMe 세트에 걸쳐 분산된 메타데이터 및 쓰기 할당 작업에서 일반적으로 나타나는 현상입니다. 테스트 결과 대부분은 140~160GB/s 범위를 유지하며, 1M에서는 100GB/s에 약간 못 미치는 수준으로 감소합니다.

FIO – 로컬 – IOPS

IOPS 측면을 살펴보면, R7725xd는 견고한 소규모 블록 성능을 보여주며, 더 큰 블록 크기가 작업 부하를 대역폭 기반 프로필로 전환하기 전에 요청 속도가 수천만에 달합니다.

4K에서 읽기는 44.9만 IOPS, 쓰기는 36.3만 IOPS를 기록했습니다. 랜덤 읽기는 71.4만 IOPS로 더욱 높은 수준에 도달하여, 시스템이 모든 드라이브에 고대기 워크로드를 효율적으로 분산할 수 있음을 보여줍니다. 이러한 값은 블록 크기가 증가함에 따라 자연스럽게 감소하지만, 8K, 16K, 32K 범위에서는 일관되게 유지됩니다.

16개와 32개 블록 단위로 볼 때, 읽기 IOPS는 각각 17.4만 IOPS와 8.35만 IOPS로, 랜덤 읽기 IOPS는 16.5만 IOPS와 8.15만 IOPS로 거의 비슷한 수준을 보입니다. 쓰기는 예상 패턴을 따르며, 순차적 및 랜덤 액세스 패턴 모두에서 낮은 수준을 유지하지만 안정적으로 유지됩니다.

64K 이상으로 이동하면서 테스트는 순수 IOPS에서 대역폭에 더 의존적인 시나리오로 전환됩니다. IOPS는 백만 단위 초반에서 수십만 단위까지 떨어집니다. 블록 크기가 1M일 때 읽기 IOPS는 약 30만, 쓰기 IOPS는 약 17만 4천으로, 임의 작업은 동일한 영역에서 완료됩니다.

전반적으로 로컬 IOPS 결과는 전송량이 늘어나고 대역폭이 주요 요소가 됨에 따라 예측 가능한 확장을 통해 작은 블록에서 매우 높은 대기열 깊이의 작업 부하를 견딜 수 있는 시스템의 능력을 명확히 보여줍니다.

PEAK:AIO: Dell PowerEdge R7725xd가 이 워크로드에 적합한 이유

PEAK:AIO는 AI 학습, 추론 파이프라인, 금융 모델링, 실시간 분석 등 대용량 데이터 세트에 대한 매우 빠르고 낮은 지연 시간 액세스를 요구하는 환경을 위해 설계되었습니다. 이 플랫폼은 고밀도 NVMe 스토리지, 균형 잡힌 PCIe 대역폭, 그리고 규모에 따른 예측 가능한 지연 시간을 기반으로 작동합니다. 이러한 요구 사항을 충족하기 위해 기반 하드웨어는 동시에 발생하는 고부하에서도 일관되고 반복 가능한 성능을 유지하면서 지속적인 처리량을 제공해야 합니다.

Dell PowerEdge R7725xd는 바로 이 부분에서 PEAK:AIO와 자연스럽게 조화를 이룹니다. 이 시스템의 아키텍처는 PCIe Gen5 리소스를 극대화하도록 설계되어, 기존 RAID 컨트롤러에 의존하지 않고 전면에 장착된 24개의 U.2 NVMe 베이의 전체 대역폭을 CPU에 직접 제공합니다. 이러한 레이아웃은 PEAK:AIO가 최신 NVMe 기반 데이터 파이프라인에서 기대하는 병렬 처리 및 지연 시간 프로파일을 제공합니다. 시스템 구성은 NVMe SSD를 두 개의 RAID0 그룹으로 나눕니다.

Dell PowerEdge R7225xd가 꺼졌습니다

테스트 시나리오에서는 R7725xd에 연결된 두 개의 클라이언트 시스템을 사용했으며, 각 시스템에는 Broadcom BCM57608 2x 200G NIC가 장착되어 있었습니다. 이를 통해 각 클라이언트에 총 4개의 200G 업링크가 연결되어 R7725xd가 PEAK:AIO 구축 환경에서 실제 운영 환경과 유사한 고성능 구성을 구현할 수 있었습니다. 이러한 수준의 네트워크 대역폭 덕분에 NIC 계층에서 병목 현상 없이 NVMe 서브시스템, PCIe 토폴로지 및 CPU 상호 연결에 충분한 부하를 가할 수 있었습니다.

그 결과, PEAK:AIO 워크로드에 효과적으로 대응하는 플랫폼이 탄생했습니다. R7725xd는 고밀도 NVMe 용량, PCIe Gen5 처리량, 병렬 처리를 위한 듀얼 AMD EPYC 9005 프로세서, 그리고 클라이언트당 수백 기가비트의 속도로 다중 클라이언트 데이터 수집을 지원하는 네트워킹 기능을 제공합니다. 이러한 모든 특징은 PEAK:AIO의 성능 기대치를 달성하는 데 필수적인 요소입니다.

PEAK:AIO – NVMe-oF RDMA – 대역폭

PEAK:AIO가 적용된 PowerEdge R7725xd에서 NVMe-oF RDMA 대역폭 결과를 살펴보면, 전반적인 추세는 이 정도 PCIe 및 네트워크 대역폭을 갖춘 시스템에서 예상했던 바와 정확히 일치합니다. 블록 크기가 증가함에 따라 처리량이 급격히 증가하다가 플랫폼의 실제 한계점 근처에서 안정화됩니다.

작은 블록 크기에서는 읽기와 쓰기 모두 20GB/s 중반대에서 성능이 시작되는데, 이는 4K와 8K 전송이 처리량 경로보다 IOPS 경로를 훨씬 더 많이 압박하기 때문에 정상적인 현상입니다. 16K와 32K 블록에 도달하면 파이프라인이 활성화됩니다. 읽기는 32K에서 약 154GB/s로 급상승하고 160GB/s 범위까지 계속 상승하는데, 이는 4개의 200Gb/s 링크로 구성된 듀얼 클라이언트 구성에서 예상되는 수준입니다.

임의 읽기 성능은 순차 읽기 성능을 거의 완벽하게 반영합니다. PEAK:AIO는 명령 대기열을 효율적으로 유지하여 임의 읽기 대역폭이 순차 읽기 대역폭을 거의 따라가며, 32K에서 1M까지 약 159~161GB/s로 안정화됩니다. 이는 스토리지 스택이 혼합 액세스 패턴에서 병목 현상을 일으키지 않으며, R7725xd의 PCIe 토폴로지가 24개의 Gen5 NVMe 드라이브에 부하를 균등하게 분산하고 있음을 나타냅니다.

쓰기 성능은 비슷한 곡선을 따르지만, 읽기보다 약간 낮은 최고점을 보입니다. 순차 쓰기는 중간 크기 블록에서 140~148GB/s 범위를 유지하며, 128KB에서는 약 117GB/s로 떨어지지만 블록 크기가 증가함에 따라 회복됩니다. 임의 쓰기는 다르게 동작하며 110~117GB/s에 가까워지면서 평탄해지는데, 이는 추가적인 오버헤드를 유발하는 혼합 큐 워크로드에서 정상적인 현상입니다.

이 섹션의 핵심은 R7725xd가 여러 클라이언트가 시스템을 한계까지 구동하더라도 NVMe-oF 환경에서 매우 높은 대역폭을 유지하는 데 전혀 문제가 없다는 것입니다. 블록 크기가 32K 이상에 도달하면 서버는 사용 가능한 네트워크 및 스토리지 대역폭을 지속적으로 포화 상태로 만듭니다. 이는 PEAK:AIO가 구현하도록 설계된 바로 이러한 성능이며, 이러한 결과는 실제 환경에서 플랫폼의 확장 능력을 강력하게 검증합니다.

최고 AIO – NVMe-oF RDMA IOPS

IOPS 측면에서 PowerEdge R7725xd는 강력한 소규모 블록 성능을 보이지만, 초기에는 예상보다 낮은 수치를 보였습니다. 이 문제는 향후 네트워크 드라이버 지원 개선을 통해 해결될 것으로 예상됩니다. 이러한 개선에도 불구하고, 전체적인 확장 추세는 블록 크기가 증가할 때 NVMe-oF RDMA가 일반적으로 동작하는 방식과 정확히 일치합니다.

가장 작은 블록 크기에서도 시스템은 순차 및 랜덤 워크로드 모두에서 6만 IOPS 이상의 성능을 제공할 수 있습니다. 읽기, 쓰기, 랜덤 읽기 및 랜덤 쓰기는 모두 4K와 8K로 거의 동일한 범위에 있으며, 이는 프런트엔드 클라이언트, PCIe 인프라, 그리고 NVMe 드라이브 자체가 요청 속도를 따라잡는 데 아무런 문제가 없음을 나타냅니다.

블록 크기가 커짐에 따라 예상되는 IOPS 감소가 시작됩니다. 32K에서 읽기는 약 4.7만 IOPS에 도달하고, 쓰기는 약 4.4만 IOPS로 약간 뒤처집니다. 무작위 쓰기가 가장 큰 타격을 입어 약 3.3만 IOPS로 떨어지는데, 이는 혼합 액세스 패턴으로 인해 발생하는 추가 대기열 및 CPU 오버헤드와 일치합니다.

대형 블록으로 이동하면서 IOPS는 예측 가능한 선형 방식으로 계속 감소합니다. 256K 및 512K 전송에 도달하면 처리량이 주요 지표가 되고 IOPS는 자연스럽게 수십만 대 중반으로 떨어집니다. 1M 블록 크기에서는 모든 워크로드가 140K~153K IOPS로 수렴하며, 이는 이전 섹션에서 살펴본 대역폭 수치와 일치합니다.

GPUDirect 스토리지 성능

R7725xd에서 수행한 테스트 중 하나는 Magnum IO GPUDirect Storage(GDS) 테스트였습니다. GDS는 NVIDIA에서 개발한 기능으로, GPU가 NVMe 드라이브나 기타 고속 저장 장치에 저장된 데이터에 액세스할 때 CPU를 거치지 않고 바로 사용할 수 있도록 합니다. GDS는 CPU와 시스템 메모리를 통해 데이터를 라우팅하는 대신, GPU와 저장 장치 간의 직접 통신을 지원하여 지연 시간을 크게 줄이고 데이터 처리량을 향상시킵니다.

GPUDirect 스토리지 작동 방식

전통적으로 GPU가 NVMe 드라이브에 저장된 데이터를 처리할 때, 데이터는 GPU에 도달하기 전에 먼저 CPU와 시스템 메모리를 거쳐야 합니다. 이 과정에서 CPU가 중개 역할을 하게 되어 병목 현상이 발생하고, 지연 시간이 늘어나고 귀중한 시스템 리소스가 소모됩니다. GPUDirect Storage는 GPU가 PCIe 버스를 통해 저장 장치의 데이터에 직접 액세스할 수 있도록 하여 이러한 비효율성을 제거합니다. 이러한 직접 경로는 데이터 이동 오버헤드를 줄여 더 빠르고 효율적인 데이터 전송을 가능하게 합니다.

AI 워크로드, 특히 딥러닝 관련 워크로드는 매우 데이터 집약적입니다. 대규모 신경망을 학습하려면 테라바이트급의 데이터를 처리해야 하며, 데이터 전송 지연은 GPU 활용도 저하 및 학습 시간 증가로 이어질 수 있습니다. GPUDirect Storage는 데이터가 GPU에 최대한 빠르게 전달되도록 보장하여 유휴 시간을 최소화하고 연산 효율성을 극대화함으로써 이러한 문제를 해결합니다.

또한 GDS는 비디오 처리, 자연어 처리 또는 실시간 추론과 같이 대용량 데이터 세트를 스트리밍하는 작업 부하에 특히 유용합니다. GDS는 CPU에 대한 의존도를 줄임으로써 데이터 이동을 가속화하고 다른 작업을 위한 CPU 리소스를 확보하여 전반적인 시스템 성능을 더욱 향상시킵니다.

GPUDirect는 원시 대역폭 외에도 NVMe-oF(TCP/RDMA)를 지원하여 초저지연 I/O를 제공합니다. 이를 통해 GPU가 데이터 부족 현상을 겪지 않도록 보장하여 실시간 AI 추론, 분석 파이프라인, 비디오 재생에 이상적인 시스템입니다.

GDSIO 순차 읽기

GDSIO를 사용하는 단일 클라이언트로 PEAK:AIO를 검토할 때, 블록 크기와 스레드 수가 증가함에 따라 읽기 처리량이 뚜렷하게 증가하는 패턴을 보입니다. 이 단일 클라이언트는 두 개의 400G 링크를 통해 연결되어 있어 총 처리량이 90GB/s로 제한되었습니다.

가장 작은 블록 크기와 적은 스레드 수에서는 성능이 그다지 좋지 않으며, 단일 스레드에서 4K 읽기는 약 189MiB/s로 시작합니다. 스레드 병렬 처리를 늘리자마자 시스템은 즉시 응답하여 4개 스레드에서 691MiB/s를 기록하고, 더 큰 블록으로 이동하면서 수 GiB/s 범위로 진입합니다.

중간 범위의 블록 크기는 스레드 수에 가장 큰 민감도를 보입니다. 32K에서 처리량은 단일 스레드에서 1.3GiB/s에서 64개 스레드에서는 거의 20GiB/s로 증가하며, 그 이상에서는 약간만 감소합니다. 64K와 128K에서도 유사한 패턴이 나타나는데, 낮은 병렬 처리에서는 한 자릿수 이하의 GiB/s에서 워크로드가 확장됨에 따라 30GiB/s 이상으로 전환됩니다.

더 큰 블록 크기에 도달하면, 시스템이 단일 클라이언트에 대한 성능 한계에 도달함에 따라 처리량이 평준화되기 시작합니다. 1MiB에서는 성능이 단일 스레드에서 11GiB/s에서 높은 스레드 수에서는 약 88GiB/s로 상승합니다. 5MiB와 10MiB 전송은 테스트가 64, 128 또는 256 스레드에서 실행되는지 여부와 관계없이 약 89~90GiB/s에서 정점을 찍는 동일한 안정세를 보입니다.

GDSIO 순차 쓰기

쓰기 측면에서 확장 동작은 읽기와 유사한 패턴을 따르지만, 대부분의 블록 크기에서 성능이 약간 낮습니다. 이는 순차 쓰기 워크로드에서 예상되는 결과입니다. 가장 작은 블록 크기에서 처리량은 4K 단일 스레드의 경우 165MiB/s에서 시작하여 병렬 처리량이 증가함에 따라 꾸준히 증가합니다. 스레드가 4개일 때는 619MiB/s를 약간 넘는 수준으로 증가한 후, 스레드가 8개일 때는 1GiB/s를 넘어섭니다.

중간 범위 블록 크기는 스레드 수가 증가함에 따라 더 큰 성능 향상을 보입니다. 32K에서 처리량은 1GiB/s 미만에서 시작하여 스레드 수가 증가함에 따라 21GiB/s 이상으로 확장됩니다. 64K 및 128K 범위에서도 이러한 추세가 지속되어, 워크로드가 병렬화됨에 따라 한 자릿수 초반의 GiB/s에서 30GiB/s 중반 및 50GiB/s로 증가합니다.

더 큰 전송은 시스템이 자연스러운 쓰기 처리량 한계에 도달했을 때 발생합니다. 1MiB에서 성능은 단일 스레드에서 13.3GiB/s에서 높은 스레드 수에서는 90GiB/s 미만으로 상승합니다. 5MiB 및 10MiB 테스트도 유사한 패턴을 보이며, 시스템 스레드 수(64, 128 또는 256)에 관계없이 결과는 약 90GiB/s에 도달합니다.

Gen5 시대의 성능 재정의

Dell PowerEdge R7725xd는 단순한 스토리지 서버가 아닙니다. 랙 내부에서 대역폭이 전달되는 방식의 변화를 의미합니다. PCIe 스위치를 제거하고 모든 NVMe 드라이브에 CPU로 직접 연결되는 경로를 제공함으로써 Dell은 처리량을 원활하게 확장하고, 발열량을 예측 가능하게 유지하며, 동시성을 과제가 아닌 자산으로 만드는 시스템을 구축했습니다.

마이크론의 9550 PRO SSD와 PEAK:AIO의 병렬 I/O 소프트웨어와 함께 사용하면 R7725xd는 고밀도 NVMe 섀시에서 진정한 데이터 엔진으로 탈바꿈합니다. 로컬 PCIe 패브릭을 포화 상태로 만들고, RDMA를 통해 GPU에 회선 속도로 데이터를 전송하며, 2U 크기 내에서 컴퓨팅과 스토리지 역할을 동시에 수행할 수 있습니다.

Dell PowerEdge R7225xd 히어로

델 파워에지 R7225xd

실제로 이 구성은 로컬 처리량 300GB/s 이상, 네트워크 처리량 160GB/s 이상을 제공하여 복잡성과 비용의 극히 일부만으로 다중 노드 스토리지 클러스터에 필적하는 성능을 제공합니다. 이는 실리콘부터 소프트웨어까지 스택의 모든 계층이 효율성과 지속적인 대역폭을 중심으로 구성될 때 어떤 결과가 발생하는지 보여주는 사례입니다.

R7725xd는 Gen5 시대의 단일 노드 스토리지 성능에 대한 새로운 기준을 제시합니다. 차세대 AI 파이프라인, 고속 분석 또는 체크포인트 중심의 학습 환경을 구축하는 조직에게, 이 제품은 병목 현상을 시스템 자체에서 완전히 제거했을 때 어떤 결과가 나올지 보여주는 예시입니다.

R7725xd 제품 페이지

이 보고서는 Dell Technologies의 후원을 받았습니다. 이 보고서에 표현된 모든 견해와 의견은 고려 중인 제품에 대한 우리의 공정한 견해를 기반으로 합니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

케빈 오브라이언

StorageReview Lab 내부에서 제품을 평가하고 업계 리더와 협력하여 새로운 테스트 환경을 개발합니다. 집에서 나는 가족을 부양하고 있습니다.