Supermicro는 NVIDIA Vera Rubin NVL4 플랫폼을 기반으로 하는 새로운 HPC용 데이터 센터 빌딩 블록 솔루션(DCBBS) 청사진을 발표했습니다. 이번 발표는 Supermicro의 DCBBS 아키텍처 전략을 기업 AI 구축을 넘어 과학 컴퓨팅 환경까지 확장하여 대규모 HPC 및 AI 인프라 구축을 위한 참조 프레임워크를 제공합니다.
이번 새로운 설계는 올해 초 공개된 NVIDIA Vera Rubin NVL72 및 NVIDIA HGX Rubin NVL8 DCBBS 설계를 기반으로 하며, 연구 기관, 국립 연구소 및 슈퍼컴퓨팅 센터에 동일한 통합 접근 방식을 적용합니다. Supermicro의 DCBBS 프레임워크는 컴퓨팅, 네트워킹, 액체 냉각, 전력 분배 및 시설 인프라를 사전 설계된 배포 모델로 결합하여 구현 복잡성을 줄이고 클러스터 배포 속도를 높입니다.
슈퍼마이크로의 사장 겸 CEO인 찰스 리앙은 인공지능(AI)이 현대 과학 연구의 핵심 요소가 되고 있다고 말했습니다. 그는 첨단 인프라를 신속하게 구축할 수 있는 기업이 미래의 발견을 주도할 것이라고 강조했습니다. 또한, 대규모 액체 냉각 GPU 클러스터 구축 경험이 새로운 청사진의 핵심 요소라고 언급했습니다.
통합 HPC 및 AI 워크로드에 맞게 설계되었습니다.
이 청사진은 전통적인 고성능 컴퓨팅(HPC) 시뮬레이션과 인공지능(AI) 가속 컴퓨팅의 융합이 점차 확대되는 추세를 기반으로 합니다. 연구 기관들은 기후 모델링, 신약 개발, 재료 과학, 에너지 연구 등 다양한 분야에서 개발 주기를 단축하고 과학적 발견을 가속화하기 위해 배정밀도 시뮬레이션 워크로드와 머신러닝 및 AI 모델을 점점 더 많이 결합하고 있습니다.
슈퍼마이크로는 NVIDIA Vera Rubin NVL4 플랫폼을 대규모 GPU 가속과 CPU 리소스, 고성능 네트워킹을 결합한 하이브리드 워크로드의 기반으로 제시합니다. 회사는 자사의 구축 방식이 100,000만 개 이상의 GPU를 탑재한 액체 냉각식 슈퍼컴퓨팅 클러스터 구축 경험을 바탕으로 한다고 밝혔습니다.
엔드투엔드 배포 방법론
DCBBS 청사진은 Supermicro가 대규모 액체 냉각 인프라 프로젝트에 사용하는 구축 프로세스를 설명합니다.
프로젝트는 현장 시설 평가로 시작되며, 이 평가에는 하역장 접근성, 데이터 센터 규모, 바닥 하중 용량, 기존 전력 및 냉각 인프라 등이 포함됩니다. 이렇게 얻은 데이터를 바탕으로 현장 맞춤형 구축 계획을 수립합니다.
시스템 통합은 출하 전에 Supermicro 제조 시설에서 수행되며, 여기에는 랙 조립, 케이블 연결, 시스템 레벨(L10) 및 클러스터 레벨(L11) 검증 테스트가 포함됩니다. 제품 배송 후에는 랙 설치, 네트워크 통합, 전원 및 냉각 연결, 시운전 및 작동 검증을 포함한 배포 서비스가 제공됩니다.
Supermicro는 중요한 연구 및 생산 환경을 위해 현장 대응 옵션을 포함한 지속적인 지원 서비스도 제공합니다.
베라 루빈 NVL4 확장 가능 유닛 아키텍처
이 설계는 반복 가능한 NVIDIA Vera Rubin NVL4 확장형 유닛을 중심으로 구성되어 있으며, 이를 복제하여 약 3.2MW 규모의 클러스터부터 기가와트급 시설에 이르는 다양한 규모의 시설을 구축할 수 있습니다.
확장 가능한 각 장치는 맞춤형 52U 인클로저를 사용하는 8개의 액체 냉각 컴퓨팅 랙으로 구성됩니다. 이 구성은 최대 1,152개의 NVIDIA Rubin GPU 와 576개의 NVIDIA Vera CPU를 통합하여 288개의 NVIDIA Vera Rubin NVL4 노드를 지원합니다. 개별 랙은 362kW의 전력 소비량 범위 내에서 작동합니다.
냉각은 Supermicro의 DLC-2 직접 액체 냉각 아키텍처를 통해 제공됩니다. 확장 가능한 각 장치는 최대 1.8MW 정격의 냉각 분배 장치 3개가 직렬로 연결되어 있으며, 2+1 이중화 구성을 갖추고 있습니다. 냉각 설계에는 칩에 직접 연결되는 콜드 플레이트, 수직 냉각수 분배 매니폴드 및 Supermicro의 PG25-A 냉각수가 사용됩니다.
네트워킹은 NVIDIA Quantum-X800 InfiniBand 인프라를 기반으로 하며, 분산형 HPC 및 AI 워크로드에 필요한 저지연, 고대역폭 상호 연결을 제공합니다. 액체 냉각 방식의 네트워킹 구성도 사용할 수 있습니다.
전력 공급은 컴퓨팅 랙당 8개의 72kW 파워 셸프에서 처리하며, 랙 상단의 두 개의 관리 스위치는 대역 외 모니터링 및 제어를 제공합니다.
GB200 NVL4 구축을 위한 즉시 사용 가능
Supermicro는 Vera Rubin 기반 아키텍처 외에도 NVIDIA GB200 NVL4 기반 구성도 단기 구축 옵션을 원하는 기업을 위해 즉시 이용 가능하다고 밝혔습니다.
이번 발표는 컴퓨팅, 네트워킹, 전력, 냉각 및 관리를 사전 검증된 배포 모델로 통합하는 랙 규모 인프라 설계로의 지속적인 업계 변화를 반영합니다. AI 및 HPC 워크로드가 계속해서 융합됨에 따라, 벤더들은 더 높은 랙 밀도와 액체 냉각 환경을 지원하면서 배포 복잡성을 줄이는 데 더욱 집중하고 있습니다.




아마존