HPE는 대규모 AI의 성능 밀도, 효율성 및 운영 요구를 충족하도록 설계된 HPE Cray 슈퍼컴퓨팅 솔루션의 확장된 세대를 출시했습니다. 이 포트폴리오는 멀티벤더, 멀티워크로드 블레이드 아키텍처, 통합 시스템 관리 소프트웨어, 고성능 상호 연결 패브릭을 중심으로 연구 기관, 정부 기관 및 대기업을 대상으로 AI의 탐색, 시뮬레이션 및 프로덕션을 가속화하는 통합 플랫폼을 구축합니다.
AI와 HPC 아키텍처의 결합
HPE의 최신 Cray 플랫폼은 HPC와 AI를 통합 아키텍처로 통합하여 대규모 확정적 성능을 제공하고 기업 IT 부서에서 기대하는 운영 제어 기능을 제공합니다. HPE HPC 및 AI 인프라 솔루션 부문 수석 부사장 겸 총괄 매니저인 트리시 댐크로거(Trish Damkroger)는 이 플랫폼을 발표하면서 AI와 HPC 아키텍처를 결합하는 것이 성능 밀도를 높이고 새로운 차원의 과학 및 기술 발전을 이루는 데 필수적이라고 강조했습니다. 요약하자면, HPE의 입장은 명확합니다. AI와 슈퍼컴퓨팅은 융합되고 있으며, HPE는 연구와 실제 결과를 모두 발전시키는 통합 시스템을 통해 시장을 선도하고자 합니다.
이번 확장은 지난달 출시된 HPE Cray 슈퍼컴퓨팅 GX5000을 기반으로 합니다. 이 제품은 통합 AI+HPC 시대에 맞춰 특별히 설계되었으며, 이제 HPE Cray 슈퍼컴퓨팅 스토리지 시스템 K3000으로 더욱 강화되었습니다. K3000은 I/O 집약적인 AI 및 시뮬레이션 워크로드의 성능을 유지하도록 설계된 임베디드 DAOS(Distributed Asynchronous Object Storage) 오픈소스 소프트웨어가 탑재된 최초의 공장 생산 스토리지 시스템으로 주목을 받고 있습니다.
주요 연구 센터 전반의 신속한 채택
이 플랫폼의 초기 도입 사례로는 슈투트가르트 대학교 고성능 컴퓨팅 센터(HLRS)와 바이에른 과학인문 아카데미의 라이프니츠 슈퍼컴퓨팅 센터(LRZ)가 있습니다. HLRS의 Herder와 LRZ의 Blue Lion이라는 차세대 시스템은 HPE Cray Supercomputing GX5000을 활용할 예정입니다. 이러한 구축 사례들을 종합적으로 고려할 때, 프로덕션급 HPC 엄격성을 바탕으로 AI 기반 탐색을 확장하고자 하는 유럽 1등급 HPC 사이트들의 추진력을 확인할 수 있습니다.
새로운 직접 액체 냉각, 다중 공급업체 컴퓨팅 블레이드
HPE는 워크로드 프로필, 예산 및 시설 제약에 맞춰 HPE Cray GX5000 랙에 혼합하여 사용할 수 있는 세 가지 새로운 컴퓨팅 블레이드를 출시합니다. 모든 블레이드는 직접 액체 냉각 방식을 채택하고, 노드 로컬 가속을 위해 두 개의 온보드 NVMe SSD를 제공하며, 높은 처리량과 낮은 지연 시간의 패브릭 연결을 위해 4개 또는 8개의 HPE Slingshot 400Gbps 엔드포인트를 통합합니다. 지원되는 프로세서는 NVIDIA Rubin, AMD Instinct MI430X 등 주요 GPU와 AMD EPYC "Venice" CPU를 포함하여 워크로드 특성에 맞춰 컴퓨팅 성능을 정밀하게 조정할 수 있습니다.
- HPE Cray 슈퍼컴퓨팅 GX440n 가속 블레이드: 범용 AI-HPC 엔진으로 설계된 이 블레이드는 NVIDIA Vera CPU 4개와 NVIDIA Rubin GPU 8개를 결합합니다. 랙당 최대 24개의 블레이드를 장착할 수 있으며, 랙당 최대 192개의 GPU까지 확장하여 대규모 AI 학습, 다중 노드 추론 및 가속화된 시뮬레이션 워크플로우를 지원합니다.
- HPE Cray 슈퍼컴퓨팅 GX350a 가속 블레이드: 혼합 정밀도 컴퓨팅에 최적화된 GX350a는 AMD EPYC SP7 600W "Venice" CPU(최대 256코어) 1개와 MI400 시리즈의 AMD Instinct MI430X GPU 4개를 결합했습니다. 이러한 조합은 강력한 FP16/BF16 성능을 통해 AI 학습 및 HPC 가속을 목표로 하는 동시에, 시뮬레이션 단계에서 배정밀도 기능을 유지합니다. 랙당 최대 28개의 블레이드로 최대 112개의 AMD MI430X GPU를 구현할 수 있습니다.
- HPE Cray 슈퍼컴퓨팅 GX250 컴퓨팅 블레이드: CPU 전용 배정밀도 고부하 워크로드(예: CFD, 기상 및 기존 시뮬레이션)를 위해 설계된 GX250은 블레이드당 최대 256개의 코어를 가진 AMD EPYC "Venice" CPU 8개를 통합합니다. 랙당 최대 40개의 블레이드를 지원하므로 예측 가능한 확장 동작으로 대규모 MPI 작업을 통합하는 시설에 적합합니다.
이러한 블레이드를 유연하게 랙 수준에서 혼합하면 전력, 냉각 또는 상호 연결 리소스를 낭비하지 않고도 GPU 집약형 AI 교육 아일랜드에서 CPU 중심 시뮬레이션 풀에 이르기까지 맞춤형 시스템 설계가 가능합니다.
통합된 멀티 테넌트 시스템 관리
HPE 슈퍼컴퓨팅 관리 소프트웨어는 베어 메탈, 가상화 및 컨테이너 환경에서 엔터프라이즈급 멀티 테넌시와 보안을 제공합니다. 운영자에게 사용자, 프로젝트 및 워크로드에 대한 강력한 격리 제어 기능을 제공하는 동시에 활용도를 극대화하는 것이 목표입니다. 전력 및 에너지 관리는 최고의 기능을 제공합니다. 이 소프트웨어는 실시간 및 과거 원격 분석, 비용 예측, 그리고 전력 기반 스케줄링 후크 기능을 제공하여 기업이 에너지 효율을 최적화하고 비용을 예측할 수 있도록 지원합니다.
운영 범위는 프로비저닝, 모니터링, 전력/냉각 관리, 탄력적인 확장을 포함한 전체 시스템 수명 주기에 걸쳐 있으며, 향상된 보안 제어 및 보고 기능을 제공합니다. 기술 운영팀에게는 높은 활용도의 혼합형 AI 및 HPC 환경을 위해 설계된 단일 제어 평면이 제공됩니다.
GX5000 기반 시스템용 HPE Slingshot 400
이제 HPE Cray Supercomputing GX5000 클러스터에서 사용 가능한 HPE Slingshot 400은 AI와 HPC가 복합적으로 작동하는 환경에서 고밀도 구축과 지속적인 처리량을 위해 고안된 직접 수냉식 스위치 블레이드 아키텍처를 통해 상호 연결 패브릭을 더욱 강화합니다. 각 스위치 블레이드는 400Gbps의 64개 포트를 제공하며, 섀시 수준 구성은 다음을 지원합니다.
- 512개 포트를 갖춘 8개 스위치
- 1,024개 포트를 갖춘 16개 스위치
- 2,048개 포트를 갖춘 32개 스위치
작년에 처음 발표된 Slingshot 400은 GX5000의 고성능 토폴로지를 활용하여 지연 시간 단축, 지속 대역폭 향상, 안정성 향상을 달성하는 동시에 비용 관리도 유지하도록 설계되었습니다. 멀티 테넌트 환경 및 혼합 워크플로우 환경에서 이 두 가지 솔루션의 조합은 규모에 상관없이 예측 가능한 성능을 제공합니다.
I/O 바운드 AI를 가속화하는 DAOS 지원 스토리지
HPE Cray 슈퍼컴퓨팅 스토리지 시스템 K3000은 내장 DAOS가 탑재된 HPE ProLiant Compute DL360 Gen12 서버를 활용하여 I/O 중심의 AI 파이프라인 및 시뮬레이션 체크포인트에 필수적인 저지연 객체 액세스, 높은 병렬 처리, 그리고 선형 확장을 우선시합니다. 이 플랫폼은 스토리지 노드당 컴퓨팅 성능과 메모리 및 NVMe 집적도 간의 균형을 유지하여 GPU와 CPU가 동시 액세스 패턴에 맞춰 원활하게 작동하도록 합니다.
구성 가능한 옵션을 사용하면 성능이나 용량을 조정할 수 있습니다.
- 8, 12 또는 16개의 NVMe 드라이브를 갖춘 성능 최적화된 DAOS 스토리지 서버
- 20개의 NVMe 드라이브를 갖춘 용량 최적화된 DAOS 스토리지 서버
- NVMe 드라이브 크기: 3.84TB, 7.68TB 또는 15.36TB
- DRAM 옵션: 512GB, 1,024GB 또는 2,048GB, 드라이브 수 및 작업 프로필에 맞춰 조정됨
상호 연결 선택은 이기종 데이터 센터 네트워크와 워크플로 요구 사항을 반영합니다.
- HPE 슬링샷 200
- HPE 슬링샷 400
- 인피니밴드 NDR
- 400 기가비트 이더넷
HPE는 DAOS를 공장 통합형 공급업체 지원 시스템으로 도입하여 배포 일정을 단축하고, 통합 복잡성을 줄이며, 데이터 집약적 AI와 HPC의 지속적인 성능을 향상시키는 것을 목표로 합니다.
이용 가능 여부 (Availability)
- HPE ProLiant 컴퓨팅 서버가 탑재된 HPE Cray 슈퍼컴퓨팅 스토리지 시스템 K3000: 2026년 초
- HPE Cray Supercomputing GX440n 가속 블레이드, GX250 컴퓨팅 블레이드 및 GX350a 가속 블레이드: 2027년 초
- HPE 슈퍼컴퓨팅 관리 소프트웨어: 2027년 초
- GX5000 기반 시스템용 HPE Slingshot 400: 2027년 초
HPE의 차세대 Cray 포트폴리오는 기존 AI/HPC 사일로를 붕괴하고, 랙당 더 높은 성능 밀도를 제공하며, 공통의 고효율 플랫폼에서 시뮬레이션과 AI 학습/추론을 모두 확장하는 기관의 운영을 간소화하도록 설계되었습니다.




아마존