StorageReview.com

Andromeda는 WEKA NeuralMesh에서 50개 이상의 GPU 공급업체에 걸쳐 스토리지 표준화를 구현합니다.

기업  ◇  엔터프라이즈 스토리지

WEKA는 개방형 공급업체 시장에서 AI 팀과 고성능 컴퓨팅을 연결하는 플랫폼인 Andromeda에 WEKA NeuralMesh를 관리형 GPU 클러스터의 핵심 데이터 스토리지 계층으로 통합한다고 발표했습니다. Andromeda 고객은 전용 NeuralMesh 배포 또는 GPU 네이티브 NeuralMesh Axon 구성 중에서 선택할 수 있으며, 이를 통해 모든 하이퍼스케일러 또는 AI 클라우드에서 실행되는 모든 클러스터에서 일관된 스토리지 성능을 누릴 수 있습니다.

안드로메다는 전 세계 50개 이상의 컴퓨팅 제공업체에서 운영되며, 관리형 클러스터로 구성된 확장된 네트워크를 통해 학습 및 추론 워크로드를 처리합니다. 100개 이상의 AI 고객사를 대상으로 수십억 GPU 시간을 지원하고 있다고 밝혔습니다. 플랫폼의 모든 클러스터는 인프라 운영 주체와 관계없이 동일한 품질 기준을 충족해야 하며, 안드로메다는 고객에게 제공되기 전에 GPU, 스토리지, 네트워크 패브릭 및 보안 전반에 걸쳐 각 클러스터를 인증합니다. 이러한 표준으로 인해 문제가 드러났습니다. 각 제공업체가 자체 스토리지 환경을 구축하면서 클러스터 간 성능이 편차를 보였던 것입니다.

WEKA NeuralMesh Observe 대시보드는 AWS, OCI 및 온프레미스 환경에 걸쳐 있는 4개의 클러스터를 용량, 처리량, IOPS 및 지연 시간 패널과 함께 보여줍니다.

NeuralMesh는 데이터 계층을 표준화하는 것을 목표로 합니다. Andromeda의 경우, 이 플랫폼은 각 클라우드 또는 데이터 센터의 자체 공유 스토리지 구현에 의존하는 대신 하드웨어 공급업체 전반에 걸쳐 일관되게 구성되는 배포 가능한 스토리지 아키텍처를 제공합니다.

안드로메다의 CEO인 윌 무셰이는 “우리의 목표는 컴퓨팅 자원의 글로벌 흐름을 가능하게 하는 것이며, 이를 위해서는 자원 공급처와 관계없이 우리가 제공하는 모든 클러스터가 최고의 성능을 발휘해야 합니다.”라고 말했습니다. “WEKA NeuralMesh를 표준으로 채택함으로써 고객은 스토리지 및 메모리 계층에서 하이퍼스케일러급의 일관성을 확보하는 동시에 개방형 시장의 유연성을 누릴 수 있게 되었습니다. 성능의 승패가 결정되는 이 영역에서 유휴 GPU는 AI 혁신의 속도를 저해합니다. WEKA는 우리가 관리하는 모든 GPU가 제 역할을 다하도록 보장하는 데 도움을 줍니다.”

NeuralMesh Axon을 사용한 GPU 네이티브 스토리지

NeuralMesh Axon은 NeuralMesh 소프트웨어 플랫폼의 GPU 네이티브 배포판입니다. 스토리지를 Andromeda의 GPU 서버에 직접 통합하여 각 클러스터의 기존 NVMe를 학습 및 추론에 필요한 통합 데이터 레이어로 변환합니다. 이러한 방식은 경제적인 측면에서 유리합니다. 하드웨어는 이미 설치되어 있고, 전원이 공급되며, 비용도 지불된 상태이므로 추가적인 공간, 전력 소모 또는 비용 증가 없이 성능을 향상시킬 수 있습니다. WEKA는 한 연구소에서 클러스터의 스토리지 용량 부족으로 인해 워크로드 처리에 병목 현상이 발생한 사례를 제시하며, Andromeda가 추가 인프라를 구축하는 대신 기존 하드웨어에 Axon을 배포했다고 설명합니다.

Andromeda는 NeuralMesh Kubernetes Operator를 사용하여 클러스터 배포 및 수명 주기 관리를 자동화합니다. 이 회사에 따르면 새로운 NeuralMesh Axon 클러스터는 베어메탈 환경에서 약 10분 만에 배포할 수 있습니다. NeuralMesh 배포의 약 절반은 Axon 구성을 사용하며, 나머지는 GPU 컴퓨팅 및 메모리 리소스 전용이 필요한 고객을 위한 배포입니다.

"안드로메다의 첫 번째 WEKA NeuralMesh Axon 구축은 베어메탈 환경에서 단 10분 만에 완료되었습니다. 이것이 우리의 청사진이 되었죠."라고 안드로메다의 수석 아키텍트인 비슈바짓 케르(Vishvajit Kher)는 말했습니다. "클라우드 제공업체가 공유 스토리지를 제공하지 않더라도 더 이상 제약받지 않습니다. WEKA NeuralMesh를 구축하면 뛰어난 성능을 보장받을 수 있습니다. 모든 기능을 갖춘 시스템이지만 시장 대안보다 최대 90% 저렴하여 규모가 커질수록 비용 절감 효과도 극대화됩니다."

Slurm 로그인, 컨트롤러 및 컴퓨팅 노드와 전용 WEKA 백엔드 서버를 보여주는 WEKA NeuralMesh 아키텍처 다이어그램

이 배포 모델을 통해 Andromeda는 클라우드 제공업체가 공유 스토리지를 제공하지 않는 환경에서도 관리형 GPU 클러스터를 구축할 수 있습니다. 이는 운영 요구 사항을 충족하는 제공업체 인프라의 범위를 넓혀줍니다.

보고된 생산 결과

Andromeda는 NeuralMesh Axon 클러스터가 클러스터당 400GB/s 이상의 총 처리량을 유지하고 프로덕션 환경에서 6백만 IOPS를 초과한다고 보고했습니다. 디렉터리당 약 10억 개의 파일로 구성된 메타데이터 집약적인 데이터 세트를 사용하는 한 생명공학 워크로드에서 이 플랫폼은 데이터 전송 시간을 몇 시간에서 몇 분으로 단축했습니다.

또한 이 회사는 자사의 관리형 클러스터를 사용하는 AI 팀이 환경 시작 시간을 약 3분에서 30초로 단축했다고 밝혔습니다. 환경 초기화 속도가 빨라지면 개발 주기 동안 팀이 실행할 수 있는 학습, 테스트 및 추론 반복 횟수가 늘어날 수 있습니다.

NeuralMesh는 클러스터 전체에 걸쳐 국부적인 장애가 연쇄적으로 확산되는 것을 방지하기 위한 장애 격리 기능을 포함합니다. 다중 테넌트 GPU 환경을 운영하는 공급업체의 경우, 이 기능은 워크로드 가용성을 유지하는 동시에 인프라 장애로 인한 운영상의 영향을 줄이는 데 도움이 됩니다.

글로벌 AI 컴퓨팅 네트워크 전반으로 확장

WEKA 배포는 전용 스토리지 구성 및 GPU 네이티브 Axon 시스템을 포함하여 Andromeda의 글로벌 인프라 전반으로 확장되고 있습니다. 또한 양사는 Andromeda가 용량과 공급자 범위를 확대함에 따라 차세대 AI 인프라로 통합을 확장할 계획입니다.

관리형 GPU 제공업체에게 이번 배포는 휴대 가능한 AI 데이터 플랫폼 에 대한 필요성이 점점 커지고 있음을 보여줍니다 . 스토리지 및 메타데이터 동작 방식이 제공업체마다 다를 경우 GPU 용량만으로는 예측 가능한 AI 성능을 보장할 수 없습니다. 스토리지 계층을 표준화하면 이기종 GPU 클러스터로 구성된 분산 환경에서 처리량, IOPS 및 운영 워크플로를 유지하는 데 도움이 됩니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

해롤드 프리츠

저는 IBM이 Selectric을 만든 이후로 기술 산업에 종사해 왔습니다. 하지만 내 배경은 글쓰기입니다. 그래서 저는 프리세일즈 사업에서 벗어나 제 뿌리로 돌아가서 약간의 글을 쓰지만 여전히 기술 분야에 참여하기로 결정했습니다.