StorageReview.com

Qumulo와 Cisco는 업데이트된 클라우드 AI 가속기를 통해 GPU 유동성을 강조합니다.

클라우드  ◇  기업

쿠물로는 기업 AI 인프라의 효율성을 향상시키기 위해 데이터 이동 병목 현상을 없애도록 설계된 새로운 아키텍처인 클라우드 AI 가속기를 발표했습니다. 이 플랫폼은 복제나 스테이징 없이도 여러 지역, 클라우드 및 하이브리드 환경에 분산된 데이터 세트를 GPU 리소스에 실시간으로 제공합니다.

이번 릴리스는 기업 AI 인프라의 비효율성을 해결하기 위한 것으로 잘 알려져 있습니다. Qumulo는 Cast AI의 2026년 Kubernetes 최적화 현황 보고서를 인용하며, 기업의 평균 GPU 활용률이 약 5%에 불과하고, 나머지 95%의 가속 컴퓨팅 자원은 워크로드가 시작되기 전에 데이터를 준비하고 복제하고 제 위치로 이동해야 하므로 유휴 상태로 남아 있다고 지적했습니다. Qumulo의 CEO인 Doug Gourlay는 발표에서 이 문제를 다음과 같이 설명했습니다. "우리가 이야기하는 모든 기업은 GPU 가용성에 집중하고 있지만, 가용성은 문제의 절반에 불과합니다. 더 근본적인 문제는 활용률이며, 그 원인은 데이터 중력에 있습니다."

AI 워크로드에 대한 데이터 배치 방식 재고

기존의 AI 인프라 구축 방식은 스토리지와 GPU 클러스터를 같은 위치에 배치하는 것으로, 고성능 플래시 시스템을 컴퓨팅 환경에 긴밀하게 연결하는 경우가 많습니다. 이러한 방식은 학습이나 추론이 활발하게 진행되는 동안에는 효과적이지만, 데이터 준비로 인한 유휴 시간에는 제대로 작동하지 않습니다. 또한, 기업들이 컴퓨팅 환경 가까이에 데이터셋을 보관하기 위해 여러 환경에 데이터셋을 복제하면서 스토리지가 파편화되는 문제점도 발생합니다.

쿠물로의 접근 방식은 데이터 위치와 컴퓨팅 위치를 분리함으로써 모델을 전환합니다. 데이터를 GPU로 이동하는 대신, 클라우드 AI 가속기는 GPU가 데이터에 직접 접근할 수 있도록 합니다. 이는 물리적 위치에 관계없이 데이터 세트에 일관되고 실시간으로 접근할 수 있도록 하는 분산 데이터 패브릭을 통해 구현됩니다.

쿠물로 클라우드 데이터 플랫폼 그래픽

이 회사는 이러한 기능을 "GPU 유동성"이라고 설명하며, 데이터의 지역적 제약 조건이 아닌 사용 가능한 컴퓨팅 용량을 기반으로 워크로드를 스케줄링할 수 있도록 한다고 밝혔습니다. 실제로 이는 기업이 데이터를 미리 배치하지 않고도 여러 클라우드 또는 지역에 걸쳐 GPU 리소스를 활용할 수 있도록 해줍니다.

아키텍처: 데이터 패브릭 및 캐싱 계층

Cloud AI Accelerator는 이전에 개별적으로 출시되었던 세 가지 Qumulo 제품을 통합한 제품입니다. Cloud Native Qumulo(CNQ)는 AWS, Azure, Google Cloud 및 Oracle Cloud Infrastructure에서 기본적으로 실행되는 Qumulo의 파일 시스템입니다. 2025년 2월에 출시된 Cloud Data Fabric(CDF)은 엣지에서 일관성 있는 캐시를 제공하는 중앙 파일 및 객체 저장소입니다. 2025년 4월에 CDF에 추가된 NeuralCache는 머신 러닝을 적용하여 예측 읽기 및 쓰기 캐싱을 수행하며, Qumulo는 이를 통해 GPU 데이터 로드 시간을 최대 64%까지 단축한다고 주장합니다. Cloud AI Accelerator 자체는 2025년 11월에 처음 출시되었으며, 5월 26일 릴리스에서는 Microsoft AI Foundry, AWS Bedrock 및 Google Vertex AI와의 직접 연결이 추가되었고, "GPU 유동성"이라는 제품 포지셔닝이 공식화되었으며, 하이브리드 배포를 위해 Cisco와의 연동 기능이 추가되었습니다.

쿠물로 클라우드 데이터 패브릭

데이터 경로는 소스 사이트(온프레미스 클러스터, 클라우드 리전, 리전 간 복제본 또는 CNQ S3 기반 스토리지)에서 가속기의 CPU DRAM 캐시로 블록 단위로 이동한 다음 GPU로 직접 전송합니다. 이 아키텍처는 온프레미스, 엣지 및 멀티 클라우드 환경 전반에 걸쳐 단일 데이터 소스를 유지하고 대량 복제를 방지하여 스토리지 오버헤드와 동기화 복잡성을 줄입니다.

이 설계는 관리형 AI 서비스와의 통합도 지원합니다. 기업은 기존 데이터 세트를 Microsoft AI Foundry, AWS Bedrock, Google Vertex AI와 같은 플랫폼에 직접 연결할 수 있으며, 데이터를 해당 환경으로 복사할 필요가 없습니다.

운영 효과: 유휴 시간 및 복잡성 감소

가장 큰 운영상의 이점은 데이터 준비 지연을 없애는 것입니다. 많은 AI 워크플로에서 데이터 준비는 며칠 또는 몇 주가 걸릴 수 있으며, 이는 모델 학습을 지연시키고 GPU 활용도를 저하시킵니다. 클라우드 AI 가속기는 데이터 세트에 즉시 접근할 수 있도록 함으로써 컴퓨팅 자원을 사용할 수 있게 되는 즉시 워크로드를 시작할 수 있도록 합니다.

이는 또한 여러 스토리지 환경을 유지 관리할 필요성을 줄여줍니다. 각 GPU 클러스터 또는 클라우드 지역마다 별도의 데이터 사일로를 만드는 대신, 조직은 단일 논리적 데이터 세트를 기반으로 운영할 수 있습니다. 따라서 데이터 관리가 간소화되고 인프라 확장이 줄어듭니다.

비용 측면에서 이 모델은 유휴 GPU 사용 시간을 줄이는 데 초점을 맞춥니다. GPU에 연결된 스토리지에 데이터를 미리 로드할 필요성을 없앰으로써 기업은 GPU가 데이터를 기다리는 시간을 단축하여 가속 컴퓨팅에 대한 전반적인 투자 수익률을 향상시킬 수 있습니다.

하이브리드 AI 인프라를 위한 시스코 통합

시스코는 하이브리드 구축 전략의 공동 시장 진출 파트너로서, 시스코 UCS는 온프레미스 컴퓨팅 환경을 제공하고 시스코 네트워킹 및 보안 솔루션은 데이터 패브릭을 포괄합니다. 쿠물로와 시스코는 협력을 통해 GPU 가용성 변화에 몇 분 만에 적응할 수 있는 인프라를 제공하며, 이것이 기업 규모에서 GPU 유동성을 실질적으로 가능하게 하는 핵심 요소라고 주장합니다.

이 두 서비스의 결합은 양방향 모두에서 매우 중요합니다. 이를 통해 Qumulo는 Cisco UCS 환경으로 진출할 수 있는 검증된 경로를 확보하고, Cisco는 컴퓨팅 리소스를 하이퍼스케일러에 분산시키면서 데이터는 온프레미스에 유지하고자 하는 하이브리드 AI 고객에게 스토리지 솔루션을 제공할 수 있습니다. 데이터 액세스는 사이트 간 일관된 전송에 의존하기 때문에 높은 처리량과 낮은 지연 시간을 제공하는 네트워킹이 핵심 요소입니다.

가용성 및 배포 모델

Qumulo 클라우드 AI 가속기가 이제 AWS, Microsoft Azure, Google Cloud 및 Oracle Cloud Infrastructure에서 사용 가능하며, Cisco UCS 환경에서 하이브리드 배포를 지원합니다. Qumulo와 Cisco는 5월 31일부터 6월 4일까지 라스베이거스에서 열리는 Cisco Live 2026의 부스 #4018에서 공동 솔루션을 선보일 예정입니다.

이번 출시는 데이터 중심 아키텍처로의 AI 인프라 설계의 광범위한 변화를 반영합니다. 가속 컴퓨팅 용량이 이를 지원하는 인프라를 앞지르는 상황에서, 활용도 향상은 GPU가 데이터를 기다리는 시간을 줄이는 데 달려 있습니다. Qumulo는 데이터셋을 모바일 환경에 맞게 조정하는 것보다 모든 GPU 클러스터에 플래시 메모리를 추가하는 것이 더 지속 가능한 접근 방식이라고 판단했습니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 iTunes/스포티 파이 | 인스타그램 | 트위터 | 틱톡 서비스 | RSS 피드

해롤드 프리츠

저는 IBM이 Selectric을 만든 이후로 기술 산업에 종사해 왔습니다. 하지만 내 배경은 글쓰기입니다. 그래서 저는 프리세일즈 사업에서 벗어나 제 뿌리로 돌아가서 약간의 글을 쓰지만 여전히 기술 분야에 참여하기로 결정했습니다.