StorageReview.com

WEKA는 AI 추론 메모리 병목 현상 해결을 위해 NeuralMesh와 NVIDIA STX를 통합했습니다.

AI  ◇  기업

WEKA는 자사의 NeuralMesh 플랫폼을 NVIDIA STX 레퍼런스 아키텍처와 통합했다고 발표하며, 증강 메모리 그리드(Augmented Memory Grid)를 차세대 AI 인프라의 핵심 구성 요소로 자리매김했습니다. 이 통합 솔루션은 대규모 추론 환경의 주요 제약 조건 중 하나인 성능, 비용 및 확장성에 영향을 미치는 메모리 제한 문제를 해결하는 것을 목표로 합니다.

NeuralMesh에서 실행되는 WEKA의 증강 메모리 그리드는 키-값 캐시를 외부화하고 영구 저장함으로써 GPU 메모리를 확장합니다. NVIDIA STX 배포 환경에서 이 아키텍처는 에이전트형 AI 워크로드에 대한 높은 처리량의 컨텍스트 메모리 스토리지를 지원하여 세션, 도구 및 워크플로 전반에 걸쳐 장기적인 컨텍스트 추론을 가능하게 합니다. 회사 측은 NVIDIA Vera Rubin NVL72 시스템, BlueField-4 DPU 및 Spectrum-X 이더넷을 활용하는 구성에서 컨텍스트 메모리 토큰 처리량을 4배에서 10배까지 향상시킬 수 있다고 밝혔습니다. 또한 이 플랫폼은 최소 320GB/s의 읽기 처리량과 150GB/s의 쓰기 처리량을 제공하여 기존 AI 스토리지 시스템의 성능을 두 배 이상 향상시킬 것으로 예상됩니다.

메모리 인프라가 추론 병목 현상이 되었습니다.

WEKA는 AI 배포에서 점점 심각해지는 제약 조건인 메모리 병목 현상을 중심으로 통합을 설계합니다. 최신 추론 파이프라인에서 GPU의 제한된 고대역폭 메모리는 키-값 캐시 제거를 빈번하게 발생시켜 재계산 및 효율성 저하를 초래합니다. 동시성이 증가함에 따라 이러한 비효율성은 더욱 심화되어 인프라 비용을 증가시키고 시스템 예측 가능성을 떨어뜨립니다.

이 회사는 공유 KV 캐시 인프라를 해결책으로 제시합니다. 공유 캐시는 사용자와 세션 간에 지속적인 컨텍스트를 유지함으로써 중복 연산을 제거하고 토큰 처리량을 안정화합니다. NVIDIA STX는 이 모델 구현을 위한 참조 아키텍처를 제공하며, WEKA는 스토리지 및 메모리 확장 계층을 제공합니다.

뉴럴메쉬 및 증강 메모리 그리드 아키텍처

NeuralMesh는 WEKA의 분산 스토리지 플랫폼으로, NVIDIA STX 스택 전체에서 작동하도록 설계되었습니다. 이 시스템은 AI 워크로드에 최적화된 고성능 데이터 서비스를 제공하며, 증강 메모리 그리드(Augmented Memory Grid)는 GPU 메모리 외부에 KV 캐시를 풀링하는 전용 메모리 확장 계층 역할을 합니다.

WEKA 증강 메모리 그리드 그래픽

이 접근 방식을 통해 추론 환경은 GPU 리소스를 고갈시키지 않고 장시간 컨텍스트 세션을 유지할 수 있습니다. 캐시 상태를 보존하고 워크로드 전반에 걸쳐 재사용을 가능하게 함으로써, 이 플랫폼은 배포 규모가 커지더라도 높은 활용률과 일관된 성능을 유지하는 것을 목표로 합니다.

WEKA는 GTC 2025에서 처음 소개되어 현재 일반에 공개된 증강 메모리 그리드(Augmented Memory Grid)가 BlueField DPU가 탑재된 NVIDIA Grace CPU 플랫폼에서 검증되었다고 발표했습니다. 이 아키텍처는 추론 효율성을 눈에 띄게 향상시켜, 첫 토큰 생성 시간 단축, GPU당 토큰 처리량 증가, 그리고 동시성 증가에 따른 성능 유지 등 여러 이점을 제공합니다. 또한, 스토리지 데이터 경로를 BlueField-4로 오프로드함으로써 CPU 오버헤드를 더욱 줄이고 I/O 병목 현상을 최소화합니다.

성능 및 효율성 향상

실제 운영 환경에서 이 플랫폼은 응답성과 인프라 효율성을 향상시키도록 설계되었습니다. WEKA에 따르면 증강 메모리 그리드(Augmented Memory Grid)는 첫 토큰 생성 시간을 최대 4배에서 20배까지 단축하는 동시에 GPU당 토큰 출력을 최대 6.5배까지 증가시킬 수 있습니다. 이러한 성능 향상은 키-값 캐시 적중률 증가와 재계산 감소를 통해 이루어지며, 이를 통해 시스템은 컨텍스트 창과 사용자 수가 증가하더라도 성능을 유지할 수 있습니다.

AI 인프라 제공업체인 Firmus는 NVIDIA 기반 인프라를 활용하여 NeuralMesh를 사용하는 초기 도입 기업으로 꼽힙니다. Firmus는 토큰 처리량 향상과 대규모 환경에서의 지연 시간 감소를 보고했으며, 이러한 성과는 하드웨어 용량 확장이 아닌 기존 GPU 리소스의 효율적인 활용 덕분이라고 설명합니다.

AI 인프라 설계에 대한 시사점

이번 통합은 AI 시스템 아키텍처의 변화를 보여주는 것으로, 메모리와 스토리지 설계가 전반적인 성능과 비용 효율성을 좌우하는 중요한 요소가 되고 있습니다. 에이전트 기반 AI 워크로드가 확장되고 컨텍스트 창이 커짐에 따라, 재계산 오버헤드 증가와 GPU 활용률 저하로 인해 DRAM만 사용하는 방식은 점점 더 비효율적이 되고 있습니다.

WEKA는 AI 팩토리의 핵심 역량으로 영구적이고 공유 가능한 KV 캐시를 제시합니다. 이러한 모델을 채택하는 조직은 GPU 활용률을 높이고 추론 작업당 에너지 소비를 줄이며 더욱 예측 가능한 확장성을 확보할 수 있습니다. 반대로, 로컬 GPU 메모리에만 의존하는 환경은 워크로드가 증가함에 따라 운영 비용이 증가하고 효율성이 저하될 가능성이 높습니다.

이용 가능 여부 (Availability)

WEKA의 증강 메모리 그리드는 NeuralMesh 플랫폼의 일부로 정식 출시되었습니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

해롤드 프리츠

저는 IBM이 Selectric을 만든 이후로 기술 산업에 종사해 왔습니다. 하지만 내 배경은 글쓰기입니다. 그래서 저는 프리세일즈 사업에서 벗어나 제 뿌리로 돌아가서 약간의 글을 쓰지만 여전히 기술 분야에 참여하기로 결정했습니다.