MinIO는 대규모 AI 추론 환경에서 점점 심각해지는 병목 현상을 해결하기 위해 설계된 컨텍스트 메모리 저장소 인 MemKV를 발표했습니다 . AIStor 와 함께 MinIO 포트폴리오의 두 번째 핵심 구성 요소로 자리매김한 MemKV는 MinIO의 데이터 인프라를 메모리 계층으로 확장하여 GPU 클러스터 전반에서 작동하는 에이전트형 AI 워크로드에 영구적이고 공유 가능한 컨텍스트를 제공합니다.
AI 시스템이 단일 응답 상호작용에서 다단계 추론 및 작업 실행으로 발전함에 따라 추론 주기 전반에 걸쳐 컨텍스트를 유지하는 것이 매우 중요해졌습니다. 현재 아키텍처에서는 HBM 및 DRAM과 같은 GPU 인접 메모리 계층의 용량 제한으로 인해 컨텍스트 손실이 빈번하게 발생합니다. 이로 인해 GPU는 이전에 생성된 컨텍스트를 다시 계산해야 하므로 지연 시간, 컴퓨팅 사용률 및 에너지 소비가 증가합니다. MinIO는 이를 특히 하이퍼스케일 및 클라우드 환경에서 규모가 커질수록 누적되는 재계산 부담으로 규정합니다.
MemKV는 페타바이트 규모에서 마이크로초 단위로 데이터를 검색할 수 있는 공유 영구 메모리 계층을 제공하여 이러한 문제를 완화하도록 설계되었습니다. 추론 작업 전반에 걸쳐 컨텍스트를 유지함으로써 플랫폼은 중복 계산을 줄이고 전반적인 시스템 효율성을 향상시킵니다. MinIO의 내부 벤치마크 결과에 따르면, 실제 운영 환경에서 동시 실행 시 첫 번째 토큰 생성 시간이 단축되었습니다. 128개의 GPU와 128개의 토큰 컨텍스트 윈도우를 사용한 대표적인 배포 환경에서 GPU 활용률이 약 50%에서 90% 이상으로 증가하여 연간 컴퓨팅 비용을 크게 절감할 수 있었습니다.
MinIO 경영진은 재계산 오버헤드가 소규모 배포에서는 눈에 띄지 않았지만 규모가 커지면 구조적인 비효율성으로 이어진다고 지적했습니다. GPU 클러스터가 커짐에 따라 컨텍스트를 반복적으로 재생성하는 데 드는 비용이 전력 소비와 인프라 요구 사항 측면에서 모두 증가하므로 지속 가능한 AI 운영을 위해서는 특수 목적에 맞게 설계된 메모리 시스템이 필수적입니다.
메모리-확장성 절충 문제 해결
기존 AI 인프라는 속도와 확장성 사이의 절충을 강요합니다. HBM 및 DRAM 과 같은 고성능 메모리 계층은 마이크로초 단위의 지연 시간을 제공하지만 용량 제약이 있고 가격이 비쌉니다. 반대로 스토리지 시스템은 확장성을 제공하지만 밀리초 단위의 지연 시간을 발생시켜 실시간 추론 및 장기 컨텍스트 추론에 적합하지 않습니다.
MemKV는 낮은 지연 시간 액세스와 대규모 용량을 결합한 공유 메모리 계층을 도입하여 이러한 격차를 해소하도록 설계되었습니다. NVIDIA BlueField-4 STX에서 실행되도록 구축되었으며 NVIDIA Dynamo 및 NIXL과 통합된 이 플랫폼은 전체 GPU 클러스터가 추론 요구 사항에 맞춘 속도로 공통 컨텍스트 데이터 풀에 액세스할 수 있도록 합니다. 이러한 접근 방식은 서로 다른 메모리 및 스토리지 계층 간의 컨텍스트 데이터 이동을 없애 지연 시간을 줄이고 처리량을 향상시킵니다.
추론 작업 부하에 최적화된 아키텍처
MemKV는 추론 데이터 경로를 위해 특별히 설계되었으며 MinIO에서 설명하는 GPU 메모리 계층 구조의 G3.5 계층과 일치합니다. NVMe 기반 인프라에서 페타바이트급 용량을 제공하면서도 마이크로초 수준의 액세스 특성을 유지하여 메모리 규모와 GPU 컴퓨팅 리소스를 효과적으로 분리합니다.
이 시스템은 NVMe에서 AI 데이터 경로로 데이터를 직접 RDMA 종단 간 전송을 통해 이동함으로써 기존의 스토리지 추상화 방식을 사용하지 않습니다 . 이를 통해 객체 기반 및 파일 기반 아키텍처에서 흔히 발생하는 HTTP 프로토콜, 파일 시스템 변환, 중간 스토리지 서버로 인한 오버헤드를 제거합니다.

출처 : Google
핵심 아키텍처 요소로는 스토리지 계층에 내장된 ARM64 바이너리로 NVIDIA BlueField-4 STX 에서 네이티브 실행이 가능 하여 외부 x86 스토리지 노드에 대한 의존도를 줄인다는 점이 있습니다. 데이터 전송은 RDMA를 통해 GPU 메모리에서 NVMe로 이루어지며 기존 스토리지 스택을 거치지 않습니다. 또한 MemKV는 기존의 4KB 스토리지 블록 대신 GPU 처리량 패턴에 최적화된 2MB~16MB의 더 큰 블록 크기를 사용합니다. 네트워킹 성능은 NVIDIA Spectrum-X 이더넷 및 PCIe Gen6를 포함한 최신 고속 패브릭과 호환되어 클러스터 전체에서 거의 유선 속도에 가까운 데이터 전송이 가능합니다.
이용 가능 여부 (Availability)
MinIO MemKV는 즉시 사용 가능합니다.




아마존