VAST Data는 NVIDIA 추론 컨텍스트 메모리 스토리지 플랫폼을 지원하는 새로운 추론 아키텍처를 출시했습니다. 이 시스템은 지속적인 다중 턴 에이전트 기반 세션을 사용하는 AI 애플리케이션에 초점을 맞추고 있습니다. VAST는 이 플랫폼을 AI에 최적화된 스토리지 클래스로 소개하며, 키-값(KV) 캐시에 대한 접근성을 향상시키고, 노드 간 추론 컨텍스트의 빠른 공유를 가능하게 하며, 전력 효율성을 개선한다고 설명합니다. 이 설계는 NVIDIA BlueField-4 DPU와 Spectrum-X 이더넷 네트워킹을 활용하며, VAST AI 운영 체제(AI OS)는 이러한 공유 인프라 리소스를 효율적으로 관리하는 데 필요한 소프트웨어를 제공합니다.
KV 캐시의 중요성에 대한 자세한 내용은 Pliops와 함께 진행한 심층 분석 보고서 를 참조하십시오.
이번 발표는 실제 애플리케이션에서 추론 성능을 제한하는 요소들의 변화를 시사합니다. 추론이 단순한 프롬프트에서 여러 에이전트와 사용자에 걸친 지속적인 추론으로 전환됨에 따라, 컨텍스트가 단일 GPU 서버 내에만 머무른다는 개념은 더 이상 유효하지 않습니다. 이러한 상황에서 전반적인 성능은 지속적인 작업 중에 추론 기록을 얼마나 잘 저장, 복원, 재사용, 확장 및 공유하는지에 점점 더 의존하게 됩니다. KV 캐시는 내부 최적화에서 주요 데이터 경로로 진화하여 최초 토큰 획득 시간(TTFT), GPU 사용률 및 클러스터 효율성에 영향을 미칩니다.
DPU를 우회하는 추론 데이터 경로 재구축
VAST의 전략은 VAST AI OS 소프트웨어를 NVIDIA BlueField-4 DPU에서 직접 실행하는 것입니다. 일반적인 클라이언트-서버 모델을 통해 접근하는 외부 구성 요소로서 스토리지 및 컨텍스트 서비스를 간주하는 대신, 이 아키텍처는 이러한 데이터 서비스를 추론이 이루어지는 GPU 서버에 직접 통합하는 동시에 전용 데이터 노드 구성도 지원합니다. 이러한 접근 방식은 병목 현상을 최소화하고 동시 접속이 증가함에 따라 성능을 저하시키는 불필요한 복사 및 지연을 제거하는 것을 목표로 합니다.
이 DPU 네이티브 설계는 대규모 추론 시스템의 실질적인 요구 사항을 명확하게 해결합니다. 수백 또는 수천 개의 세션이 동시에 실행될 때, 키-값 캐시 관리는 지속적인 입출력(I/O) 작업으로 변합니다. 시스템은 세션 실행을 유지하기 위해 컨텍스트를 빠르게 읽고, 장기적으로 사용하기 위해 저장하고, 인프라가 느린 경로를 통해 작업을 전달하거나 광범위한 조정이 필요할 때 중복 처리를 방지하기 위해 작업자 간에 컨텍스트를 공유해야 합니다. 이로 인해 TTFT(Time To Fly-out)가 증가하여 GPU가 처리 대신 대기하게 됩니다. VAST는 BlueField-4를 통해 데이터 플레인을 서버로 이동함으로써 더 효율적인 컨텍스트 트래픽, 더 높은 처리량, 그리고 GPU 처리 루프에 더 가까운 안정적인 지연 시간을 얻을 수 있다고 주장합니다.
VAST는 RDMA 패브릭을 사용하여 GPU 메모리에서 영구 NVMe 스토리지로의 효율적인 경로를 강조합니다. 이를 통해 컨텍스트가 GPU 서버와 스토리지 간에 원활하게 전송되어 기존 시스템에서 흔히 발생하는 반복적인 데이터 처리를 줄일 수 있습니다. 목표는 고성능 네트워킹을 통해 컨텍스트 이동이 "대역 내"에서 이루어지도록 하면서 CPU 개입 및 클라이언트 측 오버헤드를 최소화하는 것입니다.
대규모로 공유되고 일관된 맥락
새로운 아키텍처는 VAST의 병렬 분산 공유 시스템(DASE) 설계와 함께 작동합니다. VAST는 이를 통해 각 호스트가 대규모 환경에서 일반적으로 발생하는 조정 비용 없이 공유되고 전역적으로 일관된 컨텍스트 네임스페이스에 액세스할 수 있다고 설명합니다. 장기적인 에이전트 기반 추론 환경에서는 이러한 세부 사항이 매우 중요합니다. 컨텍스트는 규모가 클 뿐만 아니라 점점 더 공유되기 때문입니다.
에이전트 기반 시스템은 종종 여러 도구를 동시에 사용하고, 여러 에이전트 간에 핸드오프를 수행하며, 상호 작용 중에 메모리와 유사한 동작을 요구합니다. 따라서 컨텍스트를 새로 생성하는 대신 재사용하고, 단일 노드에 종속시키는 대신 추론 워커 간에 공유해야 합니다. 스케줄링, 퇴출 또는 장애 복구로 인해 시스템이 컨텍스트 지역성을 유지할 수 없는 경우, 긴 프롬프트 기록을 다시 처리하지 않고 세션을 신속하게 복원하고 계속해야 합니다. 이러한 맥락에서 KV 캐시는 중요한 클러스터 리소스가 되며, 동기화 병목 현상이 되지 않도록 광범위하게 접근 가능하게 만드는 것이 중요한 과제가 됩니다.
VAST는 DPU 기반 데이터 서비스와 모든 것을 공유하는 스토리지 설정을 결합하여 동시 세션 수가 증가하더라도 효율성을 유지하는 전역적으로 접근 가능한 컨텍스트 계층을 구축하는 것을 목표로 합니다. 격리된 컨텍스트 섹션을 추가하여 확장하는 대신, 이 플랫폼은 재사용 및 공유의 이점을 유지하면서 클러스터가 확장될 수 있도록 지원합니다.
새로운 성과 환경으로서의 맥락
VAST의 임원인 존 마오는 대규모 추론 시스템의 경쟁 우위가 단순한 컴퓨팅 성능에서 메모리 및 컨텍스트 시스템으로 이동하고 있다고 지적했습니다. 그는 가장 효율적인 클러스터는 단순히 최고 FLOPS를 기록하는 클러스터가 아니라 실시간 컨텍스트 공유 및 관리가 가능한 클러스터가 될 것이라고 요약했습니다. 또한 그는 즉각적인 온디맨드 컨텍스트 접근이 핵심 성능 영역이라고 강조하며, 신속한 컨텍스트 검색 및 재사용이 없으면 GPU가 유휴 상태로 남아 효율성이 저하된다고 경고했습니다.
이러한 관점은 모델 규모가 커지고 세션 길이가 길어짐에 따라 많은 운영자들이 겪는 경험과 일치합니다. 추론 클러스터는 일반적으로 최대 토큰 생성을 위해 구성되지만, 실제 사용 경험은 부하 시 발생하는 지연 시간(tail latency)과 TTFT(Time To First Time)에 따라 좌우됩니다. 프롬프트가 길어지고 세션이 지속될수록 컨텍스트 관리 시간이 늘어납니다. 컨텍스트를 신속하게 복원하거나 재사용할 수 없는 경우, GPU 사이클은 상태를 재설정하거나 데이터 이동을 기다리는 데 낭비됩니다. VAST의 아키텍처 접근 방식은 KV 캐시를 공유 인프라로 취급하여 이러한 문제를 줄이고 클러스터의 전반적인 효율성을 향상시킵니다.
실험에서 관리형 생산 추론으로의 전환
VAST는 또한 이 플랫폼을 규제 환경을 포함한 실제 운영 환경에서 사용 가능한 추론 서비스로의 전환 단계로 제시하고 있습니다. 추론이 특정 보안 및 규정 준수 요건을 충족하는 수익 창출 서비스가 됨에 따라, KV 캐시 관리는 속도 그 이상을 요구하며, 감독이 필수적입니다.
장시간 세션에서는 민감한 프롬프트, 추론 단계, 도구 출력 및 사용자 제공 정보가 포함될 수 있습니다. 기업은 이러한 컨텍스트에 대한 정책 제어, 격리 조치, 감사 추적 및 수명 주기 관리를 점점 더 요구하고 있습니다. VAST는 이러한 AI 기반 데이터 서비스가 AI 운영 체제에 내장되어 있어 조직이 KV 캐시를 임시 상태가 아닌 관리 가능한 리소스로 취급할 수 있다고 주장합니다.
운영적인 관점에서 VAST는 대규모 추론 환경에서 흔히 발생하는 문제, 즉 캐시 손실이나 공유 불가로 인해 발생하는 컨텍스트 재구축 폭풍과 컨텍스트가 연산보다 병목 현상을 일으켜 낭비되는 GPU 시간을 해결하는 것을 목표로 합니다. 회사는 컨텍스트의 지속성과 재사용성을 향상시키면 재계산이 줄어들고 사용률이 높아져 컨텍스트 크기와 세션 동시성이 증가함에 따라 와트당 처리량과 달러당 처리량이 모두 개선될 것으로 기대합니다.
NVIDIA: 컨텍스트 관리가 확장성 경제성을 향상시킵니다
NVIDIA의 네트워킹 부문 수석 부사장인 케빈 데이어링은 AI에서 컨텍스트의 중요성을 강조하며 이를 인간의 기억에 비유했습니다. 그는 컨텍스트를 효과적으로 관리하는 것이 멀티턴 및 멀티유저 추론의 확장에 필수적이며, 이는 결국 대규모 컨텍스트 메모리 처리 방식의 변화를 가져온다고 설명했습니다. 데이어링 부사장은 VAST Data AI OS가 NVIDIA BlueField-4와 결합하여 워크로드 증가에 따라 높은 처리량과 안정적인 데이터 경로를 제공함으로써 이를 지원한다고 언급했습니다. 이 파트너십은 DPU와 이더넷 패브릭을 단순히 기본 스토리지 액세스나 네트워킹이 아닌 핵심 추론 컨텍스트에 통합한다는 점에서 중요합니다. 핵심은 컨텍스트가 이제 GPU 문제일 뿐만 아니라 네트워킹과 스토리지 모두에 과제를 제기한다는 점이며, 최신 추론 환경에서는 GPU의 효율적인 작동을 위해 집중적인 가속과 안정적인 데이터 이동이 필수적이라는 것입니다.
VAST 아키텍처가 약속된 이점을 제공한다면, 실질적인 효과는 최고 벤치마크 점수보다는 일관된 서비스 성능 향상에 더 크게 나타날 것입니다. 즉, 많은 세션이 활성화될 때 TTFT(Time To Fly Time)가 낮아지고, 컨텍스트가 증가함에 따라 성능 저하가 줄어들며, 컨텍스트 재구축을 줄여 활용도가 향상되고, 컨텍스트 공유가 단점이 아닌 장점이 되는 멀티 노드 추론으로의 더욱 간편한 전환이 가능해집니다. 또한, VAST는 추론 인프라를 더욱 "AI 네이티브" 모델로 발전시켜, KV 캐시를 영구적인 NVMe 스토리지로 지원하고 엄격한 지연 시간 제한을 두고 노드 간에 공유하는 관리형 메모리 계층으로 취급합니다.
VAST 포워드 컨퍼런스
VAST Data는 2026년 2월 24일부터 26일까지 유타주 솔트레이크시티에서 개최되는 제1회 VAST Forward 사용자 컨퍼런스에서 전략을 발표할 예정입니다. 컨퍼런스에는 VAST 경영진 , 고객 및 파트너가 참여하여 상세한 기술 세션, 실습, 인증 프로그램 등을 진행할 계획입니다 .




아마존