ScaleFlux는 NVIDIA CMX 및 GPU HBM과 호스트 DRAM 외에 공유 KV 캐시 계층으로 SSD를 사용하는 기타 추론 아키텍처를 위해 설계된 AI 최적화 SSD 플랫폼을 출시했습니다 . 이 플랫폼은 고내구성 SSD 하드웨어, 유연한 데이터 배치(FDP) 지원 및 워크로드 원격 측정 기능을 결합하여 데이터 배치를 개선하고 쓰기 증폭을 줄이며 고부하 추론 환경에서 실질적인 내구성을 향상시키도록 설계되었습니다.
이 플랫폼은 오프로드된 KV 캐시를 통해 세 가지 스토리지 문제를 해결합니다 . 즉, 실제 워크로드 동작 특성 파악, 데이터 수명 주기별 분리, 그리고 쓰기 작업을 흡수하기 위해 과도한 플래시 용량을 사용하지 않고도 집중적인 쓰기 활동을 유지하는 것입니다.
장기 컨텍스트 추론, 공유 접두사 재사용, 에이전트 기반 애플리케이션 흐름, 유휴 세션 유지 등의 기능으로 인해 GPU 메모리 외부에 저장되는 재사용 가능한 런타임 상태의 양이 증가합니다. 기존 엔터프라이즈 워크로드와 달리 KV 캐시 블록은 빈번하게 기록되고, 다양한 기간 동안 유지되며, 비활성 상태 후 재활성화되고, 세션, 워커, 테넌트 간에 비동기적으로 무효화될 수 있습니다. 이러한 패턴은 호환되지 않는 수명 주기를 가진 데이터가 동일한 플래시 블록을 공유할 때 가비지 컬렉션 활동과 쓰기 증폭을 증가시킵니다.
ScaleFlux의 고내구성 아키텍처는 KV 캐시 워크로드에서 5년 동안 하루 7회에서 10회 이상의 유효 드라이브 쓰기 작업을 제공하도록 설계되었습니다. 회사 측은 유효 내구성이 워크로드 특성, FDP 활용률 및 장치 구성에 따라 달라진다고 설명합니다. 유효 내구성이 높을수록 운영자가 쓰기 트래픽을 처리하기 위해 배포해야 하는 플래시 메모리 용량이 줄어들어 활성 KV 캐시 및 기타 AI 런타임 상태를 저장하는 데 사용할 수 있는 설치 용량이 늘어납니다. ScaleFlux는 이러한 오버헤드를 "내구성 세금"이라고 부르며, 이를 줄이는 것이 플랫폼의 핵심 경제적 이점입니다.
SSD 플랫폼은 드라이브당 200개 이상의 FDP 쓰기 스트림을 지원합니다. 이를 통해 추론 소프트웨어는 데이터를 플래시 미디어에 저장하기 전에 수명 주기, 세션, 테넌트, 공유 접두사 분류, 소유권 또는 재사용 동작별로 그룹화할 수 있습니다. 목표는 무효화 패턴이 유사한 데이터를 함께 기록하여 가비지 컬렉션 중 내부 데이터 이동을 줄이고 데이터 클래스 간의 간섭을 최소화하는 것입니다.
ScaleFlux는 예비 제어 테스트에서 수명 주기 인식 FDP 배치 방식을 사용했을 때 기준 배치 구성에 비해 쓰기 증폭률이 2배 이상 감소하는 것을 측정했습니다. 회사 측은 실제 결과는 워크로드 특성, 수명 주기 분류, 소프트웨어 통합 및 장치 구성에 따라 달라질 수 있다고 밝혔습니다.
스케일플럭스의 CEO 겸 공동 창립자인 하오 중은 “AI 추론 인프라에는 단순한 용량 증설 이상의 기능을 제공하는 SSD가 필요합니다.”라고 말했습니다. “인프라 팀은 KV 워크로드가 드라이브에 미치는 영향을 이해하고, 데이터 수명 주기에 따라 데이터를 분리하며, 단순히 쓰기 작업을 분산시키기 위해 과잉 용량을 배포하지 않고도 높은 쓰기 속도를 유지해야 합니다. 스케일플럭스는 워크로드 인텔리전스, 확장 가능한 FDP 배치, 그리고 7~10배 이상의 효율적인 DWPD를 하나의 AI 최적화 SSD 플랫폼에 통합했습니다.”
소프트웨어 및 원격 측정 계층에서 ScaleFlux Context-Insight SSD는 KV 캐시 정책이 SSD 작동에 미치는 영향을 보여줍니다. 이 플랫폼은 지연 시간, 큐 깊이, 처리량, 요청 크기 분포, 데이터 경과 시간, 쓰기-첫 읽기 간격, 읽기 재사용, NAND 쓰기 볼륨, 가비지 컬렉션 이동 및 쓰기 증폭을 측정합니다.
Context-Insight는 상위 소프트웨어 계층을 변경하지 않고도 초기 워크로드 분석을 위해 SSD 전용 모드로 작동할 수 있습니다. 더 심층적인 통합을 통해 세션 ID, 작업자 또는 테넌트 식별자, 공유 접두사 ID, KV 블록 소유권, 수명 주기 상태 및 키-블록 매핑을 포함한 애플리케이션 메타데이터와 SSD 원격 측정 데이터를 연관시킬 수 있습니다. 이를 통해 운영자는 SSD를 불투명한 공유 리소스로 취급하는 대신 지연 시간, 내구성 소모 및 쓰기 증폭을 특정 워크로드 클래스와 연결할 수 있습니다.
ScaleFlux는 NVIDIA가 최근 발표한 CMX 컨텍스트 메모리 스토리지 플랫폼을 보완하는 플랫폼으로 자사를 포지셔닝하고 있습니다. CMX는 고속 KV 캐시 액세스 및 재사용을 위한 공유 포드 수준 컨텍스트 계층을 제공합니다. ScaleFlux의 주요 타겟은 AI 팩토리 운영업체입니다. CMX는 컨텍스트 계층을 담당하고, ScaleFlux는 기본 SSD에 특화된 내구성, 데이터 배치 및 쓰기 증폭 문제를 해결합니다.
NVIDIA의 스토리지 기술 담당 부사장인 제이슨 하디는 “AI 추론 시스템이 GPU 메모리와 DRAM을 넘어 KV 캐시를 확장함에 따라 SSD 계층의 동작 및 요구 사항을 이해하는 것이 점점 더 중요해지고 있습니다.”라고 말했습니다. “ScaleFlux와의 협력을 통해 KV 캐시 오프로드가 지연 시간, 내구성 및 쓰기 증폭과 같은 스토리지 요구 사항에 미치는 영향을 파악하고 NVIDIA CMX를 중심으로 한 광범위한 스토리지 생태계에 기여하고 있습니다.”
이 회사는 GPU HBM, 호스트 메모리 및 SSD 계층 전반에 걸친 KV 캐시 이동을 모델링하는 추적 기반 시뮬레이터를 개발하고 있습니다. 이 시뮬레이터는 제어된 조건에서 배치, 제거 및 수명 주기 그룹화 정책을 평가하기 위해 재생 가능한 SSD 추적 데이터를 생성합니다.
ScaleFlux는 FMS에서 Context-Insight 워크로드 분석, KV 메타데이터 상관관계 분석, 수명주기 인식 FDP 배치, 쓰기 증폭 감소, 쓰기 집약적인 KV 캐시 워크로드를 위한 고내구성 운영 등을 아우르는 플랫폼을 선보일 예정입니다. ScaleFlux는 이번 전시회에서 상당한 비중을 차지할 것으로 예상됩니다. 지난 7월, ScaleFlux는 전문가들이 AI 데이터 파이프라인 확장을 위한 메모리 솔루션에 대한 NVIDIA와 공동 기조연설을 포함하여 총 7개의 프레젠테이션을 진행할 것이라고 발표했습니다.
이번 플랫폼 발표는 최근 잇따른 반도체 관련 소식의 정점을 찍었습니다. 이틀 전, ScaleFlux는 같은 전시회에서 선보일 두 가지 PCIe Gen6 부품, 즉 FC6116 NVMe SSD 컨트롤러와 MC600 CXL 3.2 Type 3 메모리 컨트롤러를 공개했습니다. ScaleFlux는 FC6116의 순차 읽기 속도를 최대 28GB/s, 순차 쓰기 속도를 최대 25GB/s, 4K 랜덤 읽기 IOPS를 최대 700만, 4K 랜덤 쓰기 IOPS를 지속적으로 100만 이상 달성할 수 있다고 밝혔습니다. 또한, 9W 미만의 전력 소비로 TLC, QLC, SLC NAND를 지원하며, E1.S/L, E3.S/L, U.2/3 규격으로 최대 256TB까지 지원합니다. MC600은 Gen6 x8 구성에서 일반적인 전력 소비량이 9W 미만이며, 쿼드 채널 DDR5 또는 듀얼 채널 DDR4를 지원합니다. 최대 2TB의 DDR5 메모리를 지원하는 이 듀얼 채널 DDR4 지원 기능은 기존 DDR4 메모리를 CXL 환경에 적용할 수 있는 방법으로 ScaleFlux는 강조하고 있습니다. 두 회사 모두 2026년 4분기에 주요 고객을 대상으로 샘플링을 시작할 예정입니다.




아마존