StorageReview.com

La piattaforma SSD ScaleFlux KV Cache dichiara 7-10+ DWPD e oltre 200 FDP Streams

Impresa  ◇  SSD

ScaleFlux ha introdotto una piattaforma SSD ottimizzata per l'intelligenza artificiale, progettata per NVIDIA CMX e altre architetture di inferenza che utilizzano SSD come livello di cache KV condiviso, oltre alla memoria HBM della GPU e alla DRAM dell'host. La piattaforma combina hardware SSD ad alta resistenza, supporto per Flexible Data Placement (FDP) e telemetria del carico di lavoro, con l'obiettivo di migliorare il posizionamento dei dati, ridurre l'amplificazione della scrittura ed estendere la resistenza effettiva in ambienti di inferenza ad alto turnover.

La piattaforma affronta tre sfide di archiviazione con cache KV offloadata : caratterizzare il comportamento dei carichi di lavoro reali, separare i dati in base al ciclo di vita e sostenere un'intensa attività di scrittura senza utilizzare la capacità flash in eccesso per assorbire le scritture.

L'inferenza a lungo termine, il riutilizzo dei prefissi condivisi, i flussi applicativi agentici e le sessioni inattive mantenute aumentano il volume di stato di runtime riutilizzabile memorizzato al di fuori della memoria GPU. A differenza dei carichi di lavoro aziendali convenzionali, i blocchi della cache KV possono essere scritti frequentemente, mantenuti per periodi variabili, riattivati ​​dopo l'inattività e invalidati in modo asincrono tra sessioni, worker e tenant. Questi modelli aumentano l'attività di garbage collection e l'amplificazione della scrittura quando i dati con cicli di vita incompatibili condividono gli stessi blocchi flash.

Unità SSD ScaleFlux CSD serie 5000 U.2 con controller e package NAND esposti, rappresentativa dell'hardware dell'unità alla base della piattaforma cache ScaleFlux KV.

L'architettura ad alta resistenza di ScaleFlux è progettata per garantire da 7 a oltre 10 scritture effettive al giorno per cinque anni per i carichi di lavoro della cache KV. L'azienda sottolinea che la resistenza effettiva dipende dalle caratteristiche del carico di lavoro, dall'utilizzo di FDP e dalla configurazione del dispositivo. Una maggiore resistenza effettiva riduce la capacità flash grezza che gli operatori devono implementare esclusivamente per assorbire il traffico di scrittura, lasciando più capacità installata disponibile per contenere la cache KV attiva e altri stati di runtime dell'IA. ScaleFlux definisce questo overhead "tassa di resistenza" e la sua riduzione è il principale argomento economico della piattaforma.

La piattaforma SSD supporta oltre 200 flussi di scrittura FDP per unità. Ciò consente al software di inferenza di raggruppare i dati in base al ciclo di vita, alla sessione, al tenant, alla classificazione del prefisso condiviso, alla proprietà o al comportamento di riutilizzo prima di memorizzarli su supporti flash. L'obiettivo è scrivere insieme i dati con modelli di invalidazione simili, riducendo lo spostamento interno dei dati durante la raccolta dei rifiuti e limitando le interferenze tra le classi di dati.

Nei test preliminari controllati, ScaleFlux ha misurato una riduzione di oltre due volte dell'amplificazione di scrittura utilizzando il posizionamento FDP consapevole del ciclo di vita rispetto a una configurazione di posizionamento di base. L'azienda precisa che i risultati effettivi dipendono dalle caratteristiche del carico di lavoro, dalla classificazione del ciclo di vita, dall'integrazione del software e dalla configurazione del dispositivo.

"Le infrastrutture di inferenza AI necessitano di SSD che offrano più di una semplice capacità aggiuntiva", ha affermato Hao Zhong, CEO e co-fondatore di ScaleFlux. "I team infrastrutturali devono comprendere come i carichi di lavoro KV influiscono sull'unità, separare i dati in base al ciclo di vita e sostenere elevati tassi di scrittura senza implementare capacità in eccesso solo per diluire le scritture. ScaleFlux unisce l'intelligenza dei carichi di lavoro, il posizionamento FDP scalabile e un DWPD effettivo di 7-10+ in un'unica piattaforma SSD ottimizzata per l'IA."

A livello di software e telemetria, ScaleFlux Context-Insight SSD mostra come le policy della cache KV influenzano il funzionamento degli SSD. La piattaforma acquisisce dati relativi a latenza, profondità della coda, throughput, distribuzione delle dimensioni delle richieste, età dei dati, intervalli tra scrittura e prima lettura, riutilizzo delle letture, volume di scrittura NAND, movimento della garbage collection e amplificazione della scrittura.

Context-Insight può operare in modalità solo SSD per l'analisi iniziale del carico di lavoro senza modifiche ai livelli software superiori. Grazie a una maggiore integrazione, correla la telemetria SSD con i metadati dell'applicazione, inclusi ID di sessione, identificativi di worker o tenant, ID di prefisso condiviso, proprietà del blocco KV, stato del ciclo di vita e mappature chiave-blocco. Ciò consente agli operatori di associare latenza, consumo di resistenza e amplificazione della scrittura a specifiche classi di carico di lavoro, anziché trattare l'SSD come una risorsa condivisa opaca.

ScaleFlux posiziona la sua piattaforma come complemento alla CMX Context Memory Storage Platform di NVIDIA, annunciata di recente, che fornisce un livello di contesto condiviso a livello di pod per l'accesso e il riutilizzo ad alta velocità della cache KV. La proposta è rivolta agli operatori di AI factory: CMX gestisce il livello di contesto, mentre ScaleFlux affronta le sfide di durata, posizionamento dei dati e amplificazione della scrittura specifiche degli SSD sottostanti.

"Con l'estensione della cache KV dei sistemi di inferenza AI oltre la memoria GPU e la DRAM, la comprensione del comportamento e dei requisiti del livello SSD diventa sempre più importante", ha affermato Jason Hardy, vicepresidente della tecnologia di storage di NVIDIA. "La nostra collaborazione con ScaleFlux ci sta aiutando a caratterizzare l'impatto dell'offload della cache KV sui requisiti di storage in termini di latenza, resistenza e amplificazione della scrittura, contribuendo all'ecosistema di storage più ampio che ruota attorno a NVIDIA CMX."

L'azienda sta sviluppando un simulatore basato su tracce che modella il movimento della cache KV tra HBM della GPU, memoria host e livelli SSD. Il simulatore genera tracce SSD riproducibili per valutare le politiche di posizionamento, rimozione e raggruppamento del ciclo di vita in condizioni controllate.

ScaleFlux prevede di presentare la sua piattaforma al FMS, illustrando l'analisi del carico di lavoro Context-Insight, la correlazione dei metadati KV, il posizionamento FDP consapevole del ciclo di vita, la riduzione dell'amplificazione di scrittura e il funzionamento ad alta resistenza per carichi di lavoro di cache KV ad alta intensità di scrittura. L'azienda ha una presenza significativa alla fiera: a luglio ScaleFlux ha dichiarato che i suoi esperti terranno sette presentazioni, tra cui un intervento congiunto con NVIDIA sulle soluzioni di memoria per scalare la pipeline di dati dell'IA.

L'annuncio della piattaforma conclude un periodo intenso di novità nel settore dei semiconduttori. Due giorni prima, ScaleFlux aveva svelato due componenti PCIe Gen6 che avrebbe presentato alla stessa fiera: il controller SSD NVMe FC6116 e il controller di memoria MC600 CXL 3.2 Type 3. ScaleFlux dichiara per l'FC6116 velocità di lettura sequenziale fino a 28 GB/s e di scrittura sequenziale fino a 25 GB/s, fino a 7 milioni di IOPS in lettura casuale 4K e oltre 1 milione di IOPS in scrittura casuale 4K sostenuta, con un consumo energetico attivo del controller inferiore a 9 W e supporto per memorie NAND TLC, QLC e SLC fino a 256 TB su E1.S/L, E3.S/L e U.2/3. L'MC600 consuma in genere meno di 9 W in una configurazione Gen6 x8 e supporta DDR5 quad-channel o DDR4 dual-channel con fino a 2 TB di DDR5, una capacità dual-generation che ScaleFlux propone come soluzione per integrare la DDR4 esistente in un'implementazione CXL. Entrambi i prodotti inizieranno a essere distribuiti ai clienti chiave nel quarto trimestre del 2026.

Interagisci con StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Feed RSS

Harold Fritt

Lavoro nel settore tecnologico da quando IBM ha creato Selectric. Il mio background, però, è la scrittura. Così ho deciso di uscire dal business delle prevendite e tornare alle mie radici, scrivendo un po’ ma rimanendo comunque coinvolto nella tecnologia.