Storagereview ha collaborato con Graid a numerosi progetti, tra cui la nostra recensione più recente, " Storage at GPU Speed", e continuano a stupirci. In questo podcast, Brian conversa con la sua amica Kelley Osburn, Senior Director of OEM and Channel Business Development di Graid Technology.
Kelley è responsabile dello sviluppo e dell'implementazione della strategia di vendita OEM e di canale, della gestione di partnership e relazioni chiave e dell'espansione della presenza sul mercato e del fatturato dell'azienda. Sfrutta la sua esperienza in memoria flash, storage dati, virtualizzazione, cloud, DevOps e container/Kubernetes per offrire soluzioni a valore aggiunto ai nostri clienti e partner.
Graid Technology offre funzionalità RAID di livello enterprise per carichi di lavoro di intelligenza artificiale con modifiche infrastrutturali minime. Anziché una scheda RAID hardware dedicata o un'appliance personalizzata, AE viene offerto come licenza software e utilizza solo una piccola parte di una GPU NVIDIA esistente. Ciò consente alle organizzazioni di ottenere prestazioni e affidabilità di storage di livello enterprise senza consumare slot PCIe aggiuntivi, richiedere modifiche infrastrutturali o influire significativamente sulle prestazioni della GPU per i carichi di lavoro di training e inferenza.
Brian e Kelley approfondiscono le funzionalità della soluzione Graid, perché è fondamentale nel panorama odierno dell'intelligenza artificiale e cosa riserva il futuro.
Se sei interessato a migliorare le prestazioni RAID per i carichi di lavoro AI senza aggiungere altre GPU ai tuoi rack esistenti, questo podcast fa al caso tuo.
Se non hai tempo di ascoltare l'intero podcast, lo abbiamo suddiviso in segmenti da cinque minuti, così potrai facilmente trovare le informazioni di cui hai bisogno.
Guida per l'ascoltatore
Perché Graid? Problema risolto! [00-05]
- Il RAID/MD-RAID tradizionale ha incontrato un ostacolo con NVMe and PCIe Gen4/5/6: colli di bottiglia rigidi a 16 corsie.
- Soluzioni provvisorie non sicure: RAID 0 + snapshot/checkpoint aumentano i rischi e il sovraccarico amministrativo.
- La matematica legata alla CPU in MD-RAID devia i cicli dalle app; le GPU eccellono nella parità parallela/EC matematica.
- Graid scarica sulla GPU e utilizza percorsi peer-to-peer, quindi i dati bypassano la scheda (nessun inibitore x16).
- Aneddoto: i server con 16–44 unità amplificano la discrepanza tra le corsie fisiche dei RAID HW legacy.
Superare “limiti x16” [05-10]
- Le GPU economiche (A2000/A400) agiscono come un vigile urbano, non come un trasportatore di dati: routing NVMe peer-to-peer.
- Build reali: ~200 GB/s con ~24 unità; i nuovi percorsi spingono ~300 GB/s/server.
- Compromessi di progettazione: ~24 unità x4 per prestazioni di picco; oltre 40 unità a x2 favoriscono capacità/IOPS.
- Fattore di forma ridotto: l'edizione economica supporta fino a circa 12 unità, ideale per desktop AI.
- Banter: "Come può essere più veloce di x16?" - perché i dati non attraversano la GPU.
Edizione AI: utilizza le GPU di elaborazione esistenti [12-15]
- Esegui Graid su H100/Blackwell, lo possiedi già; nessuno slot extra per una GPU RAID.
- Ingombro ridotto: ~6/144 SM su H100; "si disconnettono" quando sono inattivi per liberare risorse.
- GPU Direct Storage sposta i dati direttamente dalla memoria NVMe alla GPU (latenza/hop inferiori).
- Mantenere gli slot mid-riser per le schede di rete da 400/800G e altri acceleratori.
- Aneddoto: "Nutri la bestia". Impedisci alle GPU di rimanere a corto di risorse IO.
Impatto di laboratorio e motivi di bordo [15-20]
- Impatto modesto in termini di token/sec durante l'inferenza; archiviazione e IA raramente raggiungono il picco contemporaneamente.
- Distribuzioni edge: singolo 2U con 2 GPU per acquisizione, light train e inferenza su larga scala.
- Preserva gli slot IO condividendo le GPU esistenti con Graid.
- Esempi: modelli di inferenza pronti all'uso per la fauna selvatica, la vendita al dettaglio e altri modelli in stile YOLO.
- Suggerimento: dimensionare lo spazio di stoccaggio in modo da evitare che si verifichino carenze in caso di tubature rotte.
Integrità, spazi dei nomi e scala [20-25]
- Il RAID è più rilevante ai margini: la resilienza mantiene le GPU produttive anche in caso di guasti.
- Errori transitori: rileva letture errate, ricostruisce dalla parità al volo e riposiziona i dati.
- Grandi namespace: le unità da 61/122/256 TB rendono preziosi i grandi pool protetti.
- Scalabilità tramite JBOF NVMe‑oF (RoCE/RDMA); 24-96+ dispositivi raw richiedono ancora RAID software.
- Roadmap: aumento del numero di unità + codifica di cancellazione per domini di protezione flessibili.
Oltre l'intelligenza artificiale: database, streaming, analisi [26-30]
- Database/HFT: Redis, Aerospike e Oracle traggono vantaggio da scritture rapide e coerenti.
- Acquisizione Splunk/log: la produttività sostenuta previene cali e contropressioni.
- Media: i server multi-streaming 8K possono ridurre il numero totale di server per un carico di lavoro.
- I vincoli di densità/potenza favoriscono prestazioni più elevate per RU nelle co-locazioni.
- Ricostruzioni: la parità passa attraverso la GPU; leggero aumento della latenza, raramente visibile dall'app.
Roadmap, PCIe Gen6, come impegnarsi [30-35]
- Software-first: lo spostamento da Gen4 a Gen5 aumenta le prestazioni poiché Graid non è nel percorso dati.
- La memoria flash Gen6 (~28 GB/s x4) amplifica la necessità di rimuovere i punti critici.
- La matematica peer-to-peer + GPU-offloaded sblocca le nuove generazioni PCIe senza sforamento di hardware.
- Modalità di acquisto: catalogo Dell, Supermicro OEM, canali (CDW) e Amazon.
- Vi presentiamo Graid: un partner di NVIDIA Inception con stand al GTC di Washington e San Jose.




Amazon