StorageReview.com

Podcast č. 141: Graid přináší funkcionalitu podnikového RAIDu pro úlohy s umělou inteligencí

Enterprise

Storagereview spolupracoval se společností Graid na řadě projektů, včetně naší nejnovější recenze, Storage at GPU Speed, a projekty stále ohromují. V tomto podcastu si Brian povídá se svou přítelkyní Kelley Osburnovou, seniorní ředitelkou pro rozvoj OEM a kanálového obchodu ve společnosti Graid Technology.

Kelley je zodpovědný za vývoj a realizaci strategie OEM a prodejních kanálů, řízení klíčových partnerství a vztahů a rozšiřování tržní přítomnosti a tržeb společnosti. Využívá své odborné znalosti v oblasti flash pamětí, ukládání dat, virtualizace, cloudu, DevOps a kontejnerů/Kubernetes k poskytování řešení s přidanou hodnotou našim zákazníkům a partnerům.

Technologie Graid poskytuje funkcionalitu RAID na podnikové úrovni pro úlohy s umělou inteligencí s minimálními změnami infrastruktury. Místo specializované hardwarové karty RAID nebo vlastního zařízení je AE nabízena jako softwarová licence a využívá pouze malý podíl stávající grafické karty NVIDIA. To umožňuje organizacím dosáhnout výkonu a spolehlivosti úložiště na podnikové úrovni, aniž by spotřebovávaly další sloty PCIe, vyžadovaly změny infrastruktury nebo významně ovlivňovaly výkon grafické karty pro úlohy trénování a inference.

Brian a Kelley se ponoří do funkcionality řešení Graid, proč je v dnešní oblasti umělé inteligence klíčové a co přinese budoucnost.

Pokud vás zajímá vylepšení výkonu RAID polí pro úlohy s umělou inteligencí bez nutnosti přidávat další GPU do stávajících racků, tento podcast vám splní vaše očekávání.

Pokud nemáte čas si poslechnout celý podcast, rozdělili jsme ho na pětiminutové segmenty, abyste si mohli snadno najít potřebné informace.

Průvodce posluchače

Proč Graid? Problém vyřešen! [00-05]

  • Tradiční RAID/MD-RAID narazil na problém s NVMe a PCIe Gen4/5/6 – závažná úzká hrdla x16 linek.
  • Nebezpečná provizorní řešení: RAID 0 + snapshoty/kontrolní body zvyšují riziko a administrativní režii.
  • Matematika vázaná na CPU v MD-RAID odvádí cykly od aplikací; GPU vynikají v paralelní paritě/EC matematika.
  • GRAID přesměruje zátěž na GPU a používá peer-to-peer cesty, takže data obcházejí kartu (bez x16 choke).
  • Anekdota: Servery s 16–44 disky zvětšují nesoulad fyzických linek staršího HW RAIDu.

Předběhnutí „limity x16“ [05-10]

  • Cenově dostupné grafické karty (A2000/A400) fungují jako dopravní policajt, ​​nikoli jako datový trajekt – peer-to-peer NVMe routing.
  • Reálné sestavení: ~200 GB/s s ~24 disky; nové cesty dosahují ~300 GB/s/server.
  • Kompromisy v designu: ~24 disků x4 pro maximální výkon; 40+ disků s x2 zvýhodňuje kapacitu/IOPS.
  • Malé rozměry: Levná edice podporuje až přibližně 12 disků – ideální pro stolní počítače s umělou inteligencí.
  • Žert: „Jak to může být rychlejší než x16?“ – protože data neprocházejí přes GPU.

AI Edition: Využijte stávající výpočetní GPU [12-15]

  • Spustit Graid na H100/Blackwell už vlastníte; žádný další slot pro RAID GPU.
  • Malá velikost: ~6/144 SM na H100; „vypadne“ při nečinnosti pro uvolnění zdrojů.
  • Funkce GPU Direct Storage přesouvá data z paměti NVMe přímo do paměti GPU (nižší latence/přeskoky).
  • Ponechte sloty uprostřed rozšiřující desky pro síťové karty 400/800G a další akcelerátory.
  • Anekdota: „Nakrmte bestii.“ Zabraňte tomu, aby GPU hladověly na I/O.

Dopad laboratoře a okrajové vzory [15-20]

  • Mírný dopad tokenů/s během inference; úložiště a umělá inteligence málokdy dosahují vrcholu najednou.
  • Nasazení na okraji sítě: Jedna 2U jednotka se 2 GPU pro zachycení, light train a inferenci ve velkém měřítku.
  • Zachovat I/O sloty sdílením stávajících GPU s Graidem.
  • Příklady: modely pro divokou zvěř ve stylu YOLO, maloobchod a další připravené inferenční modely.
  • Tip: Zvolte správnou velikost úložného prostoru, abyste zabránili nedostatku energie pod prasklými potrubími.

Integrita, jmenné prostory a škálování [20-25]

  • RAID je důležitější na okraji sítě: Odolnost udržuje GPU produktivní i během poruch.
  • Přechodné chyby: Detekce chybných čtení, obnovení z parity za běhu a přemístění dat.
  • Velké jmenné prostory: Disky třídy 61/122/256 TB dělají velké chráněné fondy cennými.
  • Škálování pomocí NVMe‑oF JBOF (RoCE/RDMA); 24-Stále vyžaduje 96+ zařízení typu „raw“ softwarový RAID.
  • Plán: Vyšší počet disků + kódování mazání pro flexibilní ochranné domény.

Za hranicemi umělé inteligence: Databáze, streamování, analytika [26-30]

  • Databáze/HFT: Redis, Aerospike a Oracle těží z rychlého a konzistentního zápisu.
  • Splunk/log ingest: Trvalá propustnost zabraňuje poklesům a zpětnému tlaku.
  • Média: Vícenásobné streamovací servery s kapacitou 8K mohou snížit celkový počet serverů pro danou úlohu.
  • Omezení hustoty/výkonu zvýhodňují vyšší výkon na RU v kolokacích.
  • Obnovení: Parita protéká přes GPU; mírné zvýšení latence, zřídka viditelné v aplikaci.

Plán, PCIe Gen6, jak se zapojit [30-35]

  • Software na prvním místě: přechod z Gen4 na Gen5 zvyšuje výkon, protože Graid není v datové cestě.
  • Flash paměti Gen6 (~28 GB/s x4) zdůrazňují potřebu odstranění úzkých míst.
  • Peer-to-peer + matematika odlehčená od GPU odemyká nové generace PCIe bez výpadků hardwaru.
  • Jak nakupovat: katalog Dell, dodavatel originálních dílů Supermicro, distribuční kanály (CDW) a Amazon.
  • Seznamte se s Graid: Partnerem NVIDIA Inception se stánky na veletrzích GTC Washington a San Jose.

Zapojte se do StorageReview

Zpravodaj | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS kanál

Harold Fritts

V technologickém průmyslu působím od doby, kdy IBM založila Selectric. Mám ale zkušenosti s psaním. Rozhodl jsem se tedy opustit předprodejní byznys a vrátit se ke svým kořenům, trochu psát, ale stále se věnovat technologiím.