OpslagReview. com

Podcast #141: Graid levert Enterprise RAID-functionaliteit aan AI-workloads

Enterprise

Storagereview heeft met Graid samengewerkt aan tal van projecten, waaronder onze meest recente review, Storage at GPU Speed, en ze blijven indruk maken. In deze podcast praat Brian met zijn vriend Kelley Osburn, Senior Director of OEM and Channel Business Development bij Graid Technology.

Kelley is verantwoordelijk voor het ontwikkelen en uitvoeren van de OEM- en channel sales-strategie, het beheren van belangrijke partnerschappen en relaties, en het uitbreiden van de marktpositie en omzet van het bedrijf. Hij zet zijn expertise in flashgeheugen, dataopslag, virtualisatie, cloud, DevOps en containers/Kubernetes in om oplossingen met toegevoegde waarde te leveren aan onze klanten en partners.

Graid Technology levert RAID-functionaliteit van enterprise-niveau voor AI-workloads met minimale infrastructuurwijzigingen. In plaats van een speciale hardware-RAID-kaart of een aangepast apparaat, wordt AE aangeboden als een softwarelicentie en gebruikt het slechts een klein deel van een bestaande NVIDIA GPU. Dit stelt organisaties in staat om storageprestaties en -betrouwbaarheid van enterprise-niveau te bereiken zonder extra PCIe-slots te gebruiken, infrastructuurwijzigingen te vereisen of de GPU-prestaties voor training- en inferentieworkloads significant te beïnvloeden.

Brian en Kelley duiken in de functionaliteit van de Graid-oplossing, waarom deze essentieel is in het huidige AI-landschap en wat de toekomst brengt.

Als u geïnteresseerd bent in het verbeteren van RAID-prestaties voor AI-workloads zonder meer GPU's aan uw bestaande racks toe te voegen, dan is deze podcast iets voor u.

Als je geen tijd hebt om de hele podcast te beluisteren, hebben we hem opgedeeld in stukjes van vijf minuten. Zo kun je makkelijk heen en weer schakelen om de informatie te vinden die je nodig hebt.

Luistergids

Waarom Graid? Probleem opgelost! [-00 05]

  • Traditionele RAID/MD-RAID loopt vast bij NVMe en PCIe Gen4/5/6: harde knelpunten in x16-lanes.
  • Onveilige noodoplossingen: RAID 0 + snapshots/controlepunten verhogen het risico en de beheerkosten.
  • CPU-gebonden wiskunde in MD-RAID leidt cycli af van apps; GPU's excelleren in parallelle pariteit/EC wiskunde.
  • Graid ontlast de gegevens naar de GPU en gebruikt peer-to-peer-paden, zodat de gegevens de kaart omzeilen (geen x16-choke).
  • Anekdote: Servers met 16–44 schijven vergroten de fysieke lane-mismatch van oudere HW RAID.

Vooruitlopen “x16 limieten” [05-10]

  • Betaalbare GPU's (A2000/A400) fungeren als verkeersregelaar en niet als datatransporteur: peer-to-peer NVMe-routering.
  • Echte builds: ~200 GB/s met ~24 schijven; nieuwe paden pushen ~300 GB/s/server.
  • Ontwerpafwegingen: ~24 x4-schijven voor maximale prestaties; 40+ schijven bij x2 bevorderen de capaciteit/IOPS.
  • Klein formaat: de voordelige versie ondersteunt maximaal ~12 schijven, ideaal voor AI-desktops.
  • Banter: "Hoe kan het sneller zijn dan x16?" - omdat de gegevens niet via de GPU worden verzonden.

AI-editie: gebruik bestaande reken-GPU's [-12 15]

  • Run Graid op H100/Blackwell, die heb je al; geen extra slot voor een RAID GPU.
  • Kleine footprint: ~6/144 SM's op H100; "vallen uit" bij inactiviteit om bronnen vrij te maken.
  • GPU Direct Storage verplaatst gegevens rechtstreeks van NVMe naar GPU-geheugen (lagere latentie/hops).
  • Behoud mid-riser slots voor 400/800G NIC's en andere accelerators.
  • Anekdote: "Voed het beest." Voorkom dat GPU's verhongeren door IO.

Lab impact en randpatronen [-15 20]

  • Bescheiden impact van tokens/sec tijdens inferentie; opslag en AI bereiken zelden tegelijkertijd hun piek.
  • Edge-implementaties: één 2U met 2 GPU's voor vastlegging, lichte training en inferentie op schaal.
  • Behoud IO-slots door bestaande GPU's te delen met Graid.
  • Voorbeelden: YOLO-stijl natuur-, detailhandel- en andere kant-en-klare inferentiemodellen.
  • Tip: Zorg voor voldoende opslagruimte om hongersnood door gebarsten pijpleidingen te voorkomen.

Integriteit, naamruimten en schaal [-20 25]

  • RAID is relevanter aan de edge: veerkracht zorgt ervoor dat GPU's productief blijven tijdens storingen.
  • Tijdelijke fouten: Detecteer slechte leesbewerkingen, bouw opnieuw op vanaf on-the-fly pariteit en verplaats gegevens.
  • Grote naamruimten: schijven van 61/122/256 TB-klasse maken grote beschermde pools waardevol.
  • Schaal via NVMe-oF JBOF's (RoCE/RDMA); 24-96+ onbewerkte apparaten hebben nog steeds nodig software-RAID.
  • Routekaart: Hoger aantal schijven + erasure coding voor flexibele beschermingsdomeinen.

Verder dan AI: databases, streaming, analyses [-26 30]

  • Databases/HFT: Redis, Aerospike en Oracle profiteren van snelle, consistente schrijfbewerkingen.
  • Splunk/log-opname: constante doorvoer voorkomt dataverlies en tegendruk.
  • Media: Multi-8K-streamservers kunnen het totale aantal servers voor een workload verminderen.
  • Beperkingen op het gebied van dichtheid en vermogen bevorderen hogere prestaties per RU bij colocaties.
  • Heropbouwen: Pariteit loopt via de GPU; lichte toename in latentie, zelden zichtbaar in de app.

Roadmap, PCIe Gen6, hoe te betrekken [30-35]

  • Eerst software: door Gen4 naar Gen5 te verplaatsen, worden de prestaties verbeterd, omdat Graid niet in het datapad zit.
  • Gen6-flash (~28 GB/s x4) vergroot de noodzaak om knelpunten te verwijderen.
  • Peer-to-peer + GPU-offloaded wiskunde maakt nieuwe PCIe-generaties mogelijk zonder hardware-churn.
  • Hoe te kopen: Dell-catalogus, Supermicro OEM, kanalen (CDW) en Amazon.
  • Maak kennis met Graid: een NVIDIA Inception-partner met stands op de GTC Washington en San Jose.

Neem contact op met StorageReview

Nieuwsbrief | YouTube | Podcast | iTunes / Spotify | Instagram | Twitter | TikTok | RSS-feed

Harold Frits

Ik zit in de technische industrie sinds IBM Selectric heeft gemaakt. Mijn achtergrond is echter schrijven. Dus besloot ik om uit de pre-sales biz te stappen en terug te keren naar mijn roots, een beetje te schrijven maar nog steeds betrokken te zijn bij technologie.