StorageReview.com

Podcast Nr. 141: Graid bietet Enterprise-RAID-Funktionalität für KI-Workloads

Unternehmen

Storagereview hat bereits in zahlreichen Projekten mit Graid zusammengearbeitet, darunter auch in unserem jüngsten Testbericht „ Speicher mit GPU-Geschwindigkeit“, und ist weiterhin beeindruckt. In diesem Podcast unterhält sich Brian mit seiner Freundin Kelley Osburn, Senior Director of OEM and Channel Business Development bei Graid Technology.

Kelley ist verantwortlich für die Entwicklung und Umsetzung der OEM- und Channel-Vertriebsstrategie, die Pflege wichtiger Partnerschaften und Beziehungen sowie den Ausbau der Marktpräsenz und des Umsatzes des Unternehmens. Er nutzt seine Expertise in den Bereichen Flash-Speicher, Datenspeicherung, Virtualisierung, Cloud, DevOps und Container/Kubernetes, um unseren Kunden und Partnern Mehrwertlösungen zu bieten.

Graid Technology bietet RAID-Funktionalität auf Enterprise-Niveau für KI-Workloads mit minimalen Infrastrukturänderungen. Anstelle einer dedizierten Hardware-RAID-Karte oder eines benutzerdefinierten Geräts wird AE als Softwarelizenz angeboten und nutzt nur einen kleinen Teil einer vorhandenen NVIDIA-GPU. Dies ermöglicht Unternehmen, Speicherleistung und Zuverlässigkeit auf Enterprise-Niveau zu erreichen, ohne zusätzliche PCIe-Steckplätze zu belegen, Infrastrukturänderungen vorzunehmen oder die GPU-Leistung für Trainings- und Inferenz-Workloads erheblich zu beeinträchtigen.

Brian und Kelley tauchen in die Funktionalität der Graid-Lösung ein, erklären, warum sie in der heutigen KI-Landschaft so wichtig ist und was die Zukunft bringt.

Wenn Sie die RAID-Leistung für KI-Workloads verbessern möchten, ohne Ihren vorhandenen Racks weitere GPUs hinzuzufügen, ist dieser Podcast die Lösung.

Wenn Sie keine Zeit haben, sich den gesamten Podcast anzuhören, haben wir ihn in fünfminütige Abschnitte unterteilt, sodass Sie problemlos zwischen den Abschnitten wechseln und die gewünschten Informationen abrufen können.

Hörerhandbuch

Warum Graid? Problem gelöst! [00-05]

  • Herkömmliches RAID/MD-RAID stößt bei NVMe an seine Grenzen und PCIe Gen4/5/6 – harte x16-Lane-Engpässe.
  • Unsichere Notlösungen: RAID 0 + Snapshots/Checkpoints erhöhen das Risiko und den Verwaltungsaufwand.
  • CPU-gebundene Mathematik in MD-RAID lenkt Zyklen von Apps ab; GPUs zeichnen sich durch parallele Parität/EC aus Mathematik.
  • Graid verlagert die Last auf die GPU und verwendet Peer-to-Peer-Pfade, sodass die Daten die Karte umgehen (keine x16-Drosselung).
  • Anekdote: Server mit 16–44 Laufwerken verstärken die physische Lane-Fehlanpassung von Legacy-HW-RAID.

Überholen „x16-Grenzen“ [05-10]

  • Preisgünstige GPUs (A2000/A400) fungieren als Verkehrspolizisten, nicht als Datenfähren – Peer-to-Peer-NVMe-Routing.
  • Echte Builds: ~200 GB/s mit ~24 Laufwerken; neue Pfade bringen ~300 GB/s/Server.
  • Design-Kompromisse: ~24 x4-Laufwerke für Spitzenleistung; 40+ Laufwerke bei x2 begünstigen Kapazität/IOPS.
  • Kleiner Formfaktor: Die kostengünstige Edition unterstützt bis zu ~12 Laufwerke – ideal für KI-Desktops.
  • Scherz: „Wie kann es schneller sein als x16?“ – weil die Daten nicht die GPU durchlaufen.

AI Edition: Vorhandene Rechen-GPUs nutzen [12-15]

  • Führen Sie Graid aus auf H100/Blackwell besitzen Sie bereits; kein zusätzlicher Steckplatz für eine RAID-GPU.
  • Winziger Platzbedarf: ~6/144 SMs auf H100; „fallen aus“, wenn sie im Leerlauf sind, um Ressourcen freizugeben.
  • GPU Direct Storage verschiebt Daten direkt von NVMe in den GPU-Speicher (geringere Latenz/Hops).
  • Behalten Sie Mid-Riser-Steckplätze für 400/800G-NICs und andere Beschleuniger.
  • Anekdote: „Füttere das Biest.“ Verhindern Sie, dass GPUs bei der E/A verhungern.

Laborauswirkungen und Kantenmuster [15-20]

  • Geringe Auswirkungen auf Token/Sekunde während der Inferenz; Speicher und KI erreichen selten gleichzeitig Spitzenwerte.
  • Edge-Bereitstellungen: Einzelne 2U mit 2 GPUs für Erfassung, Light Train und Inferenz im großen Maßstab.
  • Bewahren Sie IO-Steckplätze auf, indem Sie vorhandene GPUs mit Graid teilen.
  • Beispiele: Wildtier-, Einzelhandels- und andere gebrauchsfertige Inferenzmodelle im YOLO-Stil.
  • Tipp: Bemessen Sie den Speicher so, dass bei platzenden Pipelines kein Unterversorgungszustand auftritt.

Integrität, Namespaces und Skalierung [20-25]

  • RAID ist am Rand relevanter: Durch die Ausfallsicherheit bleiben GPUs bei Fehlern produktiv.
  • Vorübergehende Fehler: Erkennen Sie fehlerhafte Lesevorgänge, erstellen Sie die Daten mithilfe der On-the-Fly-Parität neu und verschieben Sie sie.
  • Große Namespaces: Laufwerke der 61/122/256-TB-Klasse machen große geschützte Pools wertvoll.
  • Skalierung über NVMe-oF JBOFs (RoCE/RDMA); 24-96+ Raw-Geräte erfordern immer noch Software-RAID.
  • Roadmap: Höhere Laufwerksanzahl + Erasure Coding für flexible Schutzdomänen.

Mehr als KI: Datenbanken, Streaming, Analytik [26-30]

  • Datenbanken/HFT: Redis, Aerospike und Oracle profitieren von schnellen, konsistenten Schreibvorgängen.
  • Splunk/Log-Ingest: Kontinuierlicher Durchsatz verhindert Ausfälle und Gegendruck.
  • Medien: Mehrere 8K-Streamserver können die Gesamtzahl der Server für eine Arbeitslast reduzieren.
  • Dichte-/Leistungsbeschränkungen begünstigen eine höhere Leistung pro RU in Colocations.
  • Neuaufbauten: Parität fließt durch die GPU; leichte Latenzerhöhung, selten in der Anwendung sichtbar.

Roadmap, PCIe Gen6, wie man sich engagiert [30-35]

  • Software zuerst: Die Migration von Gen4 zu Gen5 steigert die Leistung, da Graid nicht im Datenpfad liegt.
  • Gen6-Flash (~28 GB/s x4) verstärkt die Notwendigkeit, Engpässe zu beseitigen.
  • Peer-to-Peer + GPU-offloaded-Mathematik erschließt neue PCIe-Generationen ohne HW-Fluktuation.
  • So kaufen Sie: Dell-Katalog, Supermicro OEM, Kanäle (CDW) und Amazon.
  • Lernen Sie Graid kennen: Ein NVIDIA Inception-Partner mit Ständen auf der GTC Washington und San Jose.

Beteiligen Sie sich an StorageReview

Newsletter | YouTube | Podcast (iTunes / Spotify) | Instagram | Twitter | TikTok | RSS-Feed

Harold Fritts

Ich bin in der Technologiebranche tätig, seit IBM Selectric gegründet hat. Mein Hintergrund ist jedoch das Schreiben. Also beschloss ich, aus dem Vorverkaufsgeschäft auszusteigen und zu meinen Wurzeln zurückzukehren, ein bisschen zu schreiben, mich aber immer noch mit Technologie zu beschäftigen.