StorageReview.com

ポッドキャスト#141: GraidがAIワークロードにエンタープライズRAID機能を提供

Enterprise

Storagereviewは、最新レビュー「GPUスピードでストレージを活用」をはじめ、数々のプロジェクトでGraidと協力してきましたが、彼らの仕事ぶりには感銘を受け続けています。今回のポッドキャストでは、ブライアンが友人であり、Graid TechnologyのOEMおよびチャネルビジネス開発担当シニアディレクターであるケリー・オスバーンと対談します。

ケリーは、OEMおよびチャネル販売戦略の策定と実行、主要なパートナーシップと関係の管理、そして当社の市場プレゼンスと収益の拡大を担っています。フラッシュメモリ、データストレージ、仮想化、クラウド、DevOps、コンテナ/Kubernetesに関する専門知識を活かし、お客様とパートナーに付加価値の高いソリューションを提供しています。

Graid Technologyは、インフラストラクチャの変更を最小限に抑えながら、AIワークロード向けのエンタープライズグレードのRAID機能を提供します。専用のハードウェアRAIDカードやカスタムアプライアンスではなく、AEはソフトウェアライセンスとして提供され、既存のNVIDIA GPUのごく一部のみを使用します。これにより、組織は追加のPCIeスロットを消費したり、インフラストラクチャの変更を必要とせず、トレーニングや推論ワークロードのGPUパフォーマンスに大きな影響を与えることなく、エンタープライズグレードのストレージパフォーマンスと信頼性を実現できます。

Brian と Kelley は、Graid ソリューションの機能、それが今日の AI 環境においてなぜ重要なのか、そして将来の展望について詳しく説明します。

既存のラックに GPU を追加せずに AI ワークロードの RAID パフォーマンスを向上させることに興味がある場合は、このポッドキャストが役立ちます。

ポッドキャストを全部聞く時間がない場合には、5 分間のセグメントに分割して、必要な情報を簡単に取得できるようにしています。

リスナーガイド

なぜGraid?問題は解決! [00 – 05]

  • 従来のRAID/MD-RAIDはNVMeで壁にぶつかる (NAIST) と PCIe Gen4/5/6 - ハード x16 レーンのボトルネック。
  • 安全でない一時しのぎ: RAID 0 + スナップショット/チェックポイントにより、リスクと管理オーバーヘッドが増加します。
  • MD-RAIDのCPU依存の計算はアプリからサイクルを転用する;GPUは並列パリティ/ECに優れている 算数。
  • Graid は GPU にオフロードし、ピアツーピア パスを使用するため、データはカードをバイパスします (x16 チョークなし)。
  • 逸話: 16 ~ 44 ドライブのサーバーでは、従来の HW RAID の物理レーンの不一致が拡大します。

追い抜く 「x16制限」 [05-10]

  • 手頃な価格の GPU (A2000/A400) は、データ フェリーではなく交通整理役として機能します (ピアツーピアの NVMe ルーティング)。
  • 実際の構築: 約 24 個のドライブで約 200 GB/秒。新しいパスによりサーバーあたり約 300 GB/秒がプッシュされます。
  • 設計上のトレードオフ: ピーク パフォーマンスを得るには約 24 台の x4 ドライブ、容量/IOPS を優先するには x2 で 40 台以上のドライブを使用します。
  • 小型フォーム ファクター: 低価格版は最大 12 台のドライブをサポートし、AI デスクトップに最適です。
  • 冗談: 「どうして x16 より速くなるのですか?」—データが GPU を通過しないからです。

AIエディション: 既存のコンピューティングGPUを使用する [12 – 15]

  • Graidを実行する すでに所有している H100/Blackwell。RAID GPU 用の追加スロットはありません。
  • フットプリントが非常に小さい: H100 上の SM は ~6/144 個。アイドル状態のときは「ドロップアウト」してリソースを解放します。
  • GPU ダイレクト ストレージは、NVMe から GPU メモリにデータを直接移動します (レイテンシ/ホップ数が少なくなります)。
  • ミッドライザー スロットは 400/800G NIC やその他のアクセラレータ用に確保しておきます。
  • 逸話: 「獣に餌をやれ」。GPU が IO で飢えないようにしましょう。

研究室のインパクトと エッジパターン [15 – 20]

  • 推論中はトークン/秒の影響は中程度で、ストレージと AI が同時にピークになることはほとんどありません。
  • エッジ展開: 大規模なキャプチャ、ライト トレイン、推論用の 2 つの GPU を備えた単一の 2U。
  • 既存の GPU を Graid と共有することで IO スロットを確保します。
  • 例: YOLO スタイルの野生生物、小売、その他のすぐに使用できる推論モデル。
  • ヒント: バースト的なパイプラインでストレージの枯渇を回避するためにストレージのサイズを決定します。

整合性、名前空間、スケール [20 – 25]

  • RAID はエッジでより重要になります。回復力により、障害発生時でも GPU の生産性が維持されます。
  • 一時的なエラー: 不正な読み取りを検出し、オンザフライのパリティから再構築し、データを再配置します。
  • 大きな名前空間: 61/122/256 TB クラスのドライブにより、大規模な保護プールが価値あるものになります。
  • NVMe‑oF JBOF (RoCE/RDMA) 経由でスケールします。 24–96以上のRAWデバイスでは、 ソフトウェア RAID。
  • ロードマップ: 柔軟な保護ドメインのためのドライブ数の増加と消去コーディング。

AIを超えて:データベース、ストリーミング、分析 [26 – 30]

  • データベース/HFT: Redis、 Aerospike と Oracle は、高速で一貫性のある書き込みのメリットを享受できます。
  • Splunk/ログ取り込み: 持続的なスループットにより、ドロップとバックプレッシャーを防止します。
  • メディア: マルチ 8K ストリーム サーバーは、ワークロードの合計サーバー数を削減できます。
  • 密度/電力の制約により、コロケーションでは RU あたりのパフォーマンスが向上することが望まれます。
  • 再構築: パリティは GPU を介して流れます。レイテンシがわずかに増加しますが、アプリで目立つことはほとんどありません。

ロードマップ、PCIe Gen6、取り組み方 [30-35]

  • ソフトウェアファースト: Gen4 を Gen5 に移行すると、Graid がデータ パスに存在しないため、パフォーマンスが向上します。
  • Gen6 フラッシュ (~28 GB/s x4) では、チョークポイントを削除する必要性が高まります。
  • ピアツーピア + GPU オフロード演算により、ハードウェアの変更なしで新しい PCIe 世代を実現できます。
  • 購入方法: Dell カタログ、Supermicro OEM、チャネル (CDW)、Amazon。
  • GTC ワシントンとサンノゼにブースを構える NVIDIA Inception パートナー、Graid をご紹介します。

StorageReview と連携する

ニュースレター| YouTube | ポッドキャスト(iTunes / Spotify) | Instagram | Twitter | TikTok | RSSフィード

ハロルド・フリッツ

IBM が Selectric を設立して以来、私はテクノロジー業界に携わってきました。しかし、私のバックグラウンドは執筆です。そこで私はプリセールスの仕事から抜け出し、自分のルーツに戻り、少し執筆活動をしながらもテクノロジーに携わることにしました。