Storagereviewは、最新レビュー「GPUスピードでストレージを活用」をはじめ、数々のプロジェクトでGraidと協力してきましたが、彼らの仕事ぶりには感銘を受け続けています。今回のポッドキャストでは、ブライアンが友人であり、Graid TechnologyのOEMおよびチャネルビジネス開発担当シニアディレクターであるケリー・オスバーンと対談します。
ケリーは、OEMおよびチャネル販売戦略の策定と実行、主要なパートナーシップと関係の管理、そして当社の市場プレゼンスと収益の拡大を担っています。フラッシュメモリ、データストレージ、仮想化、クラウド、DevOps、コンテナ/Kubernetesに関する専門知識を活かし、お客様とパートナーに付加価値の高いソリューションを提供しています。
Graid Technologyは、インフラストラクチャの変更を最小限に抑えながら、AIワークロード向けのエンタープライズグレードのRAID機能を提供します。専用のハードウェアRAIDカードやカスタムアプライアンスではなく、AEはソフトウェアライセンスとして提供され、既存のNVIDIA GPUのごく一部のみを使用します。これにより、組織は追加のPCIeスロットを消費したり、インフラストラクチャの変更を必要とせず、トレーニングや推論ワークロードのGPUパフォーマンスに大きな影響を与えることなく、エンタープライズグレードのストレージパフォーマンスと信頼性を実現できます。
Brian と Kelley は、Graid ソリューションの機能、それが今日の AI 環境においてなぜ重要なのか、そして将来の展望について詳しく説明します。
既存のラックに GPU を追加せずに AI ワークロードの RAID パフォーマンスを向上させることに興味がある場合は、このポッドキャストが役立ちます。
ポッドキャストを全部聞く時間がない場合には、5 分間のセグメントに分割して、必要な情報を簡単に取得できるようにしています。
リスナーガイド
なぜGraid?問題は解決! [00 – 05]
- 従来のRAID/MD-RAIDはNVMeで壁にぶつかる (NAIST) と PCIe Gen4/5/6 - ハード x16 レーンのボトルネック。
- 安全でない一時しのぎ: RAID 0 + スナップショット/チェックポイントにより、リスクと管理オーバーヘッドが増加します。
- MD-RAIDのCPU依存の計算はアプリからサイクルを転用する;GPUは並列パリティ/ECに優れている 算数。
- Graid は GPU にオフロードし、ピアツーピア パスを使用するため、データはカードをバイパスします (x16 チョークなし)。
- 逸話: 16 ~ 44 ドライブのサーバーでは、従来の HW RAID の物理レーンの不一致が拡大します。
追い抜く 「x16制限」 [05-10]
- 手頃な価格の GPU (A2000/A400) は、データ フェリーではなく交通整理役として機能します (ピアツーピアの NVMe ルーティング)。
- 実際の構築: 約 24 個のドライブで約 200 GB/秒。新しいパスによりサーバーあたり約 300 GB/秒がプッシュされます。
- 設計上のトレードオフ: ピーク パフォーマンスを得るには約 24 台の x4 ドライブ、容量/IOPS を優先するには x2 で 40 台以上のドライブを使用します。
- 小型フォーム ファクター: 低価格版は最大 12 台のドライブをサポートし、AI デスクトップに最適です。
- 冗談: 「どうして x16 より速くなるのですか?」—データが GPU を通過しないからです。
AIエディション: 既存のコンピューティングGPUを使用する [12 – 15]
- Graidを実行する すでに所有している H100/Blackwell。RAID GPU 用の追加スロットはありません。
- フットプリントが非常に小さい: H100 上の SM は ~6/144 個。アイドル状態のときは「ドロップアウト」してリソースを解放します。
- GPU ダイレクト ストレージは、NVMe から GPU メモリにデータを直接移動します (レイテンシ/ホップ数が少なくなります)。
- ミッドライザー スロットは 400/800G NIC やその他のアクセラレータ用に確保しておきます。
- 逸話: 「獣に餌をやれ」。GPU が IO で飢えないようにしましょう。
研究室のインパクトと エッジパターン [15 – 20]
- 推論中はトークン/秒の影響は中程度で、ストレージと AI が同時にピークになることはほとんどありません。
- エッジ展開: 大規模なキャプチャ、ライト トレイン、推論用の 2 つの GPU を備えた単一の 2U。
- 既存の GPU を Graid と共有することで IO スロットを確保します。
- 例: YOLO スタイルの野生生物、小売、その他のすぐに使用できる推論モデル。
- ヒント: バースト的なパイプラインでストレージの枯渇を回避するためにストレージのサイズを決定します。
整合性、名前空間、スケール [20 – 25]
- RAID はエッジでより重要になります。回復力により、障害発生時でも GPU の生産性が維持されます。
- 一時的なエラー: 不正な読み取りを検出し、オンザフライのパリティから再構築し、データを再配置します。
- 大きな名前空間: 61/122/256 TB クラスのドライブにより、大規模な保護プールが価値あるものになります。
- NVMe‑oF JBOF (RoCE/RDMA) 経由でスケールします。 24–96以上のRAWデバイスでは、 ソフトウェア RAID。
- ロードマップ: 柔軟な保護ドメインのためのドライブ数の増加と消去コーディング。
AIを超えて:データベース、ストリーミング、分析 [26 – 30]
- データベース/HFT: Redis、 Aerospike と Oracle は、高速で一貫性のある書き込みのメリットを享受できます。
- Splunk/ログ取り込み: 持続的なスループットにより、ドロップとバックプレッシャーを防止します。
- メディア: マルチ 8K ストリーム サーバーは、ワークロードの合計サーバー数を削減できます。
- 密度/電力の制約により、コロケーションでは RU あたりのパフォーマンスが向上することが望まれます。
- 再構築: パリティは GPU を介して流れます。レイテンシがわずかに増加しますが、アプリで目立つことはほとんどありません。
ロードマップ、PCIe Gen6、取り組み方 [30-35]
- ソフトウェアファースト: Gen4 を Gen5 に移行すると、Graid がデータ パスに存在しないため、パフォーマンスが向上します。
- Gen6 フラッシュ (~28 GB/s x4) では、チョークポイントを削除する必要性が高まります。
- ピアツーピア + GPU オフロード演算により、ハードウェアの変更なしで新しい PCIe 世代を実現できます。
- 購入方法: Dell カタログ、Supermicro OEM、チャネル (CDW)、Amazon。
- GTC ワシントンとサンノゼにブースを構える NVIDIA Inception パートナー、Graid をご紹介します。




Amazon