Storagereview 與 Graid 合作過許多項目,包括我們最近的評論, GPU 速度的存儲, 他們繼續給人留下深刻的印象。在本期播客中,Brian 與他的朋友、Graid Technology 的 OEM 和通路業務發展高級總監 Kelley Osburn 進行了交談。
Kelley 負責制定和執行 OEM 和通路銷售策略,管理關鍵合作夥伴關係,並拓展公司的市場影響力和收入。他利用自己在快閃記憶體、資料儲存、虛擬化、雲端、DevOps 以及容器/Kubernetes 方面的專業知識,為我們的客戶和合作夥伴提供增值解決方案。
Graid 技術只需極少的基礎架構改動,即可為 AI 工作負載提供企業級 RAID 功能。 AE 並非專用硬體 RAID 卡或客製化設備,而是以軟體授權的形式提供,並且僅佔用現有 NVIDIA GPU 的一小部分資源。這使得企業能夠實現企業級儲存效能和可靠性,而無需佔用額外的 PCIe 插槽、進行基礎架構改造,也不會顯著影響 GPU 在訓練和推理工作負載中的效能。
Brian 和 Kelley 深入探討了 Graid 解決方案的功能、它在當今人工智慧領域的重要性以及未來的發展方向。
如果您有興趣提高 AI 工作負載的 RAID 效能,而無需在現有機架上添加更多 GPU,那麼本播客可以滿足您的需求。
如果您沒有時間收聽整個播客,我們將其分成五分鐘的片段,以便您可以輕鬆地跳轉以獲取所需的資訊。
聽眾指南
為什麼選擇 Graid?問題解決了! [00-05]
- 傳統 RAID/MD-RAID 與 NVMe 遭遇困境 以及 PCIe Gen4/5/6——x16 頻道硬瓶頸。
- 不安全的權宜之計:RAID 0 + 快照/檢查點會增加風險和管理開銷。
- MD-RAID 中 CPU 密集型數學運算轉移了應用程式的週期;GPU 擅長並行奇偶校驗/EC 數學。
- Graid 卸載到 GPU 並使用點對點路徑,因此資料繞過卡片(無 x16 阻塞)。
- 軼事:16-44 個磁碟機伺服器放大了傳統 HW RAID 的實體通道不匹配問題。
超越 “x16 限制” [05-10]
- 經濟實惠的 GPU(A2000/A400)充當交通警察,而不是資料渡輪-點對點 NVMe 路由。
- 實際建置:~200 GB/s,約 24 個磁碟機;新路徑推動~300 GB/s/伺服器。
- 設計權衡:~24 x4 驅動器可實現峰值效能;40+ x2 驅動器有利於容量/IOPS。
- 體積小巧:低成本版本支援最多約 12 個驅動器 - 非常適合 AI 桌面。
- 玩笑:「它怎麼會比 x16 快?」——因為資料不會遍歷 GPU。
AI 版:使用現有的運算 GPU [12-15]
- 運行 Graid H100/Blackwell,您已經擁有;沒有額外的 RAID GPU 插槽。
- 佔用空間極小:H100 上約 6/144 SM;空閒時「退出」以釋放資源。
- GPU 直接儲存將資料從 NVMe 直接移至 GPU 記憶體(更低的延遲/跳數)。
- 保留用於 400/800G NIC 和其他加速器的中置插槽。
- 軼事:「餵飽野獸。」防止 GPU 因 IO 而挨餓。
實驗室影響和 邊緣圖案 [15-20]
- 推理期間令牌/秒的影響適中;儲存和人工智慧很少同時達到高峰。
- 邊緣部署:單一 2U 配備 2 個 GPU,用於大規模捕捉、輕型訓練和推理。
- 透過與 Graid 共享現有 GPU 來保留 IO 插槽。
- 例如:YOLO 風格的野生動物、零售和其他可立即使用的推理模型。
- 提示:調整儲存空間大小以避免管線爆裂導致儲存空間不足。
完整性、命名空間和規模 [20-25]
- RAID 在邊緣更具相關性:彈性可使 GPU 在發生故障時保持高效能。
- 瞬態錯誤:偵測錯誤讀取、從動態奇偶校驗重建並重新定位資料。
- 大命名空間:61/122/256 TB 級硬碟使大型受保護池變得有價值。
- 透過 NVMe‑oF JBOF (RoCE/RDMA) 進行擴充; 24 - 96+ 原始設備仍然需要 軟體 RAID。
- 路線圖:更高的驅動器數量+擦除編碼,實現靈活的保護域。
超越人工智慧:資料庫、串流媒體、分析 [26-30]
- 資料庫/高頻交易:Redis, Aerospike 和 Oracle 受惠於快速、一致的寫入。
- Splunk/log 攝取:持續的吞吐量可防止遺失和背壓。
- 媒體:多 8K 流伺服器可以減少工作負載的總伺服器數。
- 密度/功率限制有利於在共置中實現更高的每 RU 性能。
- 重建:奇偶校驗流經 GPU;延遲略有增加,很少在應用程式可見。
路線圖、PCIe Gen6、如何參與 [30-35]
- 軟體優先:由於 Graid 不在資料路徑中,因此將 Gen4 移至 Gen5 可以提高效能。
- Gen6 快閃記憶體(~28 GB/s x4)放大了消除瓶頸的必要性。
- 點對點 + GPU 卸載數學解鎖了新一代 PCIe,無需硬體流失。
- 購買方式:戴爾目錄、Supermicro OEM、頻道(CDW)和亞馬遜。
- 認識 Graid:NVIDIA Inception 合作夥伴,在 GTC 華盛頓和聖荷西設有攤位。




Amazon