存储评论网

播客#141:Graid 为 AI 工作负载提供企业 RAID 功能

企业版

Storagereview 与 Graid 在多个项目上都有合作,包括我们最近发布的评测文章《GPU 速度下的存储》,他们一直表现出色。在本期播客中,Brian 将与他的朋友、Graid Technology 的 OEM 和渠道业务发展高级总监 Kelley Osburn 进行对话。

Kelley 负责制定和执行 OEM 和渠道销售战略,管理关键合作伙伴关系,并拓展公司的市场影响力和收入。他利用自己在闪存、数据存储、虚拟化、云、DevOps 以及容器/Kubernetes 方面的专业知识,为我们的客户和合作伙伴提供增值解决方案。

Graid 技术只需极少的基础架构改动,即可为 AI 工作负载提供企业级 RAID 功能。AE 并非专用硬件 RAID 卡或定制设备,而是以软件许可证的形式提供,并且仅占用现有 NVIDIA GPU 的一小部分资源。这使得企业能够实现企业级存储性能和可靠性,而无需占用额外的 PCIe 插槽、进行基础架构改造,也不会显著影响 GPU 在训练和推理工作负载中的性能。

Brian 和 Kelley 深入探讨了 Graid 解决方案的功能、它在当今人工智能领域的重要性以及未来的发展方向。

如果您有兴趣提高 AI 工作负载的 RAID 性能,而无需在现有机架上添加更多 GPU,那么本播客可以满足您的需求。

如果您没有时间收听整个播客,我们将其分成五分钟的片段,以便您可以轻松地跳转以获取所需的信息。

听众指南

为什么选择 Graid?问题解决了! [00-05]

  • 传统 RAID/MD-RAID 与 NVMe 遭遇困境 PCIe Gen4/5/6——x16 通道硬瓶颈。
  • 不安全的权宜之计:RAID 0 + 快照/检查点会增加风险和管理开销。
  • MD-RAID 中 CPU 密集型数学运算转移了应用程序的周期;GPU 擅长并行奇偶校验/EC 数学。
  • Graid 卸载到 GPU 并使用点对点路径,因此数据绕过卡(无 x16 阻塞)。
  • 轶事:16-44 个驱动器服务器放大了传统 HW RAID 的物理通道不匹配问题。

超越 “x16 限制” [05-10]

  • 经济实惠的 GPU(A2000/A400)充当交通警察,而不是数据渡轮——点对点 NVMe 路由。
  • 实际构建:~200 GB/s,约 24 个驱动器;新路径推动~300 GB/s/服务器。
  • 设计权衡:~24 x4 驱动器可实现峰值性能;40+ x2 驱动器有利于容量/IOPS。
  • 体积小巧:低成本版本最多支持约 12 个驱动器 - 非常适合 AI 桌面。
  • 玩笑:“它怎么会比 x16 更快?”——因为数据不会遍历 GPU。

AI 版:使用现有的计算 GPU [12-15]

  • 运行 Graid H100/Blackwell,您已经拥有;没有额外的 RAID GPU 插槽。
  • 占用空间极小:H100 上约 6/144 SM;空闲时“退出”以释放资源。
  • GPU 直接存储将数据从 NVMe 直接移动到 GPU 内存(更低的延迟/跳数)。
  • 保留用于 400/800G NIC 和其他加速器的中置插槽。
  • 轶事:“喂饱野兽。”防止 GPU 因 IO 而挨饿。

实验室影响和 边缘图案 [15-20]

  • 推理期间令牌/秒的影响适中;存储和人工智能很少同时达到峰值。
  • 边缘部署:单个 2U 配备 2 个 GPU,用于大规模捕获、轻型训练和推理。
  • 通过与 Graid 共享现有 GPU 来保留 IO 插槽。
  • 示例:YOLO 风格的野生动物、零售和其他可立即使用的推理模型。
  • 提示:调整存储空间大小以避免管道爆裂导致存储空间不足。

完整性、命名空间和规模 [20-25]

  • RAID 在边缘更具相关性:弹性可使 GPU 在发生故障时保持高效。
  • 瞬态错误:检测错误读取、从动态奇偶校验重建并重新定位数据。
  • 大命名空间:61/122/256 TB 级驱动器使大型受保护池变得有价值。
  • 通过 NVMe‑oF JBOF (RoCE/RDMA) 进行扩展; 2496+ 原始设备仍然需要 软件 RAID。
  • 路线图:更高的驱动器数量+擦除编码,实现灵活的保护域。

超越人工智能:数据库、流媒体、分析 [26-30]

  • 数据库/高频交易:Redis, Aerospike 和 Oracle 受益于快速、一致的写入。
  • Splunk/log 摄取:持续的吞吐量可防止丢失和背压。
  • 媒体:多 8K 流服务器可以减少工作负载的总服务器数量。
  • 密度/功率限制有利于在共置中实现更高的每 RU 性能。
  • 重建:奇偶校验流经 GPU;延迟略有增加,很少在应用程序可见。

路线图、PCIe Gen6、如何参与 [30-35]

  • 软件优先:由于 Graid 不在数据路径中,因此将 Gen4 移动到 Gen5 可以提高性能。
  • Gen6 闪存(~28 GB/s x4)放大了消除瓶颈的必要性。
  • 点对点 + GPU 卸载数学解锁了新一代 PCIe,无需硬件流失。
  • 购买方式:戴尔目录、Supermicro OEM、渠道(CDW)和亚马逊。
  • 认识 Graid:NVIDIA Inception 合作伙伴,在 GTC 华盛顿和圣何塞设有展位。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。