Storagereview 与 Graid 在多个项目上都有合作,包括我们最近发布的评测文章《GPU 速度下的存储》,他们一直表现出色。在本期播客中,Brian 将与他的朋友、Graid Technology 的 OEM 和渠道业务发展高级总监 Kelley Osburn 进行对话。
Kelley 负责制定和执行 OEM 和渠道销售战略,管理关键合作伙伴关系,并拓展公司的市场影响力和收入。他利用自己在闪存、数据存储、虚拟化、云、DevOps 以及容器/Kubernetes 方面的专业知识,为我们的客户和合作伙伴提供增值解决方案。
Graid 技术只需极少的基础架构改动,即可为 AI 工作负载提供企业级 RAID 功能。AE 并非专用硬件 RAID 卡或定制设备,而是以软件许可证的形式提供,并且仅占用现有 NVIDIA GPU 的一小部分资源。这使得企业能够实现企业级存储性能和可靠性,而无需占用额外的 PCIe 插槽、进行基础架构改造,也不会显著影响 GPU 在训练和推理工作负载中的性能。
Brian 和 Kelley 深入探讨了 Graid 解决方案的功能、它在当今人工智能领域的重要性以及未来的发展方向。
如果您有兴趣提高 AI 工作负载的 RAID 性能,而无需在现有机架上添加更多 GPU,那么本播客可以满足您的需求。
如果您没有时间收听整个播客,我们将其分成五分钟的片段,以便您可以轻松地跳转以获取所需的信息。
听众指南
为什么选择 Graid?问题解决了! [00-05]
- 传统 RAID/MD-RAID 与 NVMe 遭遇困境 和 PCIe Gen4/5/6——x16 通道硬瓶颈。
- 不安全的权宜之计:RAID 0 + 快照/检查点会增加风险和管理开销。
- MD-RAID 中 CPU 密集型数学运算转移了应用程序的周期;GPU 擅长并行奇偶校验/EC 数学。
- Graid 卸载到 GPU 并使用点对点路径,因此数据绕过卡(无 x16 阻塞)。
- 轶事:16-44 个驱动器服务器放大了传统 HW RAID 的物理通道不匹配问题。
超越 “x16 限制” [05-10]
- 经济实惠的 GPU(A2000/A400)充当交通警察,而不是数据渡轮——点对点 NVMe 路由。
- 实际构建:~200 GB/s,约 24 个驱动器;新路径推动~300 GB/s/服务器。
- 设计权衡:~24 x4 驱动器可实现峰值性能;40+ x2 驱动器有利于容量/IOPS。
- 体积小巧:低成本版本最多支持约 12 个驱动器 - 非常适合 AI 桌面。
- 玩笑:“它怎么会比 x16 更快?”——因为数据不会遍历 GPU。
AI 版:使用现有的计算 GPU [12-15]
- 运行 Graid H100/Blackwell,您已经拥有;没有额外的 RAID GPU 插槽。
- 占用空间极小:H100 上约 6/144 SM;空闲时“退出”以释放资源。
- GPU 直接存储将数据从 NVMe 直接移动到 GPU 内存(更低的延迟/跳数)。
- 保留用于 400/800G NIC 和其他加速器的中置插槽。
- 轶事:“喂饱野兽。”防止 GPU 因 IO 而挨饿。
实验室影响和 边缘图案 [15-20]
- 推理期间令牌/秒的影响适中;存储和人工智能很少同时达到峰值。
- 边缘部署:单个 2U 配备 2 个 GPU,用于大规模捕获、轻型训练和推理。
- 通过与 Graid 共享现有 GPU 来保留 IO 插槽。
- 示例:YOLO 风格的野生动物、零售和其他可立即使用的推理模型。
- 提示:调整存储空间大小以避免管道爆裂导致存储空间不足。
完整性、命名空间和规模 [20-25]
- RAID 在边缘更具相关性:弹性可使 GPU 在发生故障时保持高效。
- 瞬态错误:检测错误读取、从动态奇偶校验重建并重新定位数据。
- 大命名空间:61/122/256 TB 级驱动器使大型受保护池变得有价值。
- 通过 NVMe‑oF JBOF (RoCE/RDMA) 进行扩展; 24–96+ 原始设备仍然需要 软件 RAID。
- 路线图:更高的驱动器数量+擦除编码,实现灵活的保护域。
超越人工智能:数据库、流媒体、分析 [26-30]
- 数据库/高频交易:Redis, Aerospike 和 Oracle 受益于快速、一致的写入。
- Splunk/log 摄取:持续的吞吐量可防止丢失和背压。
- 媒体:多 8K 流服务器可以减少工作负载的总服务器数量。
- 密度/功率限制有利于在共置中实现更高的每 RU 性能。
- 重建:奇偶校验流经 GPU;延迟略有增加,很少在应用程序可见。
路线图、PCIe Gen6、如何参与 [30-35]
- 软件优先:由于 Graid 不在数据路径中,因此将 Gen4 移动到 Gen5 可以提高性能。
- Gen6 闪存(~28 GB/s x4)放大了消除瓶颈的必要性。
- 点对点 + GPU 卸载数学解锁了新一代 PCIe,无需硬件流失。
- 购买方式:戴尔目录、Supermicro OEM、渠道(CDW)和亚马逊。
- 认识 Graid:NVIDIA Inception 合作伙伴,在 GTC 华盛顿和圣何塞设有展位。




Amazon