存储评论网

WEKA 将 NeuralMesh 与 NVIDIA STX 集成,以解决 AI 推理内存瓶颈问题

AI  ◇  企业版

WEKA宣布整合其 神经网格 该平台采用 NVIDIA STX 参考架构,将其增强型内存网格定位为下一代 AI 基础设施的核心组件。该组合解决方案旨在解决大规模推理环境中的主要制约因素之一:内存限制会影响性能、成本和可扩展性。

WEKA 的增强内存网格 (Augmented Memory Grid) 基于 NeuralMesh 运行,通过将键值缓存外部化并持久化来扩展 GPU 内存。在 NVIDIA STX 部署中,该架构支持用于智能体 AI 工作负载的高吞吐量上下文内存存储,从而实现跨会话、工具和工作流的长上下文推理。该公司表示,利用以下配置 NVIDIA Vera Rubin NVL72 该系统采用 BlueField-4 DPU 和 Spectrum-X 以太网,可将上下文内存令牌吞吐量提高 4 倍至 10 倍。该平台预计还能提供至少 320 GB/s 的读取吞吐量和 150 GB/s 的写入吞吐量,比传统 AI 存储系统的性能高出一倍以上。

内存基础设施成为推理瓶颈

WEKA 的集成方案围绕着人工智能部署中日益严峻的瓶颈——内存墙——展开。在现代推理流水线中,GPU 上有限的高带宽内存会导致频繁的键值缓存驱逐,从而造成重复计算并降低效率。随着并发量的增加,这些效率损失会不断累积,推高基础设施成本并降低系统可预测性。

该公司提倡采用共享键值缓存基础设施作为解决方案。通过跨用户和会话维护持久上下文,共享缓存可以消除冗余计算并稳定令牌吞吐量。 NVIDIA STX 为实现此模型提供了一个参考架构,其中 WEKA 提供存储和内存扩展层。

神经网格和增强记忆网格架构

NeuralMesh 是 WEKA 的分布式存储平台,旨在跨整个 NVIDIA STX 堆栈运行。该系统提供专为 AI 工作负载量身定制的高性能数据服务,而增强内存网格 (Augmented Memory Grid) 则作为一个专用的内存扩展层,将键值缓存 (KV cache) 汇集到 GPU 内存之外。

WEKA增强记忆网格图形

这种方法允许推理环境在不耗尽 GPU 资源的情况下维持长时间的上下文会话。通过保留缓存状态并支持跨工作负载的重用,该平台旨在随着部署规模的扩大,保持高利用率和稳定的性能。

WEKA 报告称,最初在 GTC 2025 上推出的增强型内存网格 (Augmented Memory Grid) 已在搭载 BlueField DPU 的 NVIDIA Grace CPU 平台上完成验证,并已正式发布。该架构显著提升了推理效率,包括大幅缩短首次令牌获取时间、提高每个 GPU 的令牌吞吐量,以及在并发量增加时保持性能稳定。将存储数据路径卸载到 BlueField-4 进一步降低了 CPU 开销,并最大限度地减少了 I/O 瓶颈。

性能和效率提升

在生产环境中,该平台旨在提升响应速度和基础设施效率。WEKA 指出,增强型内存网格 (Augmented Memory Grid) 可以将首次令牌响应时间 (Time-to-first-token) 缩短 4 倍至 20 倍,同时将每个 GPU 的令牌输出量提高 6.5 倍。这些性能提升得益于更高的键值缓存命中率和更少的重复计算,从而使系统能够在上下文窗口和用户数量增长的情况下保持性能。

AI基础设施提供商Firmus是率先将NeuralMesh技术应用于NVIDIA基础设施的公司之一。该公司报告称,大规模部署后,令牌吞吐量显著提升,延迟显著降低,并将这些优势归功于对现有GPU资源的更高效利用,而非硬件规模的扩展。

对人工智能基础设施设计的影响

此次集成凸显了人工智能系统架构的转变,内存和存储设计越来越决定着整体性能和成本效益。随着智能体人工智能工作负载的扩展和上下文窗口的增大,仅使用DRAM的方法由于不断增加的重复计算开销和GPU利用率不足而变得越来越不可行。

WEKA 将持久共享的键值缓存定位为 AI 工厂的基础功能。采用此模型的组织可以保持更高的 GPU 利用率,降低每次推理任务的能耗,并获得更可预测的扩展特性。相反,继续仅依赖本地 GPU 内存的环境,随着工作负载的扩展,可能会面临不断增加的运营成本和收益递减的问题。

可用性

WEKA 的增强记忆网格通常作为 NeuralMesh 平台的一部分提供。

参与 StorageReview

资讯订阅 | YouTube | 播客 iTunes/Spotify | Instagram | Twitter(现为X) | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。