存储评论网

Cloudera 和 VAST Data 携手推出联合 AI 工厂堆栈,旨在解决 GPU 资源匮乏问题。

AI  ◇  企业版

Cloudera 和 VAST Data 已达成合作,共同构建一个统一的 AI 工厂架构,旨在为运行持续 AI 训练、推理和分析工作负载的企业提供支持。该联合产品将 Cloudera 的容器化数据服务与 VAST AI 操作系统相结合,旨在解决企业 AI 部署中日益普遍的问题:昂贵的 GPU 集群因等待数据而闲置。

这种GPU空闲问题,通常被称为GPU资源匮乏,往往出现在企业将AI工作负载生硬地部署到原本并非为满足现代AI流水线持续高吞吐量需求而设计的数据架构上时。数据准备、训练、推理和分析都在争夺同一基础设施,当数据层无法跟上时,加速器就会停止工作。Cloudera和VAST正致力于通过整合其技术栈来解决这一瓶颈,旨在确保GPU在整个AI生命周期中都能获得低延迟的数据。

建筑是如何建造的

Cloudera方面,该公司采用了其湖屋架构,将数据工程、流处理、分析、机器学习和人工智能服务打包到可移植容器中,这些容器可以在混合云和多云环境中运行。这为客户提供了一致的运营模式,无论工作负载实际在何处执行。

VAST 贡献其 Disaggregated Shared Everything (DASE) 架构作为底层数据基础设施,可扩展至 EB 级,同时将矢量数据库服务与 NVIDIA cuVS 集成,实现 GPU 加速的矢量索引和搜索。VAST AI 操作系统基于 NVIDIA AI 数据平台参考设计构建,旨在将潜在的企业数据转化为可供训练和推理管道直接使用的 AI 就绪状态。Cloudera 在此基础上构建了其数据工程、治理和 AI 服务。

该组合技术栈旨在覆盖从原始数据摄取到模型部署的完整路径,并在数据中心、私有云和公有云之间实现一致的操作。Cloudera 和 VAST 表示,该架构通过高带宽、低延迟的数据管道消除了 GPU 资源不足的问题,从而提高了 GPU 的持续利用率和计算效率。该平台还能够大规模处理结构化、非结构化和多模态数据集,并具备企业级治理和合规控制功能,适用于私有和自主的 AI 部署。

NVIDIA 集成和推理

此次合作高度依赖 NVIDIA 的技术栈。除了 VAST AI 操作系统所依赖的 AI 数据平台参考设计之外,两家公司还将 NVIDIA AI 企业版软件集成到联合架构中。Cloudera 的 AI 推理服务利用 NVIDIA NIM 微服务,使企业能够直接在自身数据上部署和扩展模型,包括 NVIDIA 最新的 Nemotron 开放模型。

在数据工程方面,客户可以使用 NVIDIA cuDF 加速 Apache Spark 工作负载,该 cuDF 与 Cloudera 数据工程无缝集成。这使得 Spark 作业能够利用 VAST 的高吞吐量数据服务进行 GPU 加速处理,从而有助于 AI 流水线中数据密集型阶段的效率提升,而不仅仅是训练和推理阶段。

特别是对于受监管的行业,Cloudera 和 VAST 将其定位为“从芯片到应用”的解决方案,涵盖从底层 NVIDIA 硬件和软件到生产 AI 应用的所有内容,可根据数据驻留和合规性要求部署在本地或云端。

可用性

两家公司表示,此次合作将整合其已安装用户群中 60 艾字节的客户管理数据,使两家供应商都能拥有庞大的现有企业客户群,以便在对私有 AI 基础设施的需求不断增长时瞄准这些客户。

Cloudera 与 VAST 联合推出的 AI 工厂解决方案现已通过两家公司的企业销售团队和合作伙伴网络发售。Cloudera 和 VAST 计划在 2026 年前扩展产品组合,推出更多参考架构、经过验证的部署模式和行业特定解决方案。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。