存储评论网

NVIDIA 和 Google Cloud 将在 Next 2026 大会上扩展 AI 超级计算机平台

AI  ◇  企业版

NVIDIA 和 Google Cloud 在拉斯维加斯举行的 Google Cloud Next 大会上宣布了双方长期工程合作的新阶段,并介绍了 Google Cloud AI 超级计算机平台的更新,旨在扩展智能体和物理 AI 在生产环境中的应用。两家公司将继续合作设计涵盖芯片、系统、网络和软件的基础设施,以支持日益复杂的 AI 工作负载,包括自主代理、机器人和数字孪生。

NVIDIA 和 Google Cloud 的标志

Vera Rubin 开发的 A5X 基础设施瞄准大规模人工智能工厂

Google Cloud 推出了基于 A5X 的裸金属实例。 NVIDIA Vera Rubin NVL72 机架级系统。这些系统旨在显著提高推理的经济性和效率,与上一代系统相比,每个令牌的成本最多可降低 10 倍,每兆瓦的令牌吞吐量最多可提高 10 倍。

Vera Rubin Stack 来自 GTC 26

A5X平台集成了 NVIDIA ConnectX-9 超级网卡该架构采用谷歌新一代 Virgo 网络堆栈,支持单站点集群扩展至 80,000 万个 Rubin GPU,以及跨多站点部署扩展至 960,000 万个 GPU。其设计目标场景是超大规模 AI 训练和推理环境,在这些环境中,网络性能和系统级优化至关重要。

谷歌云强调,紧密集成的基础设施和托管式人工智能服务是支持下一代人工智能工作负载的必要条件。这一组合技术栈使客户能够训练、微调和部署模型,并着重提升性能、效率和运营可扩展性。

布莱克威尔广泛的产品组合助力实现适度加速

Google Cloud 还概述了其基于 NVIDIA Blackwell 的实例产品组合,涵盖各种部署规模和性能配置。产品包括基于 NVIDIA HGX B200 系统的 A4 虚拟机、基于 GB200 和 GB300 NVL72 平台的 A4X 和 A4X Max 配置,以及通过 G4 实例提供的 GPU 部分访问权限。 RTX PRO 6000 Blackwell 服务器版 GPUs.

RTX PRO 6000

该系列产品使企业能够根据工作负载需求调整基础设施。配置范围从用于轻量级推理任务的部分GPU,到配备72个GPU的完整NVL72机架(通过第五代NVLink和NVLink交换机技术互连)。高端部署可扩展至数万个GPU,用于大型模型训练和分布式推理。

这些系统旨在支持一系列人工智能工作负载,包括混合专家 (MoE) 模型、多模态推理、大规模数据处理以及机器人和物理人工智能的仿真工作负载。

早期用户已经开始使用该平台。思维机器实验室正在使用 GB300 NVL72OpenAI 使用基于 A4X Max 的实例来扩展其 Tinker API 的训练,而 OpenAI 则在 Google Cloud 上基于 GB200 和 GB300 的实例上运行大规模推理工作负载,包括 ChatGPT。

机密人工智能扩展到 Blackwell GPU

谷歌云正在将其机密计算能力扩展到其人工智能基础设施。基于 NVIDIA Blackwell 和 Blackwell Ultra GPU 的 Gemini 模型现已在谷歌分布式云上提供预览版,使企业能够将模型部署在更靠近敏感数据源的位置。

Google Cloud 安全控制图表

NVIDIA Confidential Computing 可实现加密执行环境,确保提示信息和微调数据免受未经授权的访问,包括云运营商的访问。此功能也即将通过配备 RTX PRO 6000 Blackwell GPU 的 Confidential G4 虚拟机引入多租户环境。

这标志着 Blackwell GPU 在公共云中首次实现机密计算,目标客户是需要严格数据保护且同时需要访问高性能 AI 基础设施的受监管行业。

面向智能体的开放模型和托管强化学习管道

该平台支持广泛的模型生态系统,包括谷歌的 Gemini 和 Gemma 模型以及英伟达的 Nemotron 开放模型。 NVIDIA Nemotron 3 Super 现已与 Gemini 企业代理平台集成,使开发人员能够构建和部署推理驱动的代理工作流。

Google Cloud 还推出了基于 NVIDIA NeMo 构建的强化学习 API 的托管训练集群。这项服务可自动完成集群配置、作业编排和故障处理,从而支持大规模强化学习训练。其目标是降低运维复杂性,使团队能够专注于模型行为和优化。

CrowdStrike 使用 NVIDIA NeMo 工具(包括 Data Designer、Automodel 和 Megatron Bridge)生成合成数据并微调特定领域的网络安全模型。这些工作流程运行在基于 Blackwell 的基础架构上,从而加速威胁检测和响应流程。

不断扩展的工业和物理人工智能工作负载

该联合平台还面向工业和物理人工智能应用场景。Cadence 和西门子数字化工业软件的应用现已在 Google Cloud 上提供,并借助 NVIDIA 加速技术,支持半导体、汽车、航空航天和重型设备等行业的各种设计、仿真和制造工作流程。

NVIDIA Omniverse 库和 Isaac Sim 已在 Google Cloud Marketplace 上架,可用于开发物理上精确的数字孪生模型和机器人仿真流程。这些工具使企业能够在部署前对系统进行仿真和验证。

此外,NVIDIA NIM 微服务可以部署在 Vertex AI 和 Google Kubernetes Engine 上,以支持视觉 AI 和机器人工作负载。这些服务支持实时视频分析、机器人规划和自动化数据处理等功能。

平台聚焦:从实验到生产

此次更新将 Google Cloud AI Hypercomputer 定位为一个全栈平台,用于将 AI 工作负载从研究阶段迁移到生产阶段。该平台紧密集成了计算、网络、软件和安全功能,旨在支持大规模智能体系统、工业自动化和实时 AI 应用。

参与 StorageReview

资讯订阅 | YouTube | 播客 iTunes/Spotify | Instagram | Twitter(现为X) | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。