NVIDIA 和 Google Cloud 在拉斯维加斯举行的 Google Cloud Next 大会上宣布了双方长期工程合作的新阶段,并介绍了 Google Cloud AI 超级计算机平台的更新,旨在扩展智能体和物理 AI 在生产环境中的应用。两家公司将继续合作设计涵盖芯片、系统、网络和软件的基础设施,以支持日益复杂的 AI 工作负载,包括自主代理、机器人和数字孪生。
Vera Rubin 开发的 A5X 基础设施瞄准大规模人工智能工厂
Google Cloud推出了基于NVIDIA Vera Rubin NVL72机架级系统的A5X裸机实例。这些系统旨在显著提高推理的经济性和效率,与上一代产品相比,每个令牌的成本最多可降低10倍,每兆瓦的令牌吞吐量最多可提高10倍。
A5X 平台集成了NVIDIA ConnectX-9 SuperNIC和 Google 的下一代 Virgo 网络协议栈。该架构支持在单个站点内扩展至 80,000 个 Rubin GPU,并在多站点部署中扩展至 960,000 个 GPU。该设计面向对网络性能和系统级优化要求极高的超大规模 AI 训练和推理环境。
谷歌云强调,紧密集成的基础设施和托管式人工智能服务是支持下一代人工智能工作负载的必要条件。这一组合技术栈使客户能够训练、微调和部署模型,并着重提升性能、效率和运营可扩展性。
布莱克威尔广泛的产品组合助力实现适度加速
Google Cloud 还概述了其基于 NVIDIA Blackwell 的实例产品组合,涵盖各种部署规模和性能配置。产品包括基于 NVIDIA HGX B200 系统的 A4 虚拟机、基于 GB200 和 GB300 NVL72 平台的 A4X 和 A4X Max 配置,以及通过配备RTX PRO 6000 Blackwell Server Edition GPU的 G4 实例提供的 GPU 部分访问权限。
该系列产品使企业能够根据工作负载需求调整基础设施。配置范围从用于轻量级推理任务的部分GPU,到配备72个GPU的完整NVL72机架(通过第五代NVLink和NVLink交换机技术互连)。高端部署可扩展至数万个GPU,用于大型模型训练和分布式推理。
这些系统旨在支持一系列人工智能工作负载,包括混合专家 (MoE) 模型、多模态推理、大规模数据处理以及机器人和物理人工智能的仿真工作负载。
早期用户已经开始利用该平台。Thinking Machines Lab 使用基于GB300 NVL72的 A4X Max 实例来扩展其 Tinker API 的训练规模,而 OpenAI 则在 Google Cloud 上基于 GB200 和 GB300 的实例上运行包括 ChatGPT 在内的大规模推理工作负载。
机密人工智能扩展到 Blackwell GPU
谷歌云正在将其机密计算能力扩展到其人工智能基础设施。基于 NVIDIA Blackwell 和 Blackwell Ultra GPU 的 Gemini 模型现已在谷歌分布式云上提供预览版,使企业能够将模型部署在更靠近敏感数据源的位置。
NVIDIA Confidential Computing 可实现加密执行环境,确保提示信息和微调数据免受未经授权的访问,包括云运营商的访问。此功能也即将通过配备 RTX PRO 6000 Blackwell GPU 的 Confidential G4 虚拟机引入多租户环境。
这标志着 Blackwell GPU 在公共云中首次实现机密计算,目标客户是需要严格数据保护且同时需要访问高性能 AI 基础设施的受监管行业。
面向智能体的开放模型和托管强化学习管道
该平台支持广泛的模型生态系统,包括谷歌的 Gemini 和 Gemma 模型以及英伟达的 Nemotron 开放模型。NVIDIA Nemotron 3 Super 现已集成到 Gemini 企业代理平台中,使开发人员能够构建和部署基于推理的代理工作流。
Google Cloud 还推出了基于 NVIDIA NeMo 构建的强化学习 API 的托管训练集群。这项服务可自动完成集群配置、作业编排和故障处理,从而支持大规模强化学习训练。其目标是降低运维复杂性,使团队能够专注于模型行为和优化。
CrowdStrike 使用 NVIDIA NeMo 工具(包括 Data Designer、Automodel 和 Megatron Bridge)生成合成数据并微调特定领域的网络安全模型。这些工作流程运行在基于 Blackwell 的基础架构上,从而加速威胁检测和响应流程。
不断扩展的工业和物理人工智能工作负载
该联合平台还面向工业和物理人工智能应用场景。Cadence 和西门子数字化工业软件的应用现已在 Google Cloud 上提供,并借助 NVIDIA 加速技术,支持半导体、汽车、航空航天和重型设备等行业的各种设计、仿真和制造工作流程。
NVIDIA Omniverse 库和 Isaac Sim 已在 Google Cloud Marketplace 上架,可用于开发物理上精确的数字孪生模型和机器人仿真流程。这些工具使企业能够在部署前对系统进行仿真和验证。
此外,NVIDIA NIM 微服务可以部署在 Vertex AI 和 Google Kubernetes Engine 上,以支持视觉 AI 和机器人工作负载。这些服务支持实时视频分析、机器人规划和自动化数据处理等功能。
平台聚焦:从实验到生产
此次更新将 Google Cloud AI Hypercomputer 定位为一个全栈平台,用于将 AI 工作负载从研究阶段迁移到生产阶段。该平台紧密集成了计算、网络、软件和安全功能,旨在支持大规模智能体系统、工业自动化和实时 AI 应用。




Amazon