存储评论网

NVIDIA GTC 2026:Rubin GPU、Groq LPU、Vera CPU 以及 NVIDIA 为万亿参数推理构建的产品

AI  ◇  企业版

在圣何塞举行的 GTC 2026 大会上,NVIDIA 首席执行官黄仁勋发表了主题演讲,概述了公司下一代 AI 基础设施平台,并发布了一系列涵盖芯片、系统、软件和生态系统合作的重大公告。GTC 2026 吸引了来自 190 多个国家和地区的 3 万多名与会者,是 NVIDIA 自 Blackwell 平台发布以来最全面的平台更新的舞台,其核心是 Vera Rubin 架构的全面量产部署以及 Groq 30,000 LPU 技术与 NVIDIA 数据中心生态系统的集成。正如黄仁勋在演讲中所说,智能 AI 的转折点已经到来,Vera Rubin 的发布标志着 NVIDIA 历史上规模最大的基础设施建设的开端。

主题演讲的核心是第四条人工智能扩展定律的出现:智能体扩展。在智能体扩展中,人工智能系统不仅与人类通信,还与其他人工智能智能体通信,从而对低延迟、大上下文推理以及前所未有的规模提出了指数级的需求。NVIDIA 将 Vera Rubin 平台定位为服务于这一新领域的基础设施基础。该平台集成了七款联合设计的芯片,并部署在五个专为人工智能工厂打造的全新机架式系统中。该平台也获得了前沿人工智能实验室的认可:Anthropic 首席执行官兼联合创始人 Dario Amodei 指出:“企业和开发人员正在使用 Claude 进行日益复杂的推理、智能体工作流程和关键任务决策。这需要能够跟上步伐的基础设施。NVIDIA 的 Vera Rubin 平台为我们提供了所需的计算、网络和系统设计,使我们能够在提升客户所依赖的安全性和可靠性的同时,持续交付成果。” OpenAI 首席执行官 Sam Altman 表示:“NVIDIA 的基础设施是我们不断推进人工智能前沿发展的基石。借助 NVIDIA Vera Rubin,我们将能够大规模运行更强大的模型和智能体,并为数亿用户提供更快、更可靠的系统。”

Vera Rubin平台:开启智能体人工智能的前沿

基于在 CES 2026 上首次亮相的 Vera Rubin NVL72 架构,GTC 2026 将其扩展为一个全面的 POD 级 AI 工厂生态系统。NVIDIA 将此定义为从独立芯片和独立服务器向完全集成的机架级系统、Pod 级部署和自主 AI 工厂的转变。Vera Rubin 平台整合了 NVIDIA Vera CPU、Rubin GPU、NVLink 6 交换机、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6 以太网交换机以及新集成的 NVIDIA Groq 3 LPU,所有这些组件都旨在作为一个统一的 AI 超级计算机运行,并在计算、网络和存储方面进行深度协同设计,并由拥有全球供应链的 80 多家 MGX 合作伙伴组成的生态系统提供支持。

 

NVIDIA 声称,与 Blackwell 一代相比,该平台在所有 AI 工作负载下,每瓦推理吞吐量最高可提升 10 倍,每个令牌的成本仅为其十分之一。对于训练大型混合专家模型,Vera Rubin 仅需四分之一的 GPU 即可达到相同的性能。NVL72 可与 NVIDIA Quantum-X800 InfiniBand 和 Spectrum-X 以太网无缝扩展,从而在大规模 GPU 集群中保持高利用率,同时缩短训练时间和降低总体拥有成本。

代际对比:Blackwell Ultra 与 Vera Rubin NVL72

规格 GB300 NVL72(Blackwell Ultra) VR NVL72(维拉·鲁宾)
计算架构
GPU 数量 72块Blackwell Ultra GPU 72 个 Rubin GPU
CPU数量 36 个 Grace CPU 36个Vera CPU
CPU内核 每个CPU配备72个ARM核心 每个CPU配备88个奥林巴斯ARM核心
人工智能性能
FP4推理性能 1.44 百亿亿次浮点运算 3.6 百亿亿次浮点运算
每个 GPU 的 NVFP4(推理) 20 浮点数 50 浮点数
每个 GPU 的 NVFP4(训练) 10 浮点数 35 浮点数
内存
GPU内存类型 HBM3e HBM4
GPU内存带宽 约 8 TB/秒 约 22 TB/秒
互联
NVLink 一代 NVLink 5 NVLink 6
NVLink带宽(每个GPU) 1.8 TB / s 3.6 TB / s
机架级 NVLink 带宽 130 TB / s 260 TB / s
社交
横向扩展网卡 ConnectX-8(800 Gb/s) ConnectX-9(1.6 TB/s)
CPU-GPU互连 NVLink-C2C(900 GB/s) NVLink-C2C(1.8 TB/s)

基于 Vera Rubin 架构的产品将于 2026 年下半年起通过合作伙伴渠道发售。这些合作伙伴包括领先的云服务提供商 Amazon Web Services、Google Cloud、Microsoft Azure 和 Oracle Cloud Infrastructure,以及 NVIDIA 云合作伙伴 CoreWeave、Crusoe、Lambda、Nebius、Nscale 和 Together AI。全球系统制造商戴尔科技、HPE、联想和超微预计也将推出基于 Vera Rubin 架构的服务器,此外还有华硕、富士康、技嘉、英业达、和硕、QCT、纬创和 Wiwynn 等厂商。

从 CPX 到 LPX:NVIDIA 收购 Groq 如何重塑解码加速

去年在人工智能基础设施峰会上,NVIDIA 发布了 CPX 机架,并推出了两种配置,旨在加速长上下文推理查询。当时我们报道了这一消息,也因此对 CPX 的实际功能产生了一些疑问。乍一看,虽然 CPX 的架构概念很有趣,但除了可能对注意力机制进行额外加速之外,它似乎并没有在 Rubin GPU 本身的基础上提供任何实质性的功能。

NVIDIA GTC 2026 rubin GPU

随后,NVIDIA 收购了 Groq,这在业内引起了巨大反响,并引发了人们对 NVIDIA 将如何把 Groq 的 LPU 技术整合到更广泛的 Vera Rubin 平台中的猜测。在 2026 年 GTC 大会上,NVIDIA 通过发布 LPX 澄清了这些猜测。从展示的内容来看,CPX 机架的概念已经演变为 Groq 3 LPX 机架,原 CPX 侧重于上下文处理的架构被基于 Groq 芯片构建的全新解码加速架构所取代。

Rubin GPU 与 Groq 3 LPU:互补的架构

规格 鲁宾GPU Groq 3 LPU (LP30)
内存类型 HBM4 堆叠式SRAM
内存容量(每芯片) 288 GB 500 MB
内存带宽 22 TB / s 150 TB / s
强度 高通量训练和预填充 超低延迟令牌解码
部署 VR NVL72(每架 72 个) LPX机架(每架256个)
聚合机架内存 约20.7 TB HBM4 128 GB 内存
扩展带宽(机架) 260 TB/s NVLink 6 640 TB / s

单个 LPX 机架可容纳 256 个 Groq 3 LPU。每个 LPU 包含约 500 MB 的堆叠式 SRAM,该机架可提供约 128 GB 的片上 SRAM 和 640 TB/s 的扩展带宽,专为超低延迟解码加速而设计。两种处理器类型之间的差异十分显著:Rubin GPU 提供 288 GB 的 HBM4 显存,带宽为 22 TB/s;而 LPU 则以容量换取原始带宽,每个芯片的 SRAM 池可提供 150 TB/s 的带宽。当通过定制的基于 Spectrum X 的互连与 VR NVL72 协同部署时,这两个机架将协同处理每个解码令​​牌,其中注意力解码由 Rubin 负责,而前馈层则卸载到 LPU。针对万亿参数模型和百万令牌上下文进行了优化,协同设计的 LPX 架构与 Vera Rubin 配合使用,可最大限度地提高功耗、内存和计算效率。 LPX 机架采用全液冷设计,基于 MGX 基础设施,将于 2026 年下半年上市,与 Vera Rubin 的全面推广同步进行。

重要的是,NVIDIA 确认无需对 CUDA 进行任何更改。LPU 作为现有 CUDA 堆栈的加速器运行在 Vera 和 NVL72 平台上,以透明的方式按令牌卸载计算任务。在 GTC 问答环节,NVIDIA 将 LPU 描述为“解码模型加速器”,并解释说他们将“与正在部署这些万亿参数模型的 AI 实验室和 AI 前沿模型构建者深入合作”,以实现下一代高端和超高端模型服务。Groq 的许多创始人和工程师已加入 NVIDIA,据报道,两支团队之间的合作非常出色,他们正携手推进 Groq 的路线图,将其融入 MGX 基础设施。LPX 的部署初期将专注于模型构建者和服务提供商,而非面向广泛的 OEM 厂商。我们期待看到 NVIDIA 和 Groq 的整合带来的实际性能提升。

Vera CPU 机架:专为强化学习和智能体工作负载打造的计算平台

为什么智能体人工智能需要一种新型CPU

要理解英伟达为何要打造专用的CPU机架,首先需要了解强化学习(RL)在现代人工智能开发中训练后阶段的工作原理。训练后阶段是指模型在大规模数据集上完成预训练之后,对模型进行优化和定制,使其更适用于特定应用场景。

在强化学习框架中,训练循环包含三个核心组件:策略模型(即被训练的模型)、模型执行动作并接收反馈的环境,以及用于评估这些动作质量的奖励信号。策略模型生成候选输出,这些输出随后在环境中执行,由奖励模型进行评分,并利用所得梯度更新策略。

中心位置的 Vera CPU 节点

对于智能体人工智能工作负载而言,这种强化学习环境并非抽象的模拟环境,而是一个真实的计算沙箱。例如,考虑使用 Claude Code 或类似的自主编码代理工具对智能体编码模型进行后训练。在这种情况下,需要三个不同的计算池同时运行。首先,有一个由 GPU 加速器组成的训练池,用于更新策略模型的权重。其次,推理加速器运行当前策略模型的检查点,大规模生成候选动作(代码编辑、工具调用、文件操作)。第三,也是至关重要的,还有一个庞大的传统 CPU 计算池,用于运行实际的强化学习环境。在这些环境中,智能体执行其生成的代码、运行测试套件、执行工具调用、发出 SQL 查询、编译二进制文件、与文件系统交互,以及执行所有产生奖励信号的沙箱操作,这些奖励信号会反馈到训练循环中。

这种传统计算需求规模巨大。策略模型的每次执行都可能触发数十个顺序工具调用,每个工具调用都必须执行、评估并返回结果,下一步才能进行。当在训练过程中并行生成数千个数据点时,需要庞大的高速 CPU 集群来防止 GPU 训练集群在环境执行过程中停滞。CPU 沙箱池中的任何延迟都会直接导致 GPU 周期闲置和训练计算资源浪费。同样的情况也适用于已部署的智能体系统的推理阶段。智能体执行的每一次工具调用、代码编译和沙箱执行都是 CPU 工作,必须足够快才能保持端到端智能体管道的响应速度。正如 NVIDIA 的新闻稿中所述,CPU 不再仅仅是模型的支撑,而是模型的驱动者。

Vera CPU机架:NVIDIA的答案

为了满足这一需求,NVIDIA 推出了 Vera CPU,该公司称之为全球首款专为智能体人工智能和强化学习时代打造的处理器。Vera CPU 机架是一个专用的机架级系统,包含 256 个液冷 Vera 处理器,能够支持超过 22,500 个并发 CPU 环境,每个环境均可独立运行并达到全性能。人工智能工厂可以快速部署并扩展到单个机架中数万个并发实例和智能体工具。该机架提供 400 TB 的总内存、300 TB/s 的聚合内存带宽和 64 个 BlueField-4 DPU,所有这些都与 Vera Rubin 和 DGX 生态系统兼容,并基于 NVIDIA MGX 模块化参考架构构建。

Vera CPU 本身由 88 个 NVIDIA 定制设计的 Olympus 核心构成,完全兼容 Armv9.2 架构。每个核心都支持使用 NVIDIA 空间多线程技术同时执行两个任务。第二代低功耗内存子系统基于 LPDDR5X 构建,可提供高达 1.2 TB/s 的带宽,与通用 CPU 相比,带宽翻倍,功耗却只有一半。

除了卓越的性能之外,Vera Rack 还解决了供应链中的一个实际问题:运营规模达数万 GPU 的 AI 工厂需要同样庞大的 CPU 集群来执行环境任务,而从 AMD 或 Intel 采购如此大量的高性能 x86 处理器,并按所需规模和时间交付,会带来巨大的采购和供货挑战。而垂直整合的 NVIDIA CPU 机架则简化了这种依赖性。

与 NVIDIA 合作部署 Vera CPU 的客户包括阿里巴巴、字节跳动、Meta 和 Oracle 云基础设施,以及 CoreWeave、Crusoe、Lambda、Nebius、Nscale、Cloudflare、Together AI 和 Vultr。制造合作伙伴包括戴尔科技、HPE、联想、超微、华硕、思科、富士康、技嘉和 QCT 等。

BlueField-4 STX 和 NVIDIA CMX:推理上下文内存存储背后的参考架构

在 2026 年国际消费电子展 (CES) 上,NVIDIA 发布了推理上下文内存存储 (ICMS) 平台,这是一种专为大规模 LLM 推理中的键值缓存管理而构建的全新 AI 原生存储基础设施。在 2026 年全球技术大会 (GTC) 上,NVIDIA 发布了为其提供支持的参考架构:BlueField-4 STX。该模块化设计能够无缝扩展 GPU 内存,以存储代理上下文和键值缓存数据。STX 的首个机架级实现是全新的 NVIDIA CMX 上下文内存存储平台,它通过高性能上下文层扩展 GPU 内存,从而支持可扩展的推理和代理系统。

当你考察基于Transformer的推理的扩展性时,专用存储层的必要性就显而易见了。每个生成的token都必须通过注意力机制关注所有先前的token,而键值(KV)缓存存储预先计算的注意力矩阵以供重用,从而避免重复计算。问题在于,KV缓存的大小会随着序列长度和批处理大小的增加而增长。在多租户环境中,当处理跨越百万级token上下文窗口的数千个并发请求时,GPU HBM就会耗尽。运维人员必须要么减小批处理大小、缩短上下文窗口,要么增加GPU数量,而所有这些措施都会降低经济效益或性能。

BlueField-4 STX 通过提供一个高带宽的共享存储层来解决这个问题,该存储层专为 KV 缓存访问模式而设计,位于 GPU HBM 和传统存储之间。它由 Vera Rubin 平台加速,并利用了针对存储优化的 BlueField-4 处理器,该处理器将 Vera CPU 与 ConnectX-9 SuperNIC、Spectrum-X 以太网、NVIDIA DOCA 和 NVIDIA AI 企业软件相结合。NVIDIA 声称,与传统存储相比,CMX 平台每秒可提供高达 5 倍的令牌处理速度;与传统 CPU 架构相比,高性能存储的能效提高了 4 倍;企业级 AI 数据的数据摄取速度提高了 2 倍。

NVIDIA 还推出了 DOCA Memos,这是一个全新的 DOCA 框架,它利用专用的 KV 缓存处理能力增强 BlueField-4 存储,从而提高推理吞吐量并显著提升能效。其结果是实现了 POD 范围内的上下文信息,从而能够更快地与 AI 代理进行多轮交互,提供更具可扩展性的 AI 服务,并提高整体基础设施的利用率。这与开源的 NVIDIA Dynamo 项目紧密相关,后者为分离式预填充/解码阶段、智能路由和分层存储卸载提供了软件框架。

STX 是 NVIDIA 不直接销售,而是提供给存储生态系统合作伙伴的参考架构。参与基于 STX 架构的下一代基础设施联合设计的存储提供商包括 Cloudian、DDN、戴尔科技、Everpure、日立 Vantara、HPE、IBM、MinIO、NetApp、Nutanix、VAST Data 和 WEKA。构建基于 STX 架构系统的制造合作伙伴包括 AIC、Supermicro 和 QCT。计划采用 STX 架构进行上下文记忆存储的领先 AI 实验室和云提供商包括 CoreWeave、Crusoe、IREN、Lambda、Mistral AI、Nebius、Oracle 云基础设施和 Vultr。基于 STX 架构的平台将于 2026 年下半年由合作伙伴提供。

Vera Rubin DSX AI 工厂参考设计和 Omniverse DSX 蓝图

除了单个机架和扩展舱之外,NVIDIA 还发布了 Vera Rubin DSX AI Factory 参考设计以及 NVIDIA Omniverse DSX Blueprint 的正式发布,二者共同构成了一个全面的框架,用于设计、构建和运营协同设计的 AI 基础设施,从而最大限度地提高每瓦特的令牌数,并加快首次投产的速度。通过紧密集成计算、网络、存储、电源和冷却,该架构提高了能源效率,并确保 AI 工厂能够在持续、高强度的工作负载下可靠扩展,同时保持最高的正常运行时间。

Rubin DSX 软件栈采用开放、模块化和可组合的设计,将集群硬件与电力和冷却系统连接起来。它包含多个组件库:DSX Max-Q 支持在整个 AI 工厂内实现动态电力配置,从而在固定功率的数据中心内部署多 30% 的 AI 基础设施。DSX Flex 使 AI 工厂成为电网灵活的资产,释放 NVIDIA 估计的 100 吉瓦闲置电网电力。鉴于能源目前是 AI 基础设施建设的最大瓶颈,这项功能至关重要。目前,美国有超过 300 亿美元的设备积压,以及超过 200 吉瓦的项目等待互联。DSX Exchange 支持在 IT、运营技术和运营代理之间实现计算、网络、能源、电力和冷却信号的可扩展且安全的集成。DSX Sim 模型使用 NVIDIA DSX Air 平台验证 AI 工厂作为高保真数字孪生体的功能。

Omniverse DSX Blueprint 现已在 build.nvidia.com 上正式发布,并与 Vera Rubin DSX 参考设计完全兼容。它允许开发人员构建其 AI 工厂的物理精确数字孪生模型,实时模拟运行,并在建设或部署开始前优化性能。该蓝图将电源、冷却、网络和运维整合到一个统一的环境中,从而加快产品实现盈利的速度并提高 AI 效率。

参与 DSX 架构和蓝图开发的行业领军企业包括 Cadence、达索系统、伊顿、Jacobs、Nscale、Phaidra、Procore Technologies、PTC、施耐德电气、西门子、Switch、特灵科技和 Vertiv。值得一提的是,Nscale 和卡特彼勒正在西弗吉尼亚州一个数吉瓦的园区内,将 DSX Vera Rubin 参考设计付诸实践,该园区被誉为全球最大的 AI 工厂之一。在能源方面,Emerald AI、GE Vernova、日立和西门子能源正在利用 DSX 参考架构释放电网容量,为新建 AI 工厂提供所需的电力。Phaidra 已将 DSX Max-Q 集成到一个自学习 AI 代理中,该代理通过减少冷却峰值,在确保安全性的前提下,可提供约 10% 的额外计算能力。

NVIDIA Agent Toolkit 和 OpenCLAW:自主代理的软件栈

TC 2026 还重点关注了智能体 AI 工作负载的快速增长,NVIDIA 将自主代理描述为该公司迄今为止增长最快的工作负载。软件发布的核心是 OpenCLAW,它被誉为可能是历史上最重要的软件版本,是一个用于编排名为 CLAW 的长期运行、自我演化的代理的框架。CLAW 是一种自主系统,能够规划、行动并执行整个任务,而不仅仅是单个任务。NVIDIA 将 CLAW 定义为 AI 的全新应用层,并指出我们已经从询问“什么、如何或为什么”转变为询问“构建、创建或制作”。

NVIDIA 发布了 NVIDIA Agent Toolkit,这是一个完全开源的模型、运行时和蓝图集合,用于构建、评估和优化长时间运行的自主代理。其关键组件包括用于推理、编码和语音的 Nemotron 开放模型;用于代理分析和定制的 Nemo;用于模型推理的 NIM;以及用于横向扩展服务的 Dynamo 1.0。新增组件包括 NVIDIA OpenShell,这是一个开源的安全运行时,为代理执行提供基于策略的网络、隐私和安全防护;以及 IQ,这是一个开源蓝图,结合了前沿模型和开放模型的智能,用于深度研究代理,它是首个同时在深度研究基准测试 1 和复杂深度研究基准测试 2 中名列前茅的研究系统。新增的 cuOPT 技能则带来了处理以自然语言描述的优化问题的专业知识。

NVIDIA 还发布了 Nemo CLAW,这是其对 OpenCLAW 社区的贡献,由 NVIDIA 与 OpenCLAW 构建者 Peter Steinberger 合作开发。Nemo CLAW 只需一条命令即可安装 OpenCLAW、Nemotron 模型和 OpenShell 运行时环境,为智能体在预设的隐私和安全防护范围内开发和学习新技能奠定了基础。它可以在任何平台上运行,从云基础设施到本地 RTX PC、DGX Station 和 DGX Spark。

DGX Spark 和 DGX Station:本地 CLAW 开发平台

鉴于许多开发者更倾向于使用能够完全掌控计算资源的本地开发环境,NVIDIA 推出了两款专为 CLAW 智能体开发而打造的全新平台。DGX Spark 是一款高性能、高能效的平台,可运行安全可靠、始终在线的自主智能体。目前,基于 DGX Spark 和 GB10 的 OEM 合作伙伴系统已在全球范围内上市。DGX Station 定位为终极本地 CLAW 开发平台,使开发者能够在完全本地运行具有前沿智能的模型,无需云连接。这对于开发至关重要,因为所有操作都保留在本地,从而实现完全控制和安全性。DGX Station 系统将于 2026 年 3 月 16 日起通过 OEM 合作伙伴接受预订。

维拉·鲁宾太空舱:地球之外的人工智能基础设施

NVIDIA宣布,其最新的加速计算平台正在开启太空创新的新时代,将人工智能计算引入轨道数据中心(ODC)、地理空间智能和自主太空作业。NVIDIA Vera Rubin太空模块的AI计算能力比NVIDIA H100 GPU高出25倍,可用于太空推理,使大型语言模型和高级基础模型能够在轨道上直接运行。其紧密集成的CPU-GPU架构提供了实时处理来自太空仪器的海量数据流所需的性能和内存。

与 Vera Rubin 空间模块相辅相成,NVIDIA IGX Thor 为轨道上的关键任务边缘环境提供工业级耐用性;而 Jetson Orin 则在一个超紧凑的模块中提供高性能 AI 推理,该模块针对受 SWaP 限制的航天器进行了优化。在地面上,RTX PRO 6000 Blackwell 服务器版 GPU 的性能比传统的基于 CPU 的批处理系统快 100 倍,可用于地理空间智能处理。包括 Aetherflux、Axiom Space、Kepler Communications、Planet Labs、Sophia Space 和 Starcloud 在内的合作伙伴正在基于这些平台构建下一代太空任务,涵盖轨道数据中心、自主太空操作和实时地球观测等领域。

NVIDIA Dynamo 1.0:面向人工智能工厂的推理操作系统

在 GTC 2026 大会上,NVIDIA 发布了开源软件 Dynamo 1.0,并将其正式投入生产。NVIDIA 将其定位为首个用于 AI 工厂推理的分布式操作系统。正如计算机操作系统协调硬件和应用程序一样,Dynamo 1.0 作为 AI 工厂的分布式编排层,能够无缝管理集群中的 GPU 和内存资源,从而大规模地支持复杂、异构的 AI 工作负载。

Dynamo 1.0 通过智能路由和在 GPU 与低成本存储层之间移动数据的功能,将推理工作分配到多个 GPU 上,从而减少计算浪费并缓解内存限制。对于智能体 AI 和长上下文工作负载,Dynamo 可以将请求路由到已保存先前步骤中最相关键值缓存数据的 GPU,并在不需要时卸载这些内存,此功能与 BlueField-4 STX/ICMS 存储架构直接集成。在最近的行业基准测试中,Dynamo 将 NVIDIA Blackwell GPU 的推理性能提升了高达 7 倍,降低了代币成本,并为数百万已部署的 GPU 增加了收入机会,所有这些都基于免费的开源软件。

NVIDIA 通过将 Dynamo 和 TensorRT-LLM 优化集成到包括 LangChain、llm-d、LMCache、SGLang 和 vLLM 在内的常用推理框架中,加速了开源生态系统的发展。Dynamo 的核心构建模块,例如用于内存管理的 KVBM、用于快速 GPU 间数据传输的 NIXL 以及用于简化扩展的 Grove,也以独立模块的形式提供。此外,NVIDIA 还向 FlashInfer 项目贡献了 TensorRT-LLM CUDA 内核,以便将其原生集成到开源框架中。

该平台的应用范围十分广泛。NVIDIA 推理平台现已与包括 AWS、Microsoft Azure、Google Cloud 和 Oracle Cloud Infrastructure 在内的云服务提供商,以及 NVIDIA 云合作伙伴阿里云、CoreWeave、Crusoe、DigitalOcean、Nebius、Nscale 和 Together AI 在内的多家云服务商集成。人工智能原生公司 Cursor、Hebbia 和 Perplexity 以及推理终端提供商 Baseten、Deep Infra 和 Fireworks 也已采用该平台。包括 Amazon、AstraZeneca、BlackRock、ByteDance、Coupang、Instacart、Meituan、PayPal、Pinterest、Shopee 和 SoftBank Corp. 在内的全球企业也已采用 NVIDIA 推理技术栈。Dynamo 1.0 现已面向全球开发者开放。

参与 StorageReview

资讯订阅 | YouTube | 播客 iTunes/Spotify | Instagram | Twitter(现为X) | TikTok | RSS订阅

迪维扬什·贾恩

机器学习工程师、家庭实验室爱好者和技术发烧友。在 Storage Review,我负责人工智能和新兴工作负载测试,旨在提供实用见解和性能分析。