存储评论网

适用于 Omniverse 的 NVIDIA L40S:从 OpenUSD 场景到物理感知的世界模型

AI  ◇  企业版

L40S 填补了数据中心 GPU 生态系统中的一个关键空白。虽然像 Nvidia H100 这样的专注于计算的 AI 训练 GPU 优先考虑原始性能,而完全忽略了图形加速,但传统的专业可视化卡通常缺乏现代推理工作负载和新兴 AI 驱动图形应用程序所需的 AI 计算能力。这种定位使其对于合成数据生成、多模态 AI 开发以及计算和图形性能都至关重要的 Omniverse 应用尤为重要。

NVIDIA L40S 正面

NVIDIA L40S 规格

规格 L40 L40S H100 80G PCIe
GPU架构 阿达洛夫莱斯 阿达洛夫莱斯 料斗
GPU 芯片 AD102 AD102 GH100
CUDA核心 18,176 18,176 14,592
张量核心 568(第四代) 568(第四代) 456
RT核心 142(第三代) 142(第三代)
GPU内存 48GB GDDR6 带 ECC 48GB GDDR6 带 ECC 80GB HBM2e
内存带宽 864 GB /秒 864 GB /秒 2 TB / s
存储器接口 384 bit 384 bit 5120 bit
最大功耗 300W 350W 350W
外形 4.4 英寸高 x 10.5 英寸长:双槽 4.4 英寸高 x 10.5 英寸长:双槽 4.4 英寸高 x 10.5 英寸长:双槽
散热解决方案 被动 被动 被动
显示连接器 4 个显示端口 1.4a 4 个显示端口 1.4a
PCIe 接口 第 4 代 x16 第 4 代 x16 第 5 代 x16
电源连接器 16针 16针 16针
vGPU 支持 没有
多实例 GPU (MiG) 没有 没有
NVLink 支持 没有 没有 没有

性能规格

米制 L40 性能 L40S 性能 H100性能
FP32 性能 90.5 TFLOPS 91.6 TFLOPS 51.2 TFLOPS
TF32 张量核心 362.1 TFLOPS 366 TFLOPS 756 TFLOPS
FP16 张量核心 724 TFLOPS 733 TFLOPS 1513 TFLOPS
FP8 张量核心 1,448 TFLOPS 1,466 TFLOPS 3026 TFLOPS
峰值 INT8 张量 TOPS 1,448 TFLOPS 1,466 TFLOPS 3026 TOPS
RT核心性能 209 TFLOPS 212 TFLOPS

(性能数字具有稀疏性)

NVIDIA L40S 与 H100

仔细查看规格,便能发现 NVIDIA L40S 和 H100 背后独特的设计理念。L40S 基于 Ada Lovelace 架构构建,使用与 NVIDIA 高端工作站显卡相同的 AD102 芯片。这一传承使其拥有多达 18,176 个 CUDA 核心,从而实现了卓越的单精度 FP32 性能,这是传统图形渲染和科学计算的基石。相比之下,H100 的 Hopper 架构和 GH100 芯片则专为 AI 和 HPC 工作负载而设计。

最显著的区别在于核心配置。L40S 包含 142 个第三代 RT Core 和 568 个第四代 Tensor Core。RT Core 是用于加速光线追踪的专用硬件,而 H100 则完全没有这项功能,这使得 L40S 拥有独特的照片级真实感渲染能力。虽然 H100 的 Tensor Core 数量较少,但它们速度更快、更先进,并针对 FP8 等新型 AI 数据格式进行了优化,使其在原始 AI 性能方面遥遥领先。

这种权衡在内存子系统上也体现得很明显。H100 采用 80GB 高成本 HBM2e 内存,提供惊人的 2 TB/s 带宽。这对于在大规模 AI 模型训练和推理过程中确保 SM 的正常运行至关重要。L40S 采用更传统的 48GB GDDR6 内存,提供 864 GB/s 的带宽。虽然不到 H100 的一半,但这仍然是一个相当大的容量,完全足以加载大型 3D 场景、高分辨率纹理以及用于推理的大型 AI 模型。

最后,功能集概述了它们的预期用途。L40S 配备四个 DisplayPort 1.4a 输出和强大的 vGPU 支持,使其成为虚拟化工作站、渲染农场和云游戏部署的理想之选。H100 不具备任何显示输出或 vGPU 功能,而是提供多实例 GPU (MiG) 技术,该技术允许将其划分为多个较小的独立 GPU 实例,以同时处理多个计算密集型工作负载。L350S 和 PCIe H40 共享双插槽、被动散热设计和 100W 功率范围,使其能够在各种行业标准服务器中灵活部署。

将 L40S 与 NVIDIA 的旗舰产品 H100 进行比较,它们在目标用途上的差异显而易见。H100 在同代 GPU 中,在原始 AI 训练性能方面无可争议地处于领先地位,但这种比较仅仅展现了部分情况。值得注意的是,L40 也属于 NVIDIA 产品线,其 TDP 为 300W,而 L40S 的功率范围为 350W,因此在提供类似性能的同时,功耗也更低。

NVIDIA L40S 顶视图

我们此次评测的 H100 是最初搭载 HBM80e 显存的 2GB PCIe 版本。此后,NVIDIA 陆续扩展了该系列产品,推出了 H100 NVL 等版本。H80 NVL 是最初 94GB PCIe 型号的替代品,提供 400GB 显存和更高的 100W TDP,同时增加了对双 GPU 配置的 NVLink 支持。H8 系列还扩展了 200 GPU SXM 配置,以及更新的 HXNUMX,它共享相同的 GPU 芯片,但在 PCIe 和 SXM 规格下均能提供增强的性能。

NVIDIA L40S H100 H100 NVL L4

L40S 和 H100 之间的区别凸显了数据中心 GPU 设计上的战略差异。H100 是一款专注于计算的显卡,专为 AI 和高性能计算工作负载优化。其目标是大规模 AI 训练,其中最大化计算吞吐量是首要目标。从海量的 HBM2e 显存带宽到专用的 Tensor Core,其设计的方方面面都专为最严苛的神经网络训练场景而设计。

相比之下,L40S 是一款通用 GPU,专为多功能性而设计,不仅支持 AI 推理,还支持图形密集型工作负载和 NVIDIA vGPU 部署。虽然 L100S 是一款功能强大且经济高效的 AI 推理解决方案,但它的真正优势在于支持各种图形密集型应用程序,而 HXNUMX 则并非如此。

图形密集型工作负载和专业应用程序

L40S 在众多需要强大计算能力和高级渲染能力的图形密集型领域表现出色。在 3D 渲染和动画领域,工作室依靠 L40S 进行复杂的场景渲染,其 RT Core 可加速光线追踪计算,而这在纯计算型 GPU 上是无法实现的。影视制作公司利用这些功能进行实时预可视化,使导演和摄影师能够在拍摄过程中看到逼真的 CGI 场景渲染效果,从而大幅缩短后期制作时间并降低成本。

建筑和工程公司利用 L40S 进行实时建筑可视化和产品设计,客户可以在实际施工开始前浏览逼真的建筑效果图或检查详细的产品原型。该显卡的专业图形处理能力也使其成为 CAD 工作站的理想选择,工程师既需要强大的计算能力来执行复杂的模拟,也需要强大的图形加速功能来实现流畅、高保真的视口性能。

NVIDIA L40S 端口

在媒体和娱乐领域,L40S 为渲染农场提供支持,用于处理最终质量的动画帧。同时,其 vGPU 功能支持基于云的创意工作流程,使艺术家可以远程访问强大的图形工作站。视频编辑和后期制作机构使用 L40S 进行实时效果处理、调色和合成工作流程,这些工作流程需要图形加速和大量计算资源。

虚拟桌面基础架构 (VDI) 市场是另一个关键的应用领域,L40S 的 vGPU 技术可支持多位用户共享 GPU 资源,从而构建图形加速的虚拟桌面。这使得企业环境中也能使用专业的图形功能,而无需为每个用户分配单独的 GPU。

基于物理的人工智能训练的演变

更重要的是,L40S 提供了 H100 完全缺乏的功能。关键区别在于 L40S 拥有 142 个第三代 RT 核心,可实现实时光线追踪和照片级渲染。H100 没有 RT 核心,无法进行图形加速,而 L40S 的 RT 核心使其成为需要 AI 计算和高级图形处理能力的应用的理想之选。

NVIDIA CFD 演示

资料来源:Nvidia

随着我们见证人工智能生成的 3D 建模、数字孪生模拟和通用场景描述 (OpenUSD) 工作流程的日益普及,这种区别变得越来越重要。人工智能的下一个前沿领域不仅仅是训练更大的语言模型;而是开发能够理解物理、空间关系和现实世界交互的世界模型。这种演变需要我们在训练数据生成方式上进行根本性的转变。

虽然训练传统 AI 模型在很大程度上依赖于 NVIDIA 的旗舰计算 GPU,但训练下一代基于物理的世界模型则需要采用不同的方法。这些先进的 AI 系统需要大量的训练数据,这些数据不仅要捕捉视觉信息,还要捕捉物理属性、光照行为、材料相互作用和空间关系。像 L40S 这样的 GPU 对于大规模训练数据生成至关重要,其 RT 核心能够创建物理上精确的合成环境,为训练更复杂的 AI 模型奠定基础。

这种由专用 RT Cores 提供支持的高级图形渲染功能正是使 L40S 成为 NVIDIA Omniverse 平台和更广泛的基于物理的 AI 开发生态系统的理想引擎的原因。

Omniverse

Omniverse是一个包含 API、SDK 和服务的开发平台,允许开发者基于通用场景描述 (OpenUSD) 构建应用程序和工作流程。它旨在创建和连接物理上精确的实时 3D 虚拟世界。这通过将 NVIDIA 的 RTX 技术(用于实现逼真的光线追踪渲染)直接集成到工业和机器人仿真工作流程中来实现。L40S 凭借其强大的 RT Core,为驱动这些高要求的 RTX 渲染工作负载提供了必要的硬件加速,使开发者能够以惊人的真实感模拟光照、材质和物理效果。

Omniverse 不仅仅是一个可视化工具,更是一个开发下一代物理 AI 的平台。通过创建这些逼真的虚拟世界(或称“数字孪生”),开发者可以在安全的虚拟环境中模拟复杂的工业设施、测试整个机器人队伍,并在实际部署之前验证自动驾驶汽车。至关重要的是,这些高保真模拟成为生成大量基于物理的合成数据的基础;而这些数据是训练在专注于计算的 GPU 上运行的强大 AI 模型的关键资源。

机器人合成操作运动生成

NVIDIA Isaac GR00T合成操作运动生成蓝图为机器人训练提供了一个框架,展示了 L40S 的 RT Core 如何利用最少的人类演示数据创建大型数据集。该工作流程解决了机器人开发中的一个关键挑战:收集足够多的高质量机器人操作任务训练数据既耗时又昂贵。

NVIDIA L40S Isaac SIM

传统的机器人训练严重依赖于监督学习或模仿学习,即机器人通过观察和模仿人类专家的演示来获得新技能。然而,创建完美的演示极具挑战性,而在现实世界中收集大量高质量的数据集既繁琐又耗时,成本高昂。一位经过专业训练的人类操作员通常需要大约一分钟才能录制一次高质量的演示,由于需要大量的人力投入和潜在的错误,这一过程难以扩展。

NVIDIA L40S Isaac SIM 2

Isaac GR00T 蓝图通过利用物理精确模拟生成的合成数据来加速数据收集过程,从而应对了这一挑战。组织只需几个小时的人工演示,就能收集到成倍增长的数据。

Isaac GR00T蓝图由三个关键组件构成,它们协同工作以创建一个全面的合成数据生成流程:

  • GR00T-Teleop 使熟练的人类操作员能够使用 Apple Vision Pro 等空间计算设备控制虚拟机器人。该系统允许操作员在逼真的虚拟环境中演示复杂的操作任务,不仅捕捉运动轨迹,还能捕捉环境背景和物体交互。Apple Vision Pro 将手部追踪数据传输到 Isaac Lab,后者同时将机器人环境的沉浸式视图传输回设备,从而实现对机器人的直观交互式控制。
  • GR00T-模仿者 该组件将记录的演示数据,利用先进的模拟技术,将其扩展为更大的合成数据集。该组件使用记录的演示数据作为输入,在 Isaac Lab 中生成额外的合成运动轨迹,支持单臂和双手人形机器人的操作。该过程包括注释演示数据中的关键点,并使用插值来确保合成轨迹的平滑性和上下文相关性。
  • GR00T-Gen 利用 NVIDIA Omniverse 和 Cosmos 平台,通过 3D 升级和域随机化来扩展合成数据集。该组件通过随机化场景中的背景、光照和其他变量来增加多样性。它通过 NVIDIA Cosmos Transfer 增强生成的图像,实现照片级真实感,从而缩小模拟与现实之间的差距。
NVIDIA GR00T

这条流水线完美展现了现代数据中心 GPU 各自专属的互补功能。L40S 配备专用的 RT 核心,充当着世界构建器的角色。它在数据生成的初始阶段至关重要,负责处理基于物理的渲染、实时光线追踪和域随机化,从而创建逼真且多样化的虚拟环境。

这个高保真虚拟世界随后成为下一代技术的画布。生成式人工智能模型(例如NVIDIA Cosmos中的模型)在 H100 等以计算为中心的 GPU 上运行,以生成最终的训练数据。H100 利用 L40S 构建的逼真环境,生成数百万个动态的、具有物理感知能力的场景。

AI推理性能基准

L40S 等显卡的另一个受欢迎用例是经济高效的推理。为了评估 L40S 与 H100 在实际 AI 推理能力方面的比较,我们使用 vLLM 对 LLM 性能进行了基准测试,该 vLLM 在 BF14 上运行 Nvidia 的 Open Reasoning Nemotron 16B 参数模型,最大令牌长度为 32K。 

vLLM 基准测试结果

H100 展现出明显的性能领先优势,吞吐量比 L4.2S 高出约 40 倍。这一优势直接源于 H100 翻倍的 Tensor Core 性能和超过两倍的内存带宽(2 TB/s vs 864 GB/s)。 

NVIDIA L40S vLLM 吞吐量与请求

然而,性价比却截然不同。L40S 的价格通常不到 H100 的三分之一,这使得它对于许多推理工作负载而言更具成本效益。对于运行推理服务且对绝对峰值性能要求不高的组织而言,L40S 通常会提供更优的总体拥有成本。

双击线性性能部分,我们可以看到 L40S 提供了非常可接受的性能水平,能够以 ~16ms TPOT(每个输出令牌的时间)SLO 处理 52 个并发请求。

NVIDIA L40S vLLM P99 TPOT

需要注意的一个重要因素是,AI 推理,尤其是文本生成的解码阶段,本质上是一项内存带宽密集型操作。在推理过程中,模型必须反复访问存储在 GPU 内存中的权重来生成每个新的 token,这使得内存吞吐量成为关键的性能瓶颈。这一特性解释了为什么 H100 凭借其卓越的内存带宽和增强的 Tensor Core 性能,自然而然地实现了更高的推理吞吐量。

然而,对于同时需要AI推理和图形加速的部署场景,例如具有AI增强效果的实时渲染、具有AI功能的交互式应用程序,L40S成为唯一可行的选择。

结语

NVIDIA L40S 和最新的 Blackwell RTX Pro 6000 继任者作为战略性定位的 GPU,旨在满足现代数据中心不断变化的需求,在这些数据中心中,AI 计算和高级图形功能日益融合。虽然 H100 和 B200 级 GPU 仍然是纯 AI 训练和推理工作负载领域无可争议的领导者,但 L40S 作为一款通用 GPU,开辟了一个独特而有价值的细分市场,弥合了以计算为中心的 AI 卡与传统专业可视化解决方案之间的差距。

L40S 的独特价值主张在同时需要 AI 推理能力和图形加速的场景中体现得淋漓尽致。其 142 个第三代 RT 核心,能够支持 H100 等纯计算 GPU 无法实现的应用,从专业工作流程中的实时光线追踪,到用于下一代 AI 训练的逼真合成数据生成。这种双重能力使其成为数字孪生开发、基于物理的 AI 训练以及不断发展的 Omniverse 生态系统等新兴应用不可或缺的利器。

从经济角度来看,L40S 对于那些不需要 H100 那样极致 AI 性能的企业来说,具有极高的价值。L100S 的成本约为 H40 的三分之一,却能提供出色的推理性能,同时提供图形功能,为数据中心部署带来极大的灵活性。对于许多企业而言,这种兼具成本效益和多功能性的选择,使得 L40S 成为比投资单独的 AI 和图形解决方案更实用的选择。

L40S 数据表

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

迪维扬什·贾恩

机器学习工程师、家庭实验室爱好者和技术发烧友。在 Storage Review,我负责人工智能和新兴工作负载测试,旨在提供实用见解和性能分析。