今年 8 月,NVIDIA 将其顶级 Blackwell 台式机产品拆分为两个面向专业人士的系列:工作站和服务器。RTX PRO 6000 工作站显卡专为需要在塔式或台式机机箱内实现最大计算能力和显存的创作者、工程师和 AI 开发者而设计。RTX PRO 6000 Blackwell 服务器版则专为机架式服务器以及数据中心的无头推理或渲染节点而设计。既然我们已经在测试中测试了这款工作站显卡,那么本次评测将重点关注它。
RTX PRO 6000 售价 8,500 美元,配备满配的 GB202 显存,包含 24,064 个 CUDA 核心、752 个第五代 Tensor 核心、188 个第四代 RT 核心以及 96 GB GDDR7 ECC 显存。其吸引力显而易见。它拥有消费级显卡无法比拟的内存容量、专业的驱动程序以及双插槽的外形,非常适合对电源或气流没有特殊要求的实际工作站。
NVIDIA 将此 GPU 定位于混合工作流程。这包括具有长上下文的本地 LLM 推理、大型场景渲染、复杂模拟以及多 GPU 研究平台。实用性至关重要。该卡采用标准 PCIe 5.0 x16 接口,提供四个 DisplayPort 2.1b 输出,可实现高分辨率、高刷新率的可视化,并提供 600 W 可配置 TDP,允许集成商进行调整,以获得最佳的散热、声学或密度。
我们的目标是评估该工作站版本在实验室中在 AI、渲染和通用计算方面的表现,并量化 96 GB 池对单个桌面节点功能的影响。
NVIDIA RTX PRO 6000 工作站版与服务器版
RTX PRO 6000 的变体基于相同的 Blackwell GB202 基础架构,因此其原始计算能力在纸面上看起来很相似。区别在于它们的部署方式和位置。我们正在测试的工作站卡是一款独立的、主动散热的双插槽主板,配备四个 DisplayPort 2.1b 输出和工作室级驱动程序。它可以插入塔式或桌边工作站,驱动本地面板,并运行 ISV 认证的 DCC 和 CAD 应用程序以及 CUDA、TensorRT 和 cuDNN。如果工作流程融合了交互式视口工作、本地可视化和机载 AI,那么这条路径可以将所有功能集成到一个机箱中,并具有可预测的声学和散热性能。
此 RTX PRO 6000 Blackwell 服务器版 其设计目的截然不同。它采用无头机架式配置,专为服务器设计,具有前后气流和远程管理功能。由于作业通过网络调度,结果远程使用,因此没有主动显示输出。固件、电源和散热配置文件在调度程序下进行调整,以实现全天候运行,通常与 NVIDIA AI Enterprise、容器编排和虚拟机管理程序直通配合使用。简而言之,当创作者和工程师需要在本地查看和操作工作,同时运行大型推理或模拟批次时,工作站型号是理想之选。在数据中心队列后扩展相同节点时,服务器版本更有意义,因为每个功率、电缆和气流路径都必须符合 OEM 服务计划。
NVIDIA RTX PRO 6000 规格
下表概述了 NVIDIA RTX PRO 6000 与 RTX 5090 和上一代 RTX 4090 的规格比较。
| GPU 比较 | NVIDIA RTX PRO 6000 | NVIDIA RTX 5090 | NVIDIA RTX 4090 |
| GPU名称 | GB202 | GB202 | AD102 |
| 卓越 | 布莱克威尔2.0 | 布莱克威尔2.0 | 阿达洛夫莱斯 |
| 工艺尺寸 | 5纳米 | 5纳米 | 5纳米 |
| 晶体管 | 92,200百万 | 92,200百万 | 76,300百万 |
| 密度 | 122.9米 / 平方毫米 | 122.9米 / 平方毫米 | 125.3米 / 平方毫米 |
| 模具尺寸 | 750mm² | 750mm² | 609mm² |
| 槽宽 | 双槽 | 双槽 | 三槽 |
| 尺寸 | 304毫米x 137毫米x 40毫米 | 304毫米x 137毫米x 48毫米 | 304毫米x 137毫米x 61毫米 |
| TDP | 600W | 575W | 450W |
| 输出 | 4个DisplayPort 2.1b | 1 个 HDMI 2.1b,3 个 DisplayPort 2.1b | 1 个 HDMI 2.1、3 个 DisplayPort 1.4a |
| 电源连接器 | 1x 16针 | 1x 16针 | 1x 16针 |
| 总线接口 | PCIe 5.0 x16 | PCIe 5.0 x16 | PCIe 4.0 x16 |
| 基地时钟 | 1590 MHz | 2017 MHz | 2235 MHz |
| 提升时钟 | 2617 MHz | 2407 MHz | 2520 MHz |
| 记忆时钟 | 1750 MHz(有效28 Gbps) | 2209 MHz(有效28 Gbps) | 1313 MHz(有效21 Gbps) |
| 内存大小 | 96 GB | 32 GB | 24 GB |
| 内存类型 | GDDR7 ECC | GDDR7 | GDDR6X |
| Magistrala pamięci | 512 bit | 512 bit | 384 bit |
| 内存带宽 | 1.79 TB / s | 1.79 TB / s | 1.01 TB / s |
| CUDA核心 | 24,064 | 21,760 | 16,384 |
| 张量核心 | 752 | 680 | 512 |
| 个ROPs | 192 | 192 | 176 |
| SM 计数 | 188 | 170 | 128 |
| RT核心 | 188 | 170 | 128 |
| L1缓存 | 128 KB(每个 SM) | 128 KB(每个 SM) | 128 KB(每个 SM) |
| L2缓存 | 128 MB | 88 MB | 72 MB |
| 像素率 | 502.5 GPixel / s | 462.1 GPixel / s | 443.5 GPixel / s |
| 纹理速率 | 1,968.0 格塞尔/秒 | 1,637 格塞尔/秒 | 1,290 格塞尔/秒 |
| FP16(一半) | 126.0 万亿次浮点运算 (1:1) | 104.8 万亿次浮点运算 (1:1) | 82.58 万亿次浮点运算 (1:1) |
| FP32(浮点数) | 126.0 TFLOPS | 104.8 TFLOPS | 82.58 TFLOPS |
| FP64 (双精度) | 1.968 万亿次浮点运算 (1:64) | 1.637 万亿次浮点运算 (1:64) | 1,290 GFLOPS(1:64) |
| 发行价格(美元) | $8,500 | $1,999 | $1,599 |
建筑与设计
RTX PRO 6000 工作站 GPU 秉承了 NVIDIA 简洁实用的设计理念,与 RTX 5090 FE 一脉相承,采用工业哑光黑色外观,并采用针对工作站环境优化的双轴流风扇布局。每个风扇都经过精心设计,可将气流推过全长 3D 均热板,从而在持续负载下保持热平衡。其尺寸为 304 毫米 × 137 毫米 × 40 毫米,可轻松安装于双插槽配置中,并凭借 600 瓦的 TDP 额定值提供卓越的性能密度。
PRO 6000 的顶部边缘配备一个 16 针电源接口,可为 96 GB GDDR7 内存和 Blackwell 2.0 架构提供所需的电流。其做工质感高端坚固,铝制外壳可有效引导气流穿过散热片。NVIDIA 的低调品牌标识与专业美学相得益彰,没有 RGB 灯效或游戏特效,更强调了对散热性能要求极高的工作站机箱的可靠性和性能。
在 I/O 方面,NVIDIA 提供四个 DisplayPort 2.1b 输出,确保兼容多显示器 8K 设置、色彩精准的 HDR 工作流程以及高级渲染环境。DisplayPort 2.1b 取代 HDMI 体现了其专业定位,并增强了带宽,适用于高刷新率和高分辨率显示器。
性能测试
为了评估 NVIDIA RTX PRO 6000 样品的性能,我们将其与 NVIDIA 的旗舰消费级显卡 RTX 5090 Founders Edition 和 RTX 4090 Founders Edition 进行了直接比较。测试涵盖了多种专业工作负载和 AI 驱动的工作负载,以突出其原始计算能力和实际应用性能。基准测试包括 UL Procyon AI 文本生成、UL Procyon AI 图像生成、LuxMark、Geekbench 6 和 V-Ray,从而提供了渲染、推理和生产力性能的均衡概览。
除了这些标准工作负载之外,我们还进行了有针对性的测试,旨在展示 RTX PRO 6000 中的 96 GB GDDR7 内存,展示其在处理大型模型、高分辨率数据集和专业可视化工作负载方面的优势,其中容量和持续吞吐量至关重要。
- RTX PRO 6000
- GeForce RTX 5090FE
- GeForce RTX 4090FE
- RTX 6000 ADA
为了充分利用全新 NVIDIA RTX PRO 6000 的优势,我们采用了 AMD ThreadRipper 平台。该系统配置了 64 核 CPU 和水冷系统。它拥有充足的 CPU 底层处理能力,足以让 GPU 高效运行。完整的系统配置如下所示。
StorageReview AMD ThreadRipper 测试平台
- 主板: 华硕 Pro WS TRX50-SAGE WIFI
- CPU: AMD Ryzen Threadripper 7980X 64 核
- RAM: 32GB DDR5 4800MT/s
- 存储: 2TB 三星 980 Pro
- OS: Windows 11 Pro for Workstations
UL Procyon:AI 文本生成
此 南河三 AI 文本 信号生成 基准 通过提供简洁一致的评估方法,简化了 AI LLM 性能测试。它允许跨多个 LLM 模型进行重复测试,同时最大限度地降低大型模型和可变因素的复杂性。它与 AI 硬件领导者共同开发,优化了本地 AI 加速器的使用,从而实现更可靠、更高效的性能评估。以下测量结果均使用 TensorRT 进行测试。
在所有四项模型测试中,NVIDIA RTX PRO 6000 始终领先。从 Phi 开始,PRO 6000 的总得分达到 6,775,超过了 RTX 5090(5,749)、RTX 4090(4,958)和 RTX 6000 Ada(4,508)。其更快的令牌生成速率(每秒 325.9 个令牌)和更低的延迟(生成第一个令牌仅需 0.182 秒)突显了其在实时文本生成和基于聊天的 AI 工作负载中的响应能力。
Mistral 也延续了这一趋势,PRO 6000 的得分为 7,346,与 5090(6,267)、4090(5,094)和 6000 Ada(4,255)保持了相当大的领先优势。其 271.8 个 token/s 的吞吐量展现了其更大的 96 GB 内存池和针对高上下文推理优化的工作站调优的优势。
在 Llama3 测试中,PRO 6000 以 6,501 的得分保持领先,而 RTX 5090 为 6,104,4090 为 4,849,6000 Ada 为 4,026。这凸显了 NVIDIA Blackwell 架构的一致性,并且随着变压器工作负载的复杂性和上下文长度的扩展,PRO 6000 仍能保持性能优势。
最后,在强调长上下文推理和持续性能的 Llama2 测试中,PRO 6000 达到了 8,008 分,而 5090、4090 和 6000 Ada 则分别以 6,591、5,013 和 3,957 分落后。即使序列长度和推理时间增加,PRO 6000 在速度和稳定性方面仍保持着明显的优势,运行速度比测试中的任何其他 GPU 都更快,吞吐量也更流畅。
| UL Procyon:AI 文本生成 | NVIDIA RTX PRO 6000 | NVIDIA RTX 5090 | NVIDIA RTX 4090 | NVIDIA RTX 6000 Ada |
| 菲总分 | 6,775 | 5,749 | 4,958 | 4,508 |
| Phi 输出时间到第一个标记 | 0.182小号 | 0.244小号 | 0.255小号 | 0.288小号 |
| 每秒输出 Phi 令牌数 | 325.855 吨/秒 | 314.435 吨/秒 | 244.343 吨/秒 | 228.359 吨/秒 |
| Phi 总时长 | 9.498小号 | 10.280小号 | 12.872小号 | 13.869小号 |
| 米斯特拉尔总成绩 | 7,346 | 6,267 | 5,094 | 4,255 |
| Mistral 输出第一个令牌的时间 | 0.229小号 | 0.297小号 | 0.322小号 | 0.419小号 |
| 每秒 Mistral 输出代币数 | 271.779 吨/秒 | 255.945 吨/秒 | 183.266 吨/秒 | 166.633 吨/秒 |
| 米斯特拉尔总持续时间 | 11.493小号 | 12.593小号 | 17.010小号 | 19.092小号 |
| Llama3 总体评分 | 6,501 | 6,104 | 4,849 | 4,026 |
| Llama3 输出第一个标记的时间 | 0.218小号 | 0.234小号 | 0.259小号 | 0.348小号 |
| Llama3 每秒输出令牌数 | 226.407 吨/秒 | 214.285 吨/秒 | 150.039 吨/秒 | 138.620 吨/秒 |
| Llama3 总时长 | 13.554小号 | 14.304小号 | 19.991小号 | 22.062小号 |
| Llama2 总体评分 | 8,008 | 6,591 | 5,013 | 3,957 |
| Llama2 输出第一个标记的时间 | 0.307小号 | 0.419小号 | 0.500小号 | 0.679小号 |
| Llama2 每秒输出令牌数 | 145.595 吨/秒 | 134.502 吨/秒 | 92.853 吨/秒 | 78.532 吨/秒 |
| Llama2 总时长 | 20.712小号 | 23.018小号 | 32.448小号 | 38.923小号 |
UL Procyon: 人工智能图像生成
此 Procyon AI 图像生成基准 提供一致且准确的方法来衡量各种硬件(从低功耗 NPU 到高端 GPU)的 AI 推理性能。它包含三项测试:针对高端 GPU 的 Stable Diffusion XL (FP16)、针对中等性能 GPU 的 Stable Diffusion 1.5 (FP16) 以及针对低功耗设备的 Stable Diffusion 1.5 (INT8)。该基准测试使用针对每个系统的最佳推理引擎,确保结果公平且具有可比性。
从稳定扩散 1.5 (FP16) 开始,NVIDIA RTX PRO 6000 的总得分高达 8,869,远超 RTX 5090 的 8,193、RTX 4090 的 5,260 和 RTX 6000 Ada 的 4,230。PRO 6000 的图像生成耗时 11.27 秒,平均每幅图像耗时 0.705 秒,是本次测试中最快的显卡。这充分证明了其针对工作站优化的调校和 96 GB GDDR7 显存能够在不影响效率的情况下实现持续的高精度输出。
在衡量轻量级量化推理性能的稳定扩散 1.5 (INT8) 测试中,所有 GPU 的表现都相当接近。PRO 6000 的得分为 79,064,与 RTX 5090 的 79,272 几乎相同,同时领先于 RTX 4090(62,160)和 RTX 6000 Ada(55,901)。由于 INT8 工作负载对内存带宽和容量的依赖程度较低,因此差异很小,但 PRO 6000 保持了一致的结果,平均每张图像的生成时间为 0.395 秒。
稳定扩散 XL (FP16) 测试要求 GPU 进行更长、更苛刻的推理运行,这不仅对内存性能,也对持续计算吞吐量提出了更高的要求。PRO 6000 的总得分为 6,991 分,略低于 RTX 5090 的 7,179 分,但远高于 RTX 4090 的 5,025 分和 RTX 6000 Ada 的 3,043 分。它的总渲染时间为 85.8 秒,即每幅图像 5.36 秒,这表明 PRO 6000 能够高效地处理扩展的生成工作负载,且不会出现速度下降的情况。
| UL Procyon:AI 图像生成 | NVIDIA RTX PRO 6000 | NVIDIA RTX 5090 | NVIDIA RTX 4090 | NVIDIA RTX 6000 Ada |
| 稳定扩散 1.5 (FP16) – 总体得分 | 8,869 | 8,193 | 5,260 | 4,230 |
| 稳定扩散 1.5 (FP16) – 总时间 | 11.274小号 | 12.204小号 | 19.011小号 | 23.639小号 |
| 稳定扩散 1.5 (FP16) – 图像生成速度 | 0.705 秒/图像 | 0.763 秒/图像 | 1.188 秒/图像 | 1.477 秒/图像 |
| 稳定扩散 1.5 (INT8) – 总体得分 | 79,064 | 79,272 | 62,160 | 55,901 |
| 稳定扩散 1.5 (INT8) – 总时间 | 3.162小号 | 3.154小号 | 4.022小号 | 4.472小号 |
| 稳定扩散 1.5 (INT8) – 图像生成速度 | 0.395 秒/图像 | 0.394 秒/图像 | 0.503 秒/图像 | 0.559 秒/图像 |
| 稳定扩散 XL (FP16) – 总体得分 | 6,991 | 7,179 | 5,025 | 3,043 |
| 稳定扩散 XL (FP16) – 总时间 | 85.819小号 | 83.573小号 | 119.379小号 | 197.172小号 |
| 稳定扩散 XL (FP16) – 图像生成速度 | 5.364 秒/图像 | 5.223 秒/图像 | 7.461 秒/图像 | 12.323 秒/图像 |
搅拌机4.4
Blender 是一款开源 3D 建模应用程序。本次基准测试使用 Blender Benchmark 实用程序运行。分数以每分钟采样数计算,数值越高,性能越好。
在所有三个场景中,NVIDIA RTX PRO 6000 均占据榜首,展现了其 Blackwell 架构和更大显存容量的优势。在怪兽场景中,PRO 6000 的采样率为每分钟 7,870.17 个样本,领先于 RTX 5090 的 7,421.50 个样本,而 RTX 4090 和 RTX 6000 Ada 分别以 5,733.97 个样本和 5,632.60 个样本紧随其后。
在“旧货店”场景中,PRO 6000 继续保持领先,采样率为每分钟 4,158.91 次,而 RTX 5090 为 3,980.15 次,RTX 4090 为 2,827.83 次,RTX 6000 Ada 为 2,663.77 次。最后,在倾向于同时强调着色和内存效率的“课堂”场景中,PRO 6000 的采样率达到了每分钟 4,041.11 次,再次领先于 RTX 5090 的 3,732.63 次,并显著优于 RTX 4090 和 RTX 6000 Ada 的采样率(分别为 2,909.35 次和 2,818.83 次)。
| Blender 4.4(越高越好) | NVIDIA RTX PRO 6000 | NVIDIA RTX 5090 | NVIDIA RTX 4090 | NVIDIA RTX 6000 Ada |
| 怪物 | 7,870.17 | 7,421.50 | 5,733.97 | 5,632.60 |
| 旧货店 | 4,158.91 | 3,980.15 | 2,827.83 | 2,663.77 |
| 课堂 | 4,041.11 | 3,732.63 | 2,909.35 | 2,818.83 |
乐士马克
Luxmark 是一款 GPU 基准测试,利用开源光线追踪渲染器 LuxRender 来评估系统处理高精细 3D 场景的性能。该基准测试尤其适用于评估服务器和工作站的图形渲染能力,尤其是在视觉效果和建筑可视化应用中,精确的光线模拟至关重要。
在食物场景测试中,NVIDIA RTX PRO 6000 以 24,287 分的成绩领先,略胜 RTX 5090 的 23,141 分,而 RTX 4090 和 RTX 6000 Ada 则分别以 17,171 分和 14,873 分紧随其后。这表明 PRO 6000 能够在高度精细的几何和光照工作负载下保持流畅的光线追踪性能,且不会降低稳定性或降低散热性能。
在要求更高的 Hall 场景中,该场景强调大规模几何形状和复杂的全局照明,PRO 6000 再次以 52,588 的成绩获得最高分,略高于 RTX 5090 的 51,725,远高于 RTX 4090(38,887)和 RTX 6000 Ada(32,132)。
| Luxmark(越高越好) | NVIDIA RTX PRO 6000 | NVIDIA RTX 5090 | NVIDIA RTX 4090 | NVIDIA RTX 6000 Ada |
| 食物评分 | 24,287 | 23,141 | 17,171 | 14,873 |
| 霍尔斯 | 52,588 | 51,725 | 38,887 | 32,132 |
Geekbench 6
Geekbench 6 是衡量整体系统性能的跨平台基准测试。Geekbench 浏览器可让您将任何系统与其进行比较。
在本次测试中,NVIDIA RTX PRO 6000 的 GPU OpenCL 得分高达 384,158,超越了 RTX 5090(374,807)、RTX 4090(333,384)和 RTX 6000 Ada(336,882)。PRO 6000 更高的得分体现了其优化的工作站设计、增强的内存带宽和专业的驱动程序堆栈,这些特性共同使其能够在各种计算密集型工作负载下保持稳定的性能。
| Geekbench(越高越好) | NVIDIA RTX PRO 6000 | NVIDIA RTX 5090 | NVIDIA RTX 4090 | NVIDIA RTX 6000 Ada |
| GPU OpenCL 分数 | 384,158 | 374,807 | 333,384 | 336,882 |
的V-Ray
此 的V-Ray 基准测试使用先进的 V-Ray 6 引擎来衡量 CPU、NVIDIA GPU 或两者的渲染性能。它利用快速测试和简单的评分系统,帮助用户评估和比较其系统的渲染能力。对于寻求高效性能洞察的专业人士来说,它是一款必备工具。
在我们的测试中,NVIDIA RTX PRO 6000 的 vpaths 得分为 12,128,介于 RTX 5090(14,764)和 RTX 4090(10,847)之间。RTX 6000 Ada 得分为 10,766,略微落后。虽然 RTX 5090 在这项 GPU 密集型渲染测试中保持略微领先,但 PRO 6000 展现了强劲而稳定的性能,进一步证明了其面向工作站的调校能力以及在满负载渲染下的持续效率。
| V-Ray(越高越好) | NVIDIA RTX PRO 6000 | NVIDIA RTX 5090 | NVIDIA RTX 4090 | NVIDIA RTX 6000 Ada |
| 虚拟路径 | 12,128 | 14,764 | 10,847 | 10,766 |
LM Studio 多模型推理测试
在本轮测试中,我们使用 LM Studio 评估了 NVIDIA RTX PRO 6000 在一系列流行的大型语言模型中的表现,包括 GPT-OSS 120B、Gemma 3(4B、12B 和 27B)、Llama 3.1(8B 和 70B)以及 Llama 3.3 70B。每个模型都使用相同的指令进行提示:
“写一篇500字的关于树懒历史的学术论文。”
本次测试主要关注每秒令牌数(吞吐量)和总时间(完成时间),它们共同凸显了 RTX PRO 6000 在相同生成条件下处理不同模型大小和复杂性的效率。
在 LM Studio 推理测试中,NVIDIA RTX PRO 6000 在各种模型尺寸(从较小的 4B 参数模型到大规模 120B 级配置)中表现出色,具有出色的性能和可扩展性。
本次测试的亮点是 OpenAI GPT-OSS 120B 模型,RTX PRO 6000 每秒生成 163.1 个 token,并在 9.54 秒内完成了 500 个单词的生成。这一结果之所以引人注目,是因为 RTX 5090 等显卡无法加载或执行 120B 模型,甚至由于 VRAM 有限,甚至连 70B 模型都经常无法处理。PRO 6000 的 96 GB GDDR7 显存使其能够在本地处理这些庞大的模型,使其在工作站 GPU 中独树一帜。
对于较小的模型,Gemma 3.4 B 实现了最高的吞吐量,以每秒 226.7 个令牌的速度在 3.51 秒内完成任务。Llama 3.1 8B Instruct 紧随其后,每秒 197.1 个令牌,总时间为 4.17 秒。这些运行显示了 PRO 6000 在中端推理工作负载下的强大效率和快速响应。
在高端,Llama 3.1 70B Instruct 和 Llama 3.3 70B 型号平均每秒生成 31.8 个令牌,总生成时间分别为 27.2 秒和 25.3 秒,尽管尺寸较大,但仍显示出一致的输出。
总体而言,RTX PRO 6000 在运行大规模模型时展现出卓越的稳定性、吞吐量和处理能力。其 96 GB 的内存容量使其能够处理超出消费级 GPU 极限的工作负载,使其成为需要可靠本地性能进行高级 AI 和生成模型开发的开发者、研究人员和专业人士的理想选择。
| LM Studio(模型推理结果) | |||||||||
|---|---|---|---|---|---|---|---|---|---|
| 型号名称 | 令牌/秒 | 第一个令牌的时间 | 总时间(秒) | 提示符 | 预测标记 | 代币总数 | |||
| OpenAI GPT-OSS 120B | 163.15 | 0.193 | 9.543 | 81 | 1,557 | 1,638 | |||
| 杰玛 3 4B | 226.73 | 0.113 | 3.51 | 25 | 796 | 821 | |||
| 杰玛 3 12B | 117.15 | 0.068 | 8.06 | 25 | 944 | 969 | |||
| 杰玛 3 27B | 68.06 | 0.221 | 12.048 | 25 | 820 | 845 | |||
| Meta Llama 3.1 8B 指导 | 197.07 | 0.062 | 4.171 | 49 | 822 | 871 | |||
| Meta Llama 3.1 70B 指导 | 31.84 | 0.159 | 27.227 | 49 | 867 | 916 | |||
| 元骆驼 3.3 70B | 31.74 | 0.323 | 25.329 | 49 | 804 | 853 | |||
NVIDIA RTX PRO 6000 功耗
为了评估 AI 工作负载的实际效率,我们利用了 UL Procyon AI 图像生成基准测试,特别是 Stable Diffusion XL FP16 测试。该测试重点关注第二张和最后一张生成图像之间的时间间隔,记录完成时间间隔所需的时间、峰值和持续功耗,以及完成后的系统空闲功耗。
在我们的测试中,RTX PRO 6000 在持续负载下的平均系统功耗为 918.5 W,峰值为 1,036.3 W,工作负载完成后,空闲功耗稳定在 152.3 W。整个测试间隔持续 5.3 秒,总功耗为 1.35 Wh。这些结果展现了工作站级 GPU 卓越的功耗性能比,在长时间推理工作负载下保持功耗良好控制的同时,还能保持高输出。
与其他 GPU 相比,RTX PRO 6000 的总能耗与 RTX 4090 接近,同时保持了更快的完成时间,并且在能效和速度方面均显著优于 RTX 6000 Ada。有趣的是,共用 GB202 芯片的新款 Blackwell 显卡在这种工作负载下表现出非常相似的能效特性,总能耗仅略有差异,这可能是由于 PRO 6000 的 TDP 更高。这表明 NVIDIA 的最新一代显卡仍在持续优化每瓦性能,而非大幅提升性能。
| 稳定扩散 XL FP16 图像功率使用情况(越低越好) | NVIDIA RTX PRO 6000 | NVIDIA RTX 5090 | NVIDIA RTX 4090 | NVIDIA RTX 6000 Ada |
| 耗电量 | 1.35Wh | 1.16Wh | 1.35Wh | 1.76Wh |
| 测试时间 | 5.3s | 5.1s | 7.3s | 12.6s |
结语
总体而言,NVIDIA RTX PRO 6000 是目前适用于专业工作流程的、性能最强的工作站 GPU,它以桌面型设计提供数据中心级的性能。测试时的零售价约为 8,500 美元,它的目标客户是那些需要可靠性、高计算密度和海量 ECC 内存池来处理生产工作的团队。凭借 24,064 个 CUDA 核心、752 个 Tensor 核心、96 GB GDDR7 ECC 和 Blackwell 架构,它能够处理超出 GeForce RTX 5090 或 4090 等消费级显卡实际极限的工作负载。单项基准测试可能显示消费级显卡在原始速度方面略胜一筹,但从容量、稳定性、驱动程序和 ISV 支持等方面综合来看,RTX PRO 6000 更适合专业用途。
对于 AI 和 ML 而言,96 GB 的池容量至关重要。它支持本地进行长上下文推理和超大型检查点,我们通过运行 70B 到 120B 级别的模型,同时保持每秒强大的令牌数,证明了这一点。更大的二级缓存和内存带宽也为渲染和模拟带来了优势,使其在 Blender、V-Ray 和 LuxMark 的长时间负载下也能提供可预测且持续的性能。
该卡适用于真正的工作站。它采用真正的双插槽设计,配备 PCIe 5.0 x16 接口、四个 DisplayPort 2.1b 输出和一个 16 针电源输入。请规划优质电源和机箱气流,以支持 600W 的主板功率。多 GPU 支持也非常简单,OEM 和 ISV 支持 2 到 8 个 GPU,涵盖 AI、渲染和计算堆栈。
如果您的工作涉及长上下文 LLM、非常大的场景或单个节点上的高精度模拟,RTX PRO 6000 凭借其他卡无法比拟的容量和一致性证明了其优势。





Amazon