在 2026 年国际消费电子展 (CES) 上,NVIDIA 发布了DGX Spark的软件更新,进一步拓展了其作为紧凑型本地部署 AI 系统的功能。此次更新主要针对新的运行时环境、量化格式和部署方案,使用户能够更轻松地在本地运行开源模型、自动化工作流程以及创建和 3D 流水线。该更新面向已在实验室、边缘部署或工程环境中使用 DGX Spark 的团队,不涉及任何新的硬件。
企业环境中的开源人工智能
NVIDIA 强调了开源 AI 的快速崛起。开源 AI 框架和模型的月下载量从 2023 年 6 月的约 700 万次增长到 2025 年 12 月的约 3.9 亿次。Spark 已进行调整以支持这一趋势:PyTorch、vLLM、SGLang、llama.cpp、LlamaIndex 以及来自 Qwen、Meta、Stability 和 Wan 等社区的众多模型现已完全集成到系统中。
对于采用开源工具的企业而言,这意味着更少的自定义集成工作,以及他们已使用的技术栈更可靠的运行。
自发布以来速度提升高达 2.5 倍
NVIDIA 声称,与 DGX Spark 发布时相比,关键工作负载的性能提升高达 2.5 倍。这一提升源于 TensorRT-LLM 的增强、更先进的量化技术以及解码优化,而非硬件方面的改变。
一个具体的例子是使用 TensorRT-LLM 的 Qwen-235B。从 FP8 量化过渡到 NVFP4 量化,并采用 Eagle3 的推测性解码,吞吐量提升了一倍以上。在 CUDA 和 llama.cpp 下的 Stable Diffusion 3.5 Large 算法中,Qwen3-30B 的性能提升约为 1.4 倍。由于 PyTorch 流水线针对 Spark 的 GPU 进行了优化,因此,无论是完全优化还是参数优化,微调过程都能带来显著但较小的性能提升。
剧本:从“桌面上的盒子”到可用的工作流程
为了弥合原始计算能力与可用解决方案之间的差距,NVIDIA 推出了新的 DGX Spark playbook,将工具、模型和指南结合起来,用于常见的企业任务。
新增内容包括:
- 推理:vLLM、SGLang、TensorRT-LLM、推测性解码、多模态推理、Spark 上的 NIM、NVFP4 量化和本地 Nemotron-3 Nano。
- 微调:多 Spark PyTorch 微调、FLUX.1 DreamBooth LoRA、LLAMA Factory、NeMo 和基于 Unsloth 的高效训练。
- 数据科学:CUDA-X 数据科学、优化的 JAX、文本到知识图谱,以及特定领域的工作流程,例如单细胞 RNA 测序和定量投资组合优化。
- 工具和连接:ComfyUI、VS Code、DGX Dashboard、AI Workbench 中的 RAG、Tailscale 和基于 NCCL 的“Connect Two Sparks”。
重点不在于花哨的演示,而在于可复现性。这些操作手册作为预先验证的参考框架,无需重构整个技术栈即可部署到本地。
混合型 MacBook 和 Spark 可将 AI 视频流水线速度提升 8 倍
在内容创作方面,NVIDIA 测试了 AI 视频生成工作流程,将 MacBook Pro M4 Max 与 DGX Spark 通过 ComfyUI 和 FLUX.1-dev、WAN 2.2 以及 GPU 加速的升频器相结合。
参考流程以一段未来都市中红色跑车的 4K 视频为特色,充分展现了改进之处。仅在 MacBook 上运行整个工作流程大约需要 8 分钟。将繁重的处理任务转移到 DGX Spark 后,时间缩短至约 1 分钟,速度提升了 8 倍。
这一进展源于在 Spark 上运行 FLUX.1-dev 和 WAN 2.2 的量化 NVFP4/NVFP8 版本,并随后应用 RTX 视频超分辨率技术。对于媒体、设计和营销团队而言,这使得生成式视频的渲染方式从批处理式转变为更接近交互式迭代的过程,同时还能在数据中心或边缘机架内保持控制。
3D 和 RTX 重混:Spark 作为后台 AI 协处理器
DGX Spark 也被作为一款协处理器,用于基于 RTX Remix 的 3D 工作流程。例如,在 RTX 5090 系统上运行交互式“Mod”环境时,Spark 会批量生成 AI 纹理(例如,100 种材质),并将结果返回到场景中,而不会中断艺术家的工作。
使用 SWAT 4 进行的前后对比展示了 AI 增强型材料如何使传统资产焕发新生。然而,关键的商业优势在于工作流程设计:Spark 作为持续的后台引擎,用于生成任务,而主工作站则保持运行。
Nsight Copilot:本地 CUDA AI 助手
值得一提的是,新增功能是 Nsight Copilot,它在 DGX Spark 上本地运行。
开发者可以请求诸如“使用 CUDA 以 FP4 格式编写矩阵乘法”之类的任务,Nsight Copilot 提供了一个完整的 cuBLAS-Lt 示例,该示例在设备上将 FP32 输入量化为 FP4,设置每个张量的缩放比例,以 FP32 格式执行 GEMM,并返回 FP32 输出。重要的是,此过程无需将代码或数据发送到云服务:
- 无需支付云端推理费用。
- 源代码、数据和 IP 地址均保留在本地。
- 本地GPU负责管理延迟和吞吐量。
对于拥有严格数据治理规则的组织而言,这既可以实现人工智能辅助开发,又能确保网络内部的一切安全。
智能体、机器人和边缘计算:从实验室到生产环境
NVIDIA正通过与Hugging Face和开源机器人Reachy Mini的合作,将Spark扩展到智能体和机器人应用领域。DGX Spark负责运行智能体、LLM、VLM和规划器,而Reachy Mini则提供了一种适用于人机交互研究、教育和原型设计的物理形态。
DGX Spark 将于 1 月底前纳入 NVIDIA AI Enterprise。这将为企业提供受支持的软件堆栈、生命周期管理和安全更新,以便在边缘和本地场景(例如智能制造和检测、智能零售和防损以及即时医疗保健应用)中运行 Spark。
生态系统和OEM支持
NVIDIA 在更新的最后重点介绍了其广泛的生态系统:模型提供商(OpenAI、Mistral、Stability、Qwen、Meta、ElevenLabs、Black Forest Labs 等)、工具(vLLM、Comfy、LlamaIndex、Docker、Jupyter、Weights & Biases、Anyscale,以及 VASP 和 GROMACS 等科学代码)以及包括戴尔、联想、惠普、华硕、微星、超微等在内的众多 OEM 厂商。
对于企业买家而言,DGX Spark 的信息是,它不再仅仅是面向开发人员的工具。它是一个小型节点,可以无缝集成到现有工具、供应商关系和生产 AI 策略中。




Amazon