NVIDIA DGX Spark 代表了 AI 基礎設施可訪問性的分水嶺。 2017 年,具有里程碑意義的論文《Attention is All You Need》介紹了 Transformer 架構,該論文依賴八 GPU P100 伺服器配置,功耗高達數十千瓦時,並佔用了大量資料中心空間。如今,DGX Spark 以緊湊的 240 瓦桌上型電腦尺寸提供卓越的運算效能。這種在能源效率和尺寸壓縮方面的顯著提升,使得個人研究人員、小型團隊和分散式開發組織能夠輕鬆存取先前資料中心獨有的 AI 功能。
Spark 與以往桌面 AI 解決方案的差異在於其涵蓋整個開發生命週期的全面方法。 Spark 不會在實驗、微調和部署之間做出妥協,而是在所有階段提供真正的能力。 128 GB 統一記憶體架構支援對模型進行全面的參數微調,而這在傳統工作站上需要雲資源的支持,同時每秒提供數百個令牌的吞吐量,非常適合批量推理工作負載,包括合成資料生成。它還配備了具有 200Gb 結構容量的 ConnectX-7 網絡,這意味著企業可以叢集多個 Spark 系統,以進行更大規模的模型探索。正如我們將要演示的那樣,即使是單一系統也能展現出非凡的性能。
關鍵要點
資料中心級效能,桌面級配置:GB10 Grace Blackwell,體積 1.13 公升,功率 240 瓦,售價 3,999 美元,可提供高達 1 petaFLOP FP4 稀疏效能。
改變工作流程的記憶體:128GB 統一記憶體支援在本地對 8 億模型進行全參數微調,並實現高吞吐量推理。測試中,Llama 3.1 30 億 FP4 模型在 128 個並發數下達到了約 924 tok/s 的速度,而 Qwen3 Coder 8 億-A3B FP8 模型在 64 個批次下達到了約 483 tok/s 的速度。
可擴充並連接高速儲存:整合的 ConnectX-7 提供 200G 交換矩陣,支援叢集或 NVMe-oF。內建的 2242 Gen5 NVMe 儲存雖然方便,但處理高 I/O 負載的能力有限,因此,透過 RDMA 連接外部 NVMe-oF 是實現持續高吞吐量的更佳選擇。
第一天軟體成熟度:附帶 DGX OS、CUDA、cuDNN、TensorRT、AI Workbench、容器和工作流程劇本,以便團隊可以立即運行真正的工作負載。
經實際驗證的性能:MAMF 的 BF16 性能約為 99.8 TFLOPs,FP8 性能約為 207.7 TFLOPs。 GDSIO 讀取速度在內部峰值約為 11.4 GiB/s,預計在 200G 網路架構上會有更高的上限。
什麼是 DGX Spark?誰應該考慮它?
NVIDIA DGX Spark 本質上是一個完整的 AI 開發平台,而不僅僅是一個 GPU 元件。其核心是 GB10 Grace Blackwell 超級晶片,該晶片整合了搭載第五代 Tensor Core 的 Blackwell 架構 GPU 和透過 NVLink-C2C 連接的 20 核心 Arm CPU(10 個 Cortex-X925 + 10 個 Cortex-A725)。據 NVIDIA 稱,這種一致的互連架構與 PCIe Gen 5 相比,可實現高達 5 倍的頻寬,從而創建統一的運算結構,而非離散的處理域。
為了方便用戶入門,NVIDIA 推出了基於 Ubuntu 桌面構建的 DGX 作業系統,並預先配置了完整的 AI 軟體堆疊,包括 CUDA、cuDNN、TensorRT、NVIDIA Container Runtime 和 AI Workbench,從而消除了定制工作站建置中常見的驅動程式難題和環境配置開銷。該系統提供靈活的部署模式:您可以連接週邊設備,將其用作具有完整 Ubuntu 桌面體驗的緊湊型工作站,也可以將其部署為可透過 NVIDIA Sync 存取的無頭網路設備,從而與 JupyterLab、VS Code、Cursor IDE 和 SSH 終端無縫整合。
這是專為 AI 從業人員、微調語言模型的研究人員、加速 RAPIDS 工作流程的資料科學家、實現代理系統的開發人員,以及小規模實驗燒蝕模型架構的團隊所打造的基礎架構。 Spark 的目標使用者是需要強大 AI 運算能力且無需擔心資料中心複雜性的專業人士。
NVIDIA DGX Spark 技術規格
| 規格 | 信息 |
|---|---|
| 卓越的建築 | |
| GPU | NVIDIA Blackwell 架構 |
| 中央處理器 | 20 核心 Arm(10 個 Cortex-X925 + 10 個 Cortex-A725) |
| 張量核心 | 5th代 |
| RT核心 | 4th代 |
| NVENC/NVDEC | 1× / 1× |
| 記憶體應用 | |
| 系統內存 | 128 GB LPDDR5X(統一系統記憶體) |
| 存儲器接口 | 256-位 |
| 內存帶寬 | 273 GB / s |
| 性能 | |
| FP4 | 高達 1 petaFLOP(具有 Sparsity) |
| 儲存 | |
| 儲存 | 1 TB 或 4 TB NVMe M.2(自加密) |
| 連線能力 | |
| USB | 4× Type-C USB 3.2 Gen 2×2(20Gbps) |
| 乙太網路 - ENET | 1×10GbE RJ-45 |
| NIC | ConnectX-7 智慧網路卡 – 2x 200G QSFP(允許最大 200G 頻寬) |
| 無線應用 | Wi-Fi 7,藍牙5.3 |
| 音頻輸出 | HDMI多聲道音訊輸出 |
| 顯示器連接器 | 1×HDMI 2.1a |
| 機構 | |
| 尺寸 | 150 × 150 × 50.5 毫米(5.9 × 5.9 × 1.98 吋) |
| 重量 | 1.2克 |
| 電源消耗功率 | 240W¯¯ |
NVIDIA DGX Spark 設計與構建
NVIDIA DGX Spark 延續了 NVIDIA 標誌性的工業設計語言,其緊湊的機身與大型 DGX 系統的外觀和質感相得益彰。前面板採用微型手持式設計,致敬原版全尺寸 DGX 設備的手柄,並採用金色斑點金屬飾面,營造出精緻高端的質感,並與 NVIDIA 標誌性的綠色標誌相得益彰。
DGX Spark 的外型尺寸為 5.9 × 5.9 × 1.98 吋(150 × 150 × 50.5 mm),體重 2.6 磅(1.2 公斤),總內部容積為 1.13 公升。這使得它穩居 1 升小型 PC 等級。儘管體積小巧,但由於全金屬合金外殼兼具被動式散熱器的功能,該系統仍感覺堅固耐用,兼顧了外形和功能。
電源由 240 W USB-C 外接電源模組供電,如圖所示,該模組位於主機旁。此電源模組結構緊湊,做工精良,採用標準 C5(三葉草)連接器進行交流輸入,與 DGX Spark 簡潔高效的設計相得益彰。
回到機身背面,DGX Spark 延續了機身正面的金色斑點紋理飾面,使整個機殼的設計風格保持一致。從左側開始,電源按鈕位於四個 USB-C 連接埠旁邊,其中一個連接埠為裝置提供電源傳輸 (Power Delivery)。此外,還有一個 HDMI 2.1a 輸出端口、一個 10 GbE RJ-45 端口,而這款設備的亮點在於其集成的 NVIDIA ConnectX-7 SmartNIC 驅動的雙 200 GbE QSFP56 接口。
乍一看,你可能會推斷 Spark 支援 400G 的連接;不幸的是,由於 PCIe 的限制,Spark 只能提供 200G 的連接。為了了解更多信息,我們深入研究了 Spark 的拓撲結構:
使用 lstopo,我們觀察到 CX7 網路卡的兩個互連。 CX7 透過兩條 Gen5 x4 連結進行電氣連接。在作業系統中,這些連接顯示為四個接口,每個接口支援的最大頻寬為 200G。由於測試時間有限,我們無法在 NVMe-oF 測試之外發現該平台的所有網路特性,本文稍後將詳細介紹這些測試。但是,我們計劃進一步探索該平台,並將在未來發布文章,深入探討其功能,例如將多個 Spark 集群在一起形成一個微型集群。
查看其他連接的設備,接下來是與 Gen5 x4 連接的微型 2242 外形 M.2 SSD,然後是與 PCIe Gen4 x1 鏈路連接的 Realtek RJ45 10GbE 控制器,以及與 PCIe Gen3 x1 鏈路連接的聯發科 Wi-Fi 控制器。
深入 CPU 方面,Spark 搭載 20 核心 Arm 處理器,採用類似英特爾最新處理器的異質「大小」架構,由 10 個 Cortex-A725 能源效率核心和 10 個 Cortex-X925 效能核心組成,分佈在兩個 L3 快取叢集中。第一個集群(8MB L3)包含 CPU 0-4(Cortex-A725,最高 2808 MHz)和 CPU 5-9(Cortex-X925,最高 3900 MHz);第二個集群(16MB L3)包含 CPU 10-14(Cortex-A725,最高 2860 MHz)和 CPU 15-19(Cortex-X925,最高3978-4004 MHz)。每個核心都擁有 64KB 的私有 L1 資料快取和 64KB 的 L1 指令緩存,但 L2 快取因核心類型而異:高能效 Cortex-A725 核心擁有 512KB 的 L2 緩存,而高效能 Cortex-X925 核心則擁有更大的 2MB L2 倍快取(大 2MB L2 倍)。最快的核心是 CPU 15-19,它們受益於更大的 16MB L3 快取和更高的頻率,其中 CPU 19 是峰值效能核心,頻率高達 4004 MHz。這些不同的功率/頻率等級在上圖所示的拓樸結構中以核心上的虛線表示。
放大後,我們將 DGX Spark 翻轉過來;唯一可見的塑膠零件是底座蓋,它透過磁力吸附在機殼底部。這種設計既能保持外部清潔,又能快速拆裝內部零件。拆下磁力底座後,露出四顆螺絲,即可打開主內部隔層。
在內部,我們可以看到天線佈線朝向裝置頂部,這證實了它支援 Wi-Fi 7 和藍牙 5.3 連接。這提供了靈活的網路選項,對於可能無法進行有線存取的行動或實驗室部署尤其有用。
圖中還可以看到該裝置的儲存解決方案,即 PCIe Gen5 2242 M.2 SSD,這種規格對於此類高效能硬體來說並不常見。此處顯示的配置包含一個 4TB 三星 NVMe 硬碟。
深入研究 DGX Spark,便會發現系統的核心——NVIDIA Grace Blackwell 的 GB10 超級晶片。 GB10 超級晶片兩側是 8 個焊接的 LPDDR5X 統一系統內存,可提供 273 GB/s 的頻寬,確保 CPU 和 GPU 操作之間的快速資料存取。
晶片旁邊是 CX7 網路卡,如前所述,它提供 200G 的連接能力。這使得用戶能夠將 Spark 連接到高速存儲,甚至可以將多個 Spark 實例叢集在一起。 NVIDIA 已經驗證並銷售了由 2 個 Spark 組成的集群,可以直接連接,以支援更大規模的 AI 模型。
最後,翻轉主機板即可看到所有 PCIe 連接,包括 PCIe Gen5 x4 2242 M.2 SSD 和 PCIe Gen3x1 MediaTek Wi-Fi 適配器。
Spark 不可或缺之處:現代 AI 開發設備
DGX Spark 在多個不同的專業環境中表現出特別的吸引力,每個環境都受益於其統一記憶體、緊湊外形和全面軟體整合的獨特組合。
數據科學加速:從 Pandas 到生產
對於資料科學家而言,NVIDIA DGX Spark 代表著工作流程速度和體驗的大幅提升。 ConnectX-7 網路提供 200 Gbps 頻寬,並結合 CUDA X 加速函式庫,徹底革新了資料預處理。人工智慧和數據科學建立在「優質數據輸入,優質數據輸出」的基礎之上。傳統機器學習專案最耗時的階段通常是資料清理和特徵提取。傳統的工作流程通常涉及將資料集載入到 Pandas 等工具中,並在 CPU 核心上執行轉換,這通常速度較慢。手動探索和特徵工程也可能成為重大阻礙。 Spark 透過 RAPIDS 實現端對端 GPU 加速。
典型的企業資料科學場景涉及對 40-80GB 資料集進行特徵工程:連接多個表、跨時間視窗計算聚合、處理分類編碼以及標準化分佈。在 CPU 基礎架構上,這種預處理可能耗時數小時。透過 RAPIDS cuDF 將整個資料集載入 Spark 的 128 GB 統一記憶體中,這些操作可在幾分鐘內完成,加速可達 10 倍或更高。後續的模型訓練,無論是使用 cuML 進行經典機器學習,還是使用 PyTorch 進行深度學習,都能獲得同等的收益,從而消除了資料科學家需要等待基礎架構而非迭代假設的傳統瓶頸。
合成數據生成:機器人與模擬
Spark 搭載了第四代 RT Core,使其在新興工作流程中獨佔鰲頭:即為世界模型訓練產生合成資料。傳統上,訓練穩健的操作策略需要數萬次真實世界的演示,成本高且耗時。 Isaac Sim 或 Omniverse 等平台上的逼真模擬提供了一種替代方案,但渲染具有物理精確光照、反射和材質的光線追蹤影像歷來需要昂貴的工作站 GPU,例如 NVIDIA 的L40S和 RTX 6000 Ada。
資料來源:英偉達
Spark 整合了這個工作流程。 RT Core 使 OpenUSD 工作負載能夠處理合成資料生成,而 Tensor Core 則用於藍圖/工作流程中的 AI 推理。以前,組織可能需要部署多台機器進行渲染,並單獨部署一台推理最佳化伺服器。現在,只需一台 240W 的裝置即可實現。對於探索自主操控的機器人新創公司、大學實驗室或汽車製造商而言,這種整合顯著縮短了開發時間和資本支出。
我們先前在 NVIDIA L40S 的頻道中,曾探討過類似的合成資料產生流程,該流程使用專用的 L40S 渲染系統搭配 H100 進行推理。 GB10 將這些功能整合到統一的開發設備中,標誌著該工作流程的重大演進。我們計劃在後續的分析中,針對這些不同的配置對 Spark RT Core 的效能進行更多測試,檢視其在典型機器人操作場景下的渲染和其他工作負載表現。
Vibe 程式設計革命
前特斯拉人工智慧總監兼 OpenAI 創始成員 Andrej Karpathy 創造了「氛圍編碼」(vibe coding)一詞,用來描述一種借助人工智慧進行快速軟體開發的新興方法。氛圍編碼並非逐行細緻地編寫程式碼,而是利用法學碩士(LLM)作為互動式結對程式設計人員:用自然語言描述功能,產生實作框架,透過對話式改進進行迭代,並快速建立功能原型。這種工作流程將編碼從刻意建構轉變為與理解上下文、API 和架構模式的人工智慧進行引導式對話,使個人開發者能夠以前所未有的速度建立極其複雜的系統。
OpenRouter 的使用率排名印證了 AI 輔助編碼的普及程度,其中專注於編碼的模型始終佔據推理量的主導地位。技術專業人員是 vibe 編碼的主要用戶群體,他們通常是高級用戶,會在不同的場景下並行運行多個編碼代理。隨著開源模型在關鍵基準測試中越來越接近專有模型,開發人員正在探索本地推理部署,以消除速率限制,確保在關鍵開發視窗期間的可用性,並維護專有專案的程式碼機密性。
r/LocalLLaMA 社群展現了令人印象深刻的客製化配置,從多 GPU 工作站到運行本地模型的管道式伺服器,從跨消費級硬體的分散式推理,到支援持續高吞吐量運算的精密冷卻解決方案,應有盡有。然而,這些配置也存在諸多挑戰:資本支出通常超過數萬美元,功耗巨大,散熱管理挑戰重重,需要專用空間而非標準辦公環境,並且需要大量的配置、優化和故障排除技術專業知識。
Spark 從根本上改變了這個價值主張。它售價 3,999 美元,配備 128 GB 統一內存,在安靜、緊湊、節能且功耗僅為 240 瓦的設備上提供令人印象深刻的模型推理性能。希望建立本地編碼助理基礎架構的使用者不再需要耗費大量電力並產生大量熱量的複雜家庭實驗室。經過驗證的設備方法與預先配置的 DGX 作業系統相結合,消除了先前限製本地 LLM 部署的配置複雜性,而這種複雜性先前僅限於擁有深厚 Linux 和 CUDA 專業知識的用戶。
除了消除基礎設施摩擦之外,Spark 還解決了程式碼隱私和模型自訂的關鍵問題。雲端編碼助理必須將原始碼傳輸到遠端伺服器,這對於處理專有演算法、安全關鍵基礎設施或受監管資料的組織來說,根本行不通。 Spark 上的本機推理功能可確保程式碼始終保持開發環境的完整性。此外,128 GB 的記憶體容量支援對編碼模型進行全面的參數微調,讓經驗豐富的開發人員能夠在內部程式碼庫上進行模型的專門化。對於使用領域特定語言、自訂框架或架構模式(這些模式在公共訓練資料中缺乏充分體現)的組織而言,此功能尤其寶貴。
使用 NVIDIA NeMo 在 DGX Spark 上進行微調
DGX Spark 的 128 GB 統一記憶體支援對 8B 模型進行完整的參數微調,而這傳統上需要昂貴的多 GPU 雲端設定。使用標準 Adam 優化對 Qwen3 8B 進行完整微調需要大約 132 GB(16 GB 模型權重、96 GB 優化器狀態、16 GB 梯度以及激活),超過了雙 H100 80 GB 配置。使用記憶體高效的 8 位元 Adam 可將需求降低到 70 GB 左右(取決於批次大小),可以輕鬆容納在 Spark 的記憶體池中。這一點很重要,因為在複雜的推理任務上,完整微調的準確率比 LoRA 高 4-6%。基於雲端的 2× H100 80 GB 設定的成本約為每小時 5 美元,並且具有分散式訓練複雜性,而 Spark 只需一次性投資 3,999 美元即可提供單系統訓練。
NVIDIA NeMo Automodel 為任何 Hugging Face 型號提供無需檢查點轉換的 Day-0 支持,從而消除了企業訓練框架的摩擦。直接從 HuggingFace Hub 載入 Qwen3 8B,並透過指定資料集來源、優化器設定和 LoRA 目標的 YAML 檔案配置微調。 NeMo 可自動執行分散式檢查點操作,並相容於安全張量 (safetensor),實現融合 CUDA 核心以實現 2-5 倍加速,並處理梯度累積。
使用舒適的 UI 產生圖像
ComfyUI 提供基於節點的圖形介面,將穩定擴散及相關擴散模型轉換為高度可自訂的創意流程。與傳統的網頁介面將複雜性抽象化為簡化參數滑桿不同,ComfyUI 採用視覺化圖形架構,使用者透過連接離散的功能節點來建立工作流程,每個節點代表特定的操作,例如模型載入、即時編碼、潛在擴散採樣、VAE 解碼或升級轉換。這種模組化設計能夠對整個生成流程進行精細控制,使每個計算步驟透明且可調整。它還允許用戶連結多個模型、實現自訂採樣計劃或整合 ControlNet 導引等高級技術,而這些在簡化的介面中是無法實現的。
在 DGX Spark 上,ComfyUI 利用 Blackwell GPU 的 Tensor Core 加速擴散採樣,通常可在 15-30 秒內完成生成,具體取決於採樣複雜度。 128GB 的統一記憶體架構尤其具有優勢,可在記憶體中同時維護多個檢查點模型、LoRA 適配器和 VAE 解碼器,從而消除了 VRAM 受限系統所面臨的重新載入開銷。用戶可以在本地生成幾乎無限的 AI 藝術作品,無需擔心 API 速率限制、每次生成的雲端成本以及專有創意工作流程相關的隱私問題。工作流程持久化模型提升了營運價值:完整的管線序列化為 JSON 文件,這些文件可以進行版本控制、跨團隊共享或作為元資料直接嵌入到生成的圖像中,從而實現可重複性,這對於構建合成資料集管線或在生成的資源中保持一致藝術風格的組織至關重要。
NVIDIA DGX Spark 效能測試
vLLM 線上服務 – LLM 推理測試
vLLM 是目前最受歡迎的高吞吐量 LLM 推理和服務引擎。 vLLM 線上服務基準測試是一種效能評估工具,旨在衡量該推理引擎在處理並發請求時的實際服務能力。它透過向正在運行的 vLLM 伺服器發送請求來模擬生產工作負載,這些請求的參數可配置,例如請求速率、輸入/輸出長度和並發客戶端數量。此基準測試測量了吞吐量等關鍵指標,例如每秒令牌數、第一個令牌產生時間以及每個輸出令牌的時間,從而幫助使用者了解 vLLM 在不同負載條件下的效能。
我們測試了代表當今生產部署中最受歡迎的架構和模型類型的綜合模型的推理性能。
混合專家模型
我們評估了 Qwen3 Coder 30B-A3B,它是目前最受歡迎的本地推理部署編碼模型之一。這種稀疏架構在 BF16 精確度下保持 3 億參數的完整模型大小,同時每個產生的 token 僅啟動 30 億參數。我們對 Qwen 的原版模型和 FP8 量化版本進行了基準測試。 FP8 量化模型展現出顯著的效能提升:並發數為 1 時達到 46.5 tok/s,批量大小為 64 時可擴展至驚人的 482.6 tok/s。原版 BF16 模型在並發數為 1 時達到 27.8 tok/s,批量大小為 64 時達到 166.2 tok/s,效能提升近 3 倍。
密集模型
密集模型代表了傳統的 LLM 架構,其中所有參數和活化函數都會在推理過程中被調用,因此與稀疏模型相比,其計算量更大。為了全面評估不同模型規模和量化策略下的效能特徵,我們對五種密集模型配置進行了基準測試。
我們的測試套件包括 Mistral AI 的 Mistral Small 3.1 24B(精確度為 BF16),以及 RedHat AI 的 Mistral Small 3.1 24B FP8 動態量化版本。動態量化採用選擇性權重量化技術來優化性能與精度之間的權衡,策略性地降低精度,同時最大限度地減少模型性能下降。我們針對這些規模更大的密集模型,在三種精度格式下使用了 Meta Llama 3.1 8B 進行評估:標準 BF16 配置,以及 NVIDIA 的 FP8 和 FP4 量化版本。這種模型選擇策略能夠跨模型規模直接比較效能,同時隔離漸進式量化對推理吞吐量的影響。
效能分析:大型密集模型
Mistral Small 3.1 24B 在 BF16 精確度下,在同時數為 1 時,基準吞吐量為 5.3 tok/s,在並發請求數為 128 時,可擴充至 158.9 tok/s。 FP8 動態量化版本在較低同時發生的效能提升不大,僅 8.8 tok/s,但在規模化後,效能提升高達 2 倍,在同時數量為 128 時,效能提升高達 319.7 tok/s,充分體現了動態量化在高吞吐量服務情境下的有效性。
效能分析:緊湊密集模型
Llama 3.1 8B 架構在不同量化策略下展現出顯著的效能特性差異。在 BF16 精確度下,此模型在並發等級 1 的效能為 13.6 tok/s,在 128 個並發請求下可擴充至 408.6 tok/s。轉換到 FP8 量化後,在並發等級 1 和 128 的效能分別達到 23.2 tok/s 和 752.8 tok/s,這意味著大規模吞吐量提升了 84%。 FP4 配置進一步提升了效能,在相同並發等級下的效能分別達到 34.1 tok/s 和 924.1 tok/s,這表明積極的量化策略可以在維持模型品質的同時,將效能提升至基準精度的 2.3 倍,以滿足多種生產工作負載的需求。
微尺度資料類型
微尺度化是一種先進的量化方法,它將細粒度的縮放因子應用於小塊權重,而不是對大型參數組進行統一量化。 NVIDIA 的 NVFP4 格式透過分塊浮點表示實現了這項技術,其中每個包含 8-32 個值的微尺度區塊共享一個公共指數作為縮放因子。這種精細方法在實現 4 位元表示的同時保留了數值精度,從而保持了 Transformer 架構所需的動態範圍。此格式與 NVIDIA 的 Tensor Core 架構集成,可在矩陣運算過程中實現高效的混合精度計算和動態解壓縮。
我們使用 NVFP4 量化方法,在 20B 和 120B 參數規模下評估了 OpenAI 的 GPT OSS 模型。 20B 參數模型在併發數為 1 時達到 39.7 tok/s,在並發請求數為 128 時可擴展至 611.7 tok/s。 120B 參數模型在併發數為 1 時達到 31.4 tok/s,在並發請求數為 64 時達到 162.7 tok/s。
注意:輸出吞吐量是指所有請求的總吞吐量,而不是每個請求的吞吐量。
由於時間有限,我們無法完成 TensorRT 測試,請關注 spark 的後續文章,我們將在其中探索更多推理框架的表現。
預填充和解碼重推理
LLM 推理可以從根本上分解為兩個不同的計算階段,每個階段都表現出截然不同的效能特徵和資源利用模式。預填階段透過單一平行操作處理整個輸入提示,同時在所有輸入 token 上計算注意力機制,這是一個計算密集型操作,會完全飽和張量核心和計算單元。相反,解碼階段以自回歸的方式產生輸出 token,透過順序操作一次產生一個 token。這些操作計算強度較低,但對記憶體頻寬要求很高,因為模型必須反覆存取權重和不斷增長的鍵值快取。這會產生根本不同的瓶頸特徵:預填操作通常受運算限制,而解碼操作則需要佔用大量記憶體頻寬,因此特別容易受到記憶體子系統的限制。
我們針對兩種不同的工作負載配置進行了全面測試:解碼密集型推理(512 個輸入令牌和 8,192 個輸出令牌)以及預先填充密集型推理(8,192 個輸入令牌和 512 個輸出令牌)。效能表徵揭示了預期的架構權衡:Spark 在預填充密集型工作負載(運算資源仍然是主要瓶頸)上展現出具有競爭力的吞吐量,但在解碼密集型場景下效能有所下降。這種效能差異與記憶體頻寬限制恰好吻合。解碼操作的順序性和密集的記憶體存取模式直接暴露了 Spark 架構固有的頻寬限制。這些結果為下一節中 MAMF 測量結果的解讀提供了關鍵背景,因為兩個基準測試套件都一致認為記憶體頻寬是實際推理部署中效能限制的根本因素。
最大可實現 Matmul FLOPS (MAMF)
MAMF(最大可達矩陣乘法浮點運算次數)是一種實用的效能指標,旨在衡量機器學習加速器在矩陣乘法運算中實際可達到的峰值浮點運算次數,它比硬體規格中通常宣傳的理論峰值浮點運算次數更準確。我們使用的是Stas Beckman 開發的 mamf-finder 基準測試程式。
在 BF16 精確度下,我們觀察到 MAMF 為 99.8 TFLOP,而 FP8 (E4M3) 的 MAMF 為 207.7 TFLOP。由於時間限制,我們無法對 FP4 MAMF 進行全面的表徵;然而,根據觀察到的基於精度的擴展模式推斷,我們預計其性能將比 FP8 提升 2 倍,在密集 FP4 運算中可實現約 400 TFLOP。考慮到 2:1 結構化稀疏性最佳化,這相當於理論 FP4 效能的約 80%,在稀疏計算工作負載下可實現約 800 TFLOP。需要注意的是,由於多種原因,這些 MAMF 測量值可能低於理論上的宣傳規格,我們將不會在本次評測中詳述。
GPU直接儲存
我們在 Spark 上進行的測試之一是 MagnumIO GPU 直接儲存 (GDS) 測試。 GDS 是 NVIDIA 開發的功能,可讓 GPU 在存取儲存在 NVMe 磁碟機或其他高速儲存裝置上的資料時繞過 CPU。 GDS 無需透過 CPU 和系統記憶體路由數據,而是支援 GPU 和儲存設備之間的直接通信,從而顯著降低延遲並提高數據吞吐量。
GPU 直接儲存的工作原理
傳統上,當 GPU 處理儲存在 NVMe 磁碟機上的資料時,資料必須先經過 CPU 和系統內存,然後才能到達 GPU。此過程會引入瓶頸,因為 CPU 成為中間人,增加延遲並消耗寶貴的系統資源。 GPU 直接儲存使 GPU 能夠透過 PCIe 總線直接從儲存裝置存取數據,從而消除了這種低效率。這種直接路徑減少了與資料移動相關的開銷,從而實現更快、更有效率的資料傳輸。
人工智慧工作負載,尤其是涉及深度學習的工作負載,是高度資料密集的。訓練大型神經網路需要處理 TB 級的數據,資料傳輸中的任何延遲都可能導致 GPU 利用率不足和訓練時間更長。 GPU 直接儲存透過確保資料盡快傳輸到 GPU、最大限度地減少空閒時間並最大限度地提高運算效率來解決這一挑戰。
此外,GDS 對於涉及串流大型資料集的工作負載特別有利,例如視訊處理、自然語言處理或即時推理。透過減少對 CPU 的依賴,GDS 可以加速資料移動並釋放 CPU 資源用於其他任務,從而進一步增強整體系統效能。
GDSIO – 內部 4 TB M.2
NVIDIA DGX Spark 的收納選擇頗具趣味。考慮到小巧機殼內的尺寸,NVIDIA 選擇了不太常見的 Gen5 2242 M.2 SSD。對於不熟悉這類 SSD 的讀者來說,它是一款較短的 42 毫米版本,而桌上型電腦中更常見的是 80 毫米版本。硬碟選擇較少,4 TB 是該尺寸的最高容量。不過,主要問題在於效能。小型 SSD(例如 2242 和 2230 型號)優先考慮尺寸,其次才是硬碟速度。它們常見於便攜式遊戲機、平板電腦和一些筆記型電腦。
2230 和 2242 SSD PCB 上空間有限,導致控制器、DRAM 和 NAND 封裝的空間不足。我們在測試中觀察到了一些這樣的權衡。在 1 TB 或 128 GB 的記憶體中套用 GDSIO 工作負載時,SSD 會鎖定,需要重新鏡像 Spark。將測試記憶體降低到 64 GB,並降低線程數,可以解決這個問題。這些問題通常不會出現在更常見的高效能 80mm SSD 上。
查看內部驅動器的順序讀取效能,我們發現在 1M 區塊大小和 16 個執行緒的情況下吞吐量最高,達到 11.4 GiB/s。
從順序寫入效能來看,該磁碟機在 32k 區塊大小和 128 個執行緒的情況下實現了最高吞吐量。在更大的塊大小下,性能似乎趨於穩定,平均約為 8.3 GiB/s。
對於希望購買 NVIDIA DGX Spark 進行更繁重開發工作的買家,尤其是可能利用它們來建構小型叢集的企業,我們強烈建議利用板載 200Gb NVIDIA ConnectX-7 NIC。
GDSIO – 以 RDMA 為基礎的 NVMe-oF
為了使用 NVIDIA DGX Spark 進行 NVMe-oF RDMA 測試,我們利用 PEAK:AIO 軟體在 Dell PowerEdge R770 上創建了一個 NVMe-oF 目標,該目標配備了六塊美光 9550 3.84TB SSD,並透過 RDMA 連線。如前所述,Spark 的 CX7 網路卡存在一些問題,由於時間限制,我們只能使用 100G 連接來測試 Spark。 Spark 和 PEAK:AIO 都能達到更高的效能。我們將在後續文章中對 Spark 進行額外的儲存和網路測試。
查看內部驅動器的順序讀取效能,我們發現在 128k 區塊大小和 32 個執行緒的情況下吞吐量最高,達到 12.1 GiB/s。
從順序寫入效能來看,該磁碟機在 128k 區塊大小和 16 個執行緒的情況下實現了最高吞吐量。在更大的塊大小下,性能似乎趨於穩定,平均約為 11.3 GiB/s。
這些結果有許多細微差別,由於前面提到的時間和網路方面的原因,我們只看到了理論最大值的一半。此外,128k 區塊大小下的最高吞吐量受多種因素影響,例如我們使用的企業級硬碟或 PEAK:AIO 如何處理此類 IO,您的實際結果可能會有所不同,我們計劃在未來透過 Spark 進行更多測試。
Day-One 軟體生態系統
NVIDIA 和其他供應商在軟體準備方面投入了大量資金,這與典型的硬體發布截然不同,早期採用者往往面臨文件不完整和工具缺失的問題。 Spark 發布了涵蓋常見工作流程的全面手冊:用於擴散模型的 ComfyUI、用於優化推理的 TRT-LLM、用於本地模型服務的帶有 Open WebUI 的 Ollama、用於微調的 Unsloth 以及基於 LangGraph 的多智能體架構。
軟體的成熟度徹底改變了評估體驗。開發人員無需花費數天時間配置環境,即可透過執行代表性工作負載立即評估 Spark 是否滿足其需求。這些playbook不僅提供指令,還提供容器化環境、範例資料集和預期效能指標。
可用性和 OEM 系統
NVIDIA Founders Edition 4TB 版售價 3,999 美元,將於 10 月 15 日正式發售。除了 NVIDIA 自己的產品外,幾款來自大型 OEM 廠商的 GB10 桌上型電腦也即將上市。所有 OEM 廠商的核心硬體將非常相似,但它們之間可能存在一些差異化的空間,不過大部分價格差異可能來自儲存選擇。我們已經看到許多新品發布,包括搭載 GB10 的戴爾 Pro Max、聯想 ThinkStation PGX、宏碁 Veriton GN100 和華碩 Ascent GX10。
資料來源:Nvidia
結語
NVIDIA DGX Spark 代表先進 AI 運算基礎設施可及性範式的根本轉折點。透過將 GB10 Grace Blackwell 超級晶片的功能(包括 128 GB 統一內存、1 petaFLOP 稀疏 FP4 性能、第四代 RT 核心和 ConnectX-7 網路)整合到一台售價 3,999 美元、功率 240W、容量 1.13 升的設備中,NVIDIA 有效地研究人員在研究人員之間的研究人員與小型壁壘之間,NVIDIA 發展了一個小型壁壘之間,NVIDIA 長期地研究人員在研究人員之間。
經過驗證的設備方法解決了 AI 基礎架構部署中一個持續存在的摩擦點:維護自訂配置的營運開銷。部署 Spark 單元的組織受益於 NVIDIA 對整個堆疊(包括 DGX 作業系統、CUDA 工具包、框架容器和硬體韌體)的全面測試和驗證,從而消除了困擾自訂工作站建置的配置負擔。 DGX Dashboard 的整合更新管理、系統監控和 JupyterLab 配置進一步減輕了營運負擔,而 NVIDIA Sync 的自動 SSH 金鑰分發和隧道管理則使遠端存取真正變得順暢無阻。對於正在擴展的組織而言,這意味著顯著加快入職速度:新研究人員將獲得標準化硬件,透過經過驗證的雙節點叢集配置連接到現有基礎架構,並在數小時內(而不是數天)開始高效工作,以解決驅動程式衝突或網路結構配置問題。
DGX Spark 已在緊湊、安靜的設備中提供真正的 AI 性能,我們的早期結果已表明,它對於那些希望獲得強大功能且無需資料中心開銷的團隊至關重要。故事才剛開始。我們計劃使用 200G 架構、NVMe-oF 目標和多節點叢集擴展測試,以探索擴展效率、更大的模型佔用空間和共享儲存架構。隨著軟體和合作夥伴生態系統的成熟,我們預計 Spark 部署將從強大的單節點設置發展為緊密整合的高吞吐量微型集群,從而進一步增強該平台的效能。
排行榜: NVIDIA DGX Spark 在我們的最佳本地 AI 桌上型電腦排行榜上佔據最佳桌面 AI 系統綜合排名。
排行榜:此類系統的容量規劃指南請參閱我們的《智能體導向的 RAM、GPU 和儲存指南》。





Amazon