StorageReview.com

NVIDIA DGX Spark レビュー: データセンターの機能をデスクトップにもたらす AI アプライアンス

消費財  ◇ 

NVIDIA DGX Sparkは、AIインフラストラクチャへのアクセス性における画期的な瞬間を象徴しています。2017年、Transformerアーキテクチャを紹介した画期的な論文「Attention is All You Need(注意がすべてです)」は、8GPUのP100サーバー構成に依存しており、数十キロワット時の電力を消費し、データセンターの広大なスペースを占有していました。今日、DGX Sparkは、コンパクトな240ワットのデスクトップフォームファクターで優れた演算性能を提供します。電力効率とフォームファクターの圧縮におけるこの劇的な進化により、以前はデータセンターに限定されていたAI機能が、個人の研究者、小規模チーム、そして分散開発組織でも利用できるようになります。

Nvidia DGX Spark フロント。

Spark が従来のデスクトップ AI ソリューションと一線を画すのは、開発ライフサイクル全体にわたる包括的なアプローチです。実験、微調整、導入の間で妥協を強いるのではなく、Spark はあらゆるフェーズで真の能力を提供します。128 GB の統合メモリアーキテクチャにより、従来のワークステーションではクラウドリソースが必要となるモデルのパラメータ微調整を完璧に実行できると同時に、合成データ生成を含むバッチ推論ワークロードに適した毎秒数百トークンのスループットを実現します。200GB のファブリック容量を備えた ConnectX-7 ネットワークを搭載しているため、複数の Spark システムをクラスタ化してより大規模なモデル探索を行うことが可能です。ただし、後ほど説明するように、単体でも驚くほどの性能を発揮します。

主要なポイント(要点)

  • データセンター並みの性能をデスクトップに凝縮:GB10 Grace Blackwellは、1.13リットルの筐体に240Wの電力を供給し、価格は3,999ドル。最大1ペタフロップスのFP4スパース性能を実現します。

  • ワークフローを変えるメモリ:128GBの統合メモリにより、8Bモデルのフルパラメータのローカルでの微調整と高スループットの推論が可能になります。テストでは、Llama 3.1 8B FP4が128の同時実行で約924 tok/sに達し、Qwen3 Coder 30B-A3B FP8がバッチ64で約483 tok/sに達しました。

  • 拡張性と高速ストレージの接続性を確保:統合されたConnectX-7は、クラスタリングまたはNVMe-oF用の200Gファブリックを提供します。内蔵の2242 Gen5 NVMeは便利ですが、高負荷のI/Oには制限があるため、持続的なスループットを実現するには、RDMA経由の外部NVMe-oFの方が適しています。

  • 初日からソフトウェアの成熟度を確保:DGX OS、CUDA、cuDNN、TensorRT、AI Workbench、コンテナ、ワークフロープレイブックが同梱されているため、チームはすぐに実際のワークロードを実行できます。

  • 実証済みの実世界性能:MAMFは、BF16で約99.8TFLOPS、FP8で約207.7TFLOPSを記録しました。GDSIO読み取り速度は内部で約11.4GiB/sに達し、200Gファブリックではさらに高い性能が期待されます。

DGX Spark とは何ですか? 誰が検討すべきですか?

NVIDIA DGX Sparkは、単なるGPUコンポーネントではなく、根本的に包括的なAI開発プラットフォームです。その中核を成すのは、第5世代Tensorコアを搭載したBlackwellアーキテクチャGPUと、NVLink-C2C接続された20コアArm CPU(Cortex-X925×10 + Cortex-A725×10)を統合したGB10 Grace Blackwellスーパーチップです。NVIDIAによると、このコヒーレントな相互接続アーキテクチャは、PCIe Gen 5と比較して最大5倍の帯域幅を実現し、個別の処理ドメインではなく統合された計算ファブリックを構築します。 

ユーザーがすぐに使い始められるように、NVIDIA は Ubuntu Desktop 上に構築された DGX OS を、CUDA、cuDNN、TensorRT、NVIDIA Container Runtime、AI Workbench を含む完全な AI ソフトウェア スタックが事前構成された状態で出荷します。これにより、カスタム ワークステーションの構築に付きまとうドライバーの課題や環境設定のオーバーヘッドが排除されます。このシステムは柔軟な導入パラダイムを提供します。周辺機器を接続して、Ubuntu デスクトップのフル エクスペリエンスを備えたコンパクトなワークステーションとして使用することも、NVIDIA Sync 経由でアクセス可能なヘッドレス ネットワーク アプライアンスとして導入することもできます。NVIDIA Sync は、JupyterLab、VS Code、Cursor IDE、SSH ターミナルとのシームレスな統合を実現します。 

これは、AI実践者、言語モデルの微調整を行う研究者、RAPIDSワークフローを高速化するデータサイエンティスト、エージェントシステムを実装する開発者、あるいは小規模でアブレーションモデルを用いたアーキテクチャを実験するチーム向けに特別に構築されたインフラストラクチャです。Sparkは、データセンターの複雑さを伴わずに本格的なAI計算能力を必要とする専門家を対象としています。

NVIDIA DGX Spark 技術仕様

製品仕様 Details
アーキテクチャ
GPU NVIDIA Blackwellアーキテクチャ
CPU 20コアArm(10xCortex-X925 + 10xCortex-A725)
テンソルコア 5th世代
RTコア 4th世代
NVENC / NVDEC 1倍/1倍
メモリ
システムメモリ 128 GB LPDDR5X (統合システムメモリ)
メモリインターフェイス 256ビット
メモリ帯域幅 273 GB / sの
パフォーマンス
FP4 最大1ペタフロップス(スパース性あり)
Storage
Storage 1 TB または 4 TB NVMe M.2 (自己暗号化)
接続性
USB 4× Type-C USB 3.2 Gen 2×2 (20Gbps)
イーサネット 1× 10GbE RJ-45
NIC ConnectX-7 スマート NIC – 2x 200G QSFP (最大 200G の帯域幅が可能)
無線 Wi-Fi 7、ブルートゥース5.3
音声出力 HDMIマルチチャンネルオーディオ出力
ディスプレイコネクタ HDMI 2.1a×1
メカニカル
寸法 150 × 150 × 50.5 mm(5.9 × 5.9 × 1.98インチ)
重量 1.2キロ
消費電力 240 W

NVIDIA DGX Spark の設計と構築

NVIDIA DGX Sparkは、NVIDIAの独特なインダストリアルデザインを継承し、大型DGXシステムの外観と感触を反映したコンパクトな筐体を採用しています。フロントパネルには、オリジナルのフルサイズDGXユニットのハンドルを彷彿とさせる小さな持ち手用の切り欠きが設けられ、金色の斑点が入ったメタリック仕上げが洗練された高級感を醸し出し、NVIDIAの象徴的なグリーンのロゴバッジがアクセントになっています。

DGX Sparkの寸法は150×150×50.5mm(5.9×5.9×1.98インチ)、重量は1.2kg(2.6ポンド)で、総内容積は1.13リットルです。これは、1リットルのスモールフォームファクターPCクラスにしっかりと収まるサイズです。最小限の設置面積にもかかわらず、パッシブヒートスプレッダーとしても機能するオールメタル合金シェルにより、システムは高密度で堅牢な印象を与え、デザインと機能の両方に重点が置かれています。

電源は、画像で本体の横に見える240W USB-C外付け電源アダプターから供給されます。このアダプターはコンパクトで堅牢な設計で、AC入力には標準のC5(クローバーリーフ)コネクタを採用しており、DGX Sparkのシンプルで効率的なデザインにマッチしています。

電源ブリック付きの Nvidia DGX Spark フロント。

背面に目を向けると、DGX Sparkは前面と同じ金色の斑点模様のテクスチャ仕上げを継承し、筐体全体に統一感のあるデザインを実現しています。左から順に、電源ボタンの横には4つのUSB-Cポートがあり、そのうち1つは本体への電源供給(Power Delivery)に使用されます。さらに、HDMI 2.1a出力ポートが1つ、10GbE RJ-45ポートが1つ搭載されています。そして、このユニットの特徴は、NVIDIA ConnectX-7 SmartNICを内蔵したデュアル200GbE QSFP56インターフェースです。

Nvidia DGX Spark の背面。

一見すると、Sparkは400Gの接続性を実現しているように見えるかもしれません。しかし、PCIeの制限により、Sparkは200Gの接続性しか提供できません。さらに詳しく知るために、Sparkのトポロジーを詳しく調べてみました。

lstopo を使用して、CX7 NIC からの 2 つの相互接続を観察しました。電気的には、CX7 は 2 つの Gen5 x4 リンクを介して接続されています。OS 内では、これらの接続は 4 つのインターフェースとして表示され、それぞれが最大 200G の帯域幅をサポートします。テスト時間が限られていたため、NVMe-oF テスト以外では、このプラットフォームのネットワークに関するすべての癖を発見することはできませんでした。NVMe-oF テストについては、この記事の後半で詳しく説明します。しかし、このプラットフォームをさらに詳しく調査し、複数の Spark をクラスタリングしてミニクラスターを構築するなど、その機能についてより深く掘り下げた記事を今後公開する予定です。 

他の接続デバイスを見てみると、次は Gen5 x4 に接続された小型の 2242 フォーム ファクタ M.2 SSD、続いて PCIe Gen4 x1 リンクに接続された Realtek RJ45 10GbE コントローラ、PCIe Gen3 x1 リンクに接続された MediaTek Wi-Fi コントローラです。

CPU内部を詳しく見てみると、Sparkには20コアのArmプロセッサが搭載されており、Intelの最新プロセッサに似たヘテロジニアスなBig Littleアーキテクチャを採用しています。このアーキテクチャは、10個のCortex-A725効率コアと10個のCortex-X925パフォーマンスコアで構成され、2つのL3キャッシュクラスターに分割されています。最初のクラスター(8MB L3)にはCPU 0~4(Cortex-A725、最大2808MHz)とCPU 5~9(Cortex-X925、最大3900MHz)が含まれ、2つ目のクラスター(16MB L3)にはCPU 10~14(Cortex-A725、最大2860MHz)とCPU 15~19(Cortex-X925、最大3978~4004MHz)が含まれます。各コアは64KBのL1データキャッシュと64KBのL1命令キャッシュをそれぞれ搭載していますが、L2キャッシュはコアの種類によって大きく異なります。効率重視のCortex-A725コアは512KBのL2キャッシュを搭載していますが、パフォーマンス重視のCortex-X925コアは2MBと、4倍の容量を備えています。最高速のコアはCPU 15~19で、16MBの大容量L3キャッシュと高い動作周波数の両方のメリットを享受しています。CPU 19は4004MHzでピークパフォーマンスを発揮します。これらの電力/周波数レベルの違いは、上記のトポロジ上のコア上の破線で示されています。

DGX Sparkを裏返し、ズームアウトしてみましょう。目に見えるプラスチック部品はベースカバーのみで、これはシャーシの底部に磁石で固定されています。この設計により、外観をすっきりと保ちながら、内部に素早くアクセスできます。マグネットベースを外すと4本のネジが現れ、メインの内部コンパートメントにアクセスできるようになります。

内部には、本体上部に向けてアンテナ配線が配線されており、Wi-Fi 7とBluetooth 5.3接続に対応していることが確認できます。これにより柔軟なネットワークオプションが提供され、特に有線アクセスが利用できないモバイル環境やラボ環境での導入に役立ちます。

また、ユニットのストレージソリューションであるPCIe Gen5 2242 M.2 SSDも確認できます。これは、このような高性能ハードウェアではあまり一般的ではないフォームファクターです。ここで紹介する構成には、4TBのSamsung NVMeドライブが含まれています。

Nvidia DGX Spark の SSD 内部ビュー。

DGX Spark をさらに深く掘り下げていくと、システムの心臓部である NVIDIA Grace Blackwell の GB10 スーパーチップが明らかになります。GB10 スーパーチップの両側には、273 GB/秒の帯域幅を実現する 8 個の LPDDR5X 統合システムメモリがはんだ付けされており、CPU と GPU の両方の動作において高速なデータアクセスを実現します。

チップのすぐ隣にはCX7 NICがあり、前述の通り200Gbpsの接続性を提供します。これにより、Sparkを高速ストレージに接続したり、複数のSparkインスタンスをクラスタ化したりすることが可能になります。NVIDIAは、2つのSparkを直接接続することで、より大規模なAIモデルをサポートできるクラスタを検証し、販売しています。

最後に、ボードを裏返すと、PCIe Gen5 x4 2242 M.2 SSD と PCIe Gen3x1 MediaTek Wi-Fi アダプターを含むすべての PCIe 接続が現れます。

Sparkが不可欠になる場所:最新のAI開発アプ​​ライアンス

DGX Spark は、統合メモリ、コンパクトなフォーム ファクター、包括的なソフトウェア統合の独自の組み合わせからメリットを得ており、さまざまな専門的なコンテキストで特に魅力的です。

データサイエンスの加速: Pandasから本番環境へ

データサイエンティストにとって、NVIDIA DGX Sparkはワークフローの速度とエクスペリエンスを大幅に向上させます。200Gbpsの帯域幅を提供するConnectX-7ネットワークとCUDA Xアクセラレーションライブラリの組み合わせは、データ前処理を変革します。AIとデータサイエンスは、良質なデータ入力と良質なデータ出力という基盤の上に構築されます。従来、従来のMLプロジェクトで最も時間のかかるフェーズは、データのクリーニングと特徴抽出でした。従来のワークフローでは、データセットをpandasなどのツールに読み込み、CPUコアで変換処理を実行する必要があり、これは一般的に時間がかかります。また、手作業による探索と特徴量エンジニアリングも大きな障害となる可能性があります。Sparkは、RAPIDSを通じてエンドツーエンドのGPUアクセラレーションを実現します。

典型的なエンタープライズデータサイエンスのシナリオでは、40~80GB規模のデータセットに対する特徴量エンジニアリングが求められます。これには、複数のテーブルの結合、時間枠をまたいだ集計の計算、カテゴリエンコーディングの処理、分布の正規化などが含まれます。CPUインフラストラクチャでは、この前処理に数時間かかる場合があります。RAPIDS cuDFはデータセット全体をSparkの128GB統合メモリにロードするため、これらの操作は10倍以上の高速化で数分で完了します。その後のモデルトレーニングは、cuMLを使用した従来の機械学習でも、PyTorchを使用したディープラーニングでも、同等のメリットが得られます。これにより、データサイエンティストが仮説の反復処理ではなくインフラストラクチャの待機を強いられるという従来のボトルネックが解消されます。

合成データ生成:ロボット工学とシミュレーション

第4世代RTコアの搭載により、Sparkは、世界モデルトレーニング用の合成データ生成という新たなワークフローに独自の位置づけを与えています。従来、堅牢な操作ポリシーのトレーニングには、数万回の実世界デモンストレーションが必要でしたが、これは非常に高価で時間のかかる作業でした。Isaac SimやOmniverseのようなプラットフォームでのフォトリアリスティックシミュレーションは代替手段となりますが、物理的に正確な照明、反射、マテリアルを使用してレイトレーシング画像をレンダリングするには、従来、NVIDIAのL40SやRTX 6000 Adaのような高価なワークステーションGPUが必要でした。

出典:NVIDIA

Sparkはこのワークフローを統合します。RTコアはOpenUSDワークロードによる合成データ生成を可能にし、Tensorコアはブループリント/ワークフローにおけるAI推論に使用されます。以前は、レンダリング用に複数のマシンと推論用に最適化された別のサーバーを導入する必要がありました。しかし今では、これらを240Wのアプライアンス1台で実現できます。ロボット工学のスタートアップ企業、大学の研究室、あるいは自律操縦を研究する自動車メーカーにとって、この統合は開発期間と設備投資を大幅に削減します。

 

NVIDIA L40Sに関する以前の記事では、専用のL40SレンダリングシステムとH100推論システムを組み合わせた、同様の合成データ生成パイプラインについて検討しました。GB10はこれらの機能を統合した開発用アプライアンスであり、このワークフローの大きな進化と言えます。今後の分析では、代表的なロボット操作シナリオにおけるレンダリングやその他のワークロードを検証し、これらの個別の構成に対するSpark RT Coreのパフォーマンスをさらにテストする予定です。

バイブコーディング革命

元テスラのAIディレクターであり、OpenAIの創設メンバーでもあるアンドレイ・カルパシー氏は、AIの支援による迅速なソフトウェア開発への新たなアプローチを表現するために「バイブコーディング」という用語を考案しました。バイブコーディングでは、コードを一行ずつ丁寧に記述するのではなく、LLMを対話型ペアプログラマーとして活用します。自然言語で機能を記述し、実装の土台を生成し、会話による改良を反復的に行い、機能を迅速にプロトタイプ化します。このワークフローは、コーディングを意図的な構築から、コンテキスト、API、アーキテクチャパターンを理解するAIとの誘導的な会話へと変革し、個々の開発者がかつてない速度で非常に高度なシステムを構築できるようにします。

AI支援型コーディングの普及規模は、 OpenRouterの利用ランキングからも明らかであり、コーディングに特化したモデルが推論ボリュームを常に占めている。Viveコーディングの主なユーザー層である技術専門家は、通常、パワーユーザーとして、さまざまなコンテキストで複数のコーディングエージェントを並行して実行している。また、オープンウェイトモデルが主要なベンチマークでプロプライエタリな代替モデルに匹敵するようになるにつれ、開発者はレート制限を解消し、重要な開発期間中の可用性を確保し、プロプライエタリプロジェクトのコード機密性を維持するために、ローカル推論の展開を検討している。

r/LocalLLaMAコミュニティでは、マルチGPUワークステーションから、ダクトテープで繋ぎ合わせたローカルモデル実行サーバー、コンシューマー向けハードウェアを横断した分散推論、そして持続的な高スループット生成を可能にする精巧な冷却ソリューションまで、実に素晴らしいカスタムビルドが披露されています。しかし、これらの構成には大きな障壁が存在します。数万ドルを超える設備投資、膨大な電力消費、標準的なオフィス環境ではなく専用のスペースを必要とする熱管理の課題、そして構成、最適化、トラブルシューティングのための高度な専門知識などです。

Sparkは、この価値提案を根本的に変革します。128GBの統合メモリを搭載し、わずか240Wの静音・コンパクト・省電力アプライアンスで、3,999ドルという価格でありながら、優れたモデル推論性能を実現します。ローカルコーディングアシスタントインフラの構築を目指すユーザーは、もはやキロワット時間を消費し、大量の熱を発生するような複雑なホームラボは必要ありません。事前構成済みのDGX OSを搭載した検証済みアプライアンスのアプローチにより、これまでローカルLLMの導入をLinuxとCUDAの深い専門知識を持つユーザーに限定していた構成の複雑さが解消されます。

Sparkは、インフラストラクチャの摩擦を解消するだけでなく、コードのプライバシーとモデルのカスタマイズに関する重要な懸念にも対処します。クラウドベースのコーディングアシスタントは、ソースコードをリモートサーバーに送信する必要があるため、独自のアルゴリズム、セキュリティが重要なインフラストラクチャ、または規制対象データを扱う組織にとっては、これは現実的ではありません。Sparkのローカル推論により、コードが開発環境から外部に漏れることがなくなります。さらに、128GBのメモリ容量により、コーディングモデルのパラメータを完全に微調整できるため、経験豊富な開発者は社内コードベースに合わせてモデルを特化できます。この機能は、公開されているトレーニングデータでは十分に表現されていないドメイン固有言語、カスタムフレームワーク、またはアーキテクチャパターンを持つ組織にとって特に価値があります。

DGX Spark での NVIDIA NeMo による微調整

DGX Spark の 128 GB 統合メモリにより、従来は高価なマルチ GPU クラウド セットアップを必要とした 8B モデルの完全なパラメータの微調整が可能になります。標準の Adam 最適化で Qwen3 8B を完全に微調整するには約 132 GB (16 GB のモデル重み、96 GB のオプティマイザー状態、16 GB の勾配、およびアクティベーション) が必要となり、デュアル H100 80 GB 構成を超えます。メモリ効率の高い 8 ビット Adam を使用すると、バッチ サイズに応じて要件が約 70 GB に削減され、Spark のメモリ プールに無理なく収まります。これが重要なのは、完全な微調整により、複雑な推論タスクで LoRA よりも 4~6% 高い精度が得られるためです。クラウドベースの 2× H100 80 GB セットアップでは、分散トレーニングの複雑さにより 1 時間あたり約 5 ドルのコストがかかりますが、Spark は 3,999 ドルの 1 回限りの投資で単一システムのトレーニングを提供します。

NVIDIA NeMo Automodelは、チェックポイント変換なしであらゆるHugging FaceモデルをDay-0でサポートすることで、エンタープライズトレーニングフレームワークの摩擦を解消します。HuggingFace HubからQwen3 8Bを直接読み込み、データセットソース、オプティマイザー設定、LoRAターゲットを指定するYAMLファイルで微調整を設定で​​きます。NeMoは、セーフテンソルとの互換性を備えた分散チェックポイント処理を自動化し、2~5倍の高速化を実現するCUDAカーネルの融合実装と勾配累積処理を実現します。

快適なUIによる画像生成

ComfyUIは、安定拡散モデルおよび関連拡散モデルを高度にカスタマイズ可能なクリエイティブパイプラインに変換するノードベースのグラフィカルインターフェースを提供します。従来のWebベースインターフェースでは、複雑さを簡略化したパラメータスライダーの背後に抽象化していましたが、ComfyUIは視覚的なグラフアーキテクチャを採用しています。ユーザーは、モデルの読み込み、プロンプトエンコーディング、潜在拡散サンプリング、VAEデコード、アップスケーリング変換などの特定の操作を表す個別の機能ノードを接続することで、ワークフローを構築できます。このモジュール設計により、生成パイプライン全体をきめ細かく制御でき、すべての計算ステップを透明かつ調整可能にします。また、複数のモデルを連結したり、カスタムサンプリングスケジュールを実装したり、ControlNetガイダンスなどの高度な技術を統合したりすることも可能です。これらは、簡略化されたインターフェースでは不可能です。

DGX Spark 上で、ComfyUI は Blackwell GPU の Tensor コアを活用して高速拡散サンプリングを行い、通常、サンプリングの複雑さに応じて 15 ~ 30 秒で生成を完了します。128 GB の統合メモリ アーキテクチャは特に有利で、複数のチェックポイント モデル、LoRA アダプター、VAE デコーダーをメモリ内に同時に保持することで、VRAM に制約のあるシステムを悩ませるリロード オーバーヘッドを排除します。ユーザーは、API レート制限、生成ごとのクラウド コスト、独自のクリエイティブ ワークフローに関連するプライバシーの懸念から解放され、実質的に無制限の AI アート作品をローカルで生成できます。ワークフローの永続性モデルは運用上の価値を追加します。完全なパイプラインは JSON ファイルにシリアル化され、バージョン管理、チーム間での共有、または生成された画像にメタデータとして直接埋め込むことができるため、合成データセット パイプラインを構築したり、生成されたアセット全体で一貫した芸術的スタイルを維持したりする組織にとって重要な再現性を実現します。

NVIDIA DGX Spark パフォーマンステスト

vLLMオンラインサービング – LLM推論テスト

vLLMは、LLM向けの最も普及している高スループット推論およびサービス提供エンジンです。vLLMオンラインサービス提供ベンチマークは、同時リクエスト処理時のこの推論エンジンの実世界におけるサービス提供能力を測定するために設計されたパフォーマンス評価ツールです。リクエストレート、入出力長、同時クライアント数などの設定可能なパラメータを使用して、実行中のvLLMサーバーにリクエストを送信することで、実稼働ワークロードをシミュレートします。このベンチマークは、スループット(1秒あたりのトークン数)、最初のトークンまでの時間、出力トークンあたりの時間などの主要な指標を測定することで、ユーザーがさまざまな負荷条件下でのvLLMのパフォーマンスを理解するのに役立ちます。

私たちは、現在本番環境で展開されている最も一般的なアーキテクチャとモデル タイプを表す包括的なモデル スイート全体で推論パフォーマンスをテストしました。

専門家混合モデル

ローカル推論デプロイメントで最も人気のあるコーディングモデルの一つであるQwen3 Coder 30B-A3Bを評価しました。このスパースアーキテクチャは、BF16精度で30Bパラメータのフルモデルサイズを維持しながら、生成されたトークンごとに3Bパラメータのみをアクティブ化します。Qwenの標準モデルとFP8量子化バリアントの両方をベンチマークしました。FP8量子化モデルは大幅なパフォーマンス向上を示し、同時実行数1で46.5 tok/s、バッチサイズ64では驚異的な482.6 tok/sを達成しました。標準BF16モデルは、同時実行数1で27.8 tok/s、バッチサイズ64で166.2 tok/sと、約3倍のパフォーマンス差があります。

高密度モデル

密モデルは、推論中にすべてのパラメータと活性化関数が作用する従来のLLMアーキテクチャを表しており、スパースモデルと比較して計算負荷が高くなります。モデル規模と量子化戦略にわたるパフォーマンス特性を包括的に評価するため、5つの密モデル構成をベンチマークしました。

テストスイートには、Mistral AIのMistral Small 3.1 24B(BF16精度)と、RedHat AIのMistral Small 3.1 24B FP8動的量子化バージョンが含まれていました。動的量子化は、選択的な重み量子化技術を用いて性能と精度のトレードオフを最適化し、モデルの劣化を最小限に抑えながら戦略的に精度を低下させます。これらの大規模高密度モデルは、標準のBF16構成に加え、NVIDIAのFP8およびFP4量子化バージョンという3つの精度フォーマットでMeta Llama 3.1 8B評価によって補完されました。このモデル選択戦略により、モデルスケール間で直接的な性能比較が可能になり、同時に漸進的量子化が推論スループットに与える影響を分離することが可能になります。

パフォーマンス分析: 大規模高密度モデル

Mistral Small 3.1 24B(BF16精度)は、同時実行数1で5.3 tok/sのベースラインスループットを示し、同時リクエスト数128では158.9 tok/sという大幅な性能向上を実現します。FP8動的量子化バリアントは、同時実行数が低い場合では8.8 tok/sとわずかなパフォーマンス向上を示しますが、スケールアウト時には2倍の強力なパフォーマンスを発揮し、同時実行数128で319.7 tok/sを達成します。これは、高スループットのサービングシナリオにおける動的量子化の有効性を裏付けています。

パフォーマンス分析: コンパクト密度モデル

Llama 3.1 8Bアーキテクチャは、量子化戦略によって著しく異なるパフォーマンス特性を示しています。BF16精度では、同時実行レベル1で13.6 tok/sの性能を発揮し、同時実行リクエスト数が128になると408.6 tok/sに拡張されます。FP8量子化に移行すると、同時実行レベル1で23.2 tok/s、128で752.8 tok/sの性能を発揮し、大規模環境ではスループットが84%向上します。FP4構成ではパフォーマンスがさらに向上し、同じ同時実行レベルで34.1 tok/sと924.1 tok/sを達成しました。これは、積極的な量子化戦略によって、多くの本番環境ワークロードにおいて許容可能なモデル品質を維持しながら、ベースライン精度の2.3倍のパフォーマンス向上を実現できることを示しています。

マイクロスケーリングデータ型

マイクロスケーリングは、大規模なパラメータグループ全体にわたる均一な量子化ではなく、小さな重みブロックにきめ細かなスケーリング係数を適用する高度な量子化手法です。NVIDIAのNVFP4フォーマットは、8~32個の値からなるマイクロスケールブロックごとに共通の指数をスケーリング係数として共有するブロック化浮動小数点表現を通じてこの手法を実装しています。このきめ細かなアプローチは、数値精度を維持しながら4ビット表現を実現し、Transformerアーキテクチャに不可欠なダイナミックレンジを維持します。このフォーマットはNVIDIAのTensor Coreアーキテクチャと統合されており、行列演算中にオンザフライで展開することで、効率的な混合精度計算を可能にします。

OpenAIのGPT OSSモデルを、NVFP4量子化を用いて20Bおよび120Bパラメータスケールで評価しました。20Bパラメータモデルは、同時実行数1で39.7 tok/sを達成し、同時リクエスト数128で611.7 tok/sまでスケーリングしました。120Bパラメータモデルは、同時実行数1で31.4 tok/s、同時リクエスト数64で162.7 tok/sを達成しました。

注:出力スループットは、リクエストごとのスループットではなく、リクエスト全体のスループットです。

時間が限られていたため、TensorRT テストを完了できませんでしたが、Spark のフォローアップ記事に注目して、より多くの推論フレームワークのパフォーマンスを調査する予定です。

高度な推論を事前入力してデコードする

LLM 推論は、基本的に 2 つの異なる計算フェーズに分解できます。各フェーズは、著しく異なるパフォーマンス特性とリソース使用パターンを示します。プレフィル フェーズでは、入力プロンプト全体を 1 回の並列操作で処理し、すべての入力トークンにわたってアテンション メカニズムを同時に計算します。これは、テンソル コアと計算ユニットを完全に飽和させる計算集約型の操作です。一方、デコード フェーズでは、出力トークンを自己回帰的に生成します。つまり、計算集約性は低いものの、モデルが重みと増大するキー値キャッシュに繰り返しアクセスする必要があるため、メモリ帯域幅に大きな要求がある順次操作によって、一度に 1 つのトークンを生成します。これにより、根本的に異なるボトルネック プロファイルが作成されます。プレフィル操作は通常、計算にバインドされていますが、デコード操作はメモリ帯域幅を集中的に使用するため、メモリ サブシステムの制約の影響を特に受けやすくなります。

2 つの異なるワークロード プロファイルにわたって包括的なテストを実施しました。1 つは入力トークン 512 個、出力トークン 8,192 個を使用したデコード中心の推論、もう 1 つは入力トークン 8,192 個、出力トークン 512 個を使用したプレフィル中心の推論です。パフォーマンス特性評価により、予想されるアーキテクチャのトレードオフが明らかになりました。Spark は、コンピューティング リソースが主なボトルネックとなっているプレフィル中心のワークロードでは競争力のあるスループットを示しますが、デコード中心のシナリオではパフォーマンスが低下します。このパフォーマンスの差は、メモリ帯域幅の制約と正確に一致しています。デコード操作のシーケンシャルな性質と集中的なメモリ アクセス パターンは、Spark のアーキテクチャに固有の帯域幅の制限を直接的に示しています。これらの結果は、次のセクションで MAMF 測定を解釈するための重要なコンテキストを提供します。両方のベンチマーク スイートが、現実世界の推論展開における基本的なパフォーマンス制限要因としてメモリ帯域幅を一貫して特定しているためです。

最大達成可能 Matmul FLOPS (MAMF)

MAMF(Maximum Achievable Matmul FLOPS)は、機械学習アクセラレータ上で行列乗算演算中に達成可能な、現実的なピーク浮動小数点演算回数(1秒あたり)を測定するために設計された実用的な性能指標です。ハードウェア仕様でよく謳われている理論上のピークFLOPSよりも、より正確なベンチマークを提供します。本稿では、Stas Beckman氏が作成したmamf-f​​inderベンチマークを使用します。

BF16精度では99.8 TFLOPsのMAMFが観測され、FP8(E4M3)では207.7 TFLOPsのMAMFが観測されています。時間的制約により、FP4のMAMF特性を包括的に評価することはできませんでしたが、観測された精度ベースのスケーリングパターンから推定すると、FP8と比較してさらに2倍の性能向上が見込まれ、高密度FP4演算で約400 TFLOPsが得られます。2:1構造化スパース最適化を考慮すると、これは理論上のFP4性能の約80%に相当し、スパース計算ワークロードで約800 TFLOPsを達成します。ただし、これらのMAMF測定値は、本レビューでは取り上げない多くの理由により、理論上公表されている仕様を下回る可能性があることに留意することが重要です。

GPUダイレクトストレージ

Sparkで実施したテストの一つに、MagnumIO GPU Direct Storage(GDS)テストがあります。GDSはNVIDIAが開発した機能で、NVMeドライブやその他の高速ストレージデバイスに保存されたデータへのアクセス時に、GPUがCPUをバイパスできるようにします。GDSは、CPUとシステムメモリを経由する代わりに、GPUとストレージデバイス間の直接通信を可能にするため、レイテンシが大幅に削減され、データスループットが向上します。

GPUダイレクトストレージの仕組み

従来、GPU が NVMe ドライブに保存されたデータを処理する場合、データは GPU に到達する前にまず CPU とシステム メモリを通過する必要があります。このプロセスでは、CPU が仲介役となり、遅延が増加し、貴重なシステム リソースが消費されるため、ボトルネックが発生します。GPU ダイレクト ストレージは、GPU が PCIe バスを介してストレージ デバイスから直接データにアクセスできるようにすることで、この非効率性を解消します。この直接パスにより、データ移動に関連するオーバーヘッドが削減され、より高速で効率的なデータ転送が可能になります。

AI ワークロード、特にディープラーニングを伴うワークロードは、非常にデータ集約的です。大規模なニューラル ネットワークのトレーニングにはテラバイト単位のデータ処理が必要であり、データ転送の遅延は GPU を十分に活用できず、トレーニング時間が長くなる可能性があります。GPU ダイレクト ストレージは、データが可能な限り迅速に GPU に配信され、アイドル時間を最小限に抑え、計算効率を最大化することで、この課題に対処します。

さらに、GDS は、ビデオ処理、自然言語処理、リアルタイム推論など、大規模なデータセットのストリーミングを伴うワークロードに特に役立ちます。CPU への依存度を下げることで、GDS はデータの移動を高速化し、CPU リソースを他のタスクに解放して、システム全体のパフォーマンスをさらに向上させます。

GDSIO – 内部 4 TB M.2

NVIDIA DGX Sparkは、ストレージに興味深い選択肢を採用しています。小型ケース内のサイズを考慮し、NVIDIAはあまり一般的ではないGen5 2242 M.2 SSDを採用しました。このタイプのSSDに馴染みのない読者のために説明すると、これはデスクトップPCで一般的な80mmではなく、短い42mmバージョンです。ドライブの選択肢は少なく、このサイズでは最大容量は4TBです。しかし、最大の問題はパフォーマンスです。2242や2230モデルなどの小型SSDは、サイズを最優先し、ドライブ速度は二の次です。ポータブルゲーム機、タブレット、一部のノートパソコンでよく使用されています。

2230および2242 SSDのPCBには十分なスペースがないため、コントローラー、DRAM、NANDパッケージ用のスペースが少なくなっています。テスト中に、これらのトレードオフのいくつかを確認しました。1TBまたは128GBのフットプリントでGDSIOワークロードを適用すると、SSDがロックアップし、Sparkの再イメージングが必要になりました。テストフットプリントを64GBに下げ、高スレッド数を減らすことで、この問題を回避できました。これらの問題は、より一般的な高性能80mm SSDでは通常発生しません。

内部ドライブのシーケンシャル読み取りパフォーマンスを調べてみると、16 スレッドで 1M ブロック サイズで最高のスループットが得られ、11.4 GiB/s を達成しています。

シーケンシャル書き込みのパフォーマンスを見ると、このドライブは32Kブロックサイズ、128スレッドで最高のスループットを達成しています。ブロックサイズが大きくなると、パフォーマンスは平均8.3GiB/秒程度で横ばいになるようです。

より負荷の高い開発作業のために NVIDIA DGX Spark の購入を検討している購入者、特に小規模なクラスターを作成する可能性のある企業には、オンボードの 200Gb NVIDIA ConnectX-7 NIC を活用する方法を強くお勧めします。

GDSIO – RDMA経由のNVMe-oF

NVIDIA DGX Sparkを用いたNVMe-oF RDMAテストでは、PEAK:AIOのソフトウェアを使用して、Micron 9550 3.84TB SSD 6台を搭載したDell PowerEdge R770上にNVMe-oFターゲットを作成し、RDMA接続で接続しました。前述の通り、SparkのCX7 NICには特有の問題があり、時間的な制約から、Sparkは100G接続でのみテストすることができました。SparkとPEAK:AIOはどちらも、はるかに高い数値を達成できます。今後の記事で、Sparkを用いたストレージとネットワークに関する追加テストを実施する予定です。

内部ドライブのシーケンシャル読み取りパフォーマンスを調べてみると、128k ブロック サイズで 32 スレッドで最高のスループットが得られ、12.1 GiB/s を達成しています。

シーケンシャル書き込みのパフォーマンスを見ると、このドライブは128Kブロックサイズ、16スレッドで最高のスループットを達成しています。ブロックサイズが大きくなると、パフォーマンスは平均11.3GiB/秒程度で横ばいになるようです。

これらの結果には多くの微妙な差異があり、前述の時間関連およびネットワーク関連の理由により、理論上の最大値の半分しか得られていません。また、128kブロックサイズでの最大スループットは、使用したエンタープライズドライブやPEAK:AIOによるこのIOの処理方法など、複数の要因の影響を受けます。そのため、結果は異なる可能性があり、今後Sparkを使用したテストを通じてさらに詳細な情報を提供する予定です。

初日のソフトウェアエコシステム

NVIDIAをはじめとするベンダーは、ソフトウェアの準備に多大な投資を行ってきました。これは、アーリーアダプターが不完全なドキュメントやツールの不足に悩まされる典型的なハードウェアリリースとは大きく異なります。Sparkは、一般的なワークフローを網羅した包括的なプレイブックをリリースします。拡散モデル用のComfyUI、最適化された推論のためのTRT-LLM、ローカルモデルサービング用のOpen WebUIを備えたOllama、微調整用のUnsloth、そしてLangGraphを使用したマルチエージェントアーキテクチャなどです。

このソフトウェアの成熟度によって、評価プロセスが大きく変わります。開発者は、環境設定に何日も費やすことなく、代表的なワークロードを実行することで、Sparkが要件を満たしているかどうかを即座に評価できます。プレイブックには、手順だけでなく、コンテナ化された環境、サンプルデータセット、期待されるパフォーマンス指標も含まれています。

可用性とOEMシステム

NVIDIAのFounders Editionは4TB構成で3,999ドルで注文受付中で、一般販売は10月15日より開始されます。NVIDIAの製品に加え、大手OEM各社からも複数のGB10デスクトップが発売されます。コアハードウェアは各社ほぼ共通ですが、多少の差別化の余地は残されている可能性があります。ただし、価格差はストレージの選択によるところが大きいでしょう。既に多くの発表があり、Dell Pro MaxのGB10、Lenovo ThinkStation PGX、Acer Veriton GN100、ASUS Ascent GX10などが挙げられます。

出典: Nvidia

結論

NVIDIA DGX Sparkは、高度なAIコンピューティング・インフラストラクチャのアクセシビリティ・パラダイムにおける根本的な転換点を象徴しています。GB10 Grace Blackwellスーパーチップの機能、すなわち128GBの統合メモリ、1ペタフロップスのスパースFP4性能、第3,999世代RTコア、そしてConnectX-7ネットワークを、240W、1.13リットルのアプライアンスに統合することで、NVIDIAはこれまでデータセンタークラスのAI機能を個人の研究者や小規模開発チームから隔ててきた障壁を効果的に打ち破りました。

検証済みのアプライアンス アプローチは、AI インフラストラクチャの導入における根深い問題点、つまりカスタム構成を維持するための運用上のオーバーヘッドに対処します。Spark ユニッ​​トを導入する組織は、DGX OS、CUDA ツールキット、フレームワーク コンテナー、ハードウェア ファームウェアを含むスタック全体に対する NVIDIA の包括的なテストと検証の恩恵を受けることができ、カスタム ワークステーションの構築を悩ませる構成の負担が軽減されます。DGX Dashboard の統合された更新管理、システム監視、JupyterLab プロビジョニングによって運用上の負担がさらに軽減されるとともに、NVIDIA Sync の自動 SSH キー配布とトンネル管理によってリモート アクセスが真にスムーズになります。組織を拡大していく上で、これは測定可能なほど迅速なオンボーディングにつながります。新しい研究者は標準化されたハードウェアを受け取り、検証済みの 2 ノード クラスタリング構成を介して既存のインフラストラクチャに接続し、ドライバーの競合やネットワーク ファブリック構成のトラブルシューティングに数日かかるのではなく、数時間以内に生産的な作業を開始できます。

DGX Sparkは、コンパクトで静音性に優れたアプライアンスでありながら、既に真のAIパワーを提供しています。初期段階では、データセンターのオーバーヘッドなしで本格的なAI機能を求めるチームにとって、DGX Sparkがなぜ重要なのかが示されています。物語はまだ始まったばかりです。200Gファブリック、NVMe-oFターゲット、マルチノードクラスタリングといったテストを拡張し、スケーリング効率、より大規模なモデルフットプリント、共有ストレージアーキテクチャを検証する予定です。ソフトウェアとパートナーのエコシステムが成熟するにつれて、Sparkの導入は、強力なシングルノード構成から、緊密に統合された高スループットのミニクラスタへと進化し、このプラットフォームをさらに強化していくと期待しています。

商品ページへ

Sparkデモ

ランキング: NVIDIA DGX Sparkは、ローカルAI向けベストデスクトップランキングにおいて、総合的に見て最高のデスクトップAIシステムとして君臨しています。

リーダーボード:このクラスのシステムのサイジングに関するガイダンスは、弊社の「エージェントAI向けRAM、GPU、ストレージガイド」に記載されています。

StorageReview と連携する

ニュースレター| YouTube | ポッドキャスト(iTunes / Spotify) | Instagram | Twitter | TikTok | RSSフィード

ディビヤンシュ・ジェイン

機械学習エンジニア、ホームラボ愛好家、そしてテクノロジー愛好家。StorageReviewでは、AIと新興ワークロードのテストを主導し、洞察とパフォーマンス分析を提供しています。