StorageReview.com

AMD Ryzen AI Halo レビュー:デュアルOS、200BパラメータのデスクトップがDGX Sparkに挑む

消費財  ◇ 

AMDのシリコンは、おそらく最初にこの分野に進出したと言えるでしょう。Strix HaloミニPCとノートPCは、NVIDIAが参入するずっと前から128GBの統合メモリを搭載して出荷されていました。しかし、ローカルAIデスクトップというカテゴリーは、NVIDIAがGrace Blackwellスーパーチップを1リットルの箱に詰め込み、DGX Sparkと名付けたことで、事実上作り出したものです。その売り文句はシンプルでした。クラウドで計測されるのではなく、机の上に置く、十分な統合メモリを備えた開発者クラスのマシンです。AMD Ryzen AI Haloは、そのマシンに対するAMDの回答です。AMDは2026年5月にRyzen AI Max PRO 400シリーズと同時に発表しました。6月にMicro Centerでのみ予約注文が開始され、7月10日に店頭で入手可能になりました。Ryzen AI Haloは、同様のフットプリント、128GBの統合メモリ、3,999ドルの価格、そしてSparkとは大きく異なる提案となるいくつかの決定事項を備えています。

AMD Ryzen AI Haloの正面図。

AMDはHaloを同社初のAI開発者プラットフォームと位置付け、開発者がローカルでAIを構築および実行するための迅速かつ摩擦の少ないパスを提供するとしています。内部には、Radeon 8060S統合グラフィックス(40個のRDNA 3.5演算ユニット)と50 TOPSのXDNA 2 NPUを搭載した16コア32スレッドの「Zen 5」プロセッサであるRyzen AI Max+ 395が搭載されており、AMDはプラットフォーム全体で最大126 TOPSのAIスループットを実現していると宣伝しています。128GBのLPDDR5xは8000 MT/sで動作し、256 GB/sの帯域幅を提供し、プラットフォーム全体は120WのUSB-C入力から電​​力を供給されます。AMDは、メモリプールはデバイスメモリに最大200億個のパラメータを持つモデルを保持するのに十分であると述べています。これは完全なx86ミニワークステーションであり、これが最も重要な違いの根源です。

その違いはWindowsにある。SparkはNVIDIAのLinuxベースのDGX OSのみを実行するが、Haloは同じハードウェア上でWindows 11またはAMDのLinux開発者イメージを起動する。ネイティブWindowsサポートは、Sparkを検討している人々から最も多く寄せられた要望であり、このボックスのターゲット層を根本的に変えるものだ。AMD自身のポジショニングも同じことを示唆している。WindowsとLinuxに対応しているのに対し、Sparkは(少なくとも現時点では)Linuxのみに対応している。

HaloとSparkを区別する3つの決定事項は、いずれも既存製品に対する不満点を解消するものです。Haloは、Sparkが採用しているあまり一般的ではない2242ドライブではなく、標準的なM.2 2280 SSDを使用しているため、ドライブを交換したいユーザーにとって、8TB容量を含む、より幅広いアフターマーケットオプションが利用可能になります。両方のオペレーティングシステムで可変グラフィックスメモリが最大割り当てにプリセットされているため、大規模なモデルは手動で調整することなくロードされます。また、シャーシを光るステータスリングで囲むことで、OEMによっては一部の購入者が受け取った暗くてライトのないSparkユニットに対する小さな修正となっています。AMDのアプローチのコストは、ボックスの背面に現れており、高速ファブリックはなく、10GbEのみであるため、マルチノードクラスタリングでできることが制限されます。これらがトレードオフであり、ベンチマークを実行する前に、このマシンが構築されたワークロードを定義します。

AMD Ryzen AI Haloを分解しました。

価格に関しては、ニュアンスが重要になります。Haloは2TB SSD搭載で3,999ドルで販売されており、Sparkクラスのベースシステムの相場価格とほぼ一致しています。比較対象はどのSparkかによって異なります。NVIDIAのDGX Sparkは、より大容量のドライブを搭載すると4,700ドル近くまで値上がりしており、これはLPDDR5XとNANDの供給不足に関連した動きです。ASUSなどのGrace Blackwellベースのシステムは依然として4,000ドル前後で販売されており、本日Amazonに掲載されています(アフィリエイトリンク)。カテゴリーの基準と比較すると、Haloは同等であり、その優位性は価格競争ではなく、上記の決定に基づいています。

私たちはStorageReviewのローカルAIスイートを使って、WindowsとLinuxの両方でHaloの性能を評価しました。その結果は、本レビュー全体を通して、設計およびソフトウェア分析と併せて提示されています。

主要なポイント(要点)

  • デュアルOS x86版: Ryzen AI Haloは、Sparkシリーズの中で唯一、フルx86プラットフォーム上でWindows 11またはLinuxを起動できる製品であり、2TB SSD搭載モデルが3,999ドル、DGX Spark Founders Editionが4,699ドルとなっている。
  • 大きなモデルを格納するためのメモリ: 128GBのLPDDR5x-8000統合メモリ(256GB/s)は、最大200億個のパラメータを持つモデルをローカルでサポートし、可変グラフィックスメモリが事前に調整されているため、大規模なモデルも手動設定なしでロードできます。
  • これまでテストした中で最も強力なRyzen AI Max+ 395: Haloは、Cinebench R23マルチコアで37,316、7-Zipで184.2 GIPS、Procyon AIのテキスト生成(Phi 1,192)と画像生成(SD 1.5 FP16 937)のスコアなど、ほぼすべてのWindowsワークロードにおいてHP Z2 Mini G1aとZBook Ultra G1aを上回りました。
  • CPUはSparkに勝利したが、推論は敗北した。 Linux 上では、Halo は CPU 処理において DGX Spark を完全に上回り、7-Zip での圧縮は 11% 速く、解凍は 38% 速く、LLVM コンパイルは 14% 早く完了しましたが、ほとんどの vLLM サービング シナリオでは、より高い並列処理で 2 倍から 4 倍の差があり、プリフィルを多用する GPT OSS 120B 処理では 8.8 倍の差がありました。
  • 実用的なストレージ、控えめなネットワーク: 標準のM.2 2280ベイにより、アフターマーケットでの8TBへのアップグレードが可能となるが、このプラットフォームは設計上、付属のGen5 Micron 4600をGen4にダウングレードする。また、高速ファブリックのない単一の10GbEポートは、Sparkの200G ConnectX-7が実現するマルチノードクラスタリングを排除する。

技術仕様

製品仕様 AMD Ryzen AI Haloシステム
プロセッサ
CPU AMD Ryzen™ AI Max+ 395 プロセッサー
16コア/32スレッド(Zen 5アーキテクチャ)
GPU AMD Radeon™ 8060S統合グラフィックス
40個の演算ユニット(RDNA™ 3.5アーキテクチャ)
NPU AMD XDNA™ 2 NPU
メモリ
メモリタイプ LPDDR5x
メモリ容量 128GB
メモリ速度 8000MT / s
メモリ帯域幅 256GB /秒
Storage
Storage 2TB M.2 NVMe SSD (SED)
ネットワークと接続性
イーサネット 1 × 10GbE
Wi-Fi Wi-Fiを提供7
Bluetooth Bluetooth 5.4
I / O
USB USB-Cポート×3、USB-Cポート×1(電源入力)
ディスプレイ出力 1×HDMI 2.1b
システム
TDP 120W
オペレーティングシステム LinuxまたはWindows 11
寸法 150×150×45.4mm(5.9×5.9×1.79インチ)
重量 1.2 kg (2.65 ポンド) 未満

AMD Ryzen AI Haloの構築と設計

AMD Ryzen AI Haloシステムは、NVIDIA Sparkのようなコンパクトなフォームファクターを採用しており、サイズはわずか150×150×45.4mm、重量は1.2kg(2.65ポンド)未満です。アルミニウム製のシャーシは、上部と前面にアグレッシブな幾何学的な通気パターンを備え、冷却システムへのエアフローを最大化しながら、独特の外観を実現しています。設置面積は小さいながらも、ワークステーションアプリケーション、ローカルLLM推論、AI開発ワークロードを処理できるフル機能のデスクトップAIワークステーションとして設計されています。

フロント

システムの前面は意図的にすっきりとしたデザインになっており、シャーシの幅いっぱいに広がる大きなメッシュ状の通気グリルがほぼ全体を占めています。AMDはこのエリアをエアフロー専用に設計し、大きなパターン状の吸気口から冷たい空気をシステムに取り込むことで、前面をすっきりと保っています。シャーシ下部のシルバーのアクセントが、マットブラックの筐体にさりげない視覚的なコントラストを与えています。

リアI / O

AMD Ryzen AI Halo背面接続端子。

外部接続端子はすべてシステムの背面に配置されています。背面パネルは左から右へ、以下の構成となっています。

  • USB-C電源入力
  • DisplayPort Alt Mode対応USB-Cポート
  • USB-Cポートが2つ追加されました。
  • HDMI 2.1b出力
  • 10GbE RJ45イーサネット
  • ケンジントンセキュリティロックスロット

本システムは、専用のUSB-C電源コネクタに加え、3つのUSB-Cデータポートを備えており、複数の高速周辺機器やディスプレイを同時に接続できます。HDMI 2.1bによるネイティブディスプレイ出力に加え、統合された10GbEイーサネットインターフェースにより、高速NAS接続、AIデータセット転送、ローカル開発環境などにも最適です。

内部設計

Ryzen AI Haloの底面には、ボード下部に搭載されたコンポーネントを冷却するために空気を取り込む大きな通気孔があり、四隅にある4つのゴム足によって、机や棚の上で安定して設置できます。

AMD Ryzen AI Halo 下部。

底面パネルを固定している4本のネジを外すと、M.2 SSDベイと、Wi-Fiカードコネクタを含むシステム下部基板のいくつかのコンポーネントが現れます。レビュー機では、そのスロットにMicron 4600 2TB Gen5 x4 SSDが搭載されており、黒色の粘着シートが基板の裏側を露出から保護しています。

AMD Ryzen AI Haloの底面カバーを取り外しました。

冷却に関しては、AMDはNVIDIAのDGX Sparkと同様のアプローチを採用し、フィン付きヒートシンクに空気を送り込み、シャーシ背面から排気するデュアルファンを使用している。

AMD Ryzen AI Halo用ヒートシンクとファン。

冷却アセンブリを取り外すと、メインボードが現れ、中央にAPUダイ、その両側にメモリパッケージ、左端にVRM回路が配置されているのが確認できます。ダイ上に見られる銀色の四角形は、液体金属やペースト状の化合物ではなく、AMDがダイとヒートシンクの接合部として塗布した固体サーマルパッドまたはコーティングの残留物です。そのため、ペーストや液体金属が通常残すような湿ったべたべたした外観ではなく、均一で乾燥した外観になっています。

AMD Ryzen AI Halo マザーボード。

ヒートシンクを裏返すと、コールドプレートの裏側が現れ、鏡面研磨された部分がダイと直接接触するようになっている。同時に、周囲のメモリ領域と電源供給領域は、厚さの異なるサーマルパッドが予め貼付されている。

AMD Ryzen AI Haloクーラーの底面図。

AMD Ryzen AI Halo パフォーマンス テスト

ワークステーションアプリケーションとAIに特化したワークロードにおけるパフォーマンスを評価するため、WindowsとLinux上でAMD Ryzen AI Haloプラットフォームを評価しました。Windowsでのテストでは、AMD Ryzen AI Haloシステムを、Ryzen AI Max+ PRO 395を搭載した市販の2つのシステム、コンパクトなデスクトップワークステーションであるHP Z2 Mini G1aと、モバイルワークステーションであるHP ZBook Ultra G1a 14インチと比較しました。これら3つのシステムはすべて同じプロセッサアーキテクチャとRadeon 8060S統合グラフィックスを共有しているため、これらの比較によって、Haloプラットフォームが異なる熱設計やシステム設計においてどのように動作するかが明らかになります。

AMD Ryzen AI Haloのトップカバーを取り外した背面図。

Linuxでのテストでは、AI開発とストレージのワークロードに焦点を当て、Ryzen AI HaloシステムとNVIDIA DGX Sparkを比較しました。これらのテストは、FIOストレージのベンチマークとvLLM推論のパフォーマンスに重点を置き、AMDのRyzen AI Haloベースの開発者プラットフォームと、NVIDIAがローカル大規模言語モデル推論専用に構築したAI開発システムを比較しました。

テスト済みユニット

UL Procyon: AIコンピュータービジョン

Procyon AIコンピュータビジョンベンチマークは、プロフェッショナルレベルでのAI推論エンジンの性能に関する詳細な情報を提供します。複数のベンダーのエンジンを組み込むことで、デバイスの能力を正確に反映したパフォーマンススコアを実現します。このベンチマークは、CPU、GPU、NPUなどのハードウェアタイプ間でAIアクセラレーション性能を比較することで、最先端のニューラルネットワークモデルを評価し、さまざまなワークロードや条件下での相対的な効率性をユーザーが評価できるようにします。

実際のAIワークロードを反映するため、このベンチマークでは、現代のコンピュータビジョンタスクとの関連性に基づいて選択された6種類の多様なニューラルネットワークモデルを使用しています。MobileNet V3は、画像内の被写体識別用に設計されたコンパクトなモバイル向けモデルであり、一方、Inception V4は、より深く複雑なアーキテクチャで同じタスクを実行します。

YOLO V3(You Only Look Once)は、物体の確率を推定することでリアルタイムの物体検出を実現します。MobileNet V2をベースに構築されたDeepLab V3は、セマンティックな画像セグメンテーションとピクセルクラスタリングに重点を置いています。最も計算負荷の高いテストであるReal-ESRGANは、画像を250×250ピクセルから1,000×1,000ピクセルにアップスケールします。最後に、ResNet 50は、深層ニューラルネットワークのより効果的なトレーニングを可能にする堅牢な分類モデルです。

Ryzen AI Haloプラットフォームは、CPUとGPUのワークロード全体で一貫して優れたAI推論性能を発揮しました。CPUテストでは、総合スコア216を記録し、HP Z2 Miniの227にわずかに及ばず、HP ZBook Ultraの186を大きく上回りました。GPU推論はさらに印象的で、Haloシステムは総合スコア553で最高を記録し、ZBook Ultra(528)とZ2 Mini(528)を上回りました。また、MobileNet V3推論で最速の0.38msを記録し、負荷の高いREAL-ESRGANワークロードを185.08msで完了しました。これは、Z2 Miniの211.76ms、ZBook Ultraの200.40msと比較して大幅に短縮されています。

UL Procyon: AI コンピュータービジョン推論 (低いほど良い) AMD Ryzen AI Halo (Ryzen AI Max+ 395 | Radeon 8060S) HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
CPU時間
AIコンピュータービジョン総合スコア(高いほど良い) 216 227 186
モバイルネット V3 0.73ミリ秒 0.75ミリ秒 1.09ミリ秒
レスネット 50 6.02ミリ秒 5.99ミリ秒 6.84ミリ秒
インセプション V4 17.18ミリ秒 17.12ミリ秒 19.80ミリ秒
ディープラボ V3 29.21ミリ秒 21.20ミリ秒 28.27ミリ秒
ヨロV3 35.60ミリ秒 36.58ミリ秒 41.64ミリ秒
リアルエスガン 1,931.13ミリ秒 1,892.10ミリ秒 2,138.97ミリ秒
GPUタイムズ
AIコンピュータービジョン総合スコア(高いほど良い) 553 528 583
モバイルネット V3 0.38ミリ秒 0.42ミリ秒 0.46ミリ秒
レスネット 50 4.04ミリ秒 3.85ミリ秒 3.27ミリ秒
インセプション V4 13.26ミリ秒 15.15ミリ秒 11.62ミリ秒
ディープラボ V3 12.72ミリ秒 10.98ミリ秒 10.72ミリ秒
ヨロV3 11.17ミリ秒 12.64ミリ秒 10.57ミリ秒
リアルエスガン 185.08ミリ秒 211.76ミリ秒 200.40ミリ秒

UL Procyon: AIテキスト生成

Procyon AIテキスト生成ベンチマークは、簡潔かつ一貫性のある評価方法を提供することで、AI LLMのパフォーマンステストを効率化します。これにより、複数のLLMモデルにわたる繰り返しテストが可能になり、大規模なモデルサイズや変動要因による複雑さを最小限に抑えることができます。AIハードウェアのリーディングカンパニーと共同開発されたこのベンチマークは、ローカルAIアクセラレータの利用を最適化し、より信頼性が高く効率的なパフォーマンス評価を実現します。以下の結果はTensorRTを使用して測定されたものです。

Ryzen AI Haloリファレンスプラットフォームは、Procyon AIテキスト生成において、テスト対象となったすべての言語モデルをリードしました。総合Phiスコアは1,192で最高となり、HP Z2 Miniの965、HP ZBook Ultraの922を上回りました。Mistralも同様の傾向を示し、998のスコアで850と829を上回り、Llama3は847で、競合システムの766と756をそれぞれ上回りました。Haloプラットフォームは、すべてのモデルで最初のトークン生成までの時間も短縮し、最初のPhiトークンをわずか0.996秒で生成しました。これはHPシステムのレイテンシのほぼ半分です。トークン生成スループットはZ2 Miniが優位になることもありましたが、Haloプラットフォームの起動レイテンシが大幅に低かったため、総合ベンチマークスコアは最高となりました。

UL Procyon: AIテキスト生成 AMD Ryzen AI ハロー
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
ファイ総合スコア 1,192 965 922
最初のトークンまでの Phi 出力時間 0.996 seconds 1.898 seconds 1.956 seconds
Phi 出力トークン数/秒 55.271 トークン/秒 68.967 トークン/秒 64.986 トークン/秒
Phi 全体期間 56.237 seconds 52.666 seconds 55.501 seconds
ミストラル総合スコア 998 850 829
ミストラルの最初のトークン出力時間 1.603 seconds 2.734 seconds 2.783 seconds
ミストラル出力トークン数/秒 35.027 トークン/秒 43.358 トークン/秒 41.992 トークン/秒
ミストラル全体の所要時間 88.582 seconds 81.716 seconds 84.065 seconds
ラマ3 総合スコア 847 766 756
Llama3 最初のトークンまでの時間の出力 1.963 seconds 2.545 seconds 2.578 seconds
Llama3 出力トークン数/秒 34.630 トークン/秒 36.752 トークン/秒 36.243 トークン/秒
Llama3 全体の所要時間 92.026 seconds 91.987 seconds 93.200 seconds
ラマ2 総合スコア 無し 936 929
Llama2 最初のトークンまでの時間の出力 該当なし秒 3.813 seconds 3.860 seconds
Llama2 出力トークン数/秒 トークン/秒(N/A) 24.685 トークン/秒 24.619 トークン/秒
Llama2 全体の所要時間 該当なし秒 136.077 seconds 136.720 seconds

ULプロキオン: AI画像生成

Procyon AI Image Generation Benchmarkは、低消費電力NPUからハイエンドGPUまで、幅広いハードウェアにおけるAI推論性能を、一貫性のある正確な方法で測定します。このベンチマークには、ハイエンドGPU向けのStable Diffusion XL(FP16)、中程度の性能のGPU向けのStable Diffusion 1.5(FP16)、低消費電力デバイス向けのStable Diffusion 1.5(INT8)の3つのテストが含まれています。ベンチマークは各システムに最適な推論エンジンを使用するため、公平で比較可能な結果が得られます。

画像生成は、Ryzen AI Halo の最も強力なワークロードの 1 つであることが証明されました。Stable Diffusion 1.5 FP16 では、Halo プラットフォームは総合スコア 937 を達成し、Z2 Mini の 725、ZBook Ultra の 648 を上回りました。また、生成時間はそれぞれ 137.8 秒と 154.2 秒に対し、106.7 秒に短縮されました。Stable Diffusion XL も同様に優れた結果を示し、Halo システムは 878.5 秒で完了し、Z2 Mini より約 174 秒、ZBook Ultra より 450 秒以上高速でした。このプラットフォームは、Stable Diffusion 1.5 INT8 ベンチマークも総合スコア 9,158 で完了しました。このワークロードは、HP の比較対象システムでは利用できません。

UL Procyon: AI画像生成 AMD Ryzen AI ハロー
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
安定拡散 1.5 (FP16) – 総合スコア 937 725 648
安定拡散 1.5 (FP16) – 全体時間 106.7 seconds 137.815 seconds 154.203 seconds
安定拡散1.5(FP16) – 画像生成速度 6.670 秒/画像 8.613 秒/画像 9.638 秒/画像
安定拡散 1.5 (INT8) – 総合スコア 9,158 無し 無し
安定拡散 1.5 (INT8) – 全体時間 27.298 seconds 無し 無し
安定拡散 1.5 (INT8) – 画像生成速度 3.412 秒/画像 無し 無し
安定拡散XL(FP16) – 総合スコア 682 570 451
安定拡散XL(FP16) – 全体時間 878.493 seconds 1,052.468 seconds 1,329.592 seconds
安定拡散XL(FP16) – 画像生成速度 54.906 秒/画像 65.779 秒/画像 83.100 秒/画像

SPECワークステーション4

SPECworkstation 4.0ベンチマークは、ワークステーションのパフォーマンスに関するあらゆる主要な側面を評価するための包括的なツールです。CPU、グラフィックス、アクセラレータ、ディスクのパフォーマンスを実際の環境で測定し、ハードウェア投資に関する十分な情報に基づいた意思決定を行うために必要なデータを提供します。このベンチマークには、データサイエンスタスクやONNXランタイムベースの推論テストなど、AIおよびMLワークロードに特化したテストセットが含まれており、ワークステーション環境におけるAI/MLの重要性の高まりを反映しています。7つの業界分野と4つのハードウェアサブシステムを網羅し、今日のワークステーションのパフォーマンスを詳細かつ的確に測定します。

SPECworkstation 4は、Ryzen AI Haloプラットフォームのバランスの取れたワークステーション性能を際立たせました。金融サービス(2.92)、メディア&エンターテイメント(2.97)、製品設計(2.22)、生産性&開発(1.27)の各カテゴリで最高スコアを記録し、これらのカテゴリでHP Z2 MiniとHP ZBook Ultraの両方を上回りました。Z2 Miniはエネルギー(2.50対2.35)とライフサイエンス(2.60対2.33)でわずかにリードしました。全体として、Haloリファレンスプラットフォームはベンチマークのプロフェッショナルワークロード全体で強力なパフォーマンスを発揮し、テストされたすべてのカテゴリで競争力を維持しました。

SPECworkstation 4.0.0 (高いほど良い) AMD Ryzen AI ハロー
(Ryzen AI Max+ 395 | Radeon 8060S)
 

HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S)

 

HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
エネルギー 2.35 2.50 2.20
金融 2.92 2.35 1.60
ライフサイエンス 2.33 2.60 2.20
メディア&エンターテイメント 2.97 2.22 1.90
プロダクトデザイン 2.22 2.00 1.74
生産性と開発 1.27 1.00 1.03

ラックスマーク

Luxmarkは、オープンソースのレイトレーシングレンダラーであるLuxRenderを使用して、高精細な3Dシーンにおけるシステムのパフォーマンスを評価するGPUベンチマークです。このベンチマークは、特に正確な光シミュレーションが不可欠な視覚効果や建築ビジュアライゼーションアプリケーションにおいて、サーバーやワークステーションのグラフィックレンダリング能力を評価するのに役立ちます。

Luxmark の結果では、3 つの Ryzen AI Max+ 395 プラットフォーム間でほとんど差が見られませんでした。Halo リファレンス システムは Food スコアで 4,158 と最高を記録し、Z2 Mini (3,943) と ZBook Ultra (3,915) を上回りました。Hallbench ワークロードでは、8,014 を記録し、Z2 Mini の 8,477 にはわずかに及ばなかったものの、ZBook Ultra の 7,833 を上回りました。全体として、これらの結果は、フォーム ファクターに関係なく、Radeon 8060S を中心に構築されたシステムは非常に似たレイ トレーシング パフォーマンスを発揮することを示唆しています。

ラックスマーク(高いほど良い) AMD Ryzen AI ハロー
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
ホールベンチ 8,014 8,477 7,833
食物 4,158 3,943 3,915

7-Zip圧縮

7-Zip圧縮ベンチマークは、圧縮および解凍時のCPUパフォーマンスを評価し、GIPS(ギガ命令/秒)とCPU使用率でパフォーマンスを測定します。GIPS値が高く、CPU使用率が効率的であるほど、パフォーマンスが優れていることを示します。

Ryzen AI Haloプラットフォームは、7-Zipベンチマークの主要カテゴリすべてでトップの成績を収めました。圧縮性能は176.7 GIPSを達成し、HP Z2 Miniの139.3 GIPS、ZBook Ultraの139.6 GIPSを上回りました。解凍性能も191.6 GIPSと非常に高く、Z2 Miniの164.0 GIPS、ZBook Ultraの174.0 GIPSを凌駕しました。総合的に見ると、Haloプラットフォームは184.2 GIPSという最高の総合評価を獲得し、競合システムを約20%上回るとともに、アーカイブ作成および解凍ワークロードにおいて優れた整数スループットを実現しました。

7-Zip 圧縮ベンチマーク(高いほど良い) AMD Ryzen AI ハロー
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
圧縮
現在の CPU 使用率 2,741% 2,734% 2,868%
電流定格/使用法 6.370GIPS 5.136GIPS 4.883GIPS
定格電流 174.589GIPS 140.405GIPS 140.061GIPS
結果として生じる CPU 使用率 2,751% 2,718% 2,855%
結果として得られる評価/使用法 6.424GIPS 5.126GIPS 4.890GIPS
結果として得られる評価 176.742GIPS 139.298GIPS 139.617GIPS
解凍中
現在の CPU 使用率 2,568% 2,343% 2,904%
電流定格/使用法 7.670GIPS 6.805GIPS 6.029GIPS
定格電流 196.986GIPS 159.451GIPS 175.104GIPS
結果として生じる CPU 使用率 2,469% 2,414% 2,887%
結果として得られる評価/使用法 7.766GIPS 6.793GIPS 6.028GIPS
結果として得られる評価 191.645GIPS 163.969GIPS 174.046GIPS
総合評価
合計 CPU 使用率 2,610% 2,566% 2,871%
合計評価/使用状況 7.095GIPS 5.959GIPS 5.459GIPS
総合評価 184.194GIPS 151.634GIPS 156.832GIPS

ブレンダーのベンチマーク

Blenderはオープンソースの3Dモデリングアプリケーションです。このベンチマークはBlender Benchmarkユーティリティを使用して実行されました。スコアは1分あたりのサンプル数で測定され、値が高いほどパフォーマンスが優れていることを示します。

CPU レンダリングも、Ryzen AI Halo が優れた性能を発揮した分野の一つです。モンスターシーンでは、毎分 244.7 サンプルを達成し、HP Z2 Mini (224.3) と HP ZBook Ultra (189.3) を上回りました。ジャンクショップでは毎分 159.4 サンプルを記録し、それぞれ 149.5 と 129.4 を上回りました。教室シーンでは毎分 131.6 サンプルを記録し、Z2 Mini (116.3) を約 13%、ZBook Ultra (94.1) を約 40% 上回りました。これらの結果は、Ryzen AI Max+ 395 がコンパクトなワークステーションの設置面積にもかかわらず、優れたマルチスレッドレンダリング性能を発揮することを示しています。

Blender ベンチマーク CPU (1 分あたりのサンプル数、高いほど良い) AMD Ryzen AI ハロー
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
モンスター 244.7サンプル/m 224.3サンプル/m 189.29サンプル/m
ジャンクショップ 159.4サンプル/m 149.5サンプル/m 129.42サンプル/m
教室 131.6サンプル/m 116.3サンプル/m 94.14サンプル/m

GPU レンダリングの結果は、システム間で非常に近い値を示しました。Halo リファレンス プラットフォームは、モンスター シーンを毎分 704.2 サンプルでレンダリングし、Z2 Mini (745.6) には及ばなかったものの、ZBook Ultra (661.5) を上回りました。ジャンクショップは、Halo プラットフォーム (366.6) と Z2 Mini (366.5) でほぼ同値でした。同時に、Halo システムは、毎分 361.5 サンプルで最高の Classroom スコアを記録し、Z2 Mini (359.0) と ZBook Ultra (333.3) をわずかに上回りました。これらの結果は、Radeon 8060S が実装間で非常に一貫した GPU レンダリング パフォーマンスを提供することを示しています。

Blender ベンチマーク GPU (1 分あたりのサンプル数、高いほど良い) AMD Ryzen AI ハロー
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
モンスター 704.2サンプル/m 745.55サンプル/m 661.50サンプル/m
ジャンクショップ 366.6サンプル/m 366.54サンプル/m 341.92サンプル/m
教室 361.51サンプル/m 359.01サンプル/m 333.26サンプル/m

yクランチャー

y-cruncherは、マルチスレッド対応で拡張性の高いプログラムであり、円周率πをはじめとする数兆桁までの数学定数を計算できます。2009年のリリース以来、オーバークロッカーやハードウェア愛好家の間で人気のベンチマークおよびストレステストツールとなっています。

y-cruncher の結果は、計算規模によって分かれました。10 億桁と 2.5 億桁の実行では、3 つのシステムすべてが互いに数十分の 1 秒以内の差で終了し、HP システムがわずかに先行しました。ワークロードが大きくなるにつれて、Halo は引き離し、50 億桁の計算を 71.948 秒で完了しました。これは Z2 Mini の 75.021 秒、ZBook Ultra の 78.19 秒と比較して速い結果です。100 億桁では、Halo は 151.409 秒で完了し、Z2 Mini より約 6%、ZBook Ultra より 12% 速い結果となりました。これは、実行時間が長くなるにつれて、デスクトップシャーシが重いマルチスレッド負荷によく耐えられることを示唆しています。

Y-Cruncher (総計算時間) AMD Ryzen AI ハロー
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
1億 13.193 seconds 12.965 seconds 12.93 seconds
2.5億 34.578 seconds 34.533 seconds 34.91 seconds
5億 71.948 seconds 75.021 seconds 78.19 seconds
10億 151.409 seconds 160.252 seconds 171.72 seconds

Geekbench 6

Geekbench 6は、システム全体のパフォーマンスを測定するクロスプラットフォームのベンチマークツールです。

Geekbench 6 では、Halo プラットフォームのバランスの取れたパフォーマンス プロファイルが改めて確認されました。シングル コア スコアは 2,986 で最高となり、HP Z2 Mini (2,862) と ZBook Ultra (2,825) を上回りました。マルチ コア パフォーマンスも 18,068 で比較対象の中でトップとなりました。Radeon 8060S は OpenCL GPU スコアで 92,883 を記録し、Z2 Mini (91,591) をわずかに上回り、ZBook Ultra (85,337) を大きく上回りました。CPU と GPU テスト全体で一貫してリードしていることは、Ryzen AI Max+ 395 プラットフォームの総合的なパフォーマンスを示しています。

Geekbench 6(高いほど良い) AMD Ryzen AI ハロー
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
CPUシングルコア 2,986 2,862 2,825
CPUマルチコア 18,068 17,210 17,562
GPUオープンCL 92,883 91,591 85,337

Cinebench R23

Cinebench R23は、3DレンダリングワークロードにおけるCPU性能を評価するための、広く認知されたベンチマークツールです。Cinema 4Dエンジンを搭載し、プロセッサがシングルスレッドおよびマルチスレッドのタスクをどれだけ効率的に処理できるかを測定することで、全体的な応答性と並列処理能力に関する洞察を提供します。

Cinebench R23では、2つのRyzen AI Max+ 395デスクトップ実装間で非常に拮抗した結果となった。Haloリファレンスプラットフォームはマルチコアスコア37,316を記録し、HP Z2 Miniの37,156をわずかに上回った。また、両者ともHP ZBook Ultraの29,112を大きく上回った。シングルコア性能も同様の傾向を示し、Haloプラットフォームは2,047を記録したのに対し、Z2 Miniは2,020、ZBook Ultraは1,984だった。Z2 Miniとの差はわずかだったものの、Haloシステムは常にベンチマークでトップの成績を収めた。

シネベンチ R23 (高いほど良い) AMD Ryzen AI ハロー
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
マルチコア 37,316 37,156 29,112
シングルコア 2,047 2,020 1,984

Cinebench 2024

Cinebench 2024は、CPU性能への重点を維持しつつ、GPUベースのレンダリングテストを導入することで、R23の基盤をさらに強化しています。本稿では、CPUスコアのみを検証し、各システムが最新の3Dレンダリングタスクをどの程度効率的に処理できるかについての最新の知見を提供します。

最新のCinebench 2024ベンチマークでも、R23と同様の結果が得られました。Ryzen AI Haloはマルチコアスコアで1,916を記録し、HP Z2 Mini(1,906)をわずかに上回り、HP ZBook Ultra(1,579)に対しては大きなリードを維持しました。シングルコア性能もHaloプラットフォームが優位に立ち、116ポイントを獲得したのに対し、Z2 Miniは112ポイント、ZBook Ultraは111ポイントでした。デスクトップシステム間の差は小さいものの、これらの結果はRyzen AI Max+ 395が常にトップレベルのCPUレンダリング性能を発揮できることを裏付けています。

Cinebench 2024 (高いほど良い) AMD Ryzen AI ハロー
(Ryzen AI Max+ 395 | Radeon 8060S)
HP Z2 Mini G1a (Ryzen AI Max+ PRO 395 | Radeon 8060S) HP ZBook Ultra G1a 14インチ (Ryzen AI Max+ PRO 395 | Radeon 8060S)
マルチコア 1,916 1,906 1,579
シングルコア 116 112 111

Phoronixベンチマーク

Phoronix Test Suiteは、オープンソースの自動ベンチマークプラットフォームで、OpenBenchmarking.orgを通じて450以上のテストプロファイルと100以上のテストスイートをサポートしています。依存関係のインストールからテストの実行、結果の収集まで全てを処理するため、パフォーマンス比較、ハードウェア検証、継続的インテグレーションに最適です。今回は、Stream、7-Zip、LLVMのテストにおけるパフォーマンスを検証します。

Phoronixベンチマークスイートを見ると、AMD Ryzen AI HaloプラットフォームとNVIDIA DGX Sparkはほぼ互角の性能を示しました。Ryzen AI HaloシステムはCPU中心のワークロードで常に優位に立ち、7-Zip圧縮ではDGX Sparkを11%、7-Zip解凍では38%上回り、LLVMコンパイルテストでは14%高速に完了しました。一方、DGX Sparkは持続的なメモリ帯域幅が優れており、STREAM Scale、Triad、Addテストでそれぞれ17%、13%、15%上回りました。HaloはSTREAM Copyベンチマークで18%の優位性を維持しており、両システムとも高い性能を備えているものの、Ryzen AI Haloプラットフォームは汎用コンピューティング性能に優れ、DGX Sparkはメモリ帯域幅重視のワークロードでより高いスループットを発揮することが示されています。

ホイール試乗 AMD Ryzen AI ハロー NVIDIA DGX スパーク 優勝者
7-Zip圧縮(MIPS) 186,921 169,052 ハロー(+11%)
7-Zip解凍(MIPS) 146,109 106,084 ハロー(+38%)
ストリームコピー (MB/秒) 145,363 123,730 ハロー(+18%)
ストリームスケール(MB/秒) 110,611 128,970 スパーク(+17%)
ストリームトライアド(MB/秒) 107,105 121,433 スパーク(+13%)
ストリーム追加 (MB/秒) 107,022 122,815 スパーク(+15%)
LLVMコンパイル(Make、秒) 431.8 504.3 Halo(14%高速化)

FIOパフォーマンスベンチマーク

ストレージ性能を業界で一般的に用いられる指標で測定するために、fioを使用します。従来のSSDテストでは、各ドライブをセカンダリドライブとして2回フルにデータを読み込ませて前処理していましたが、今回はファイルシステムを介してシステム内で各ドライブをテストしました。以前はNVIDIAシステムをGDSIOでテストしていましたが、AMDは同等のGPUダイレクトストレージテストを提供していないため、両プラットフォームでファイルシステムレベルのfioを実行することで、ドライブを個別にベンチマークするよりも公平な比較が可能になります。

NVIDIA DGX Spark(Founders Edition)とAMD Ryzen AI HaloはどちらもPCIe Gen5ドライブを搭載しているため、理論上は両プラットフォームのドライブ帯域幅の上限は同じです。しかし実際には、このシステムではHaloのドライブはPCIe Gen4リンク速度で動作するため、利用可能な帯域幅はドライブ自体の性能をはるかに下回ります。このリンク速度の制限は、両プラットフォーム間の帯域幅の差のかなりの部分を占めるため、このセクション全体を通して留意しておく必要があります。

このセクションでは、次の FIO ベンチマークに焦点を当てます。

  • 128Kシーケンシャル
  • 64Kランダム
  • 16Kシーケンシャル
  • 16Kランダム
  • 4Kランダム

128K シーケンシャル読み取り

シングルスレッド、ディープキューの128Kシーケンシャル読み取り(64/1)では、NVIDIA DGX Sparkは13,399.6 MB/sを記録し、AMD Ryzen AI Haloの6,897.5 MB/sのほぼ2倍となりました。レイテンシも同様の傾向を示し、この深度でのSparkの平均レイテンシは0.597 msでしたが、Haloは1.159 msと、転送するデータ量が半分であるにもかかわらず、リクエストあたりほぼ2倍遅くなりました。これは、スイープ全体を通して最も明確な差であり、Sparkのストレージスタックがこのブロックサイズでより高い持続的なシーケンシャルスループットを実現するように設計されていることを示唆しています。

128K シーケンシャル書き込み

書き込み側でも同様の傾向が見られます。IODepth 16/1 では、Spark は 2,984.4 MB/s を達成し、Halo の 1,392.4 MB/s と比較して NVIDIA が 114% 優位に立っています。レイテンシも Spark が優位で、0.67 ms に対し Halo は 1.436 ms でした。読み込み結果と合わせて、128K シーケンシャルは、Halo と比較して Spark が圧倒的に優れていることを示しています。

64Kランダム読み取り

ここでHaloの低キュー深度におけるレイテンシの優位性が真に発揮されます。1/1のキュー深度では、Haloはわずか0.051msで応答し、Sparkの0.275msと比較して、未処理のリクエスト1件あたり5倍以上高速です。この差は低~中程度のキュー深度でも維持され、Haloは0.2msを大きく下回る応答速度を維持する一方、Sparkはほとんどの範囲で0.2~0.45msの範囲にとどまります。

しかし、規模が大きくなると状況は一変します。キュー深度とスレッド数が約 16/4 を超えると、Spark の帯域幅は急激に低下し、8/16 以降は 9.8 GB/s 付近で横ばいになり、32/8 で 10,019.1 MB/s (160.3K IOPS) に達します。Halo はその上限に達することはなく、6.0~6.9 GB/s の範囲で飽和し、4/8 で 6,926.5 MB/s (110.8K IOPS) のピークに達します。帯域幅の曲線は明らかに不安定で、深度/スレッドの組み合わせに応じて約 2~6.8 GB/s の間で鋸歯状に変動し、滑らかに上昇することはありません。

フル飽和時のレイテンシもSparkに有利に働きます。32/16の場合、Haloの平均レイテンシは5.185msに跳ね上がりますが、Sparkは3.204msです。つまり、Haloはキュー深度の低い応答性のために、キューが完全にロードされた後のテール動作が悪化するという代償を払っていることになります。

64Kランダム書き込み

ランダム 64K 書き込み帯域幅は、読み取り帯域幅よりも 2 つのプラットフォーム間で近い値を示していますが、曲線の形状は大きく異なります。Halo の帯域幅はよりスパイク状で、2.5 GB/s を繰り返し超え (32/4 でピーク 2,929.1 MB/s / 46.9K IOPS)、隣接する組み合わせでは 1.1~1.5 GB/s の範囲に戻ります。Spark は比較的安定しており、ほとんどの範囲で 1.7~2.0 GB/s の範囲に収まり、2/16 でピーク 2,106.6 MB/s (33.7K IOPS) に達します。

レイテンシは64K読み取りパターンを反映しており、Haloはキュー深度が低い場合(1/1で0.054msに対し、Sparkは0.217ms)に劇的に高速で、キュー深度とスレッド数が2桁に達すると、両方のドライブとも急激に劣化します。完全飽和状態(32/16)では、Haloのレイテンシは19.611msに達し、Sparkの17.857msと比較されます。この時点で、両方のドライブは明らかに書き込み増幅による大きなストレスを受けており、曲線の一番高い部分ではHaloがわずかに劣っています。

16K シーケンシャル読み取り

帯域幅はスキャン全体を通して高いままで、両ドライブとも深​​度/スレッドの組み合わせに応じて約1~8GB/sの間で変動します。Sparkは32/1で8,069.3MB/s(516.4K IOPS)というより高いピーク値を記録し、Haloは8/4で6,715.8MB/s(429.8K IOPS)でピークに達しました。

レイテンシーは、キューの最上位を除いて、あらゆる場面でHaloが優位に立っています。1/1では、Haloの応答時間は0.027msに対し、Sparkは0.214msで、Haloはスイープのほとんどでより低いレイテンシーを維持しています。最も深い組み合わせでのみ、その差は縮まります。32/16では、Haloの平均レイテンシー1.441msがSparkの1.599msをわずかに下回り、Haloのレイテンシー曲線が飽和状態でもSparkのレイテンシー曲線を大きく上回らない数少ないポイントの1つとなっています。

16K シーケンシャル書き込み

帯域幅もここでも近い値を示しています。Sparkは16/1で2,141.6 MB/s(137.1K IOPS)のピーク値を記録し、Haloも1/8で1,970.9 MB/s(126.1K IOPS)とそれほど差はありません。

レイテンシは、両者の性能が大きく異なる点です。Haloはキュー深度が低い段階では大きくリードしていますが(1/1で0.022msに対し、Sparkは0.231ms)、キューが満杯になるにつれてレイテンシ曲線が急激に上昇します。32/16になると、Haloの平均レイテンシは6.967msまで上昇し、同じ時点でのSparkの4.306msを大きく上回ります。また、Haloの曲線は途中で予測しにくく、Sparkが比較的平坦なままの中間的な組み合わせで急激な上昇が見られます。

16Kランダム読み取り

これはHaloの優れた性能の1つです。実際、32/16構成で6,609.4 MB/s(423.0K IOPS)というより高いピーク帯域幅を記録しており、同じ構成でのSparkの6,082.6 MB/s(389.3K IOPS)を上回っています。

レイテンシは再びHaloが圧倒的に有利な状態から始まります(1/1で0.047msに対し、Sparkは0.222ms)。しかし、Haloのレイテンシ曲線はスイープ全体を通してはるかに変動が大きく、8/1、16/1、8/4、8/8で急激なスパイクが発生し、Sparkの比較的滑らかな(ただしベースラインが高い)曲線を大きく上回ります。キューの最上位では、Haloのピークレイテンシ1.971ms(16/16)はSparkのピーク1.315ms(32/16)を上回っているため、Haloは一貫性を犠牲にして低キュー深度の速度を優先しています。

16Kランダム書き込み

帯域幅に関しては、Sparkが優位に立っており、32/1で2,074.1 MB/s(132.7K IOPS)に達するのに対し、Haloは8/4で1,503.5 MB/s(96.2K IOPS)にとどまります。Sparkの帯域幅曲線は、初期の急上昇後、ほとんどのスイープで1.6~2.0 GB/sの範囲を維持するなど、かなり安定しています。これに対し、Haloは組み合わせごとに約0.1~1.5 GB/sの間で大きく変動します。

このテストで際立っているのはレイテンシです。Haloは1/1では低い値(0.154ms対0.224ms)でスタートしますが、8/16では平均レイテンシが極端に20.698msに跳ね上がり、Sparkの最悪値4.664msのほぼ4.5倍になります。この1回の急上昇を除けば、Haloのレイテンシは概ね妥当ですが、この特定の深度/スレッドの組み合わせになる可能性のあるワークロードでは、注意すべき大きな外れ値です。

4Kランダム読み取り

キュー深度が低い場合、Halo は劇的に高速に応答し (1/1 で 0.04 ms に対し Spark は 0.215 ms)、スイープの低~中範囲のほとんどでレイテンシの優位性を維持します。しかし、スパークは大規模環境でスループットにおいて決定的にリードします。ピーク IOPS は 32/16 で 1,750.7K (6,838.8 MB/s) に達し、Halo の 32/8 でのピーク 1,050.4K IOPS (4,103.2 MB/s) を大きく上回ります。

興味深いことに、キュー深度が高い場合、レイテンシの状況は逆転します。Spark のレイテンシ曲線は、深度とスレッド数が増加しても比較的低いままで、ピークはわずか 0.292 ms です。一方、Halo は 16/16 (0.513 ms) と 32/16 (1.009 ms) で急激に上昇し、定常状態のベースラインを 3 倍以上も上回ります。つまり、低キュー深度での優れた応答性は、完全な飽和状態まで維持されないということです。

4Kランダム書き込み

これは、今回の比較テストで最も大きなIOPSの差です。Sparkのランダム4K書き込みパフォーマンスは、キュー深度とスレッド数の増加に伴い急激に上昇し、8/16で490.4K IOPS(1,915.6 MB/s)に達します。一方、Haloははるかに低いレベルで、はるかに早く頭打ちになり、4/4で125.6K IOPS(490.7 MB/s)でピークに達し、残りのテストでは約110~115K IOPSを超えることはありません。Sparkは、Haloの上限のほぼ4倍の性能を発揮しています。

低いキュー深度では、レイテンシは再びHaloに有利な状態から始まります(1/1で0.079ms対0.235ms)。32/16になると、Haloの平均レイテンシは4.546msまで上昇しますが、Sparkは1.792msと比較的低いままです。IOPSの差と合わせて考えると、これはSparkの優位性が最も顕著で、深度/スレッドの全範囲にわたって最も一貫しているテストです。

vLLMオンラインサービング – LLM推論パフォーマンス

vLLMは、LLM(論理論理モデル)向けの高スループット推論およびサービスエンジンとして最も人気のあるものの1つです。vLLMオンラインサービスベンチマークは、同時リクエスト下におけるこの推論エンジンの実際のサービスパフォーマンスを評価します。実行中のvLLMサーバーにリクエストを送信することで、本番環境のワークロードをシミュレートします。リクエストレート、入力および出力の長さ、同時クライアント数などのパラメータは設定可能です。このベンチマークでは、スループット(1秒あたりのトークン数)、最初のトークン取得までの時間、出力トークンあたりの時間(TPOT)などの主要な指標を測定し、さまざまな負荷条件下でのvLLMのパフォーマンスをユーザーが理解するのに役立ちます。

さまざまなアーキテクチャ、パラメータスケール、量子化戦略にわたる包括的なモデル群全体にわたって推論性能をテストし、異なる並行処理プロファイルにおけるスループットを評価しました。

GPT OSS 120B

ISL/OSLが等しい場合(256/256):Haloはバッチサイズ64で222 tok/sまでスケーリングしたが、Sparkは701(約3.2倍)に達した。

プレフィルヘビー(8k/1k):Haloのスループットはバッチ32でピーク(427 tok/s)に達したが、バッチ64で314に低下した。一方、Sparkは2,760(約8.8倍)に急上昇し、このセットの中で最も大きな差となった。

デコードヘビー (1k/8k): Halo はバッチサイズ 64 で 305 に対し 127 トーク/秒に達しました (約 2.4 倍)。

GPT OSS 20B

ISL/OSLが同等(256/256):Sparkはすべてのバッチでリードし、バッチ64では1,917 tok/sに対し617 tok/sにスケーリングしました(Sparkは約3.1倍のリード)。

プレフィルヘビー(8k/1k):Sparkの最大のリードは、バッチサイズ64で3,672 tok/s対881 tok/sに上昇し(Sparkは約4.2倍のリード)。

デコードヘビー (1k/8k): Spark が全体を通して優位に立ち、バッチ 64 で 728 対 330 トーク/秒に達しました (Spark は約 2.2 倍の優位)。

Qwen3 コーダ 30B A3B 命令

ISL/OSL が等しい (256/256): Halo はバッチサイズ 64 で 376 トーク/秒にスケーリングされ、Spark の 729 の約半分 (約 1.9 倍) であり、ISL/OSL が等しい結果の中でも特に精度の高いものの 1 つです。

プレフィルヘビー(8k/1k):Haloはバッチ32でピーク(408 tok/s)に達したが、バッチ64で362に低下し、Sparkの1,663(約4.6倍)を下回った。

デコードヘビー (1k/8k): Halo はバッチサイズ 64 で 357 に対し 188 トーク/秒に達しました (約 1.9 倍)。

ミストラル スモール 3.1 24B インストラクト

ISL/OSLが同等(256/256):Haloはバッチ1で実際にリードし(9対8トック/秒)、その後バッチ64で202トック/秒に落ち着き、Sparkは498(約2.5倍遅れ)でした。

プレフィルヘビー(8k/1k):Haloはバッチ32でピーク(188 tok/s)に達し、バッチ64で164にわずかに低下し、Sparkの540(約3.3倍)を下回りました。

デコードヘビー(1k/8k):ほぼ互角で、バッチ64でHaloは119 tok/s、Sparkは132 tok/s(約11%の差)を記録した。

ラマ3.1 8B 指示

ISL/OSLが等しい場合(256/256):Haloはバッチ1の25 tok/sからバッチ64の407 tok/sまでスムーズにスケールアップし、バッチ4まではSparkにほぼ追随しましたが、その後Sparkが1,330までリードしました(ピーク時、Haloは約3.3倍遅れていました)。

プレフィルヘビー(8k/1k):Haloはバッチサイズ64で546 tok/sに達し、Sparkの1,059の約半分を保持しました。

Decode Heavy (1k/8k): Halo の最も競争力のあるシナリオで、バッチサイズ 64 で Spark の 263 トーク/秒に対して 235 トーク/秒を達成 (約 12% の差)。

ラマ3.1 8B命令FP4

ISL/OSLが等しい場合(256/256):Haloはバッチサイズ64で267 tok/sのピークに達しましたが、Sparkの3,573には遠く及びません。FP4では最も大きな差(約13.4倍)が見られます。

プレフィルヘビー(8k/1k):Haloはバッチサイズ64で457トック/秒に達し、Sparkの2,713(約5.9倍)と比較しました。

デコードヘビー (1k/8k): Halo はバッチサイズ 64 で 588 tok/s だったのに対し、146 tok/s にスケールアップしました (約 4 倍)。

結論

AMD Ryzen AI Haloは、NVIDIAがDGX Sparkで事実上作り出したカテゴリーに参入し、Sparkの土俵でSparkを倒そうとはしていません。vLLMのスイープでは、Sparkはほとんどのシナリオで並列度が高い場合に2倍から4倍のスループットの優位性を持ち、プリフィルが多用されるGPT OSS 120Bの処理では8.8倍に達し、デコードが多用される2回の実行でのみ約10%に縮まり、ストレージサブシステムは飽和状態のfioテストのほぼすべてで勝利しました。Haloが提供するのは、Spark Founders Editionの4,699ドルに対して3,999ドル(ただし、一部のOEMは4,000ドル以下で販売)で、DGX OSだけではなくWindows 11またはLinuxを起動できるフルx86マシンで、同じ128GBの統合メモリと2,000億パラメータの上限を同様のフットプリントで実現しています。

AMD Ryzen AI Haloマザーボードの上面図。

Sparkを除けば、Haloはテストした中で最も強力なRyzen AI Max+ 395実装です。ほぼすべてのWindowsワークロードでHP Z2 Mini G1aとZBook Ultra G1aを上回り、Cinebench R23マルチコアで37,316、7-Zipで184.2 GIPS(HPは151.6と156.8)、Procyon AIのテキストと画像生成スコアが最高、5億桁と10億桁のy-cruncher処理時間が最速でした。Linuxでは、Sparkと比較してCPU負荷の高いPhoronixテストで完全に勝利し、7-Zipでの圧縮速度が11%速く、LLVMコンパイルが14%早く完了しました。これはまずコンパクトなワークステーションであり、AI開発者の役割はそれを置き換えるのではなく、その上に重ねられています。

1秒あたりのローカルトークンの最大数を必要とする開発者、または高速ファブリック上でノードをクラスタリングする予定の開発者は、引き続き Spark を購入する必要があります。Halo の 10GbE と vLLM の上限は、それに遠く及びません。ROCm をターゲットに開発を行う開発者、ループ内に Windows が必要なチーム、またはプロフェッショナルなワークロードとローカル モデル作業の両方をカバーする 1 台のボックスを必要とする人には、Halo の方が適しています。標準の M.2 2280 ベイと事前に調整された可変グラフィックス メモリにより、Spark の所有者が提起した最も一般的な不満の 2 つが解消されます。AMD はまた、プラットフォームが第 3 四半期に最大 192GB の統合メモリを備えた Ryzen AI Max PRO 400 シリーズ シリコンを採用すると述べているため、より大規模なモデルを求める購入者は、プラットフォームを変更することなく明確な道筋を得ることができます。

製品ページ – AMD Ryzen AI Halo

ランキング: AMD Ryzen AI Haloは、ローカルAI向けベストデスクトップのランキングで、x86代替機部門のベストにランクインしています。

StorageReview と連携する

ニュースレター| YouTube | ポッドキャスト(iTunes / Spotify) | Instagram | Twitter | TikTok | RSSフィード

ブライアン・ビーラー

ブライアンはオハイオ州シンシナティに拠点を置き、StorageReview.com のチーフ アナリスト兼社長です。