StorageReview.com

Intel Arc Pro B60 Battlematrix プレビュー: オンプレミス AI 向け 192GB VRAM

消費財  ◇ 

IntelのProject Battlematrixは、アクセスしやすいAIインフラストラクチャを実現する魅力的なソリューションであり、マルチGPU設計によりワークステーション筐体に大容量のGPUメモリを提供します。開発コード名「Battlemage Arc Pro B60」のプロフェッショナルGPUを基盤とするこのプラットフォームは、クラウドサブスクリプションのコストやデータプライバシーの懸念なしに、大規模な言語モデルをローカルで展開したい組織を対象としています。単一システムで8基のGPUに最大192GBのVRAMを搭載するBattlematorは、AI推論ワークロードにおいて、他のプロフェッショナルGPUエコシステムと比較して比較的コスト効率の高い代替手段として位置付けられています。

 

この記事をInstagramで見る

 

StorageReview (@storagereview) がシェアした投稿

Battlematrixを従来のワークステーション構成と区別する特徴は、IntelのデュアルGPUカード設計です。このカードは、PCIe分岐サポートを必要とする単一のPCBに2つのフルB60 GPUを搭載しています。この密度最適化アプローチにより、通常はサーバー用マザーボードが必要となる構成が可能になります。また、Arc Pro B60はGPUあたり24GBのGDDR6を搭載しており、メモリを大量に消費するトランスフォーマーモデルに特に適しています。初期テストでは有望なポテンシャルが示されていますが、ソフトウェアによる最適化はハードウェアの性能にまだ追いついていません。

開示

テストは、Intel LLM Scalerの開発ブランチを含む、初期のソフトウェアおよびドライバーリビジョンを使用して実施されました。また、テストプラットフォームでは、Intel XeonプラットフォームではなくAMD​​ EPYCプロセッサーを使用しています。IntelはBattlematrixをXeon 6プロセッサーを搭載したオールIntelソリューションと位置付けており、Intel CPUを搭載した実稼働システムは、この結果よりも高いパフォーマンスを示す可能性があります。読者の皆様は、これらの結果を暫定的なものと捉え、ソフトウェアの成熟度とプラットフォームの最適化は2026年を通じて向上すると理解してください。 

仕様とアーキテクチャ

製品仕様 Detail
製品コレクション インテル® Arc™ Pro Bシリーズグラフィックス
コード名 バトルメイジ
GPUアーキテクチャ Xe2(TSMC N5)
Xeカラー 20
スライスをレンダリングする 5
レイ トレーシング ユニット 20
XMXエンジン 160
Xeベクターエンジン 160
グラフィッククロック 2400 MHz
グラフィックスクロック(LPモード) 2000 MHz
GPU FP32パフォーマンス 12.28 TFLOPS
GPU ピーク TOPS (INT8) 197
総ボード電力 (TBP) 200 W
メモリ 24 GB GDDR6
メモリインターフェイス 192ビット
メモリ帯域幅 456 GB / sの
メモリ速度 19 Gbps
PCIeインターフェース PCIe 5.0 x8
サポートされているディスプレイ 4
グラフィック出力 HDMI 2.1 | DP2.1 (UHBR 13.5) | DP2.1(UHBR10)
最大解像度(HDMI) 7680 x 4320 @ 120Hz
最大解像度(DP) 7680 x 4320 @ 60Hz
HDMI可変リフレッシュレート はい
VESA適応同期 はい
H.264 / H.265 / AV1 エンコード/デコード はい
レイトレーシングのサポート はい
oneAPI サポート はい
OpenVINO サポート はい
Intel IPEX サポート はい
Intel XeSS サポート はい


その インテル アーク プロ B60 ゲームに特化したシリコン基盤を共有 インテル アーク B580どちらもTSMCの5nmプロセスで製造された同じダイを使用しています。この272mm²のチップには19.6億個のトランジスタが集積され、20個のXe2コアが統合されています。GPUあたり12.28TFLOPSのFP32演算性能と197TOPSのINT8 AI性能を実現すると謳われています。重要な違いはメモリ構成にあります。B580は12GBのGDDR6メモリを搭載しているのに対し、B60は容量が倍の24GBとなっています。

各B60 GPUは192ビットのメモリインターフェースを介して2,400MHzで動作し、GPUあたり456GB/秒の帯域幅を提供します。このアーキテクチャは、AI推論における行列演算を高速化するために特別に設計された、GPUあたり160個のXMX(Xe Matrix Extensions)AIエンジンを搭載しています。

デュアル GPU 設計と PCIe 分岐

Maxsun Arc Pro B60 Dual 48G Turboは、Intelの高密度戦略を体現しています。2つの完全なGPUが1枚のデュアルスロットカードに搭載され、PCIe 5.0 x8インターフェースを介して独立して接続されています。従来のデュアルGPU設計では、チップをブリッジ接続して1つのGPUとして機能しますが、B60の各GPUはシステムに対して独立したデバイスとして認識されるため、PCIe x8/x8分岐に対応したマザーボードが必要です。1つのx16スロットが電気的に2つのx8接続に分割され、各GPUに専用の帯域幅が割り当てられます。

PCIe 5.0 x8は、GPUあたり128GB/sの双方向帯域幅を提供し、PCIe 4.0 x16と同等の性能を発揮します。デュアルカード構成の全長は300mmで、ブロワー式冷却システムを備え、2つのスロットを占有します。また、 600W定格の12V-2×6コネクタ1つを介して、合計400Wのボード電力を消費します。

各デュアルカードは、GPUごとに1セットずつ、合計4つのディスプレイ出力を提供します。DisplayPort 2.1 UHBR20ポート2基とHDMI 2.1aポート2基で構成され、仮想デスクトップ環境やマルチユーザーシステムにおいて、独立したビデオ出力構成を可能にします。重要な点は、各GPUで同時に使用できるのは2つのディスプレイ出力のうち1つだけであるということです。

 

この記事をInstagramで見る

 

StorageReview (@storagereview) がシェアした投稿

8 GPU バトルマトリックス構成

Intelのリファレンス仕様であるBattlematrixは、ワークステーションシャーシに最大8基のArc Pro B60 GPUを搭載可能で、これは4枚のデュアルGPUカードを使用することで実現されます。この構成により、以下のメリットが得られます。

  • 合計192GBのシステムVRAM (8×24GB)
  • 1,280個のXMX AIエンジン
  • 1,576 INT8 トップ 集計計算
  • 3.6TB /秒 合計メモリ帯域幅

このプラットフォームには、分岐をサポートする 4 つの PCIe 5.0 x16 スロットを備えたマザーボードが必要です。また、Battlematrix 仕様には Xeon 6 プロセッサも含まれますが、Battlematrix 構成に関するその他の情報は現在入手できません。

ユースケースと価値提案

対象者

インテルのProject Battlematrixは、オンプレミス・インフラストラクチャを必要とするAI開発チーム、機密性の高いコードベースでAI支援ワークフローを実装するソフトウェアエンジニアリング組織、そしてクラウドベースの推論サービスに代わる費用対効果の高い代替手段を求める組織という3つの市場セグメントをターゲットとしています。このプラットフォームの核となる価値提案は、複数年にわたるクラウドサブスクリプションよりも優れたデータ主権と総所有コストの優位性にあります。

プライベートAIおよびエージェント開発

Battlematrix プラットフォームの主な強みは、広範なコンテキスト ウィンドウと多数のパラメーターを必要とする大規模な言語モデルの開発ワークフローをサポートしていることです。

エージェントシステムを構築する開発チームは、特にメモリヘッドルームの恩恵を受けます。RAGエージェント実装は通常、GPUメモリ内に複数のコンポーネント(ベース言語モデル、ベクトル検索用の埋め込みモデル、リランキングモデル)を同時に保持します。さらに、エージェントワークフローは、複数段階の推論、ツールの使用、自己修正を実行し、反復処理を通じて膨大なコンテキストウィンドウを生成します。大規模なコードベースを解析するコーディングエージェントは、運用ライフサイクル全体で100万以上のトークンを蓄積することがあります。

将来のVDIと仮想化ゲーム

Intelのロードマップには、Arc Pro B60 GPUでSR-IOV(シングルルートI/O仮想化)サポートを有効化し、ハードウェアをマルチユーザー・グラフィックス・プラットフォームへと変革することが含まれています。SR-IOVにより、物理GPUを複数の仮想GPUに分割し、各仮想GPUを個別の仮想マシンに割り当てることで、ハードウェアへの直接アクセスと分離されたメモリ空間を実現できます。

この機能により、ライセンスフリーの仮想デスクトップ・インフラストラクチャ(VDI)シナリオが実現します。1台の8GPU Battlematrixシステムで、CADアプリケーション、ビデオ編集、あるいは中程度のゲーム向けに専用のGPUアクセラレーションを提供し、数十人の同時ユーザーをサポートできます。従来のVDIソリューションでは、ハードウェアコストに加えて高額なライセンス料がかかり、多くの場合、より高価なプロフェッショナル向けGPUやデータセンター向けGPUが必要になります。Intelのライセンスフリー仮想化への取り組みにより、こうした運用コストは不要になります。

価格設定と価値提案

Intelは、Arc Pro B60の価格をGPU1枚あたり約600ドルと発表しました。初期のテストと開発においては、シングルカードまたはデュアルカード構成(600ドルから1,200ドル)が手頃な価格帯となります。48GBのVRAMを搭載したデュアルGPUカード1枚で、量子化モデルに十分な容量を確保でき、一般的なオープンソースLLMアプリケーションのかなりの部分をカバーできます。

今回テストしたMaxsun Dual Arc Pro B60 Dual 48G Turbo構成の価格は、Intelの当初の発表通り、Maxsunから直接購入した場合で1,200ドルです。ただし、最近のメモリ価格の変動により、この価格は変動する可能性があります。

エントリー価格で優れた価値

シングルカード構成とデュアルカード構成は、小規模チーム、個人開発者、そしてホームラボ開発者にとって魅力的な経済性を提供します。24GBのGPUメモリで600ドル、48GBで1,200ドルという価格は、通常2倍以上の価格となるプロ向けGPU製品を大幅に下回ります。

この価値提案は、企業予算を投入せずに AI 統合を検討している組織に特に当てはまります。

vLLMオンラインサービングベンチマークパフォーマンス

vLLMは、LLM向けの最も普及している高スループット推論およびサービングエンジンです。vLLMオンラインサービングベンチマークは、同時リクエスト発生時の実環境におけるサービングパフォーマンスを測定するパフォーマンス評価ツールです。リクエストレート、入出力長、同時クライアント数などの設定可能なパラメータを使用して、実行中のvLLMサーバーにリクエストを送信することで、実稼働ワークロードをシミュレートします。このベンチマークは、スループット(1秒あたりのトークン数)、最初のトークンまでの時間(TTFT)、出力トークンあたりの時間(TPOT)などの主要な指標を測定し、ユーザーがさまざまな負荷条件下でのvLLMのパフォーマンスを理解するのに役立ちます。

テストプラットフォーム:

量子化のサポートと制限

これらのGPUは、最適なパフォーマンスを得るためにINT4量子化をターゲットとした低精度推論に優れているはずです。しかし、テストに使用したIntelのLLM Scalerは開発初期段階であったため、MXFP4マイクロスケーリングフォーマットで初期学習したGPT OSSモデルのみが正しく動作しました。標準INT4、FP8、AWQなどの他の量子化フォーマットは、完全に起動に失敗しました。この制限により、これらのGPUを徹底的にテストする能力が大幅に制限されましたが、ソフトウェアスタックが成熟するにつれて、量子化のサポートが拡大すると期待しています。

ほとんどのモデルを、8GPUのBattlematrixフル構成と、モデルをメモリに収めるのに必要な最小限のGPU数という2つの構成でテストしました。この比較により、特にバッチサイズが小さい場合の通信オーバーヘッドに関して、興味深いスケーリング特性が明らかになりました。

マイクロスケーリングデータ型

マイクロスケーリングは、大規模なパラメータグループ全体にわたる均一な量子化ではなく、小さな重みブロックにきめ細かなスケーリング係数を適用する高度な量子化手法です。MXFP4フォーマットは、ブロック化浮動小数点表現を用いてこの手法を実装します。ブロック化浮動小数点表現では、各マイクロスケールブロックが共通の指数をスケーリング係数として共有することで、数値精度を維持しながら4ビット精度を実現します。MXFP4データ型の主な利点は、BF16などの高精度フォーマットからの量子化とは異なり、モデルをINT4に量子化しても応答品質が大幅に低下しないことです。GPT OSSモデルは、B60ではMXFP4をネイティブにサポートしていないため、INT4量子化で実行されます。

OpenAI GPT-OSS 20B

20Bパラメータモデルは、通信オーバーヘッド現象を明確に示しています。バッチサイズ1では、単一のGPUでユーザーあたり49.22 tok/sのスループットを実現していますが、8つのGPUすべてに分散した場合はわずか22.83 tok/sです。単一GPU構成は2倍以上のパフォーマンスを発揮します。しかし、8つのGPU構成はより高い同時実行性を実現し、バッチサイズ16で合計511.99 tok/sのスループットを達成しています。

最小GPU構成では、バッチサイズ16でより高い総スループット(TP=4で626.84 tok/s、TP=8で511.99 tok/s)を達成しています。この直感に反する結果は、より少ないGPUで問題なく動作するモデルとコンテキスト長の場合、ハードウェアを追加しても通信オーバーヘッドが発生し、それに比例したパフォーマンス向上は得られないことを強調しています。

OpenAI GPT-OSS 120B

120Bの大型モデルでは少なくとも4基のGPUが必要となるため、単一GPUでの比較は不要となります。4基構成と8基構成のパフォーマンスはより収束し、バッチサイズ1ではユーザーあたりのスループットはほぼ同じです(どちらも16.28 tok/s)。8基構成では、データ並列処理により、より大きなバッチサイズで若干の性能向上が見られます。

専門家の混合:Qwen3 Coder 30B-A3B

スパースMoEアーキテクチャは、推論中にサブセットのみをアクティブ化しながら、多数のパラメータ数を維持します。Qwen3 Coder 30B-A3Bは、30Bのパラメータプールからトークンごとに約3Bのパラメータをアクティブ化するため、ローカルコーディングアシスタントの導入に人気があります。


BF16精度でのテストでは、4GPU構成が低バッチサイズで優位性を発揮することが改めて示されました。バッチサイズ1の場合、ユーザーあたりのスループットはTP=4で15.34 tok/s、TP=8で14.15 tok/sに達しました。

高密度モデル

密なモデルは従来のLLMアーキテクチャに従っており、推論中にすべてのパラメータと活性化関数が使用されるため、疎なモデルよりも計算負荷が高くなります。テスト期間中、INT4量子化が正常に機能しなかったため、これらのモデルはBF16精度で実行されました。

ラマ3.1 8B 指示

コンパクトな8Bモデルは単一のGPUに快適に収まりますが、スケーリング挙動を特徴付けるために様々な構成でテストされました。結果はパターンを裏付けています。バッチサイズ8で4つのGPUを使用した場合、合計スループットは240.48 tok/sですが、同じバッチサイズで8つのGPUを使用した場合は227.90 tok/sです。バッチサイズ1でのユーザーあたりのスループットはほぼ同じです(22.37 tok/s対22.83 tok/s)。

ミストラル スモール 3.1 24B インストラクト

24BパラメータのMistralモデルは、より要求の厳しいワークロードに対応します。BF16精度では、バッチサイズが大きいほどスループットが大幅に向上し、8つのGPUすべてでバッチサイズ256のときに574.16 tok/sに達します。


所見

テストしたすべてのモデルで一貫したパターンが見られます。256個の入出力トークン構成でバッチサイズが小さい場合、モデルに適合させるために必要な最小限のGPU数を使用することで、8個のGPUすべてに分散させるよりもユーザーあたりのパフォーマンスが向上します。PCIe 5.0の速度であっても、PCIeを介したGPU間の通信オーバーヘッドにより、シングルユーザーまたは低並列処理のシナリオでは、並列化によるメリットを上回るレイテンシが発生します。

この発見は、導入計画に実用的な意味合いを持ちます。シングルユーザー向けのコーディングアシスタントや同時実行性の低いエージェントワークフローを実行している組織は、より小規模なGPU構成でも十分なパフォーマンスを得ることができます。8GPU構成のBattlematrixは、バッチ推論ワークロード、合成データ生成、あるいはリクエストごとのレイテンシよりも総スループットが重要となる高同時実行サービングシナリオ、特にメモリを多く必要とする大規模モデルを使用する場合に最も有利です。

Arc Pro B60sの使用経験

私たちが実施した限定的なテストでは、驚くほどスムーズな体験でした。カードの起動と実行は簡単で、Battlemageに対応したvLLMの開発ブランチであるLLM-Scalerのセットアップも同様に簡単でした。しかし、このソフトウェアはまだ開発の初期段階です。テストを開始した時点では、GPU統計情報を一切取得できず、テンソル並列処理以外に、エキスパート並列処理やパイプライン並列処理といった複数のシステムにわたるスケーリングのための並列処理戦略もうまくいきませんでした。とはいえ、ソフトウェアスタックがリリース前の状態であることを考えると、これらの制限があることは予想していました。

最初に公開したYouTubeショート動画の後、冷却性能について多くの議論が巻き起こり、多くのコメントで、テストベッド上でカードが過熱するのではないかという懸念が表明されました。温度監視機能がなかったため、最終的にカードをサーバーシャ​​ーシに移設し、十分なエアフローを確保しました。インテルのマーケティング用レンダリング画像に示されているように、最終的なBattlematrix構成ではこれらのカードがワークステーションシャーシに密集して配置されているため、本格的なレビューではワークステーション構成での冷却性能をテストする予定です。

フォームファクタに関しては、これらのカードは標準的なワークステーションGPUよりもわずかに長く、ケースとの互換性に問題が生じる可能性があります。ただし、ほとんどのサーバー筐体ではカードの先端部にサポートブラケット用のスペースが確保されているため、サーバー筐体には問題なく収まります。

今後のテスト計画

B60の正式リリースと一般提供開始後、Intel Battlematrixを再検証し、より広範なレビューを行う予定です。幅広いモデルとデプロイメント構成で追加のvLLMテストを実施し、LLM推論のパフォーマンスを評価します。今回のプレビューでは示されていませんが、これらのGPUは、現在のソフトウェア状態では、デコード処理よりもプリフィル処理の方がパフォーマンスが優れていることが確認されています。完全なレビューでは、プリフィル処理とデコード処理が混在する推論ワークロードをさらに深く掘り下げ、この動作を詳細に分析します。

ホームラボコミュニティからは、これらのGPUをホームラボで最も人気のあるワークロードの一つであるメディアサーバーに活用したいという要望が寄せられています。そこで、Discordのメンバーと共にPlex、場合によってはJellyfinを使ってテストを実施する予定です。また、SolidWorksやAutodeskといったCADパフォーマンステストを含むプロフェッショナル向けワークロードも検討対象としています。さらに、ProxmoxとSR-IOVを組み合わせてマルチユーザーVDIサーバーを構築し、Discordメンバー向けに同時デスクトップ密度やクラウドゲーミングを評価する計画も立てています。

結論

IntelのArc Pro B60 Battlematrixは、ワークステーション価格帯で大容量GPUメモリを利用できる画期的なプラットフォームです。デュアルGPUカード設計は密度の制約に対応し、GPUあたり24GBのメモリ割り当てはLLM推論ワークロードに最適で、価格体系は既存のプロフェッショナル向けGPUエコシステムに代わる魅力的な選択肢となります。最先端のパフォーマンスよりもデータ主権とコスト効率を重視する組織にとって、このプラットフォームは検討に値します。

ソフトウェアの成熟度は依然として主要な制約です。LLM Scalerによるフレームワークの最適化と継続的なドライバーの改良へのIntelの投資は、ArcシリーズGPUを高い価値として維持するというコミットメントを示しています。 

NVIDIA DGX Sparkの驚異的なパフォーマンスと比較して、8つのGPUを搭載したバトルマトリックス構成がどれほど普及するかは未知数だ。真の注目点は、600ドルから1,200ドルという手頃な価格帯で提供されるシングルカードおよびデュアルカード構成にあるかもしれない。これらの構成は、プライベートAIインフラストラクチャの探求における障壁を劇的に引き下げるだろう。

ドライバーのアップデートやソフトウェアフレームワークの成熟に伴い、テスト範囲を拡大していく予定です。ご自身でテストしてみたい方は、Discordサーバーにご参加ください。コミュニティサーバーでは、B60へのアクセスが制限されています。

StorageReview と連携する

ニュースレター| YouTube | ポッドキャスト(iTunes / Spotify) | Instagram | Twitter | TikTok | RSSフィード

ディビヤンシュ・ジェイン

機械学習エンジニア、ホームラボ愛好家、そしてテクノロジー愛好家。StorageReviewでは、AIと新興ワークロードのテストを主導し、洞察とパフォーマンス分析を提供しています。