StorageReview.com

AMD MI455XとHelios:432GB HBM4、72GPUラック、そしてヴェラ・ルービンへの真の回答

AI  ◇  Enterprise

AMDは、これまでで最大規模の「Advancing AI」イベントを開催し、スケールを主要テーマとして強調しました。同社は、Instinct MI455X GPU、72 GPU搭載のHeliosラック、および第6世代EPYC Venice CPUを発表しました。MI455Xは、NVIDIAのB300またはRubinと比較して50%増加した432GBのHBM4を搭載し、23.3TB/sのメモリ帯域幅と最大40.26 PFLOPSのMXFP4演算能力を備えています。完全なHeliosラックでは、これらの数値が72倍になり、2.9 exaFLOPSのFP4、31TBのHBM4、1.7PB/sのメモリ帯域幅、260TB/sのスケールアップ、およびデータセンターへの43TB/sのスケールアウト帯域幅を実現します。AMDは、すべての指標において業界をリードすることを目指しています。この記事では、MI455XとHeliosについて検証します。ヴェネツィアでの発表については、別の分析で取り上げています。

AMD MI455X Helios

もう一つのテーマはオープン性であり、相互接続から始まり、あらゆるレイヤーに及んでいます。ラック内部では、72個のGPUすべてがUALinkを介してメモリを共有しています。UALinkは、AMDがイーサネット上でUALink-over-Ethernet(UALoE)として運用するオープンなコンソーシアムファブリックです。トラフィックがラックから出ると、Ultra Ethernet Consortiumのオープンなスケールアウト標準であるUltra Ethernetを介して転送されます。同じInstinctがスタックの上位で動作します。低精度演算にはOCPのオープンなMXFP4、MXFP6、MXFP8データフォーマットが使用され、それらすべてを収容するラックはOpen Compute ProjectのOpen Rack Wide設計に基づいて構築されています。ソフトウェアもオープンに開発されており、ROCmのコンパイラ、ランタイム、ライブラリはすべてソースコードで入手可能です。

スタック内のすべての仕様が今日公開されダウンロード可能になったため、ハイパースケーラーはHeliosを設計図として扱い、ネットワーク、電力供給、管理などを変更して、自社の設備やワークロードに合わせて調整したカスタムバージョンを構築できます。つまり、この記事で解説する内容はすべてAMDが提示したリファレンスデザインであり、顧客が実際に導入するユニットは大きく異なる可能性があります。すでに採用企業は決まっており、AMDによると、OpenAI、Meta、Anthropic、Microsoft、OracleなどがHeliosを採用しているとのことです。

AMD Instinct MI455X:CDNA 5のフラッグシップ

MI455Xは、3200億個のトランジスタを搭載した初のCDNA 5アクセラレータです。MI455Xは、TSMCのN2ノードで製造された8つのアクセラレータ複合ダイ(XCD)に加え、N3ノードで製造された2つのI/Oダイと2つのファブリック/キャッシュダイ、そして12個のHBM4スタックを備えています。これは、TSMCのCoWoS-Lパッケージで製造されたチップとしては過去最大規模です。

AMD Instinct MI455X GPUの概要

メモリは注目すべき点のひとつだ。12個のHBM4スタックは合計432GB、23.3TB/sの速度を実現し、HBM4によってスタックあたりのインターフェースが2,048ビットに倍増している。さらに、2つのファブリックおよびキャッシュダイによって、54TB/sで動作する192MBのL2キャッシュが追加されている。

MI455XはI/O性能にも妥協していません。ラック内の他の機器への双方向3.6TB/sのスケールアップ帯域幅を実現する72レーンのUALoE、ホストCPUへの双方向256GB/sのInfinity Fabric、そしてスケールアウト用に2つのPCIe Gen6 x16リンクまたは3つのAMD AI-NICを選択できます。

MI455Xは、それが置き換えるチップやNVIDIAの製品と比較すると、あらゆる指標において優位に立っている。

製品仕様 AMD MI455X NVIDIA ルービン AMD MI355X NVIDIA B300
アーキテクチャ CDNA5 ルービン CDNA4 ブラックウェル ウルトラ
トランジスタ 320B 336B 185B 208B
HBM容量 432GB HBM4 288GB HBM4 288GB HBM3E 288GB HBM3E
HBM帯域幅 23.3TB /秒 22TB /秒 8TB /秒 8TB /秒
GPUごとのスケールアップ 3.6TB /秒 3.6TB /秒 1.08TB /秒 1.8TB /秒
GPUごとのスケールアウト 2,400 Gb / s 1,600 Gb / s 400 Gb / s 800 Gb / s
CPU-GPUリンク 256GB/s Infinity Fabric 1.8TB/秒 C2C (1:2) PCIe 5 900GB/s C2C (1:2)

 

まずはAMDがリードしている点から見ていきましょう。MI455Xは432GBのHBMを搭載しており、最大288GBのMI355X、B300、Rubinよりも50%多くなっています。メモリ帯域幅も23.3TB/sと、このグループの中で最高です。スケールアウトの面でも同様に、GPUあたり2,400Gbit/sの帯域幅を実現しており、Rubinの1,600Gbit/s、B300の800Gbit/sを上回っています。MI455Xは、競合製品の中で最も近いものよりも50%多いネットワーク帯域幅を備えています。

AMDもついにスケールアップで追いついた。NVLinkは長年GPUファブリックのリーダーであり、2世代にわたってWideEP搭載のMoEモデルで最高のパフォーマンスを得る唯一の方法だった。UALoEは1世代でそのギャップを埋め、MI455Xは3.6TB/sでRubinのNVLink 6に匹敵する。ホストリンクではNVIDIAが依然として明確なリードを保っている。1つのVera CPUが1.8TB/sのC2Cで2つのRubin GPUにデータを供給する一方、各MI455Xは256GB/sのInfinity FabricリンクでVeniceホストと通信する。この違いが、この後の記事で説明する2つのラックアーキテクチャの分岐点となる。

純粋な演算性能に関しては、MI455Xが全体的に優位に立っていますが、一つ注意点があります。AMDのOCP MXフォーマットとNVIDIAのNVFP4はスケーリングが異なるため、これらはあくまでも公称のピーク値として捉えてください。実際の性能は別の問題です。

フォーマット AMD MI455X NVIDIA ルービン AMD MI355X NVIDIA B300
MXFP4 / NVFP4 40.26PF 35PF 10.1PF 15PF
MXFP6 / FP6 20.13PF 17.5PF 10.1PF 5PF
MXFP8 / FP8 20.13PF 17.5PF 5PF 5PF
FP16 / BF16 5.03PF 4PF 2.5PF 2.5PF
FP32 315 TF 130 TF 157.3 TF 75 TF

 

MI355X と比較すると、MI455X は MXFP4 と MXFP8 のスループットが 4 倍、FP16/BF16 と FP32 のレートが 2 倍になります。NVIDIA との比較は 2 つの部分に分かれます。B300 と比較すると、MI455X は FP4 のスループットが 2.7 倍、FP6 と FP8 のレートが 4 倍になります。Rubin は意味のあるベンチマークであり、MI455X は一貫して優位に立っています。FP4 で 15%、FP6 と FP8 で 15%、FP16/BF16 で 26% です。最も大きな差は FP32 で現れ、MI455X の 315 TF は Rubin の 130 TF の約 2.4 倍、B300 の 75 TF の 4 倍以上です。その数値はInstinctのHPC(高性能計算)の系譜に由来するものであり、マスターウェイト、高精度累積計算、科学計算ワークロードが低ビットフォーマットを超える処理を必要とするため、AI開発においても依然として重要である。

CDNA内部5

それでは、アーキテクチャをダブルクリックして、このクラス最高レベルのパフォーマンスを実際に支えているものを見ていきましょう。

XCDからSIMDへ

パッケージから階層をたどっていくと、CDNA 4 が演算ダイを非常に異なる方法で構成したため、どれだけ再構築されたかがわかります。MI355X では、各 XCD に 32 個のアクティブな演算ユニットと、Infinity Fabric に到達する前にダイのトラフィックをプールするプライベート 4MB L2 キャッシュが搭載されていました。CDNA 5 では、8 つの XCD はそのままですが、その内部の構造と用語は AMD の RDNA グラフィックス ラインから借用して再構築されています。MI455X の各 XCD は、2 つのシェーダー エンジンに分割されます。各シェーダー エンジンには、物理​​的に 17 個のワーク グループ プロセッサが搭載され、16 個が有効で、1 個は歩留まりのために予備となっています。XCD ごとの L2 は完全になくなり、演算ダイから切り離されて、メモリ セクションが戻るベース ダイの下に移動します。

重要なのは、変わらない演算処理の部分です。XCDは依然として32個のアクティブユニットを備え、GPUは合計256個で、これはMI355Xの演算ユニット数と同じです。低精度処理のスループットが世代間で4倍になったのは、実行ユニットを追加したことによるものではなく、各WGPがサイクルあたりにより多くの処理を行うようになったことによるものです。そして、今回の再設計はまさにこのWGPに重点を置いています。

WGPは、定数キャッシュを共有する4つの32レーンSIMDユニットと4つのスカラーユニットで構成されています。最大の変更点は、スレッドがWGPを通過する方法、つまりWave64からWave32への移行です。ウェーブとは、SIMDが同期して実行するスレッドの束のことです。CDNA 4はWave64を使用し、各64スレッドウェーブを4クロックサイクルにわたって16レーンSIMDに送り込んでいました。CDNA 5はWave64のサポートを完全に廃止し、Instinctアーキテクチャとしては初めてWave32をネイティブに実行します。32スレッドウェーブは、WGPの4つの32レーンSIMDユニットのそれぞれに1対1でマッピングされ、1サイクルで発行され、各SIMDがクロックごとに新しい命令を開始できるようになります。

ウェーブの幅が狭くなり、処理速度が速くなることで、マシン内での処理の流れ方が変わります。ウェーブの処理が早く完了するため、命令のレイテンシが低下します。分岐分岐のコストも、分岐の有無による処理停止が以前の64スレッドではなく最大32スレッドで済むようになったため、軽減されます。レジスタの負荷が緩和されるため、以前の半分のウェーブ数に対し、WGPあたり最大64ウェーブが常駐可能になります。これにより、スケジューラはメモリのレイテンシを隠蔽するための、より小さく独立した処理単位を多く利用できるようになります。また、Wave32では、テンソル演算用の異なるタイルサイズをハードウェアにマッピングしやすくなり、カーネル開発が簡素化されます。

Single-cycle issue is only the start of the throughput story. The SIMDs co-execute, starting new instructions while earlier multi-cycle operations drain underneath, and packed vector instructions carry 64 threads' worth of work in a single issue, details AMD's architects confirmed in the post-briefing Q&A. The vector pipeline also gains native BF16 support and a set of new data-conversion instructions for moving tensors between formats. The transcendental units double their throughput over the MI355X and add a native tanh instruction, so the softmax and activation math inside attention keeps pace with the tensor hardware around it. That path is becoming a habit: CDNA 4 doubled the transcendental rates to accelerate attention, and CDNA 5 doubles them again.

記憶階層

実行ユニットの背後には、上から下まで再構築された階層構造が存在し、それを最も明確に理解する方法は、MI355Xとのレベルごとに比較することである。

レベル MI455X(CDNA 5) MI355X(CDNA 4)
ベクトルレジスタ SIMDあたり128KB、スレッドあたり1,024、帯域幅2倍 SIMDあたり128KB、スレッドあたり256KB
WGP / CU ローカルストア 384KB(320KB LDS + 64KB ベクトルキャッシュ);帯域幅2倍 192KB(160KB LDS + 32KB L1)
命令/定数キャッシュ 64KB + WGPあたり16KB 2つのCUごとに64KBの共有 + 16KB
L2 FCD上に2×96MB、54TB/s 8 × 4MB、XCD 1枚につき1MB
メモリ側キャッシュ 消去された 256MBインフィニティキャッシュ
HBM 432GB HBM4、12 × 2,048ビットスタック、23.3TB/秒 288GB HBM3E、8 × 1,024ビットスタック、8TB/秒

 

キャッシュ行は、アーキテクチャの形状が変化した部分です。CDNA 4 は 3 層設計を採用していました。各 XCD のプライベート 4MB L2 は、Infinity Fabric に到達する前にそのダイのトラフィックを統合し、I/O ダイ内の共有 256MB Infinity Cache は HBM コントローラの前にメモリ側に配置されていました。CDNA 5 では、これらの両方の層を削除し、ファブリックとキャッシュ ダイごとに 1 つずつ、それぞれ 96 個の 1 メガバイト ブロックで構成された 2 つの独立した 96MB L2 キャッシュに置き換えています。レイアウトは垂直です。4 つの XCD、つまり 8 つのシェーダー エンジンが、12 個の HBM4 サイトのうち 6 つも保持する各 FCD の上にハイブリッド ボンディングされ、2 つの FCD はパッケージの中央にある中央の Infinity Fabric で接続され、I/O ダイが両端を覆っています。どちらの L2 も GPU メモリ内の任意のアドレスを保持でき、Infinity Fabric がペアの一貫性を維持します。 AMDが挙げている理由は帯域幅です。これらのキャッシュのうち1つだけでも、MI355XのInfinity Cache全体の合計帯域幅の1.5倍を実現し、2つ組み合わせると3倍になります。しかも、これらのトラフィックは、従来のレイアウトを制限していたダイ間分割を一切通過する必要がありません。

キャッシュには新たな役割も加わりました。これまでファブリック内で実行されていたデバイススコープのアトミック操作は、L2内でより高速に実行されるようになり、システムスコープのアトミック操作は従来通りInfinity Fabric内に留まります。さらに、新しいブロードキャストアービタが加わり、同じマトリックス上で連携するすべてのWGPにテンソルタイルをマルチキャストします。そのため、一度フェッチした重みですべてのWGPにサービスを提供でき、実効読み取り帯域幅が最大4倍に向上します。

上記のレベルはそれに合わせてスケーリングされます。WGP ごとのローカル ストレージは 384KB に倍増し、320KB の LDS と 64KB のベクトルデータ キャッシュに分割され、読み取り帯域幅は 2 倍になります。これにより、FlashAttention はクエリ、キー、値、部分的な削減をチップ上に保持し、完全なアテンション マトリックスを書き出す必要がなくなります。また、ルーティング ステートとアキュムレータを常駐させるために、融合 MoE カーネルもサポートします。ベクトル レジスタ ファイルは 128KB の SIMD ごとの容量を維持しますが、Wave32 用に再編成されます。これにより、ウェーブの数が 2 倍になり、1 つのスレッドが 256 個ではなく 1,024 個のレジスタにアドレス指定できるようになり、レジスタ帯域幅が 2 倍になり、より広い SIMD とその共実行ユニットにデータを供給します。

スカラー側もそれに合わせて再構築され、1ウェーブあたり128個のスカラーレジスタと1WGPあたり32KBの容量が確保されています。ベース部分では、HBM4は8つの1,024ビットスタックから12の2,048ビットスタックへと構成を変更し、容量を50%増加させて432GB、帯域幅を2.9倍に拡大して192チャネルのインターフェース全体で23.3TB/sを実現しています。

それらすべてを支えるのは、WGP ごとに 1 つの新しい Tensor Data Mover です。これは、最大 5 次元のテンソル タイリング スキームを理解し、中間レジスタ ステージングなしで DRAM とローカル ストア間でタイルを非同期にストリーミングします。転送は、スカラー レジスタからロードされた記述子によって記述され、セキュリティのためにハードウェアで境界チェックされます。マルチキャスト ロードがサポートされているため、SIMD ユニットはコピーを待って停止したり、ステージング レジスタをバーンしたりすることはありません。これは、最近の NVIDIA パーツのテンソル メモリ アクセラレータに対する CDNA 5 の回答です。一連の利用機能がマシンのフロントエンドを完成させます。ワークグループ クラスタは、データ共有ワークロードの配置と並行性をカーネルに明示的に制御します。分割および名前付きバリアにより、プロデューサーは完了を通知して、コンシューマーの応答を待たずに先に進むことができます。階層の各レベルのプリフェッチャは、データを消費ポイントに向けてステージングします。再設計されたコマンド フロントエンドは、推論を支配する短いカーネルのカーネル起動とディスパッチのレイテンシを削減します。

DMAシステムも同じ理念に基づいて再構築されました。ソフトウェアはDMAフロントエンドに対して転送をスケジュールし、UALoEリンクの横に配置された物理的に認識可能なバックエンドは、各ワークアイテムを分割し、利用可能なすべてのリンクに負荷分散を行い、チップを介して遠隔のエンジンにデータを転送するのではなく、メモリからバッファを直接引き出します。また、バックエンドはスケールアップネットワークからの輻輳によるバックプレッシャーに反応し、負荷の高いパスを回避するため、通信ライブラリは基盤となるトポロジーを理解することなく、バランスの取れたファブリックトラフィックを実現できます。

GPUの分割:NPSとSR-IOV

2つのL2物理レイアウトは、GPUの分割方法において2つ目の利点をもたらします。NPS1では、チップ全体が1つのNUMAドメインです。アドレスは12個のHBMスタックと両方の半分にまたがってインターリーブされ、均一な帯域幅、移植の容易さ、均等に分散されたアクセスパターンを実現します。NPS2では、GPUが2つのNUMAドメインに分割され、それぞれが6つのHBMスタック、1つのファブリックとキャッシュダイ、およびその上にスタックされたXCDを所有します。すべてのメモリ参照はそれぞれの半分内に留まり、各ドメインは実質的に96MBのプライベートL2を取得します。これは物理的なパスを短縮するだけではありません。半分間でキャッシュラインが共有されないため、2つのL2間のInfinity Fabricコヒーレンシトラフィックはほぼなくなり、AMDは、その結果としてNUMA対応アプリケーションのレイテンシが低減され、効率が向上すると述べています。 CDNA 4も同様のトレードオフを提供し、NPS2はトラフィックを1つのI/Oダイ内に収めていましたが、CDNA 5では、メモリ側バッファの一部ではなく、L2キャッシュ全体がローカライズされるため、そのトレードオフがより明確になりました。

計算パーティショニングスタックを最上位に配置します。8つのXCDにより、GPUは1つ、2つ、4つ、または8つの空間パーティションとして起動し、432GBのHBMを432、216、108、または54GBの均等なスライスに分割し、それぞれ8つから1つのXCDでバックアップします。パーティションをNUMAドメインとペアリングすることで、ランタイムは作業と配置割り当てを空間的にディスパッチし、ジョブはメモリに最も近いXCDに配置されます。次に、SR-IOVはパーティションを最大8つのハードウェア分離された仮想マシンに仮想化し、分離は実行中のNUMAモードに関係なく、メモリシステム自体で強制されます。MI355Xは1から8までの同じパーティションオプションを提供していたため、粒度は新しいものではありません。CDNA 5が下位に追加するのはプライベートL2動作であり、上位にはHeliosセクションで説明するラックレベルの仮想Podがあります。

AMD ヘリオス

MI455X単体でも高速だが​​、今回の製品発表により、AMDはラック規模および大規模スケールアップ分野の仲間入りを果たした。

AMD MI455X Heliosラック

物理的には、Heliosは従来の19インチおよび21インチラックを廃止し、AMDがOCPでMetaと共同開発したOpen Rack Wideフォーマットを採用しています。これは、幅1.2メートル、奥行き1.3メートル、垂直方向のスペースが44 OUのキャビネットです。内部には、72個のGPUが9個の演算トレイからなる2つのバンクに配置され、その間に6個のスイッチトレイが積み重ねられています。GPUとスイッチ間のリンクはすべて銅線で、背面の4つのブラインドメイトケーブルカートリッジを通って配線されているため、ケーブルを手で抜くことなくトレイを引き出してメンテナンスできます。

ラック全体の消費電力はワークロードに応じて225~245kWで、50V液冷バスバーを介して供給されます。背面マニホールドからは、設備ループから毎分約385リットルの冷却液が送られます。トレイ自体も本格的なハードウェアで、それぞれ約170ポンドの重さがあり、スイッチトレイの1,728個の差動ペア接続を装着するには約690ポンドの挿入力が必要です。そのため、カムハンドルはトレイのほぼ全幅にわたって配置されています。

構成要素

コンピュートトレイ

リファレンスデザインでは、各コンピューティングトレイは、4つのMI455Xモジュールと、最大5GHzまでブーストする高周波96コアのVenice SP7 CPUを中心に構築された自己完結型ノードです。16個のDIMMソケットには、16個の64GB DDR5 ECC RDIMMとして1TBのDRAMが搭載され、CPUには5つのE1.S NVMeスロットが接続されています。このプラットフォームは、さらに高い性能を発揮します。Veniceの16個のメモリチャネルは最大1.6TB/sの帯域幅をサポートし、現在DDR5レンジの最高容量である256GB RDIMMを使用すると、1チャネルあたり1つのDIMMを搭載した16チャネルソケットで最大4TBの容量を実現できます。

NVIDIA の足跡をたどって、CPU は、GPU の背後に単なる PCIe ホストとして配置されるのではなく、Infinity Fabric を介してコヒーレント メモリ ドメインに参加します。AMD は、1:4 の CPU 対 GPU 比率は意図的なものであると主張しています。コア自体が競合製品を凌駕しており、AMD の同等比較では、5GHz の Zen 6 コアは、コアあたりのパフォーマンスで NVIDIA の Vera を約 20% 上回っています。また、ソケットは標準の SP7 であるため、より多くのホスト コンピューティングを必要とする顧客は、256 コアのフラッグシップまで、任意の Venice SKU を取り付けることができます。また、1 つの Venice ソケットは、LPDDR ホスト設計よりもはるかに多くの DDR5 容量を備えており、そのメモリ帯域幅は、Infinity Fabric リンクを介して 4 つの GPU すべてに飽和します。

そのInfinity Fabricリンクは詳しく見てみる価値があります。Chips and CheeseのGeorge Cozma氏とVeniceとMI455Xの接続について話したところ、コヒーレントリンクはCPUのPCIeレーン上を流れると示唆されました。これはEPYCが長年PCIe PHY上でxGMIソケットリンクを伝送してきたのと同じ方法です。数値もその理論を裏付けています。PCIe Gen 6はレーンあたり64 Gb/sで信号を送信し、その速度のx16リンクは双方向で128GB/sとなり、これはAMDがGPUあたりで公表している双方向256GB/sという数値と完全に一致します。CDNA 5のホワイトペーパーのブロック図でも、ホストのInfinity Fabricインターフェースはレーンあたり64 Gb/sとラベル付けされており、これはまさにGen 6の信号レートです。この理論は、Venice SKUがドロップインする理由も説明しています。4つのGPUがCPUの128 Gen 6レーンのうち64レーンを消費し、残りはDPU、ストレージ、その他のシステムニーズのために空いています。

各コンピューティングトレイには3つの独立したネットワークが接続されており、それぞれ異なるジョブに対応しています。最も一般的なのはフロントエンドで、単一のPensando Salina 400G DPUがノードを通常のデータセンターネットワークに接続します。これについては後ほど詳しく説明します。

2つ目はスケールアウト、つまりラックをクラスタに接続するネットワークで、これを理解する最も簡単な方法は、countSerDess を数えることです。MI455X のスケールアウトは、レーンあたり 64 Gb/s の PCIe Gen 6 または 128 Gb/s の UALink128 のいずれかを使用できます。Vulcano 800 NIC は、800 GbE ポートにデータを供給するために、双方向で約 128 Gb/s の接続が必要です。Gen 6 の速度では、NIC ごとにフル x16 リンクが必要になるため、GPU は 2 つの NIC を搭載します。UALink128 の信号レートが 2 倍になると、x8 リンクで SerDes の半分で同じ処理ができるため、GPU は 3 つの NIC を搭載します。これが Helios が出荷する構成です。いずれにしても、UALink128 ホップは GPU と NIC 間の専用線に過ぎません。ネットワーク自体は Vulcano から始まります。各NICは、OpenAIがAMDや他のパートナーと共同開発したマルチパスプロトコルMRCを含むUEC準拠トランスポートを実行する800GbEポートを駆動します。物理的には、NICはトレイごとに2枚のカスタムボード上に搭載され、それぞれ4個または6個のVulcano ASICを搭載しており、GPUあたり2個および3個の構成に対応しています。フル構成では、トレイあたり12個のNICと、GPUあたり2,400Gb/sのスケールアウト帯域幅が実現します。また、NICはGPUに接続されており、経路にCPUがないため、ラック間トラフィックはホストリンクを経由しません。

3つ目はスケールアップ機能で、Heliosを真のラック規模システムたらしめる基盤となる部分です。各GPUは36個のUALoEリンクを備え、ESUN Ethernet上でUALinkのメモリセマンティクスを実行します。各リンクは400Gb/sの帯域幅を持ち、GPUあたり最大3.6TB/sの双方向帯域幅を実現します。これらのリンクはトレイの背面からスイッチトレイに向かって伸び、72個のGPUを1つの共有メモリポッドに統合するロード/ストアトラフィックを伝送します。

スイッチトレイ

次にスイッチトレイを見ていきましょう。ここで最も印象的なのは、そのシリコンがごく普通のものであることです。6つのトレイそれぞれに、Broadcom Tomahawk 6 ASICが2個搭載されています。これは、ハイパースケーラーがリーフスパインネットワークに導入しているものと同じ、汎用イーサネットスイッチチップで、それぞれ512レーンの200Gに対応しています。

各GPUは、12個のスイッチそれぞれに3つのUALoEリンク(各UALoEリンクは2x 200Gレーン)を送信し、各演算トレイから背面ケーブルカートリッジを通して144本のリンクが出ています。したがって、各Tomahawkは400Gb/sで216本のリンクを終端し、双方向帯域幅21.6TB/sを転送します。一方、各GPUは36本のリンク(72x 200Gレーン)と3.6TB/sの帯域幅を維持します。スイッチはこの処理を実現するために特別なものを必要としません。UALoEのカプセル化は単純なL2プロトコルであり、転送はイーサネットシリコンが20年間提供してきた静的MACプログラミングに依存し、フロー制御は標準的な優先度フロー制御です。

単一階層構成では、データセンターの輻輳問題が一切発生しません。多層インキャストは不要で、すべてのGPUが他のすべてのGPUから固定レイテンシのホップ1つ分だけの距離に配置されます。ダイレクトメッシュと比較して、スイッチド方式では、ワークロードが必要とする時に単一のフローがパス全体の帯域幅を占有でき、すべてのGPUが等距離に保たれます。そのため、スケジューリングにおいて局所性を考慮する必要がなく、すべてのリンクに同じ障害保護が提供されます。

フォールトトレランス

Heliosはハードウェア障害を設計上のインプットとして捉えています。この規模では、常に何らかの障害が発生します。ケーブルの不具合、パケットの損失、ファームウェアアップデートのためにスイッチが取り外されたこと、コンピューティングトレイが完全に故障したことなどです。ファブリックは、これらの事象によってジョブが中断されないように設計されています。パケットの損失は再送信によって回復され、リンク、ケーブル、またはスイッチに障害が発生した場合、トラフィックは短時間の停止後に自動的に迂回され、ワー​​クロードはチェックポイントから再開するのではなく、残りの帯域幅で継続されます。

12プレーン構成が劣化を緩やかにする要因であり、3ウェイ・ストライピングがステップサイズを決定します。GPUがスイッチに接続する3つのリンクのうち1つが失われても、そのプレーンは帯域幅の3分の2を維持します。Tomahawk全体が失われても、各GPUはスケールアップ帯域幅の1/12を失いますが、オールツーオールは他の11プレーンで動作し続けます。12個のスイッチのうち2個、つまりスイッチトレイ全体が失われても、各GPUは帯域幅の6分の1を失うだけで、接続は途切れません。これは、どのGPUも他のGPUに接続するために単一のスイッチに依存していないためです。比較のために、Vera Rubin NVL72では、各GPUが9つのトレイにある36個のNVSwitch 6 ASICに分散されているため、スイッチトレイの障害による損失は9分の1程度になります。NVIDIAは、3倍の数のスイッチASICを使用することで、より小さな劣化ステップを実現しています。AMDは、12個の高基数スイッチを使用することで、そもそも故障する可能性のあるコンポーネント、ケーブル、コネクタの数が少なくなると反論しています。数週間単位のトレーニング期間において、ファブリック帯域幅の6分の1を失うことと、仕事を失うことの差は、ラック全体の経済性に影響を及ぼす。

バーチャルポッド

障害発生時にファブリックを分割するのと同じ仕組みで、意図的にファブリックを分割することもできます。AMD はこの構造を仮想ポッド (vPod) と呼び、単位は計算ノードです。ラックの 18 個の 4 GPU ノードの任意の組み合わせを、独立したポッドに囲い込むことができます。小規模なテナントの場合は 1 ノード、大規模なトレーニング ジョブの場合はラックの大部分を囲むことができます。この分離は、スケジューラが決定するレベルよりも下のファブリック ハードウェアで強制されます。vPod はテナントに紐付けられており、他のポッドはそのメモリやトラフィックにアクセスできません。また、顧客所有のクラスタ キーをサポートする UALoE リンク上のライン レート AES-256-GCM 暗号化により、あるテナントのテンソルは他のテナントには見えません。複数の GPU にまたがるゲスト VM は、ホスト OS を信頼する必要なく、セキュリティ ドメインが透過的に拡張されます。 NVIDIAは、NVLinkドメインをパーティションに分割し、IMEXサービスがどのノードがメモリをエクスポートおよびインポートできるかを仲介することで、NVL72ラック上で同様の問題を解決しています。vPodはUALoEの世界における同等の機能であるため、GB200またはGB300フリートから移行してきたオペレーターは、この概念に馴染みがあるでしょう。

コンピューティングトレイがクラッシュした場合、影響範囲はそのvPodで止まります。つまり、そのワークロードはチェックポイントから再開され、他のすべてのPodは影響を受けずに実行され、テナント境界が障害境界としても機能します。パーティショニングの仕組みは階層構造にも及び、1台のMI455Xを最大8台のSR-IOV仮想マシンに分割できるため、同じラックで72個のGPUすべてを1つのPodとして実行する1人の顧客、あるいは最大576個のGPUスライステナントに対応でき、その階層構造のあらゆるレベルでハードウェアの分離が実現されます。

管理平面

これらすべてを実行するのは、ハードウェアと同じオープン性の理念に基づいた専用のソフトウェアスタックです。AMD Fabric Manager (AFM) は制御プレーンであり、72 個の GPU ファブリックを検出してゼロタッチ起動でプロビジョニングします。ラックの電源を入れるだけで 72 個の GPU すべてが起動し、ケーブル カートリッジの配線が組み立てミスをしていないか検証し、ラックを vPod に分割し、前述の再ルーティングと復旧を調整します。専用の管理トレイはありません。AFM は、スイッチ トレイ自身の管理プロセッサ上で、6 つのトレイに分散された 3 つの冗長インスタンスとして実行され、それらの間に分散データベースが存在するため、スイッチ トレイが故障しても制御プレーンには影響がなく、北向きの REST API によって、多数のラックを管理するクラスタコントローラにファブリックが公開されます。

内部的には、AFM はクラウドネイティブの世界からその基盤を借用しており、各トレイにエージェントを備えた標準的な Kubernetes スタイルのコントローラー上に構築されています。また、UALink が各 GPU のアドレス指定に使用するアクセラレーター ID の割り当てに至るまで、ユーザーが見る必要のないファブリックの詳細を処理します。さらに、ラックの可観測性レイヤーでもあります。単一のダッシュボードで、GPU とファブリックの使用率、リンクの状態、および障害イベントを追跡します。何かが故障すると、進行中の修復が表示され、オペレーターが独自のツールに組み込むことができるアラートが発せられます。上のスクリーンショットは、AMD のラボで Helios クラスターを監視している AFM です。管理はインバンドまたはアウトオブバンドで動作するため、診断と構成が実行中のワークロードを妨げることはありません。AFM の下のスイッチは、オープンソースの NOS である SONiC をベースにしたネットワーク OS を実行しており、AMD は UALoE の追加機能がアップストリームに取り込まれ、標準の gNMI API を通じて公開されると述べています。ラックの上部には、ノードとスイッチのライフサイクル、電源、漏電検知を管理するラックインフラストラクチャマネージャがあり、クラスタコントローラはスケジューリングのためにHeliosをKubernetesとSlurmに接続します。

Helios vs. NVIDIA Vera Rubin NVL72

それでは、Heliosが実際に市場で競合することになるNVIDIAの製品、Vera Rubin NVL72と、この製品を比較してみましょう。

ラックメートル法 AMD ヘリオス ヴェラ・ルビン NVL72
GPU 72 MI455X 72 ルービン
CPU 18ヴェネツィア 36 ベラ
HBM容量 31TB 20.7TB
HBM帯域幅 1.7PB/秒 1.58PB/秒
GPUごとのスケールアップ 3.6TB /秒 3.6TB /秒
ラックのスケールアップ 260TB /秒 260TB /秒
GPUごとのスケールアウト 2,400 Gb / s 1,600 Gb / s
スケールアップスイッチ 12 トマホーク 6 36 NVSwitch 6
ラック形式 ダブルワイドORW シングルワイドMGX

紙面上では、AMDが優位に立っている。HBMが50%増加し、スイッチASICの数が3分の1でGPUあたり3.6TB/sのスケールアップが可能で、GPUあたりのスケールアウト帯域幅も50%増加している。AMDの社内テストでは、これらのスペックを性能として主張しており、Kimi K2 ThinkingではGPUあたり1秒あたり10~15%多くのトークン、1ドルあたり最大30%多くのトークンを獲得している。これらはAMDがNVIDIAの公表値と比較した数値であり、独立した測定ではないが、AMDが評価される基準となる数値である。より興味深い違いは、それぞれの設計がGPUを外部世界に接続する方法にある。

まずスケールアウトから見ていきましょう。MI455XのNICはGPUに直接接続されています。SemiAnalysisによると、 RubinのNICはそうではありません。SemiAnalysisによれば、このパッケージには両方のConnectX-9 NICに給電するためのPCIeがないため、代わりにVera CPUに接続され、GPUトラフィックはRubinからNVLink-C2C、Vera、PCIe、ConnectX-9へと迂回します。この迂回によりレイテンシが1ホップ増加し、C2Cリンクが二重の負荷にさらされます。コンピューティング、ホストトラフィック、ネットワークが同時にフル稼働すると、VeraのC2C帯域幅の一部がNICペイロードの伝送に使われ、GPUが実際に認識するホスト帯域幅は、公称値の1.8TB/sを下回ります。

帯域幅の計算結果もそれを裏付けています。MI455Xはそれぞれ2,400 Gbit/sのスケールアウトを実現し、Rubinの1,600 Gbit/sを上回ります。そのため、HeliosはFLOPあたりのネットワーク処理能力が向上します。AMDが行った8,000個のGPUによるトレーニング実行のシミュレーションでは、3つ目のNICによってジョブ完了速度が約13%向上することが示されています。

ルビン氏はストレージについて反論しているが、その理由はやはりNICの配置にある。ConnectX-9にはPCIeスイッチが内蔵されているため、NVMeをNICに直接接続でき、GPUはCPUに触れることなくGPUDirectストレージ経由でデータを取得できる。MI455Xには同等の機能はなく、ストレージはVeniceホストに接続されているため、GPUDirect形式のデータはすべてCPUを経由してInfinity Fabricリンク経由で戻ってくる必要がある。AMDはネットワークパスを最適化したが、その分ストレージパスにコストがかかった。NVIDIAは逆のトレードオフを行った。どちらがより重要かは、ワークロードがGPU間でアクティベーションを移動することに依存するのか、ディスクからデータをストリーミングすることに依存するのかによって決まる。

顧客が変更できること

要するに、上記はすべてAMDのリファレンスデザインの説明であり、いくつかの数値は顧客が上回ることができる最低値です。最も分かりやすい例はホストCPUです。Rubin氏のVeraは固定構成で提供されますが、Heliosトレイに搭載されるVeniceは標準的なソケット式のSP7プロセッサであり、AMDはVeniceのどのSKUでもHelios固有のカスタマイズなしでそのまま搭載できることを確認しています。リファレンストレイでは、シングルスレッド速度でGPUへの処理能力が維持されるため、96コア5GHzのプロセッサが使用されています。しかし、顧客が256コアのフラッグシップモデルや、キャッシュを大量に消費する前処理用に1,152MBのスタック型L3キャッシュを搭載したVenice-Xで独自のバージョンを構成することを妨げるものはありません。

メモリとネットワークは、ソケットとスロットの同じロジックに従います。リファレンスの 1TB DRAM は、控えめな 64GB RDIMM 16 枚で構成されます。より高密度の DIMM を使用すると、トレイは 4TB になり、MRDIMM-12800 を使用すると Venice の 1.6TB/s のフルスピードが解放されます。ネットワーク側では、ビルドは、通常の PCIe Gen 6 を介して、GPU あたり 3 つの NIC から 2 つの NIC に減らすことができます。各 Vulcano ポートは、Tomahawk 5 または Tomahawk 6 ファブリックに対して 1x800G、2x400G、4x200G、または 8x100G として動作し、P4 パイプラインは、トランスポート、RoCEv2、MRC、または独自の何かにオペレーターの判断を委ねます。スイッチ NOS はオープンソースの SONiC であり、AFM は北向き API を介してファブリック全体を公開するため、管理プレーンも交換可能です。

電力予算もソケットの形状に左右されます。NVIDIAのスーパーチップは共通の筐体を採用しており、Veraは450Wのチップで、電力供給が制限されています。また、最近の世代では、負荷がかかるとGPUに電力が供給されます。AMDは、リファレンスデザインでホスト電力に制限をかけるのか、それともシフトさせるのかについては明言していませんが、AMDの設計では、その問題は顧客次第であり、電力消費量を増やしても電力の変動がないシステムをカスタマイズできます。

ホストリンクのPCIe基盤は、コンピューティングトレイのセクションで詳しく説明されており、最後の可能性として、あくまでも推測の域を出ないものの、新たな可能性が開かれています。Veniceは2P構成をサポートしており、一部のAIホストプラットフォームでは、ソケット間のxGMI幅をI/Oと交換することで、最大160レーンのPCIeレーンを使用可能な2P構成を実現できます。顧客は、NVIDIAの1:2のCPU対GPU比率に合わせるために2ソケット構成のトレイを構築したり、xGMIリンクを再調整してCPU対GPUの実効帯域幅を向上させることも可能でしょう。しかし、現在そのような構成を構築している企業は存在せず、また、これらのいずれも1.8TB/sのNVLink-C2Cとの性能差を埋めるものではありません。重要なのは、誰が決定権を持っているかということです。Heliosでは、ホスト、メモリ、電力、そして場合によってはトポロジーまでもが顧客の決定事項ですが、NVIDIAのスーパーチップは顧客に決定権を一切与えていません。

サリナDPU

さて、先ほど後回しにしたフロントエンドネットワークに戻りましょう。AMDの第3世代Pensando DPUであるSalinaは、完全にP4プログラマブルなデータパスを備えた400Gカードです。つまり、新しいカプセル化、テレメトリフック、またはトランスポートはファームウェアアップデートであり、トラフィックをドロップすることなくライブで適用できます。出荷されるサービスは、フロントエンドのチェックリストを既に網羅しています。VXLANまたはNVGREを使用したSDN、数百万のルールに拡張可能なステートフルファイアウォール、ラインレートIPsec、PSP、DTLS、またはカスタム暗号化、NAT、およびロードバランシングです。また、ラック内で最も実戦でテストされたシリコンでもあります。Pensando DPUは2019年からハイパースケーラーで稼働しており、Salinaは現在、Microsoft、Oracle、およびIBMの導入でフロントエンドとして使用されています。Oracleはこの製品ラインによってSDNが5倍向上したと評価しており、あるハイパースケーラーはI/Oをオフロードすることでサーバーあたり22個のCPUコアを解放しました。

ストレージは第二の課題です。SalinaはNVMe over Fabricsデバイスをホストに公開し、TCPまたはRDMAを介してリモートSSDプールを仮想化し、カード上で暗号化、ダイジェスト、圧縮を実行します。Heliosでは、エージェント時代のトリックが追加されています。コンテキストメモリエンジンがエミュレートされたKVデバイスを提供するため、オーバーフローしたKVキャッシュはCPU DRAM、ローカルSSD、またはリモートストレージに流出し、再計算される代わりにラインレートでHBMにストリームバックされます。Rubinの比較で指摘されているように、MI455XにはGPUDirect Storageがありません。このKVオフロードは、サービス提供側が最も重視するトラフィックに対するAMDの部分的な回答です。

我々の懸念もまた、そこにあります。帯域幅の差は明白です。Salinaは400Gカードですが、Vera Rubinラックに出荷されるBlueField-4は、64コアのGrace CPUとConnectX-9を同梱することで、帯域幅を800Gに倍増させます。ソフトウェアの差は議論の余地がありますが、確かに存在します。NVIDIAのDOCAは、開発者にコンテナ化された事前構築済みのサービスを提供し、通常のCとC++でプログラミングできます。一方、P4はほとんどのチームが触れたことのない特殊なデータプレーン言語です。Salinaは主要なサービスが完成して出荷されるため、「DOCAのカタログ対ベアP4」という比較ではありません。また、Salinaを採用するハイパースケーラーは、P4によってMRCのような新しいプロトコルを他社のシリコンサイクルよりも早くファームウェアに組み込むことができるという理由もあって、Salinaを選択しました。本当の違いは、プログラマビリティが誰に役立つかということです。Salinaの柔軟性は、AMDとP4に精通したハイパースケールチームにとっての武器です。DOCAは、一般的なエンタープライズ開発者が利用できるツールキットです。幅広い市場にとって、NVIDIAのソフトウェア導入は容易であり、AMDもそれを認識しています。

ROCm.AI

ソフトウェアの話になると、AMDはスタック自体に関する大きな発表を控えていました。8月に登場予定のROCm.AIは、AMDがGPUプラットフォームをゼロからエージェント化しようとする試みです。AIスキルは、開発者が既に利用しているコーディングエージェントであるClaude、Codex、Cursor、GeminiにROCmを組み込むことで、Instinct上でのインストール、サービス提供、デバッグを平易な英語で行えるようにします。Hyperloomは、より大胆な機能です。これは、人間が介入することなくワークロードをプロファイリングし、サービス構成を調整し、GPUカーネルを書き換え、オペレーターが寝ている間に結果を検証するオプティマイザです。AMDによると、現在約14,000のモデルを継続的に最適化しており、ライブデモではMiniMax M3から38%高いスループットを引き出すことに成功しました。エージェントの基盤として、FlyDSL は Python にアセンブリに近い制御機能をもたらし、ROCm は 6 週間の固定リリースサイクルに移行し、AMD は ROCm.AI が同一のハードウェア上で ROCm 7 と比較して平均 3.3 倍の推論と 2.4 倍のトレーニングのゲインを実現したと主張しています。ROCm 7 は既に大きな改善を示していましたが、AMD は今度は AI を活用してそのペースを加速させようとしています。

ソフトウェアセッションで最も重要なスライドは、おそらくハードウェアに関するものだった。AMDは、そこに示されたすべての数値が測定されたものであると強調し、その裏には、MI455XシリコンがROCmの下で現在稼働しており、高速であるというメッセージが込められていた。数値は、FP8 MLAデコードで20TB/s、FP4演算で20 PFLOPS、スケールアップ帯域幅で3.2TB/s、スケールアウトで190GB/sである。質疑応答で、AMDは、FP4の結果は最大達成可能行列乗算FLOPS(MAMF)測定であり、この種のベンチマークでは標準的な方法で、デバイスを最も有利にする行列形状で実行されたものであることを認めた。また、大胆な開示でもある。AMDは、MI455Xが40.26 PFLOPSのピークMXFP4定格の約50%を維持していることを公然と認めている。これは、ほとんどのベンダーが隠蔽する数値である。

AMDはこれを、市場に出回っているアクセラレータの中で最も高い演算性能を持つと謳っていますが、その主張には疑問が残ります。AMDのFP4はOCP MXFP4、NVIDIAのFP4はNVFP4です。両者は異なる手法を用いており、NVFP4は16要素ごとに分数FP8スケールを適用し、さらにテンソルレベルのスケールを上乗せしています。一方、ベースラインのMXFP4は32要素ごとに粗い2のべき乗スケールを使用しているため、NVFP4のFLOPはMXFP4のFLOPよりも多くの処理を実行します。CDNA 5もMXFP4に分数スケーリングを適用できますが、AMDは測定に使用した手法を明らかにしていません。Rubin MAMFの実行とMI455X MAMFの実行では同じ演算を測定しているわけではないため、ベンダー間のFP4の比較はアプリケーションレベル、つまり精度が一致した状態での1秒あたりのトークン数でしか決着がつきません。測定値は予測値を上回っているが、これらの数値はAMD自身の前世代と比較すると最も正直に評価できる。前世代では3倍から4倍の性能向上は明白である。

AMDにも有利な点がある。これらは最新のシリコンを用いたROCm.AIの初期結果であり、むしろ手作業で調整された実稼働環境での性能を過小評価していると言えるだろう。真の評価は、これらのラックがハイパースケーラーの現場に導入された時に下されるだろう。

閉じた思考

HeliosはAMDがこれまで出荷した中で最も完成度の高いシステムであり、チップ単位ではなくラック単位でNVIDIAと真っ向から対決する初のシステムです。今日のAI処理能力を左右する部分では、AMDが優位に立っています。GPUあたりのHBM容量が50%増加、スケールアップ性能はRubinと同等、スケールアウト帯域幅が50%増加、そしてAMD独自のモデルによれば、1ドルあたりのトークン数が最大30%増加しています。重要なのは、どのようにしてこの性能を実現したかです。商用版のTomahawkスイッチ、数値フォーマットから筐体に至るまでのオープンスタンダード、そして最終的な構成を顧客に委ねるソケット式ホストを採用しています。NVIDIAはC2Cホストリンク、DPU、ソフトウェアオンランプにおいて真の優位性を維持していますが、初めて、ハードウェア全体の性能という点ではAMDが優位に立っています。

そして、購入者も同意している。AMDによると、OpenAI、Meta、Anthropic、Microsoft、OracleなどがHeliosを採用しており、ラックは現在生産中であるとAMDは強調している。NVIDIAに倣い、ロードマップは年間サイクルで、CDNA 6ベースのMI500シリーズは次世代HBMと銅線および光インターコネクトを搭載して2027年に登場し、MI600シリーズはすでに2028年に向けて開発中である。

残るはソフトウェアだが、ここ数年で初めて、AMD GPU のストーリーをその但し書きで終わらせることはない。ROCm 7 は実際のギャップを埋め、ROCm.AI は測定されたゲインを伴って 8 月に登場し、リリースサイクルは 6 週間に固定された。誰が購入するかも重要だ。これらの契約を結んでいる研究所やハイパースケーラーは AMD と共同で設計し、発生したあらゆる問題を解決するために十分なエンジニアを雇用している。ターンキー スタックを必要とするエンタープライズは別の話で、その市場は今のところ NVIDIA のままだ。しかし Helios はハイパースケーラーや AI 研究所向けに構築されており、彼らにとってはハードウェアは準備でき、ソフトウェアはそれに追いつき、ラックは出荷されている。AMD はかつてないほど強い立場にある。

StorageReview と連携する

ニュースレター| YouTube | ポッドキャスト(iTunes / Spotify) | Instagram | Twitter | TikTok | RSSフィード

ディビヤンシュ・ジェイン

機械学習エンジニア、ホームラボ愛好家、そしてテクノロジー愛好家。StorageReviewでは、AIと新興ワークロードのテストを主導し、洞察とパフォーマンス分析を提供しています。