NVIDIAは、同社のコパッケージ型光(CPO)イーサネットスイッチプラットフォームであるSpectrum-X Ethernet Photonicsを本格的な量産体制に移行しました。同社は、レーザー数を4分の1に削減、消費電力を5分の1に低減、平均故障間隔を10倍に延長したと発表し、サプライチェーンの各段階でスイッチを製造している5つの製造パートナーの名前を明らかにしました。このマイルストーンは、Spectrum-X Ethernet Photonicsがネットワーク接続を前提として設計されたVera Rubinコンピューティングプラットフォームが、今秋の量産出荷に向けて動き出した時期と重なります。
一体型光スイッチの内部
従来のスイッチは、それぞれ独自のレーザーを搭載し、スイッチの前面パネルに差し込むプラグイン式の光トランシーバー(個別のモジュール)に依存しています。一方、Spectrum-X Ethernet Photonicsは、200Gb/s SerDesと一体化した光モジュールをベースに、スイッチングシリコンのすぐ隣に光エンジンを統合しています。プラグイン層をなくすことでレーザーの数を4分の1に削減でき、レーザーの数が少なくなれば、数十万ものリンクにまたがるファブリックにおいて故障する可能性のある個別のコンポーネントも少なくなります。
これらの障害点があるため、ほとんどのオペレーターにとって信頼性の数値は電力の数値よりも重要になります。NVIDIA の 10 倍高い平均インシデント間隔は、光パス内の何かがリンクをダウンさせる頻度に関する主張であり、生のスループットに関するものではありません。ネットワーク層の熱的および電気的フットプリントを削減すると、アクセラレータ コンピューティングのためにデータ センターのエンベロープ内の電力ヘッドルームも解放されます。これは、NVIDIA の800 VDC 電源アーキテクチャを推進する懸念事項でもあります。NVIDIA が最初にプラットフォームの詳細を発表したとき、従来のトランシーバを使用するネットワークに対する同じ利点を、5 倍優れた電力効率、5 倍長い AI 稼働時間、および 1.3 倍速い展開時間として位置付けました。
CPOサプライチェーン、段階ごとに命名
さらに異例なのは、NVIDIAが段階ごとに詳細を明らかにした製造チェーンそのものだ。TSMCはシリコンフォトニクスの製造を担当し、SPILはチップスケールのパッケージングとテストを行う。Lumentumはレーザーチップを製造し、TFC Communicationはレーザーモジュールのサブアセンブリを構築する。Foxconnは最終的なスイッチシステムの組み立てを行う。コパッケージングされた光学部品は、長年にわたりデモンストレーションでは見栄えが良かったものの、量産化には困難が伴う技術であったため、5社のベンダーからなる具体的な製造チェーンが稼働していることは、成熟度を示す確かな証拠と言える。
CoreWeave、Lambda、Oracle Cloud Infrastructure、Microsoft Azure、IBM Cloud、Nebiusなどのクラウドプロバイダーは、CPOファブリックを統合する早期導入企業に含まれています。
ヴェラ・ルービン著『ネットワーク化されるプラットフォーム』
このスイッチは、NVIDIAが5月下旬のGTC台北で発表したVera Rubinへの給電用であり、生産出荷は今秋開始予定である。NVIDIA MGXラックスケール設計の第3世代を代表するこのプラットフォームは、前世代のGrace Blackwellアーキテクチャと比較して、大規模で最大10倍高いエージェントAIスループットを実現するように設計されている。システム製造は、Dell Technologies、HPE、Lenovo、Supermicroなどのティア1サーバーベンダーに加え、ASUS、ASRock Rack、Compal、Foxconn、GIGABYTE、Inventec、MSI、Pegatron、Quanta Cloud Technology、Wistron、Wiwynnに及ぶ。ストレージおよびインフラストラクチャソフトウェア側では、NVIDIAは、Cloudian、DDN、Hitachi Vantara、IBM、MinIO、NetApp、Nutanix、VAST Data、WEKAを、このプラットフォームで本格的な生産を行っているパートナーとして挙げている。
ラックレベルでは、Vera Rubin NVL72はVera CPU、Rubin GPU、および第6世代NVLinkネットワークを統合し、統一されたコンピューティング環境を提供します。マルチテナント環境におけるコンプライアンスと企業データの保護に対応するため、このアーキテクチャはフルスタックのNVIDIA Confidential Computingを組み込んでいます。この実装により、ハードウェアレベルの認証と高速インターコネクトを介したエンドツーエンドのラインレート暗号化を特徴とするラック規模のTrusted Execution Environment(TEE)が構築され、物理的およびファームウェアレベルでの改ざんを防止します。
「エージェント型AIは、新しいタイプのワークロードです。1つのプロンプトから、推論、情報検索、ツールの使用、応答生成といった1000ステップに及ぶプロセスが開始されます」と、NVIDIAの創業者兼CEOであるジェンセン・フアン氏は述べています。「Vera Rubinはまさにこの時のために構築されました」と付け加え、Vera Rubinを「次世代の産業革命を推進するために必要なパフォーマンス、効率性、セキュリティを備え、大規模なインテリジェンスを提供するAIファクトリーエンジン」と表現しました。
BlueField-4 DPU統合による複数テナントの隔離
Vera Rubinアーキテクチャは、NVIDIA BlueField-4データ処理ユニット(DPU)を組み込んでおり、プライマリホストプロセッサからインフラストラクチャワークロードをオフロードします。最大800Gb/sのソフトウェア定義ネットワーク回線速度で動作するBlueField-4は、ハードウェアで分離されたマルチテナントネットワーク、テレメトリ、およびストレージ仮想化を提供します。BlueField-4の高度なセキュアな信頼できるリソースアーキテクチャを利用することで、クラスタオペレーターは、大規模な分散展開全体で、きめ細かなトラフィック分離、ポリシー適用の自動化、およびコントロールプレーンの管理を行うことができます。
光学部品の量産体制が整い、ルービン社からの出荷が今秋に開始される予定であることから、実務上の問題は、ハードウェアが実際に存在するかどうかという点から、オペレーターがどれだけ迅速に準備できるかという点へと移り変わる。




Amazon