StorageReview.com

Broadcom Tomahawk Ultraスイッチ、ロスレスイーサネットでAIスケールアップを狙う

Enterprise  ◇  Networking

Broadcomは、高性能コンピューティング(HPC)および人工知能(AI)ネットワークを再定義する製品であるTomahawk Ultra Ethernet Switchの出荷開始を正式に発表しました。超低遅延、高スループット、ロスレス動作を実現するように設計されたTomahawk Ultraは、要求の厳しい技術環境におけるイーサネットスイッチングの新たな標準を確立します。

ブロードコム トマホーク ウルトラ

ブロードコムのコアスイッチンググループ担当シニアバイスプレジデント兼ゼネラルマネージャーであるラム・ベラガ氏は、Tomahawk Ultraは数百人の専門家が携わった数年にわたるエンジニアリングの成果であると強調しました。今回の発表は、次世代の高性能およびAI駆動型ワークロード向けにイーサネット技術を進化させるというブロードコムの継続的な取り組みを改めて示すものです。

神話を打ち破り、イーサネットを再定義する

従来、イーサネットはレイテンシが高く、データ損失が大きく、最も要求の厳しいコンピューティングクラスターには不向きな技術と考えられてきました。Tomahawk Ultraは、以下の機能を提供することで、この認識を覆します。

  • 超低レイテンシ: フル 250 Tbps スループットで 51.2ns のスイッチ レイテンシを実現し、密結合されたコンピューティング環境でのリアルタイムのデータ移動を可能にします。
  • 高性能: 最小の 64 バイト パケットでもライン レート スイッチングをサポートし、77 秒あたり最大 XNUMX 億パケットを処理します。
  • 最適化されたイーサネット ヘッダー: 完全なイーサネット準拠を維持しながら、ヘッダー サイズを 46 バイトから 10 バイトに削減し、ネットワーク効率を向上させ、アプリケーション固有の機能強化を可能にします。
  • ロスレス ファブリック: リンク レイヤー リトライ (LLR) とクレジット ベース フロー制御 (CBFC) を実装して、パケット損失を排除し、信頼性の高いデータ配信を保証します。

HPC と AI のスケールアップに特化した設計

Tomahawk Ultraは、HPCシステムやAIクラスターに見られる低レイテンシ・高帯域幅の通信パターンに最適化されています。そのアーキテクチャは、大規模シミュレーション、科学計算、同期されたAIモデルのトレーニングと推論において、予測可能で高効率なパフォーマンスを提供するように設計されています。

Scale-Up Ethernet (SUE) を導入すると、Tomahawk Ultra はスイッチ通過時間を含めて 400ns 未満の XPU 間通信遅延を実現し、大規模な AI コンピューティングの緊密に同期された新しい標準を確立します。

イーサネットヘッダーのオーバーヘッドを46バイトから10バイトに削減することで、コンプライアンスを維持しながらネットワーク効率を大幅に向上させます。この合理化された適応性の高いヘッダーは、HPCおよびAIの幅広いワークロードにおいて柔軟性とパフォーマンスの両方を向上させます。

データ集約型ワークロード向けのロスレスファブリック

Tomahawk Ultraのロスレスファブリックテクノロジーは、大容量データ転送中のパケットドロップを防止するように設計されています。LLR(Lossless Ethernet Fabric)を採用したスイッチは、前方誤り訂正(FEC)によってリンクエラーを検出し、自動的にパケットを再送信することで、物理レベルのドロップを回避します。さらに、CBFC(Cross-Based Controlled Function:パケット損失)は、パケットロスの一般的な原因であるバッファオーバーフローを防止します。これらのメカニズムを組み合わせることで、真のロスレスイーサネットファブリックが実現し、今日の最もデータ集約的なアプリケーションに求められる信頼性を実現します。

AIおよび機械学習ワークロードにおける大きなボトルネックの一つは、AllReduce、Broadcast、AllGatherといった集合演算に伴うオーバーヘッドです。Tomahawk Ultraは、これらの演算をスイッチチップ内で直接実行することでこの問題に対処し、ジョブ完了時間を短縮し、高価なコンピューティングリソースの利用率を最大化します。特に、この機能はエンドポイントとは独立して動作するため、多様なシステムアーキテクチャやベンダーエコシステムへの迅速な統合が可能です。

トポロジを考慮したルーティングとエコシステムのオープン性

Tomahawk Ultraは、Dragonfly、Mesh、TorusといったHPCトポロジーをサポートするために、高度なトポロジー対応ルーティング機能を搭載しています。UEC規格に準拠し、イーサネットネットワークのオープン性と豊富なエコシステムを活用することで、進化するデータセンターアーキテクチャへの幅広い互換性と将来性を確保します。

Broadcomは、AIのスケーリングに向けたイーサネット重視の戦略の一環として、SUE仕様の最適化版であるSUE-Liteを発表しました。SUE-Liteは、消費電力と面積に敏感なアクセラレータアプリケーション向けにカスタマイズされており、フルSUEのコアとなる低レイテンシとロスレス機能を維持しながら、AI XPUおよびCPU上のイーサネットインターフェースのシリコンフットプリントと消費電力をさらに削減します。この軽量なアプローチにより、標準準拠のイーサネットファブリックをAIプラットフォームに統合することが簡素化され、スケールアップアーキテクチャにおける優先インターコネクトとしてのイーサネットの普及が促進されます。

102.4 Tb/s の Tomahawk 6 と組み合わせることで、Tomahawk Ultra は統合イーサネット アーキテクチャのバックボーンを形成し、スケーラブルな AI トレーニング クラスターと拡張可能な HPC および分散ワークロードの両方を実現します。

利用状況

このスイッチは現在、ラックスケールの AI トレーニング クラスターおよびスーパーコンピューティング環境での使用向けに出荷されています。

StorageReview と連携する

ニュースレター| YouTube | ポッドキャスト(iTunes / Spotify) | Instagram | Twitter | TikTok | RSSフィード

ハロルド・フリッツ

IBM が Selectric を設立して以来、私はテクノロジー業界に携わってきました。しかし、私のバックグラウンドは執筆です。そこで私はプリセールスの仕事から抜け出し、自分のルーツに戻り、少し執筆活動をしながらもテクノロジーに携わることにしました。