StorageReview.com

今日の高速性、明日への準備:QSAN XN4226D 統合ストレージ

Enterprise  ◇  エンタープライズストレージ

QSANは2004年からエンタープライズストレージソリューションを構築しており、その経験はXN4シリーズに顕著に表れています。当社のラボに設置されているXN4226Dは、デュアルアクティブコントローラーを搭載した2U、26ベイのオールNVMeアレイで、ブロックストレージとファイルストレージを統合した高可用性を実現します。QSM 4ソフトウェアは、スナップショット、レプリケーションオプション、データ削減、そして分かりやすい管理エクスペリエンスといった、期待されるデータサービスを追加します。XN4は、マルチプロトコルの柔軟性を損なうことなくNVMeのスピードを求めるチームのために設計されており、非常に手頃な価格となっています。

主要なポイント(要点)

  • 実際の HA でブロックとファイルを統合します。 デュアル アクティブ コントローラーと QSM 4 により、ブロックとファイル用の 1 つのプラットフォームで高可用性が実現します。
  • NVMe-oF を正しく実行します。 完全なプロトコルは、iSCSI、ファイバー チャネル、NFS、SMB、FTP、WebDAV に加えて、TCP および RDMA 上の NVMe-oF によって広がります。
  • 実証済みのスループット。 TCP を使用した大規模なシーケンシャル読み取りでは最大 21.21 GB/秒、RDMA を使用した大規模なシーケンシャル書き込みでは最大 11.14 GB/秒を測定しました。
  • 最新のパイプライン向けに構築されています。 2U に 26 個のオール NVMe ベイ、シンプルな管理、メディア、監視分析、VDI、データベース、AI 推論用に 100~200GbE まで拡張可能な I/O オプションを備えています。

このプラットフォームは、iSCSI、ファイバーチャネル、NFS、SMB、FTP、WebDAVに加え、TCPおよびRDMA経由のNVMe-oFもサポートしています。また、TCPとRDMAの動作とスケーリングを比較するNVMe-oFに特化した調査も実施しました。テストでは、大規模なシーケンシャルリードでユニットの限界まで負荷をかけ、21.21GB/秒という驚異的なスループットを達成しました。このシステムがどこに適合するかは、数値そのものと同じくらい重要です。XN4226Dは、VMwareまたはProxmoxをVMware、VDI、データベース層に組み合わせた混合環境、クリエイティブファイルサービス、予測可能なNVMeパスを必要とするAI推論ノード、メディアバックアップ、監視およびセンサーワークロード向けの高帯域幅の取り込みなど、様々な環境に対応します。QSAN XN4226Dは、ほぼあらゆるワークロードに適しています。

QSANは、ライブ放送、リプレイオプション、AIビデオエンハンスメント、OTT/エッジキャッシングといったメディア制作に加え、スマートシティCCTV、異常検知、リアルタイムリプレイといった監視ビデオ分析においても、著しい成長を遂げています。これらのワークロードは、100~200GbEのスループットで理想的にサポートされます。

結局のところ、その価値は明白です。統合された高可用性、シャーシ全体にわたるNVMe、そしてニーズの拡大に応じて最大100GbEまたは32GbファイバーチャネルまでのI/Oオプションが得られます。パフォーマンスは多くのTier 1アレイと同等でありながら、ライセンスはより手頃な価格で、プロトコルカバレッジはNVMe-oF、iSCSI、ファイバーチャネル、SMB、NFSと幅広く対応しています。InfiniBandを検討しているものの予算が限られている組織にとって、QSANのイーサネットアプローチは、標準的な機器で100~200GbEスケールにおいてInfiniBandに匹敵する応答性を提供します。

実際のアプリケーション結果を優先するチームにとって、QSAN の長寿命、直感的なソフトウェア、クリーンなハードウェア設計により、XN4226D は、信頼できるオールフラッシュの主力製品となります。

QSAN XN4 ハードウェア

QSAN XN4シリーズストレージアレイは、26ベイ、2U、19インチラック対応のサーバーシャ​​ーシに搭載され、4コアまたは8コアのIntel Xeon CPUを搭載したシングルまたはデュアルコントローラーオプションが用意されており、小規模から大規模まで、あらゆる運用環境の冗長性とパフォーマンスニーズに対応します。26ベイすべてに搭載した場合、XN4シリーズシャーシ1台で2.5インチU.2/U.3 NVMeソリッドステートドライブに最大798テラバイトのデータを保存できます。また、最大20台のSAS接続拡張ユニットを追加することで、アレイの総容量を16.773ペタバイトまで拡張できます。

各コントローラーは、2.5Gbps RJ45 Ethernetポートを1つ、10Gbps SFP+ポートを4つ、12Gbps SASワイドポートを2つ搭載しています。また、10Gbps RJ45、25Gbps SFP28、100Gbps QSFPポートへのアップグレードオプションもご用意しています。さらに、16Gbps SFP+および32Gbps SFP28アダプターを追加することで、ファイバーチャネルのサポートも追加可能です。

以下の表は、XN4226D-4CとXN4226S-4Cストレージシステムの仕様を比較したものです。これらは4Cバージョンで、モデルに応じてデュアルアクティブまたはシングルアップグレード可能なコントローラを搭載しています。より高い処理能力を必要とする環境向けに、これらのシステムの8Cバージョンもご用意しています。

製品仕様 XN4226D-4C XN4226S-4C
モデル名 XN4226D-4C XN4226S-4C
アーキテクチャ デュアルアクティブコントローラー 単一アップグレード可能なコントローラー
CPU インテル® Xeon® 4コア × 2 インテル® Xeon® 4コア
メモリ
メモリモジュールがプリインストールされています 32GB DDR4 RDIMM 16GB DDR4 RDIMM
合計メモリスロット数 16 8
メモリは最大まで拡張可能 2,048GB 1,024GB
Storage
ドライブベイ 2.5インチスロット×26 2.5インチスロット×26
拡張ユニットを備えた最大ドライブベイ数 546 546
互換性のあるドライブタイプ 2.5インチデュアルポートU.2 / U.3 NVMe SSD
2.5インチSAS SSD(拡張ユニット用)
3.5インチSAS HDD(拡張ユニット用)
2.5インチシングルポートU.2 / U.3 NVMe SSD
2.5インチSAS SSD(拡張ユニット用)
3.5インチSAS HDD(拡張ユニット用)
ドライブインターフェース U.2 NVMe(PCIe Gen 4)
SAS 12 Gb/s(拡張ユニット用)
U.2 NVMe(PCIe Gen 4)
SAS 12 Gb/s(拡張ユニット用)
最大内部生容量 798TB 798TB
拡張による最大容量 16,773TB 16,773TB
ホットスワップ可能なドライブ はい はい
接続ポート
PCIe拡張 (第4世代×8スロット)×4 (第4世代×8スロット)×2
2.5 GbE RJ45 LANポート 2(機内) 1(機内)
10 GbE SFP+ LAN ポート 8(オンボード)/ 16(オプション) 4(オンボード)/ 8(オプション)
10 GbE RJ45 LANポート 16(オプション) 8(オプション)
25 GbE SFP28 LAN ポート 16(オプション) 8(オプション)
100 GbE QSFP LAN ポート 8(オプション) 4(オプション)
16 Gb SFP+ ファイバーチャネル 16(オプション) 8(オプション)
32 Gb SFP28 ファイバーチャネル 16(オプション) 8(オプション)
拡張と外部ポート
12 Gb/s SAS ワイドポート 4(機内) 2(機内)
USBポート 1 (フロント) / 2 (リア) 1 (フロント) / 1 (リア)
その他 コンソールポート×2、サービスポート×2 コンソールポート×1、サービスポート×1
ソフトウェア仕様
ストレージOS QSM4 QSM4
RAIDタイプ 0 / 1 / 5 / 6 / 10 / 50 / 60 / 5EE / 6EE / 50EE / 60EE
ストレージ効率 シンプロビジョニング / 圧縮と重複排除(オプション)
ソフトウェアアクセラレーション SSD キャッシュ / 自動階層化 / RDMA
Data Protection スナップショット / 非同期 / 同期(オプション)
バックアップサービス Rsync / S3 バックアップ / クラウド バックアップ / XMirror* / Microsoft 365 メール バックアップ
セキュリティ SSL / SSH / iSCSI CHAP / ISE & SED / WORM / RBAC / Windows ACL / ウイルス対策
サポートプロトコル CIFS / NFS / FTP / WebDAV / iSCSI / FCP / NVMe-oF
マネジメント Web UI / Windows AD / LDAP / RESTful API / SES / LCM
外観
寸法(高さ×幅×奥行き) 88 × 438 × 573mm 88 × 438 × 573mm
正味重量 19.6kg 16.5kg
総重量 28.6kg 25.5kg
その他
メモリ保護 キャッシュ・トゥ・フラッシュモジュール(内蔵)
システムファン 8台 4台
電源ユニット 850W × 2(80プラスプラチナ)
電源入力 100~240 VAC、50/60 Hz
消費電力 812 W / 2,770 BTU
認定 CE / FCC / BSMI
標準保証 システム: 5 年 | キャッシュ・トゥ・フラッシュモジュール: 1 年

QSAN XN4の機能

XN4アレイは、TCPおよびRDMA経由で提供されるNVMe over Fabrics(NVMe-oF)など、高性能コンピューティングと大量のデータを必要とするAIモデルのサポートに必要な最新の接続プロトコルを標準装備しています。iSCSI、NFS、FCP、CIFS/SMB、FTP、WebDAV経由の接続も可能で、レガシーシステムと最先端システムが混在するデータセンターのブロックストレージおよびファイルストレージのニーズに対応します。

NVMe-oFの利点

iSCSI、NFS、FCPなどのプロトコルは依然としてエンタープライズストレージアプリケーションで広く使用されていますが、NVMe-oFはレイテンシを大幅に改善します。NVMe規格は、システムのPCIeバスに直接接続されるソリッドステートドライブ向けに根本的に設計されました。一方、iSCSIやNFSなどの旧来のプロトコルは、従来のハードディスクドライブの制限とアクセス時間の遅さを念頭に開発されました。NVMe-oFテクノロジーは、ほとんどの場合、より広い帯域幅とより高速なアクセス時間により、旧来の接続プロトコルよりも優れたパフォーマンスを発揮します。NVMe-oFは、RDMA(Remote Direct Memory Access)機能を備えたネットワークインターフェースも活用できるため、CPU処理を必要とせずに、データをターゲットコンピュータのメモリに直接転送できます。

データ削減と最適化機能

XN4ストレージアレイの高性能ハードウェアスタックは、ストレージ管理者に広く認知され高く評価されている数々のソフトウェア機能によってさらに強化されています。シンプロビジョニング、圧縮、重複排除により、SAN容量を最大限に活用できます。また、SSDキャッシュと自動ストレージ階層化により、頻繁に使用されるファイルやオブジェクトへのアクセス時間を短縮できます。アプライアンスのQSM 4オペレーティングシステムには、組み込みのスナップショットツールが用意されており、変更のテストとロールバックも容易に行えます。

セキュリティと管理機能

QSANは、XN4シリーズにおいて、お客様のセキュリティと管理に関する進化するニーズに配慮しています。XN4は、Instant Secure Erase(ISE)およびSelf-Encrypting Drives(SED)に加え、SSL/TLSなどのセキュリティプロトコル、ロールベースアクセス制御(RBAC)による認証、Active Directory/LDAPサーバーのサポートに対応しています。アレイはHTTPS Web UIまたはRESTful APIを使用して管理でき、AnsibleやTerraformなどの様々なツールによる自動化が可能です。

QSM 4 管理

QSAN XN4シリーズのオペレーティングシステムであるQSM 4は、あらゆる経験レベルのストレージ管理者にとって、ストレージアレイのセットアップと管理を容易にします。開梱後すぐに導入でき、プールの高速作成、直感的なホスト割り当て、Web UIとREST APIによる軽量管理など、ストレージに関する深い専門知識を持たない小規模なITチーム向けに設計されています。

ダッシュボード画面には、システム ステータス情報とサーバーによって記録された最近のイベントが表示されます。


ログインすると、SANの健全性の概要を一目で確認できるダッシュボード画面が表示されます。ここから、左側のパネルのリストから任意のサブメニューに移動できます。

管理者はストレージ メニューから、ドライブのプールとそれに関連付けられたボリュームを作成および管理できます。

各プールを構成するディスクグループは、「ディスクグループ」タブで管理できます。この機能は、割り当てられているドライブ数に応じて、0、1、5、6、10、50、60、5EE、6EE、50EE、60EEなど、さまざまなRAIDレベルをサポートします。

ブロックストレージとファイルストレージのニーズに合わせて、プール上にボリュームを構築できます。ウィザードを使用して、接続されたクライアントのニーズに合わせて各ボリュームの容量とブロックサイズを設定できます。

リストを下に移動すると、「共有」メニューがあり、ファイルボリューム上に共有オブジェクトを作成できます。サポートされている共有プロトコルには、CIFS (SMB)、FTP、NFS、WebDAV などがあります。

新しい共有を作成するときに、QSM 4 では、複数のユーザーがアクセスするファイルをホストするための標準ネットワーク共有と、個別にのみアクセスできるユーザーのホーム フォルダーを保持するように設計されたユーザーホーム共有の 2 つのオプションが提供されます。

ブロックボリュームまたはファイルボリュームと共有を作成したら、「ホスト」メニューでIPアドレスまたはホスト名を割り当てる必要があります。ホストは、以下のスクリーンショットに示すように、ブロックストレージまたはファイル(共有)ストレージのどちらに対応するかによって分類されます。

ブロックストレージ用のホストは、ボリュームにiSCSI、FCP、またはNVMe-oF over TCPを利用できます。一方、ファイル(共有)ストレージ用のホストは複数のプロトコルを同時にサポートできるため、多様なファイル共有要件を持つデータセンターに不可欠な柔軟性を提供します。

QSM 4 は、[モニター] メニューで基本的な監視機能も提供しており、アレイ内のさまざまなハードウェア モジュールとドライブのステータス、およびドライブ、ストレージ プール、CPU、メモリの使用状況の統計を表示します。

QSM 4のWeb UIでは、「アカウント」メニューでユーザー、グループ、ドメインの管理が可能です。また、「システム」メニューでは、SAN全体にわたる様々な設定オプションを利用できます。ログ機能とアラート機能は、「通知」メニューからアクセスできます。最後に、メニューバーの右上には、QSANファイルマネージャー、言語サポート、サインアウト/電源管理のアイコンがあります。

シンプルなProxmox統合

ProxmoxはNVMe over Fabrics(NVMe-oF)をネイティブにサポートしており、高性能ストレージアレイをクラスタに容易に統合できます。プロセスは、ストレージシステム上にNVMe-oFターゲットをプロビジョニングすることから始まります。次に、Proxmoxホストを使用してこれらのターゲットを検出し、接続します。接続が完了したら、再起動後もこれらの接続が維持されるようにシステムを構成する必要があります。

この例では、アレイの IP アドレスとサービス ポートを指定するシェル コマンドを使用して検出が実行されます。

nvme discover -t tcp -a 172.16.16.100 -s 4420
nvme discover -t tcp -a 172.13.13.100 -s 4420

次に、NQN を参照して、プロビジョニングされた名前空間に接続します。

nvme connect -t tcp -n nqn.2024-11.com.qsan:dev4 -a 172.16.16.100 -s 4420
nvme connect -t tcp -n nqn.2024-11.com.qsan:dev6 -a 172.13.13.100 -s 4420

再起動後も構成が維持されるようにするには、検出アドレスを NVMe 検出構成ファイルに追加します。

echo "discover -t tcp -a 172.16.16.100 -s 4420" | tee -a /etc/nvme/discovery.conf
echo "discover -t tcp -a 172.13.13.100 -s 4420" | tee -a /etc/nvme/discovery.conf

最後に、自動接続サービスを有効にして、Proxmox が起動時に NVMe セッションを自動的に再確立できるようにします。

systemctl enable nvmf-autoconnect.service

Proxmox は QSAN ストレージとシームレスに統合でき、ネットワーク ファブリックの柔軟性とともに、NVMe の低レイテンシ、高帯域幅のパフォーマンスを実現します。

QSAN を接続した後、Proxmox シェルから「nvme list」コマンドを発行してすべての NVMe デバイスを表示できます。新しく追加された QSAN ボリュームは、それぞれ 11 TB のストレージを持つ /dev/nvme6n1 および /dev/nvme7n1 として表示されます。

QSAN ストレージが Proxmox GUI に表示されると、新しい LVM ボリューム グループを作成できます。pve > ディスク > LVM で、2 つの 11TB デバイス (/dev/nvme6n1 と /dev/nvme7n1) が表示され、VM とコンテナーで使用するために個別のボリューム グループ (qsan-1 と qsan-2 など) として初期化できます。

ストレージ ペインで新しい LVM プールの 1 つ (qsan-1) をクリックすると、それがオンラインで有効になっており、使用可能であり、11 TB の容量がフルに使用されており、VM およびコンテナのプロビジョニングの準備ができていることが示されます。

性能試験

QSAN XN4226Dを2つの環境でテストし、それぞれ異なるテストプラットフォームを活用しました。最初の環境は、NVIDIA ConnectX-5デュアルポート25G NICを4枚搭載したDell PowerEdge R750を中心に構築しました。このサーバーにQSAN XN4226Dを8本のDACケーブルで直接接続しました。このセットアップでは、QSANの利用可能なすべてのネットワークポートを使用し、最高のパフォーマンスを発揮することができました。

FIOテストでは、2つのRAID6ストレージプールを使用し、両方のコントローラーに均等に分散された8つのブロックボリュームを作成しました。各ボリュームには固有のターゲットが割り当てられ、1つのIPアドレスが専用に割り当てられました。このプラットフォームでNVMe-oF RDMAとTCPの両方を測定しました。

GDSIOの2つ目の環境では、NVIDIA H100 GPUを2基搭載したDell PowerEdge R7715と、クアッドポートのBroadcom 25G NICを使用しました。この環境では、QSANボリュームレイアウトはそのままに、ボリューム数を8つから4つに減らしました。クアッドポートのNICを使用することで、4つの25G接続を使用してサーバーをストレージアレイに直接接続しました。

FIOパフォーマンスベンチマーク

QSAN XN4226Dのストレージパフォーマンスを測定するために、業界標準の指標を適用し、FIOツールを使用しました。各ストレージデバイスは、シーケンシャルライトワークロードでドライブを2回フルフィルするプリコンディショニングステップと、その後の定常パフォーマンス測定を含む、同一のテストプロセスを受けました。測定対象のワークロードの種類が変化するたびに、新しい転送サイズで再度プリコンディショニングフィルを実行しました。

このセクションでは、次の FIO ベンチマークに焦点を当てます。

  • 1万シーケンシャル
  •  64Kランダム
  • 16Kランダム
  • 4Kランダム

1Mシーケンシャル書き込み帯域幅

1Mシーケンシャルライトテストでは、NVMe over RDMAは、ほぼすべてのキュー深度とジョブ数において、NVMe over TCPと比較して一貫して高い帯域幅を提供しました。ピーク時には、RDMAが11.14GB/秒を達成したのに対し、TCPは8.83GB/秒にとどまり、RDMAが約26%の差で優位に立っています。キュー深度が低い場合でも、RDMAは優位性を維持しました。例えば、QD1/1ジョブでは、RDMAは6.30GB/秒を記録し、TCPの4.77GB/秒を約32%上回りました。

ワークロードのスケールアップに伴い、2つのプロトコル間のパフォーマンス差は若干縮まりましたが、RDMAは依然として全体を通して明確な優位性を示しました。TCPは複数のテストポイントで一貫して8.5~8.8GB/秒の範囲で推移しましたが、RDMAは頻繁に10.5GB/秒を超え、ピーク時には11GB/秒をわずかに上回りました。

1Mシーケンシャル書き込みレイテンシ

1Mシーケンシャルライトレイテンシテストでは、RDMAはほとんどのキュー深度とジョブ数において、TCPに対して明確な効率優位性を維持しました。ワークロードが軽い場合、2つのプロトコルはほぼ同程度のレイテンシを示し、どちらも5ミリ秒未満のレイテンシを示しました。しかし、同時実行数が増えるにつれて、その差はより顕著になりました。例えば、QD16/16ジョブでは、RDMAは368.48ミリ秒を記録したのに対し、TCPは455.95ミリ秒を記録し、RDMAは19%の改善を示しました。

この乖離は、極めて大規模な処理ではさらに顕著になりました。QD256/1ジョブでは、RDMAは1,389.16ミリ秒で完了したのに対し、TCPは1,987.39ミリ秒まで上昇し、RDMAのレイテンシが43%削減されたことを示しています。この傾向は、特に高負荷のシナリオにおいて、RDMAがレイテンシを抑えながら高いスループットを維持できることを示唆しています。

1Mシーケンシャルリード帯域幅

1Mシーケンシャルリードテストでは、パフォーマンスのダイナミクスが変化し、TCPがRDMAを全面的に明らかに上回りました。TCPはピーク時に21.21GB/秒に達し、RDMAは15.96GB/秒で最高値に達しました。TCPの方が約33%も有利です。キュー深度が低い場合でも、TCPは急速にリードを広げました。例えば、QD1/4ジョブでは、TCPは18.91GB/秒を達成したのに対し、RDMAは15.05GB/秒と、25%以上の差がありました。

TCPの優位性は、ほぼすべてのワークロード規模において一貫して見られました。飽和状態に達すると、TCPは20~21GB/秒の範囲で結果を維持しましたが、RDMAは15GB/秒付近で平坦化しました。これは、RDMAは書き込みが多くレイテンシの影響を受けやすい操作に優れている一方で、テスト対象のRAID6 NVMe構成ではTCPがシーケンシャルリードの帯域幅効率において優れていることを示しています。

1Mシーケンシャルリードレイテンシ

1Mシーケンシャルリードレイテンシテストでは、2つのプロトコルの結果は比較的近いものでしたが、キュー深度が高い場合、RDMAは概してわずかに優位に立っていました。ワークロードが軽い場合、レイテンシプロファイルはほぼ同じで、同時実行性が増加し始めるまで、どちらも5ミリ秒未満を維持しました。例えば、QD8/64ジョブでは、TCPは234.09ミリ秒を記録しましたが、RDMAは194.54ミリ秒と、17%の短縮を示しました。

この傾向は、より高負荷な状況でも続きました。QD32/64ジョブでは、RDMAのスループットは847.59ミリ秒だったのに対し、TCPは881.31ミリ秒でした。これはわずか3.8%の改善ですが、RDMAのスタックオーバーヘッドが低いことと整合しています。とはいえ、両プロトコルは同様のパターンでスケーリングし、ワークロードが増加するにつれてレイテンシは予想通りに増加しました。

64k ランダム書き込み IOPS

 

64Kランダム書き込みテストでは、RDMAはTCPよりも一貫して高いIOPSを達成し、並列化されたランダム操作の処理効率の高さを際立たせました。ピーク時には、RDMAは58.89K IOPSに達しましたが、TCPは48.57K IOPSにとどまり、21%のパフォーマンス優位性を示しました。

両プロトコル間の差はテスト全体を通して顕著でした。例えば、QD1/16ジョブでは、RDMAは54.13K IOPSを記録したのに対し、TCPは45.30K IOPSと、約16%の差がありました。ワークロードがさらに拡大しても、RDMAは53K~55K IOPSの範囲を維持しましたが、TCPは42K~46K IOPSの範囲を維持しました。

64Kランダム書き込みレイテンシ

64Kランダム書き込みレイテンシテストでは、RDMAはTCPと比較して応答時間が短く、特にキュー深度とジョブ数の増加に伴いその傾向が顕著でした。低負荷時には、両プロトコルのパフォーマンスはほぼ同等で、1ミリ秒未満を維持しました。例えば、QD1/1ジョブでは、TCPは0.26ミリ秒でしたが、RDMAは0.25ミリ秒でほぼ同じでした。

しかし、ワークロードが拡大するにつれて、RDMAは効率性の優位性を維持しました。QD16/64ジョブでは、RDMAは74.09ミリ秒を記録したのに対し、TCPは95.64ミリ秒と、約23%の差がありました。この差は、最大負荷時のQD256/1ジョブでさらに拡大し、RDMAは291.13ミリ秒を記録したのに対し、TCPは398.56ミリ秒と、約37%も差を広げました。

64K ランダム読み取り IOPS

64Kランダム読み取りテストでは、TCPとRDMAは全体的に非常に近いパフォーマンスを示しましたが、ワークロードに応じて2つのプロトコル間の優位性はわずかに変化しました。TCPはピーク時に176.33K IOPSを達成し、RDMAは175.40K IOPSと僅差でそれに続き、わずか0.5%の差でした。

中程度の深度では、結果はほぼ互角でした。例えば、QD4/16ジョブでは、TCPが168.60K IOPSを記録したのに対し、RDMAは163.94K IOPSでそれに続き、その差は2.8%未満でした。その他のポイントでは、RDMAがわずかに上回り、例えばQD8/1ジョブでは171.71K IOPSを記録し、TCPは171.15K IOPSとほぼ互角でした。

64Kランダム読み取りレイテンシ

64Kランダム読み取りレイテンシテストでは、両プロトコルは非常に近い結果を示しましたが、高負荷時にはRDMAがわずかに優位に立っていました。低負荷時には、TCPとRDMAのレイテンシはどちらも1ミリ秒未満で、実質的に差はありませんでした。例えば、QD1/1ジョブでは、TCPは0.43ミリ秒、RDMAは0.38ミリ秒でした。

同時実行数が増えるにつれて、その差はより顕著になりました。QD16/64ジョブでは、RDMAが23.28ミリ秒、TCPが26.19ミリ秒と、12%の改善が見られました。最大負荷時には、RDMAの差はさらに大きくなり、TCPが129.02ミリ秒に対し、RDMAは98.08ミリ秒となり、24%の短縮となりました。

16K ランダム書き込み IOPS

16Kランダム書き込みテストでは、2つのプロトコル間のパフォーマンス差は大きく、RDMAはほとんどの場合TCPの2倍以上のIOPSを達成しました。RDMAのピークIOPSは111.13K、TCPは68.95K IOPSで、RDMAが61%の優位性を示しました。

キュー深度が低い場合、その差は明らかでした。例えば、QD1/16ジョブでは、RDMAは104.86K IOPSを記録したのに対し、TCPは41.78K IOPSでした。これはRDMAが151%も優れていることを意味します。ワークロード範囲全体を通して、RDMAは100K~111K IOPSの範囲で安定して結果を維持しましたが、TCPは最大深度での終盤の急上昇を除き、概ね40K~50K IOPSの範囲に留まりました。

16Kランダム書き込みレイテンシ

16Kランダム書き込みレイテンシテストでは、ワークロードのスケールアップに伴い、RDMAがTCPに対して明確な優位性を維持しました。負荷が低い場合、両プロトコルはほぼ同じで、応答時間は2ミリ秒未満を維持しました。例えば、QD1/1ジョブでは、TCPは0.40ミリ秒、RDMAは0.41ミリ秒でした。

同時実行数が増えるにつれて、RDMAの性能差が開き始めました。QD16/64ジョブでは、RDMAが21.15ミリ秒を記録したのに対し、TCPは77.12ミリ秒と、72%という劇的な短縮を記録しました。この優位性は、最も深い階層でも維持されました。QD32/64ジョブでは、RDMAは161.13ミリ秒で完了したのに対し、TCPは235.17ミリ秒と、31%の改善を示しました。

16K ランダム読み取り IOPS

16Kランダム読み取りテストでは、RDMAがあらゆるワークロードにおいてTCPを完全に上回りました。RDMAはピーク時に388.44K IOPSを達成しましたが、TCPはわずか16.42K IOPSにとどまり、RDMAが23倍以上の優位性を示しました。

この差は最初から明らかでした。QD1/1ジョブでは、RDMAは29.27 IOPSを達成したのに対し、TCPはわずか8.10 IOPSでした。同時実行数が増えるにつれて、RDMAは300万~380万IOPSの範囲に急速にスケールアップしましたが、TCPはキュー深度が高くても15~16 IOPS程度で停滞しました。

16K ランダム読み取りレイテンシ

16Kランダム読み取りレイテンシテストでは、RDMAとTCPの差は劇的で、IOPSの結果を反映していました。負荷が軽い場合、2つのプロトコルはほぼ同じで、レイテンシは1~10ミリ秒でした。

ワークロードが拡大するにつれて、RDMAはレイテンシを良好に抑制しましたが、TCPは大幅に低下しました。Q8/64ジョブでは、RDMAは13.65ミリ秒、TCPは260.90ミリ秒と、約19倍の改善が見られました。最終的に、QD32/64ジョブはRDMAを63.28ミリ秒で完了しましたが、TCPは2,366.99ミリ秒と、約37倍の時間がかかりました。

4K ランダム書き込み IOPS

4Kランダム書き込みテストでは、RDMAはTCPを一貫して上回りましたが、ブロックサイズの大きいワークロードと比較するとその差は小さくなりました。RDMAはピーク時に125.73K IOPSを達成し、TCPは115.89K IOPSに達し、RDMAが約8.5%の優位性を示しました。

キュー深度が低い場合、TCPはRDMAにわずかに遅れをとりましたが、それでも競争力のあるパフォーマンスを発揮しました。例えば、QD1/16ジョブでは、RDMAは122.82K IOPSを達成したのに対し、TCPは111.91K IOPSで、約10%の向上が見られました。ほとんどのテストポイントにおいて、RDMAは120K~125K IOPSの範囲で推移しましたが、TCPは110K~116K IOPSを維持しました。QD32/64ジョブでは終盤に92.21K IOPSまで低下しました。

4Kランダム書き込みレイテンシ

4Kランダム書き込みレイテンシテストでは、RDMAはTCPよりも一貫して低い応答時間を示しましたが、ブロックサイズの大きいワークロードと比較するとその差は小さくなりました。負荷が低い場合、両プロトコルはほぼ同じで、いずれも1ミリ秒未満を維持しました。例えば、QD1/1では、TCPは0.16ミリ秒でしたが、RDMAは0.21ミリ秒でした。

同時実行数が増えるにつれて、その差はより顕著になりました。QD16/64ジョブでは、RDMAは19.36ミリ秒を記録したのに対し、TCPは36.20ミリ秒で、RDMAのレイテンシは46%削減されました。最大深度では、RDMAは145.61ミリ秒で完了したのに対し、TCPは177.62ミリ秒まで上昇し、RDMAは22%の改善を示しました。

4K ランダム読み取り IOPS

4Kランダム読み取りテストでは、両プロトコルとも優れたパフォーマンスを発揮しましたが、RDMAは一貫してTCPに対してわずかに優位に立っていました。RDMAはピーク時に404.64K IOPSに達し、TCPは382.96K IOPSで、RDMAが5.7%の優位性を示しました。

低深度では、すでにRDMAが有利な結果を示していました。例えば、QD1/16ジョブでは、RDMAは353.57 IOPSを達成したのに対し、TCPは329.10 IOPSで、約7.5%の差がありました。ワークロードが拡大するにつれて、RDMAはリードを維持し、通常は360~400 IOPSの範囲で動作しました。一方、TCPは330~380 IOPS付近で推移しました。

4Kランダム読み取りレイテンシ

4Kランダム読み取りレイテンシテストでは、RDMAはTCPに対して明確な効率性を示し、特にワークロードの規模が大きくなるにつれてその差は顕著でした。キュー深度が浅い場合、2つのプロトコルはほぼ同等でした。例えば、QD1/1ジョブでは、TCPは0.24ミリ秒を記録しましたが、RDMAは0.27ミリ秒とわずかに遅れていました。

同時実行性が高まるにつれて、RDMAがリードしました。QD16/64ジョブでは、RDMAは23.92ミリ秒、TCPは26.81ミリ秒と、10.8%の改善を示しました。QD32/64ジョブの最大負荷時には、RDMAは54.61ミリ秒で完了しましたが、TCPは70.12ミリ秒にまで膨れ上がり、RDMAのレイテンシは22%減少しました。

GPUDirect ストレージパフォーマンス

このテストベンチで実施したテストの一つに、Magnum IO GPUDirect Storage(GDS)テストがあります。GDSはNVIDIAが開発した機能で、NVMeドライブやその他の高速ストレージデバイスに保存されたデータへのアクセス時に、GPUがCPUをバイパスできるようにします。GDSは、CPUとシステムメモリを経由する代わりに、GPUとストレージデバイス間の直接通信を可能にするため、レイテンシが大幅に削減され、データスループットが向上します。

GPUDirectストレージの仕組み

従来、GPUがNVMeドライブに保存されたデータを処理する場合、データはGPUに到達する前にCPUとシステムメモリを経由する必要があります。このプロセスはCPUを介在させるためボトルネックとなり、レイテンシが増加し、貴重なシステムリソースが消費されます。GPUDirect Storageは、GPUがPCIeバスを介してストレージデバイスから直接データにアクセスできるようにすることで、この非効率性を解消します。この直接的なパスにより、データ移動に伴うオーバーヘッドが削減され、より高速で効率的なデータ転送が可能になります。

AIワークロード、特にディープラーニングを含むワークロードは、膨大なデータ処理を必要とします。大規模なニューラルネットワークのトレーニングにはテラバイト単位のデータ処理が必要であり、データ転送の遅延はGPUの活用率低下やトレーニング時間の長期化につながる可能性があります。GPUDirectストレージは、データがGPUに可能な限り迅速に転送されることで、アイドル時間を最小限に抑え、計算効率を最大化することで、この課題に対処します。

さらに、GDS は、ビデオ処理、自然言語処理、リアルタイム推論など、大規模なデータセットのストリーミングを伴うワークロードに特に役立ちます。CPU への依存度を下げることで、GDS はデータの移動を高速化し、CPU リソースを他のタスクに解放して、システム全体のパフォーマンスをさらに向上させます。

GPUDirectとNVMe-oF(TCP/RDMA)は、帯域幅の限界を超えて、超低レイテンシI/Oを実現します。これにより、GPUがデータ不足に陥る心配がなくなり、リアルタイムAI推論、分析パイプライン、ビデオリプレイに最適なシステムとなります。

多くの実際の導入では、これは 100~200 GbE の使用可能スループットに相当し、AI 推論 (2~4 GPU)、メディア制作 (ブロードキャスト リプレイ、OTT エッジ キャッシング)、監視ビデオ分析、HPC チェックポイントなどのワークロードに完全に適合します。

読み取りスループット

GDSIOシーケンシャルリードワークロードでは、スループットはブロックサイズとスレッド数の両方に応じて着実に増加し、複数のテストポイントで最大11.0GiB/秒に達しました。ブロックサイズが512K以上になると、スレッド数に関わらずスループットは10.9~11.0GiB/秒の間で安定し、最高の結果を維持しました。

ブロックサイズが小さい場合、パフォーマンスは当初は大幅に低下しました。例えば、4Kブロックでは、単一スレッドでわずか0.3GiB/秒のスループットから始まり、256スレッドでも1.5GiB/秒で安定しました。一方、ブロックサイズを64Kに増やすと、システムは10.9GiB/秒までスケールアップでき、スレッド数の増加に伴いスループットはほぼ飽和状態になりました。

スイートスポットは128K~256Kブロックあたりで、32スレッド以上でスループットが10GiB/sを超え、テストした最大ブロックサイズ全体で安定したパフォーマンスを示しました。これは、ブロックサイズが十分に大きくなるとプラットフォームの帯域幅が完全に飽和状態になり、256Kを超えるとわずかな増加にとどまることを示しています。

レイテンシを読む

GDSIOシーケンシャルリードのレイテンシ結果では、応答時間はブロックサイズとスレッド数の両方に応じて予測通りに変化しました。最小のワークロードでは、レイテンシは非常に低いままでした。例えば、単一スレッドで4Kブロックの場合、レイテンシはわずか50µsでした。同時実行性が最小限の場合、最大32Kブロックサイズでもレイテンシは200µs未満でした。

スレッド数が増加するにつれて、レイテンシの上昇がより顕著になりました。64Kブロック、64スレッドではレイテンシは1.5ミリ秒に達し、128スレッドでは2.9ミリ秒に倍増し、256スレッドでは5.7ミリ秒にまで上昇しました。対照的に、4Kや8Kといった小さなブロックサイズでは、最大256スレッドでもレイテンシは2.7~2.8ミリ秒の範囲にとどまり、より細かい粒度でより厳密な制御が行われていることが示されました。

ブロックサイズが大きくなると、レイテンシはさらに劇的に向上しました。1Mブロック、256スレッドではレイテンシは96.1ミリ秒に達し、10Mブロック、256スレッドでは4.3秒まで急上昇し、極端な条件下ではシステムのスケーリング限界が明確に示されました。

書き込みスループット

GDSIOシーケンシャル書き込みワークロードでは、スループットはブロックサイズとスレッド数の両方に応じて増加しましたが、読み取りパフォーマンスの上限を大きく下回ると横ばい状態になりました。システムは、5MBや10MBといった大きなブロックサイズを128スレッドで使用し、ピーク時で7.2GiB/秒を達成しました。

最小ブロックサイズでは、スループットは控えめでした。4Kブロックでは、パフォーマンスは1スレッドで0.3GiB/秒から始まり、32スレッドで1.0GiB/秒まで上昇し、その後は横ばいになりました。ブロックサイズを64Kに増やすと帯域幅が拡大し、8スレッドで5.6GiB/秒に達しましたが、同時実行数が増えるにつれてわずかに低下しました。

最もバランスが取れていたのは512K~1Mブロックあたりで、この範囲ではスレッド数に関わらずスループットが6.7~7.1GiB/sとなり、システムがこの範囲で飽和状態に達したことを示しています。この範囲を超えると、スレッド数を増やしても有意なパフォーマンス向上は見られず、場合によってはオーバーヘッドの増加によりパフォーマンスがわずかに低下しました。

ライトレイテンシ

GDSIO シーケンシャル書き込みレイテンシの結果では、ブロック サイズが小さい場合は応答時間がスムーズに増加しましたが、ブロック サイズとスレッド数の両方が増加すると、応答時間が急激に増加しました。

最小のワークロードでは、レイテンシは最小限でした。4Kブロックでシングルスレッドの場合、平均レイテンシはわずか58µsで、16Kブロックで最大4スレッドまで200µs未満を維持しました。32Kブロックで中程度の同時実行性でも、レイテンシは1ms未満でした。

システムがより大きなブロックサイズに移行するにつれて、遅延はより顕著になりました。128Kブロック、64スレッドではレイテンシは5.3ミリ秒に達し、128スレッドではさらに倍増して10.7ミリ秒になりました。512Kブロックでは、結果はさらに長くなり、256スレッドでは73.4ミリ秒に達しました。

最も負荷の高いケース、つまり 256 スレッドで 5M および 10M ブロックの場合、レイテンシがそれぞれ 709 ミリ秒と 4.8 秒に急上昇し、順次書き込みスケーリングの上限が明らかになりました。

最終的な考え

QSANのXN4226Dは、多くのITチームがまさに求めている性能を備えています。これは、アーキテクチャの変更を必要とせずに最新プロトコルとレガシープロトコルの両方をサポートする、統合型デュアルコントローラNVMeプラットフォームです。当社のテストでは、TCPが大容量シーケンシャル読み取りで21.21GB/秒という最高の速度を示し、RDMAは大容量シーケンシャル書き込みで11.14GB/秒という最高の速度を達成し、同時実行のスケールアップに伴うレイテンシを低く抑えました。ブロックサイズが小さい場合、RDMAはランダム書き込みの効率を一貫して向上させ、テール動作を抑制しました。結論はシンプルです。幅広い互換性と高い読み取り帯域幅を求める場合はNVMe-oF TCPを使用し、書き込みレイテンシと一貫性が最も重要になる場合はRDMAを選択してください。

ハードウェアのフットプリントは実用的です。2UシャーシにU.2またはU.3 NVMeドライブ用のフロントベイを26個搭載し、アクティブな高可用性と、NVMeの速度よりも容量を優先する必要がある場合のSASシェルフへの容易な拡張を実現します。QSM 4は、期待されるデータサービスとクリーンなUIに加え、既存の自動化システムとのシームレスな統合を可能にするREST APIを備えています。小規模なITチームにとって、QSM 4は設定と管理が容易です。これを検証するために、Proxmoxクラスターを容易に統合し、これらのVMから高速ストレージへのアクセスを提供しました。より高度なワークロード向けには、QSANが中小企業のAIニーズに十分対応できる体制を整えています。

予測可能なパフォーマンス、スムーズな管理、そしてマルチプロトコル対応を重視する組織にとって、XN4226Dは自信を持ってお勧めできる製品です。真のNVMeスループット、RDMAによる優れた書き込みレイテンシ、そして速度低下を招かないソフトウェアエクスペリエンスを提供します。さらに、リーズナブルな価格設定も相まって、このQSANプラットフォームは、混在環境をスムーズに構築できます。

QSAN 製品ページ

StorageReview と連携する

ニュースレター| YouTube | ポッドキャスト(iTunes / Spotify) | Instagram | Twitter | TikTok | RSSフィード

アンドリュー・ワーグ

Andrew Waag 氏は Linde plc の分散システム管理者で、サーバー ハードウェア、エンタープライズ ストレージ システム、ネットワーク機器などに興味を持っています。彼は常にホームラボで実行できる新しいことを模索し、仮想化とストレージ テクノロジの実験を行っています。