StorageReview.com

Western Digital OpenFlex Data24 – Analýza výkonu GPUDirect

Enterprise  ◇  Podnikové úložiště

Tuto zprávu sponzoruje společnost Western Digital. Veškeré názory a stanoviska vyjádřené v této zprávě vycházejí z našeho nezaujatého pohledu na daný produkt (produkty).

Umělá inteligence je v dnešní době velkým hitem a zatímco někteří hyperscaleři vytvářejí řešení na míru pro své problémy s daty z umělé inteligence, Western Digital (WD) má pro nás ostatní odpověď. Western Digital OpenFlex™ Data24™ nabízí robustní a škálovatelné úložné řešení, které splňuje vysoké nároky na propustnost umělé inteligence a dalších úloh akcelerovaných GPU. Umožněním přímých datových cest mezi pamětí GPU a úložištěm OpenFlex Data24 výrazně snižuje latenci. Maximalizuje také šířku pásma, čímž zajišťuje efektivní zpracování dat a optimální využití GPU pro rychlejší a efektivnější zpracování rozsáhlých datových sad.

Díky využití NVMe-oF™ může společnost Western Digital sdílet deagregované vysokorychlostní úložiště napříč více servery, což zajišťuje rychlý přístup k datům a jejich přenos. Bezproblémová integrace OpenFlex Data24 s vysoce výkonnými grafickými procesory umožňuje dosáhnout obrovské propustnosti potřebné pro trénování a inferenci umělé inteligence, což z něj dělá klíčového nástroje pro provoz datových center nové generace. Díky těmto vlastnostem je OpenFlex Data24 výkonným nástrojem pro každou organizaci, která chce využít plný potenciál umělé inteligence a dalších pokročilých výpočetních úloh.

Western Digital OpenFlex Data24 4000

Úložná platforma OpenFlex Data24 řady 4000 NVMe-oF od společnosti Western Digital přináší do sdílených úložných prostředí bezkonkurenční výkon. Tato vysoce výkonná platforma rozšiřuje možnosti flash paměti NVMe™ a poskytuje sdílení s nízkou latencí přes ethernetovou strukturu. Řada Data24 4000 využívá šest zařízení Western Digital RapidFlex™ A2000 Fabric Bridge k zajištění bezproblémového síťového připojení s využitím až dvanácti portů 100GbE. Tato rozhraní podporují protokoly RoCEv2 i TCP a poskytují tak všestranné možnosti přenosu dat.

Šasi je navrženo ve formátu 2U a pojme až 24 dvouportových U.2 NVMe SSD disků. Díky podpoře PCIe® Gen4 je tato platforma navržena tak, aby plně využila výkon každého SSD disku a zároveň zachovala vysokou šířku pásma v celém šasi. NVMe SSD disky jsou k dispozici v různých kapacitách a variantách odolnosti, včetně SSD disků Ultrastar® DC SN655 s kapacitou až 15.36 TB, což je celková hrubá kapacita 368 TB¹.

Návrh platformy eliminuje nadměrné předplatné a zajišťuje vyvážený přístup, který zachovává výkon NVMe. Řada Data24 4000 také zahrnuje podporu RESTful API pro efektivní správu, usnadňuje používání a integraci do stávajících IT infrastruktur.

Vysoká dostupnost a spolehlivost podnikové třídy jsou klíčovými atributy řady Data24 4000. Důležité prvky, jako jsou duální I/O moduly a redundance ventilátorů N+2, poskytují klid a zajišťují nepřetržitý provoz i při nepředvídaných selháních komponent. Na celou platformu, včetně SSD disků, se vztahuje 5letá omezená záruka.

Klíčové specifikace Western Digital OpenFlex Data24

Specifikace OpenFlex Data24
Maximální kapacita úložiště 368TB
Vstupní napětí 120 V - 240 V
PSU Duální 800W
Rychlost přenosu dat 12x 100Gb/s NVMe-oF
Form Factor 2U
Provozní teplota 10 ° C až 35 ° C
Hmotnost 18.25 kg / 40.2 lbs
Rozměry (Š x V x V) 491.9 mm × 628.65 mm × 85.5 mm / 19.37 palce × 24.75 palce × 3.37 palce
Spotřeba energie (max./typ.) 750 W / ~550 W
Účinnost zdroje 80 plus titan
Sloty pro mechaniky 24
Chlazení 4 systémové ventilátory (podpora N+2)
Rackové jednotky (U) 2U
Požadovaná hloubka stojanu 1000 mm (39.4 palce)
Požadovaná šířka regálu 450 mm (17.72 palce)

Testování dat OpenFlex24

Abychom prodloužili životnost OpenFlex Data24, museli jsme dát dohromady několik klíčových prvků: NVIDIA GPUDirect™, NVIDIA IndeX® a ohromujících 5.9 TB dat simulace tornáda. Využitím NVIDIA GPUDirect jsme umožnili přímou komunikaci mezi pamětí GPU a OpenFlex Data24, čímž jsme drasticky snížili latenci a maximalizovali datovou propustnost. Využití NVIDIA IndeX nám umožnilo vizualizovat a efektivněji interagovat s masivní datovou sadou tornád a demonstrovat tak schopnosti systému zpracovávat data v reálném čase. Toto nastavení poskytlo perfektní testovací prostředí pro demonstraci schopnosti OpenFlex Data24 zvládat intenzivní úlohy umělé inteligence a rozsáhlé zpracování dat s pozoruhodnou rychlostí a efektivitou.

NVIDIA GPUDirect

Technologie NVIDIA GPUDirect výrazně zvyšuje efektivitu přenosu dat ve vysoce výkonných výpočetních prostředích s grafickými procesory (GPU). Tato sada technologií optimalizuje pohyb dat mezi grafickými procesory (GPU) a dalšími systémovými komponentami. Snížením latence a režijních nákladů umožňuje GPUDirect přímější komunikaci mezi grafickými procesory (GPU) a periferiemi, jako jsou síťové adaptéry, úložná zařízení a další GPU. Tradiční procesy přenosu dat zahrnují směrování dat přes CPU a systémovou paměť, což vytváří úzká hrdla, která omezují výkon. GPUDirect tato úzká hrdla zmírňuje tím, že umožňuje přímý přístup k paměti (DMA) GPU, obejde CPU a systémovou paměť, a tím zvyšuje celkovou propustnost.

Podle Harryho Pettyho, vedoucího technického marketingového manažera společnosti NVIDIA:

„Technologie NVIDIA poskytují nízkou latenci a rychlý přenos dat z úložiště, čímž optimalizují výkon úloh umělé inteligence snížením doby nečinnosti GPU. To přináší rychlejší trénování modelů a přesnější výsledky, což umožňuje rychlejší objevování a efektivnější pracovní postupy.“

GPUDirect obsahuje několik klíčových funkcí, včetně GPUDirect RDMA, která usnadňuje přímý přenos dat mezi GPU a síťovými adaptéry s podporou RDMA. Tato přímá komunikace je klíčová pro aplikace vyžadující rychlou výměnu dat, jako jsou vědecké simulace a rozsáhlá analýza dat. Umožněním rychlejšího přenosu dat snižuje GPUDirect RDMA latenci a zvyšuje efektivitu clusterů GPU. GPUDirect Storage navíc těsněji integruje GPU s vysokorychlostními úložnými systémy, což umožňuje datově náročným aplikacím využít maximální šířku pásma moderního úložiště NVMe. Tato integrace zrychluje přístup k datům a zkracuje dobu strávenou čekáním na načtení dat do paměti GPU, což je klíčové pro analýzu v reálném čase a rozsáhlé úlohy strojového učení.

Možnosti GPUDirect jsou obzvláště užitečné v prostředích, kde více GPU pracuje v tandemu, jako jsou například trénovací clustery hlubokého učení. Usnadněním přímé komunikace mezi GPU optimalizuje GPUDirect paralelní zpracování a výrazně snižuje režijní náklady spojené s přenosy dat mezi GPU. Toto vylepšení je obzvláště výhodné při trénování složitých neuronových sítí, kde je nutné rychle vyměňovat velké objemy dat mezi více GPU. Zvýšení efektivity díky GPUDirect je patrné také v aplikacích, jako jsou simulace molekulární dynamiky a dynamika tekutin, kde je výpočetní zátěž rozdělena mezi více GPU, aby se dosáhlo rychlejších výsledků.

NVIDIA Index

NVIDIA IndeX je pokročilý nástroj pro volumetrickou vizualizaci navržený pro zpracování rozsáhlých datových sad s vysokou věrností. IndeX využívá akceleraci GPU k poskytování interaktivní vizualizace 3D volumetrických dat v reálném čase, což ho činí nepostradatelným pro odvětví, jako je průzkum ropy a zemního plynu, lékařské zobrazování a vědecký výzkum. Tradiční vizualizační nástroje se často potýkají s naprostým rozsahem a složitostí moderních datových sad, což vede k pomalejšímu vykreslování a méně interaktivnímu uživatelskému prostředí. IndeX tato omezení překonává využitím technologie GPU od NVIDIA k vysoce výkonnému vykreslování a zpracování dat, což zajišťuje, že uživatelé mohou se svými daty interagovat v reálném čase.

Schopnosti IndeXu jsou dány jeho schopností využít paralelní výpočetní výkon GPU, což mu umožňuje efektivně spravovat a vykreslovat rozsáhlá objemová data. Tato schopnost je cenná v aplikacích, které vyžadují vizualizaci s vysokým rozlišením, jako je seismická interpretace a simulace ložiska v ropném a plynárenském sektoru. Poskytováním detailních a přesných vizuálních reprezentací podpovrchových struktur pomáhá IndeX geovědcům činit informovanější rozhodnutí. V lékařské oblasti IndeX usnadňuje vizualizaci složitých anatomických struktur pomocí zobrazovacích metod, jako jsou magnetická rezonance a počítačová tomografie, a pomáhá tak s diagnostikou a plánováním léčby.

Schopnost IndeXu pro vykreslování v reálném čase je také klíčová pro vědecký výzkum, kde je třeba vizualizovat a rychle analyzovat velké datové sady ze simulací a experimentů. Výzkumníci mohou interaktivně manipulovat s daty a zkoumat je, což umožňuje rychlejší testování a objevování hypotéz. Škálovatelnost IndeXu zajišťuje, že zvládne rostoucí objemy dat generované pokročilými vědeckými přístroji a simulacemi, a poskytuje tak výzkumníkům nástroje pro efektivní vizualizaci a interpretaci jejich dat. Díky bezproblémové integraci se stávajícími pracovními postupy a podpoře různých datových formátů zvyšuje IndeX produktivitu a urychluje tempo objevování napříč různými obory.

Spojení všeho dohromady

Integrace řady Data24 4000 s technologií NVIDIA GPUDirect výrazně zvyšuje výkon aplikací náročných na GPU zefektivněním přenosu dat mezi GPU a úložištěm. GPUDirect usnadňuje přímý přístup k paměti, což umožňuje přesun dat mimo CPU a systémovou paměť, čímž se snižuje latence a zvyšuje propustnost. V kombinaci s vysoce výkonnými funkcemi NVMe-oF řady Data24 4000 zajišťuje GPUDirect, že GPU mohou rychle přistupovat k velkým datovým sadám uloženým na NVMe SSD discích.

Tato integrace je obzvláště výhodná v prostředích, kde je klíčová vysokorychlostní výměna dat mezi grafickými procesory (GPU) a úložištěm, jako je například hluboké učení a vědecké simulace. Nízká latence a vysoká šířka pásma řady Data24 4000 ve spojení s přímými datovými cestami, které umožňuje technologie GPUDirect, minimalizují doby přenosu dat a umožňují efektivnější využití GPU. Tato synergie optimalizuje výkon úloh paralelního zpracování, kde více GPU vyžaduje rychlý a častý přístup ke sdíleným datům.

Pro toto testování jsou server OpenFlex Data24 4000 a GPU propojeny přes 200GbE přepínač s protokolem NVMe-oF RoCEv2 se shodnými MTU 5000. Server GPU používá 3 Mellanox® CX7 RNIC s 2x 200 GbE na RNIC. OpenFlex Data24 4000 je k dispozici s 12x 100GbE porty. Každý port CX7 má 2 IP adresy, což umožňuje mapování jednoho CX7 na čtyři porty na Data24. To zajišťuje konektivitu ke všem 4 PCIe linkám na každém dvouportovém disku. 6x 200GbE linek se rovná potenciálu šířky pásma 12x 100GbE linek pro neblokující síťovou architekturu.

Každá karta NVIDIA H100 je připojena přes slot PCIe Gen5 x16, který teoreticky může dosáhnout šířky pásma 64 GB/s obousměrně. Každý port RNIC 200GbE a 100GbE může teoreticky dosáhnout rychlosti 25 GB/s, respektive 12.5 GB/s. Důležitým aspektem návrhu je zajištění neblokující architektury. To vyžaduje, aby grafické karty, RNIC a disky NVMe-oF byly fyzicky namapovány na stejný přepínač CPU, NUMA a PLX. To umožňuje konfiguraci plně využít výhod GPUDirect. Jak je vidět v této implementaci, zrcadlená konfigurace na druhém přepínači CPU, NUMA a PLX by umožnila předvídatelné škálování výpočetního výkonu a teoretické zdvojnásobení výkonu.

V trénovacích klastrech umělé inteligence může kombinace Data24 4000 a GPUDirect umožnit rychlejší trénovací časy snížením úzkých míst spojených s načítáním dat. Efektivní datové cesty zajišťují, že GPU mohou nepřetržitě přijímat data bez přerušení, čímž se udržují vysoké rychlosti zpracování a zlepšuje celková efektivita systému. Toto nastavení je také výhodné pro analýzu v reálném čase a další aplikace, které vyžadují rychlý přístup k datům a jejich zpracování, což poskytuje významné zvýšení výkonu pro různé výpočetní úlohy.

Konfigurace serveru NVIDIA Index

Pro test NVIDIA IndeX jsme použili desku Supermicro 521GE-TNRT vybavenou přepínanou backplane PCIe, dvojici grafických karet NVIDIA H100 a tři síťové karty NVIDIA ConnectX-7.

Klíčové specifikace Supermicro® 521GE-TNRT
Model Supermicro 521GE-TNRT
Procesor 2x Intel® Xeon® Platinum 8462Y+
Memory 1TB DDR5
GPU 2x NVIDIA H100 PCIe
Síťové rozhraní 3x síťové karty NVIDIA ConnectX-7

Syntetické testování GDSIO

Jako benchmarkový nástroj pro tento účel se používá GDSIO, specializovaný proprietární nástroj od společnosti NVIDIA určený k měření výkonu úložiště v prostředích GDS (GPU-direct storage). Pro toto kolo testování jsme se podívali na několik konfigurací: jednu GPU s 12 disky a 24 disky a také dvě GPU s 24 disky.

Výkon disku Western Digital OpenFlex Data24 v testu GDSIO Performance ve spojení s grafickými kartami NVIDIA H100 odhaluje poznatky o hrubém výkonu disků. V konfiguraci s 12 disky a jednou grafickou kartou dosáhl systém šířky pásma zápisu 44.14 GB/s. Zvýšení počtu disků na 24 s využitím jedné grafické karty vykázalo mírné zlepšení, přičemž výkon zápisu dosáhl 54.15 GB/s. Zavedení druhé grafické karty v konfiguraci s 24 disky vedlo k podstatnému zvýšení šířky pásma zápisu na 87.91 GB/s.

Výkon čtení sleduje podobný trend. Konfigurace s 12 disky a jednou grafickou kartou přinesla propustnost čtení 53.47 GB/s. Rozšíření na 24 disků s jednou grafickou kartou ji mírně zvýšilo na 54.75 GB/s. Nejvýraznější zlepšení však nastalo u nastavení s dvěma grafickými kartami, kde systém dosáhl působivé propustnosti čtení 101.14 GB/s. Tyto výsledky podtrhují schopnost systému OpenFlex Data24 předvídatelně škálovat se zvýšeným počtem disků.

Přidání grafických procesorů (GPU) hraje klíčovou roli v maximalizaci výkonu. Konfigurace s 24 disky a dvěma GPU se ukázala jako optimální a poskytuje nejvyšší šířku pásma pro operace čtení a zápisu. Tento test podtrhuje důležitost akcelerace GPU pro využití plného potenciálu frameworku GDSIO. OpenFlex Data24 ve spojení s grafickými procesory NVIDIA H100 vykazuje výjimečný výkon, což z něj činí robustní řešení pro náročná úložná prostředí.

U úloh s umělou inteligencí, kde je rychlý příjem a zpracování dat klíčový, se výkon pozorovaný u OpenFlex Data24 může promítnout do významného zkrácení doby trénování a efektivnějšího zpracování velkých datových sad. Schopnost rychle přesouvat data z úložiště do paměti GPU zajišťuje, že výpočetní zdroje výkonných GPU jsou plně využity, což usnadňuje rychlejší a efektivnější trénování a inferenci modelů.

Použití OpenFlex Data24 k napájení tornád H100

Klimatologičtí vědci již dlouho studují supercelové bouřky, atmosférické jevy zodpovědné za nejprudší a nejnebezpečnější tornáda na světě. Tyto bouře jsou dynamické a složité, takže přesné simulace jsou časově a datově náročné. Zkoumání takových dat je pomalý a těžkopádný proces, jehož vykreslení nových vizualizací často trvá hodiny.

Použití grafických procesorů NVIDIA a NVIDIA IndeX způsobilo v této oblasti revoluci. Vědci nyní mohou provádět volumetrické vizualizace v reálném čase. Simulace, kterou jsme spustili na systému Supermicro s H100 (s daty z OpenFlex Data24), ukazuje bouři v Oklahomě v roce 2011, kterou simuloval profesor Leigh Orf. Tato simulace, matematicky odvozená z počátečních podmínek těsně před vznikem tornáda, zahrnuje 250 miliard bodů mřížky, z nichž každý má více než tucet atributů, jako je déšť, kroupy, tlak a rychlost větru. Tato podrobná vizualizace zobrazující 6000 kroků simulace poskytuje bezprecedentní vhled do dynamiky tornáda.

Klíčem k této simulaci je NanoVDB, kompaktní datová struktura s řídkým objemem, která snižuje velikost datových sad a paměťovou náročnost mapováním dat přímo do paměti GPU. Ve spojení s technologií GPUDirect Storage a OpenFlex Data24 jsme dosáhli rychlosti až 89 GB/s a mohli jsme zobrazit výsledky rychlostí přes 13 snímků za sekundu. To se přibližně rovná 5.9 TB datové sady zpracované každých 66 sekund. Tato kombinace umožňuje interaktivní navigaci, úpravy parametrů za běhu a snadné procházení simulací.


S vypnutou technologií GPUDirect (a tedy daty nyní procházejícími komplexem CPU) se šířka pásma sníží na přibližně 15 GB/s a snímková frekvence výrazně klesne na 4 snímky za sekundu.

Rychlost je klíčová, ale fotorealistická kvalita je také nezbytná pro ověření přesnosti simulací. Pokud se simulace a realita neshodují, je nutné modely opravit. Pro tuto vizualizaci se používá NVIDIA Iray, tracer založený na GPU, který vykresluje fyzikálně správný transport světla, spolu s objemovými daty NVIDIA IndeX. Trychtýř tornáda, kontakt se zemí a detailní prvky, jako je poměr oblaků a vody a déšť, reprezentované modrošedými póry, jsou jasně viditelné.

Závěr

V tomto projektu jsou dobře demonstrovány výhody v oblasti výkonu, času a nákladů, které může dobře nakonfigurovaná neblokující architektura nabídnout úlohám akcelerovaným GPU. Jednoduše řečeno, dosažení maximální propustnosti nebo výpočetní kapacity GPU vede k efektivnějším výsledkům a návratnosti investic.

Architektura společnosti Western Digital podporuje Open Composable Infrastructure (OCI) a platforma OpenFlex Data24 4000 tento přístup OCI využívá k rozdělení úložiště dat pomocí technologie NVMe-over-Fabrics (NVMe-oF). Toto oddělení úložných zdrojů od serveru GPU nejen pomáhá uvolnit zdroje serverů (uvolňuje tyto zdroje z tradičních upgradů lockstep), ale zároveň umožňuje jemné doladění mapování disků NVMe na GPU. Toto přesné přizpůsobení disků požadavkům GPU umožňuje důkladně řešit potřeby výkonu, kapacity a kapacity dat GPU, což zase nabízí předvídatelné škálování a flexibilitu potřebnou pro tyto zdroje.

Protože data již nejsou izolovaná, stávají se dostupným síťovým úložným zdrojem, který lze podle potřeby sdílet mezi více GPU servery, což dále zvyšuje flexibilitu.

Western Digital OpenFlex Data24 v kombinaci s technologií NVIDIA GPUDirect prokazuje impozantní schopnosti zvládat úlohy akcelerované umělou inteligencí a dalšími GPU. Umožněním přímých datových cest mezi pamětí GPU a úložištěm NVMe výrazně snižuje Data24 latenci a maximalizuje šířku pásma, čímž zajišťuje efektivní zpracování dat a optimální využití GPU. Tato integrace umožňuje rychlejší a efektivnější zpracování rozsáhlých datových sad, což z Data24 činí neocenitelný přínos v moderních datově náročných prostředích.

Naše testování v reálném prostředí, zahrnující rozsáhlou datovou sadu simulací tornád, ukázalo pozoruhodné zvýšení výkonu, kterého bylo díky tomuto nastavení dosaženo. Schopnost OpenFlex Data24 poskytovat vysokou propustnost a nízkou latenci datových přenosů ve spojení s vizualizačními schopnostmi NVIDIA IndeX v reálném čase podtrhuje jeho potenciál v náročných aplikacích, jako je trénování umělé inteligence, vědecké simulace a analýza v reálném čase.

Využití řady Data24 a technologie GPUDirect pro trénovací clustery umělé inteligence může výrazně zkrátit dobu trénování zajištěním plynulého toku dat z úložiště do grafických procesorů (GPU). Toto nastavení minimalizuje úzká hrdla a zvyšuje celkovou efektivitu systému, což z něj činí klíčovou součást při vytváření rychlejších a přesnějších modelů umělé inteligence.

Kromě umělé inteligence se výhody OpenFlex Data24 rozšiřují i ​​na další úlohy akcelerované GPU, včetně vysoce výkonných výpočtů a analýzy dat v reálném čase. Snížená latence a zvýšená propustnost, které tato platforma umožňuje, zajišťují, že aplikace vyžadující rychlý přístup k datům a jejich zpracování mohou pracovat na špičkový výkon a poskytovat včasné a přesné výsledky.

Podívejte se na tuto ukázku v akci od 6. do 8. srpna 2024 na stánku č. 607 na veletrhu FMS 2024.

Platformy Western Digital OpenFlex

[1] Jeden terabajt (TB) se rovná jednomu bilionu bajtů. Skutečná uživatelská kapacita může být menší v důsledku provozního prostředí.

Zapojte se do StorageReview

Zpravodaj | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS kanál

Brian Beeler

Brian sídlí v Cincinnati ve státě Ohio a je hlavním analytikem a prezidentem společnosti StorageReview.com.

Předchozí příspěvek:

Další příspěvek: