StorageReview.com

Dopad úložiště a GPU na úlohy umělé inteligence

Enterprise  ◇  Software a licence

Téměř neuplyne týden, abychom od IT dodavatele neslyšeli o dopadu jeho řešení na organizace zabývající se umělou inteligencí, hlubokým učením, strojovým učením nebo edge inteligencí. Problém je však v tom, že chybí podstatné poznatky o tom, jak tato řešení ovlivňují výkon každého z těchto úkolů. Nedávno jsme se rozhodli zjistit, zda s tím můžeme něco udělat, a to partnerstvím se společností byteLAKE, která se zabývá vývojem řešení pro umělou inteligenci a HPC se sídlem v Polsku. Hlavním cílem je vyhodnotit dopad úložišť a GPU na pracovní zátěž umělé inteligence.

Dopad úložiště na umělou inteligenci

Zpočátku jsme chtěli prozkoumat populární názor, že lokální úložiště ovlivňuje výkon modelů umělé inteligence. V naší laboratoři jsme použili jeden ze serverů Dell EMC PowerEdge R740xd , nakonfigurovaný se dvěma procesory Intel Xeon Gold 6130 s 256 GB paměti DRAM. Spustili jsme test umělé inteligence byteLAKE s využitím tří různých alternativ lokálního úložiště. Pro test jsme použili starší SSD disk KIOXIA PX04S spolu s mnohem rychlejším diskem Samsung 983 ZET a pamětí Intel Optane 900P.

úložný grafický procesor s umělou inteligencí Dell EMC 740

Během benchmarku jsme analyzovali výkon procesu učení umělé inteligence. V testech jsme spustili proces učení pro reálný scénář. V tomto případě byly testy součástí trénovacího postupu v jednom z produktů byteLAKE: EWA Guard . Je založen na nejnovějším modelu YOLO (You Only Look Once), což je nejmodernější model detekce v reálném čase. Model se skládá z jedné vstupní vrstvy, 22 konvolučních vrstev, 5 vrstev sdružování, 2 vrstev routeru, jedné vrstvy reorganizace a jedné detekční vrstvy.

Jako základní metriku výkonu jsme použili dobu provádění trénování pro 5000 epoch. Benchmarky byly pro každou konfiguraci úložiště třikrát opakovány a průměrné hodnoty jsou uvedeny níže.

výsledky:

  • KIOXIA 98 hodin 24 minut
  • Samsung 98h 44
  • Intel 98h 42

Jak je z dat zřejmé, lokální úložiště nemělo žádný vliv na výkon. Testování se pohybovalo od SATA SSD až po nejnovější a nejlepší Optane, ale bez jakéhokoli dopadu. Úložiště však může hrát důležitější roli, pokud jde o příchozí a odchozí data, ale z výpočetního hlediska pro umělou inteligenci v tomto případě žádný dopad nebyl.

Dopad GPU a úložiště na umělou inteligenci

S daty o úložišti k dispozici jsme k PowerEdge přidali jeden grafický procesor NVIDIA T4, abychom posoudili vliv grafického procesoru na umělou inteligenci. Pro toto testování jsme také spustili stejné tři konfigurace úložiště.

NVIDIA Tesla T4

výsledky:

  • KIOXIA 4h 30
  • Samsung 4h 28m
  • Intel 4h 27m

Jak se očekávalo, GPU zaznamenala velký dopad, a to exponenciální dopad, který vedl k 22násobnému zlepšení. Vzhledem k tomu, že GPU zrychlila celkový výkon umělé inteligence, někteří se domnívali, že by mohlo mít vliv i rychlejší úložiště. To se však nepotvrdilo, protože SATA disk byl přesně v souladu s vysokorychlostním NVMe.

Závěry

V tomto testování jsme zjistili, že použití rychlejších úložných zařízení nezlepšuje výkon učení. Hlavním důvodem je složitá struktura modelu umělé inteligence. Doba učení je delší než doba čtení dat. Jinými slovy, doba učení s využitím aktuální dávky obrázků je delší než doba potřebná pro čtení další dávky. V důsledku toho jsou operace ukládání skryty za výpočty umělé inteligence.

Při přidání NVIDIA T4 se předpokládalo, že rychlejší zpracování umělou inteligencí by mělo vliv na výkon úložiště. V tomto testu se tak nestalo, protože i s T4 měl model umělé inteligence stále větší složku učení a nevyžadoval úložiště, aby byl nijak zvlášť rychlý.

I když je třeba vynaložit další úsilí k dalšímu testování dopadu konkrétních komponent a systémů na umělou inteligenci, domníváme se, že tato počáteční data jsou užitečná a dobrým výchozím bodem pro diskusi. Potřebujeme aplikační data, abychom lépe pochopili, kde se z hlediska IT nacházejí správné páky a kde mohou rozpočtové výdaje přinést nejvýraznější výsledky. To samozřejmě do značné míry závisí také na tom, kde se tato aktivita odehrává, ať už v datovém centru nebo na okraji sítě. Prozatím vítáme zapojení společnosti byteLAKE a dalších, kteří jsou na špičce AI, aby pomohli poskytnout užitečná data a zodpovědět tyto naléhavé otázky.

Toto je náš první test umělé inteligence, ale ne poslední. Mariusz Kolanko, spoluzakladatel společnosti byteLAKE, uvedl, že pracují na produktu s názvem CFD Suite (AI pro výpočetní dynamiku tekutin „CFD“ pro urychlení řešičů), kde proces hlubokého učení vyžaduje velké množství dat pro každou epochu trénování. Tento model může ve skutečnosti klást vyšší zátěž na úložiště pro trénování modelů v oblasti velkých dat a mohl by mít vliv na výkon samotných procesů hlubokého učení. V konečném důsledku, stejně jako u jakékoli aplikace, je důležité pochopit, že aplikace potřebuje přiřadit správné zdroje datového centra. Umělá inteligence zjevně není univerzální aplikací.

Zjistěte více o byteLAKE

Diskutujte na Redditu

Zapojte se do StorageReview

Zpravodaj | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS kanál

Brian Beeler

Brian sídlí v Cincinnati ve státě Ohio a je hlavním analytikem a prezidentem společnosti StorageReview.com.

Předchozí příspěvek:

Další příspěvek: