StorageReview.com

Recenze grafické karty NVIDIA L4 – Průvodce nízkopříkonovým inferencováním

AI  ◇  Enterprise

V neustávajícím proudu inovací dnešního světa umělé inteligence je měření a pochopení schopností různých hardwarových platforem klíčové. Ne každá umělá inteligence vyžaduje obrovské farmy trénovacích grafických procesorů (GPU), důležitým segmentem je inference umělé inteligence, která často vyžaduje méně výkonu GPU, zejména na okraji sítě. V této recenzi se podíváme na několik grafických procesorů NVIDIA L4 na třech různých serverech Dell a na různé úlohy, včetně MLperf, abychom zjistili, jak si L4 vede.

NVIDIA L4

Grafický procesor NVIDIA L4

V jádru L4 nabízí působivých 30.3 teraFLOP s výkonem FP32, což je ideální pro vysoce přesné výpočetní úlohy. Jeho schopnosti se rozšiřují i ​​na výpočty se smíšenou přesností s tenzorovými jádry TF32, FP16 a BFLOAT16, která jsou klíčová pro efektivitu hlubokého učení. Specifikace L4 uvádí výkon mezi 60 a 121 teraFLOP.

V úlohách s nízkou přesností se L4 blýská s 242.5 teraFLOP v tenzorových jádrech FP8 a INT8, což vylepšuje inferenciaci neuronových sítí. Jeho 24GB paměť GDDR6, doplněná o šířku pásma 300 GB/s, mu umožňuje zpracovávat velké datové sady a složité modely. Nejvýraznější je zde energetická účinnost L4, s TDP 72 W, což ho činí vhodným pro různá výpočetní prostředí. Tato kombinace vysokého výkonu, paměťové efektivity a nízké spotřeby energie dělá z NVIDIA L4 přesvědčivou volbu pro výpočetní výzvy na okraji sítě.

Grafická karta NVIDIA L4 na platformě R760
Specifikace NVIDIA L4
FP 32 30.3 teraFLOPů
Tenzorové jádro TF32 60 teraFLOPů
FP16 Tensor Core 121 teraFLOPů
Tensor Core BFLOAT16 121 teraFLOPů
FP8 Tensor Core 242.5 teraFLOPů
INT8 Tensor Core 242.5 TOPs
Paměť GPU 24GB GDDR6
Šířka pásma paměti GPU 300GB / s
Maximální tepelný návrhový výkon (TDP) 72W
Form Factor 1slotový nízkoprofilový PCIe
Propojit PCIe Gen4 x16
Tabulka specifikací L4

Samozřejmě, vzhledem k ceně L4 někde kolem 2500 dolarů, A2 za zhruba poloviční cenu a starší (ale stále docela schopný) T4 dostupný za méně než 1000 dolarů, je zřejmou otázkou, jaký je rozdíl mezi těmito třemi inferenčními GPU.

Specifikace NVIDIA L4, A2 a T4 NVIDIA L4 Nvidia A2 Nvidia T4
FP 32 30.3 teraFLOPů 4.5 teraFLOPů 8.1 teraFLOPů
Tenzorové jádro TF32 60 teraFLOPů 9 teraFLOPů N / A
FP16 Tensor Core 121 teraFLOPů 18 teraFLOPů N / A
Tensor Core BFLOAT16 121 teraFLOPů 18 teraFLOPů N / A
FP8 Tensor Core 242.5 teraFLOPů N / A N / A
INT8 Tensor Core 242.5 TOPs 36 TOPS 130 TOPS
Paměť GPU 24GB GDDR6 16GB GDDR6 16GB GDDR6
Šířka pásma paměti GPU 300GB / s 200GB / s 320+ GB/s
Maximální tepelný návrhový výkon (TDP) 72W 40-60W 70W
Form Factor 1slotový nízkoprofilový PCIe
Propojit PCIe Gen4 x16 PCIe Gen4 x8 PCIe Gen3 x16
Tabulka specifikací L4 A2 T4

Jedna věc, kterou je třeba si uvědomit při pohledu na tyto tři karty, je, že se nejedná o generačně rovnocenné náhrady, což vysvětluje, proč T4 i po mnoha letech zůstává oblíbenou volbou pro některé případy použití. A2 přišla jako náhrada za T4, tedy s nízkou spotřebou energie a lepší kompatibilitou (x8 vs. x16 mechanická) varianta. Technicky vzato je L4 tedy náhradou za T4, přičemž A2 se nachází v meziprostoru, který se může, ale nemusí v budoucnu dočkat aktualizace.

Výkon MLPerf Inference 3.1

MLPerf je konsorcium lídrů v oblasti umělé inteligence z akademické sféry, výzkumu a průmyslu, založené za účelem poskytování spravedlivých a relevantních benchmarků hardwaru a softwaru umělé inteligence. Tyto benchmarky jsou navrženy tak, aby měřily výkon hardwaru, softwaru a služeb strojového učení v různých úlohách a scénářích.

Naše testy se zaměřují na dva specifické benchmarky MLPerf: Resnet50 a BERT.

  • Resnet50: Toto je konvoluční neuronová síť používaná především pro klasifikaci obrázků. Je dobrým ukazatelem toho, jak dobře systém zvládá úlohy hlubokého učení související se zpracováním obrazu.
  • BERT (Bidirectional Encoder Representations from Transformers): Tento benchmark se zaměřuje na úlohy zpracování přirozeného jazyka a nabízí vhled do toho, jak systém rozumí a zpracovává lidský jazyk.

Oba tyto testy jsou klíčové pro vyhodnocení schopností hardwaru umělé inteligence v reálných scénářích zahrnujících zpracování obrazu a jazyka.

Vyhodnocení NVIDIA L4 pomocí těchto benchmarků je klíčové pro pochopení schopností GPU L4 v konkrétních úlohách umělé inteligence. Nabízí také vhled do toho, jak různé konfigurace (jednoduché, dvojité a čtyřnásobné nastavení) ovlivňují výkon. Tyto informace jsou nezbytné pro profesionály a organizace, které chtějí optimalizovat svou infrastrukturu umělé inteligence.

Modely běží ve dvou klíčových režimech: serverový a offline.

  • Offline režim: Tento režim měří výkon systému, když jsou všechna data k dispozici pro zpracování současně. Je to podobné dávkovému zpracování, kdy systém zpracovává velkou datovou sadu v jedné dávce. Offline režim je klíčový pro scénáře, kde latence není primárním problémem, ale propustnost a efektivita ano.
  • Serverový režim: Naproti tomu serverový režim vyhodnocuje výkon systému ve scénáři napodobujícím reálné serverové prostředí, kde požadavky přicházejí jeden po druhém. Tento režim je citlivý na latenci a měří, jak rychle systém dokáže reagovat na každý požadavek. Je nezbytný pro aplikace pracující v reálném čase, jako jsou webové servery nebo interaktivní aplikace, kde je nutná okamžitá reakce.

1× NVIDIA L4 – Dell PowerEdge XR7620

NVIDIA L4 v Dellu XR7620

V rámci naší nedávné recenze serveru Dell PowerEdge XR7620 , vybaveného jedním grafickým čipem NVIDIA L4, jsme jej vzali na okraj sítě, kde jsme spustili několik úloh, včetně MLPerfu.

Konfigurace našeho testovacího systému zahrnovala následující komponenty:

  • 2 x Xeon Gold 6426Y – 16jádrový 2.5 GHz
  • 1× NVIDIA L4
  • 8× 16GB DDR5
  • 480GB BOSS RAID1
  • Ubuntu Server 22.04
  • Ovladač NVIDIA 535
Dell PowerEdge XR7620 1x NVIDIA L4 Skóre
Resnet50 – Server 12,204.40
Resnet50 – Offline 13,010.20
BERT K99 – Server 898.945
BERT K99 – Offline 973.435

Výkon v serverovém i offline režimu pro Resnet50 a BERT K99 je téměř identický, což naznačuje, že L4 si udržuje konzistentní výkon napříč různými modely serverů.

1, 2 a 4 grafické karty NVIDIA L4 – Dell PowerEdge T560

Dell PowerEdge T560 Tower – Nvidia L4 GOU x4

Konfigurace naší recenzované jednotky zahrnovala následující komponenty:

  • 2 x Intel Xeon Gold 6448Y (32 jader/64 vláken, TDP 225 W, 2.1–4.1 GHz)
  • 8 x 1.6TB SSD disky Solidigm P5520 s kartou PERC 12 RAID
  • 1–4 grafické karty NVIDIA L4
  • 8 x 64GB RDIMM moduly
  • Ubuntu Server 22.04
  • Ovladač NVIDIA 535
Návrat z okraje sítě do datového centra a jeho využití všestranný věžový počítač Dell T560 serveru, všimli jsme si, že L4 si vede v testu s jednou GPU stejně dobře. To ukazuje, že obě platformy mohou poskytnout solidní základ pro L4 bez úzkých hrdel.
Dell PowerEdge T560 1x NVIDIA L4 Skóre
Resnet50 – Server 12,204.40
Resnet50 – Offline 12,872.10
Bert K99 – Server 898.945
Bert K99 – Offline 945.146

V našich testech se dvěma grafickými procesory L4 v počítači Dell T560 jsme pozorovali toto téměř lineární škálování výkonu v benchmarkech Resnet50 i BERT K99. Toto škálování svědčí o efektivitě grafických procesorů L4 a jejich schopnosti pracovat v tandemu bez významných ztrát způsobených režijními náklady nebo neefektivitou.

Dell PowerEdge T560 2x NVIDIA L4 Skóre
Resnet50 – Server 24,407.50
Resnet50 – Offline 25,463.20
BERT K99 – Server 1,801.28
BERT K99 – Offline 1,904.10

Konzistentní lineární škálování, které jsme zaznamenali u dvou grafických karet NVIDIA L4, se působivě rozšiřuje i na konfigurace se čtyřmi jednotkami L4. Toto škálování je obzvláště pozoruhodné, protože udržení lineárního zvýšení výkonu je s každou přidanou grafickou kartou stále náročnější kvůli složitosti paralelního zpracování a správy zdrojů.

Dell PowerEdge T560 4x NVIDIA L4 Skóre
Resnet50 – Server 48,818.30
Resnet50 – Offline 51,381.70
BERT K99 – Server 3,604.96
BERT K99 – Offline 3,821.46

Tyto výsledky slouží pouze pro ilustrační účely a nejedná se o soutěžní ani oficiální výsledky MLPerf. Úplný seznam oficiálních výsledků naleznete na stránce s výsledky MLPerf.

Kromě ověření lineární škálovatelnosti grafických karet NVIDIA L4 naše testy v laboratoři osvětlily praktické důsledky nasazení těchto jednotek v různých provozních scénářích. Například konzistence výkonu mezi serverovým a offline režimem napříč všemi konfiguracemi s grafickými kartami L4 odhaluje jejich spolehlivost a všestrannost.

Tento aspekt je obzvláště důležitý pro podniky a výzkumné instituce, kde se provozní kontexty výrazně liší. Naše pozorování minimálního dopadu úzkých míst v propojení a efektivity synchronizace GPU v nastaveních s více GPU navíc poskytují cenné poznatky pro ty, kteří chtějí škálovat svou infrastrukturu umělé inteligence. Tyto poznatky jdou nad rámec pouhých srovnávacích čísel a nabízejí hlubší pochopení toho, jak lze takový hardware optimálně využít v reálných scénářích, a vedou k lepším architektonickým rozhodnutím a investičním strategiím v oblasti infrastruktury umělé inteligence a HPC.

NVIDIA L4 – Výkon aplikací

Porovnali jsme výkon nové grafické karty NVIDIA L4 s předchozími modely NVIDIA A2 a NVIDIA T4. Abychom demonstrovali toto zvýšení výkonu oproti předchozím modelům, nasadili jsme všechny tři modely v našem laboratoři v serveru s operačním systémem Windows Server 2022 a nejnovějšími ovladači NVIDIA, přičemž jsme využili celou naši sadu testů grafických karet.

Tyto karty byly testovány na Dell Poweredge R760 s následující konfigurací:

  • 2 x Intel Xeon Gold 6430 (32 jader, 2.1 GHz)
  • Windows Server 2022
  • Ovladač NVIDIA 538.15
  • ECC zakázáno na všech kartách pro 1x samplování
NVIDIA L4 v rozšiřující pozici R760

Při zahájení testování výkonu mezi touto skupinou tří podnikových GPU je důležité si uvědomit jedinečné rozdíly ve výkonu mezi staršími modely A2 a T4. Když byla A2 uvedena na trh, nabízela některá pozoruhodná vylepšení, jako je nižší spotřeba energie a provoz na menším slotu PCIe Gen4 x8 namísto většího slotu PCIe Gen3 x16, který vyžadoval starší T4. To jí hned na začátku umožnilo zasunout se do více systémů, zejména s ohledem na menší potřebnou velikost.

Mixér OptiX 4.0

Blender OptiX je open-source 3D modelovací aplikace. Tento test lze spustit pro CPU i GPU, ale my jsme provedli pouze GPU, stejně jako většinu ostatních testů zde. Tento benchmark byl spuštěn pomocí utility Blender Benchmark CLI. Skóre je počet vzorků za minutu, přičemž vyšší znamená lepší.

Blender 4.0
(Vyšší je lepší)
NVIDIA L4 Nvidia A2 Nvidia T4
Rozhraní příkazového řádku GPU Blenderu – Monster 2,207.765 458.692 850.076
CLI GPU Blenderu – Junkshop 1,127.829 292.553 517.243
Rozhraní příkazového řádku GPU Blenderu – Učebna 1,111.753 262.387 478.786

Blackmagic RAW Speed ​​​​Test

CPU a GPU testujeme pomocí testu RAW Speed ​​od Blackmagic, který testuje rychlost přehrávání videa. Jedná se spíše o hybridní test, který zahrnuje výkon CPU a GPU pro dekódování RAW v reálném prostředí. Tyto výsledky jsou zobrazeny jako samostatné, ale my se zde zaměřujeme pouze na GPU, takže výsledky CPU zde nejsou uvedeny.

Blackmagic RAW Speed ​​​​Test
(Vyšší je lepší)
NVIDIA L4 Nvidia A2 Nvidia T4
8K CUDA 95 FPS 38 FPS 53 FPS

Grafický procesor Cinebench 2024

Maxonův Cinebench 2024 je benchmark pro vykreslování na CPU a GPU, který využívá všechna jádra a vlákna CPU. Protože se opět zaměřujeme na výsledky GPU, nespouštěli jsme části testu zaměřené na CPU. Vyšší skóre znamená lepší výsledek.

Cinebench 2024
(Vyšší je lepší)
NVIDIA L4 Nvidia A2 Nvidia T4
GPU 15,263 4,006 5,644

GPU PI

GPUPI 3.3.3 je verze odlehčeného benchmarkovacího nástroje určeného k výpočtu π (pí) na miliardy desetinných míst pomocí hardwarové akcelerace prostřednictvím GPU a CPU. Využívá výpočetní výkon OpenCL a CUDA, které zahrnují jak centrální, tak grafické procesory. CUDA jsme spustili pouze na všech 3 GPU a zde uvedená čísla představují dobu výpočtu bez přidané doby redukce. Nižší hodnota je lepší.

Doba výpočtu GPU PI v sekundách
(Čím níže, tím lépe)
NVIDIA L4 Nvidia A2 Nvidia T4
GPUPI v3.3 – 1B 3.732s 19.799s 7.504s
GPUPI v3.3 – 32B 244.380s 1,210.801s 486.231s

Zatímco předchozí výsledky se zaměřovaly pouze na jednu iteraci každé karty, měli jsme také možnost podívat se na nasazení 5x NVIDIA L4 v Dell PowerEdge T560.

Doba výpočtu GPU PI v sekundách
(Čím níže, tím lépe)
Dell PowerEdge T560 (2x Xeon Gold 6448Y) s 5x NVIDIA L4
GPUPI v3.3 – 1B 0 s 850 ms
GPUPI v3.3 – 32B 50 s 361 ms

Octanebench

OctaneBench je benchmarkovací nástroj pro OctaneRender, další 3D renderer s podporou RTX podobný V-Ray.

 Oktanové číslo (vyšší znamená lepší)
Scéna Jádro NVIDIA L4 Nvidia A2 Nvidia T4
Interiér Informační kanály 15.59 4.49 6.39
Přímé osvětlení 50.85 14.32 21.76
Trasování cesty 64.02 18.46 25.76
Nápad Informační kanály 9.30 2.77 3.93
Přímé osvětlení 39.34 11.53 16.79
Trasování cesty 48.24 14.21 20.32
ATV Informační kanály 24.38 6.83 9.50
Přímé osvětlení 54.86 16.05 21.98
Trasování cesty 68.98 20.06 27.50
Krabici Informační kanály 12.89 3.88 5.42
Přímé osvětlení 48.80 14.59 21.36
Trasování cesty 54.56 16.51 23.85
Celkové skóre 491.83 143.71 204.56

Geekbench 6 GPU

Geekbench 6 je multiplatformní benchmark, který měří celkový výkon systému. K dispozici jsou možnosti testování pro CPU i GPU. Vyšší skóre znamená lepší výsledky. Opět jsme se zaměřili pouze na výsledky GPU.

Srovnání s jakýmkoli systémem najdete v prohlížeči Geekbench.

Geekbench 6.1.0
(Vyšší je lepší)
NVIDIA L4 Nvidia A2 Nvidia T4
Geekbench GPU OpenCL 156,224 35,835 83,046

Luxmark

LuxMark je multiplatformní benchmarkovací nástroj s OpenCL od těch, kteří provozují open-source 3D renderovací engine LuxRender. Tento nástroj se zaměřuje na výkon GPU v 3D modelování, osvětlení a práci s videem. Pro tuto recenzi jsme použili nejnovější verzi, v4alpha0. V LuxMarku platí, že čím vyšší, tím lepší skóre.

Luxmark v4.0alpha0
GPU OpenCL
(Vyšší je lepší)
NVIDIA L4 Nvidia A2 Nvidia T4
Lavice do haly 14,328 3,759 5,893
Lavice pro jídlo 5,330 1,258 2,033

GROMACS CUDA

Také využíváme kompilovaný GROMACS, software pro molekulární dynamiku, speciálně pro CUDA. Tato kompilace na míru měla využít paralelní procesorové schopnosti 5 grafických procesorů NVIDIA L4, které jsou nezbytné pro urychlení výpočetních simulací.

Proces zahrnoval využití nvcc, kompilátoru CUDA od NVIDIA, spolu s mnoha iteracemi příslušných optimalizačních příznaků, aby se zajistilo, že binární soubory budou správně vyladěny na architekturu serveru. Zahrnutí podpory CUDA do kompilace GROMACS umožňuje softwaru přímo propojit se s hardwarem GPU, což může drasticky zkrátit výpočetní časy složitých simulací.

Test: Interakce proteinů na míru v Gromacs

Využitím vstupního souboru poskytnutého komunitou z našeho rozmanitého Discordu, který obsahoval parametry a struktury přizpůsobené pro specifickou studii interakcí proteinů, jsme zahájili simulaci molekulární dynamiky. Výsledky byly pozoruhodné – systém dosáhl simulační rychlosti 170.268 nanosekund za den.

GPU Systém ns/den čas jádra (s)
Nvidia A4000 Bílý box AMD Ryzen 5950x 84.415 163,763
RTX NVIDIA 4070 Bílý box AMD Ryzen 7950x3d 131.85 209,692.3
5x NVIDIA L4 Dell T560 s 2 procesory Intel Xeon Gold 6448Y 170.268 608,912.7

Více než umělá inteligence

Vzhledem k tomu, že se kolem umělé inteligence stává stále větší hit, je snadné se nechat unést výkonem modelů na NVIDIA L4, ale ta má v rukávu i několik dalších triků, které otevírají řadu možností pro video aplikace. Dokáže hostit až 1 040 souběžných video streamů AV1 v rozlišení 720p30. To může transformovat způsob, jakým lze obsah streamovat živě pro uživatele na okraji sítě, vylepšit kreativní vyprávění příběhů a nabídnout zajímavé využití pro pohlcující AR/VR zážitky.

NVIDIA L4 také vyniká v optimalizaci grafického výkonu, což je patrné z jejích schopností v oblasti vykreslování v reálném čase a sledování paprsků. V edge office je L4 schopna poskytovat robustní a výkonné akcelerované grafické výpočty ve VDI koncovým uživatelům, kteří to nejvíce potřebují a kde je nezbytné vysoce kvalitní vykreslování grafiky v reálném čase.

Závěrečné myšlenky

Grafická karta NVIDIA L4 poskytuje solidní platformu pro edge AI a vysoce výkonné výpočty a nabízí bezkonkurenční efektivitu a všestrannost v řadě aplikací. Její schopnost zvládat náročné procesy s umělou inteligencí, akcelerací nebo video kanály a optimalizovat grafický výkon z ní činí ideální volbu pro edge inferencing nebo akceleraci virtuálních desktopů. Kombinace vysokého výpočetního výkonu, pokročilých paměťových možností a energetické účinnosti u L4 ji staví do role klíčového hráče v akceleraci úloh na okraji sítě, zejména v odvětvích s umělou inteligencí a náročnou grafikou.

NVIDIA L4 twist stack

Není pochyb o tom, že umělá inteligence je v dnešní době okem IT hurikánu a poptávka po monstrózních grafických procesorech H100/H200 stále roste. Zároveň se však vynakládá velký tlak na to, aby se na okraj sítě, kde se vytvářejí a analyzují data, dostala robustnější IT vybavení. V těchto případech je potřeba vhodnější grafická karta. V tomto ohledu vyniká NVIDIA L4 a měla by být výchozí volbou pro inferencing na okraji sítě, ať už jako samostatná jednotka, nebo škálovatelně, jak jsme testovali v T560.

Produktová stránka NVIDIA L4

Zapojte se do StorageReview

Zpravodaj | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS kanál

Jordan Ranous

Specialista na umělou inteligenci; provede vás světem podnikové umělé inteligence. Autor a analytik pro Storage Review s praxí v oblasti analýzy velkých finančních dat, provozu/vývoje v datových centrech a analýzy zákaznické zkušenosti. Pilot, astrofotograf, guru pro LTO pásky a nadšenec pro baterie/solární energii.