StorageReview.com

Recenzia NVIDIA RTX PRO 4500 Edge: 2.7x viac L4 v HPE ProLiant DL145 Gen11

AI  ◇  podnik

NVIDIA RTX PRO 4500 Blackwell Server Edition je karta, ktorú NVIDIA vytvorila primárne ako náhradu za L4 v serveroch, ktoré sa nachádzajú mimo dátového centra: jednoslotová, PCIe Gen5, pasívne chladená, 165 W, s 32 GB GDDR7 a kompletnou sadou funkcií Blackwell vrátane tenzorových jadier FP4 a viacinštanciového grafického procesora. HPE nám poslala ProLiant DL145 Gen11, server s krátkou hĺbkou na okraji servera, ktorý spáruje s týmto grafickým procesorom vo svojom riešení Nemotron na okraji servera, a my sme spustili rovnaké testovanie vLLM na RTX PRO 4500 a na L4 v rovnakom šasi. Táto recenzia RTX PRO 4500 na okraji servera je o tomto jednom porovnaní: čo získa stránka, ktorá už používa L4 v okrajovom zariadení, výmenou za 4500, v tokenoch, latencii a spotrebe energie.

Recenzia RTX PRO 4500 edge: NVIDIA RTX PRO 4500 Blackwell Server Edition stojaca pred HPE ProLiant DL145 Gen11 v laboratóriu StorageReview

V rámci dvoch malých modelov BF16 pri praktickej súbežnosti poskytuje RTX PRO 4500 2.7-násobok výstupnej priepustnosti L4, udržiava latenciu prvého tokenu pod sekundu pri záťaži, kde L4 už spadla do frontu, a zvyšuje spotrebu celého servera DL145 z približne 196 W na približne 301 W. Na watt GPU je zisk 1.3 až 1.4-násobok. Na kartu je to rozdiel medzi obsluhou 32 až 64 súbežných chatovacích relácií a obsluhou 256. Na box DL145 obslúži až tri L4 a tri s 32 reláciami sa priepustnosti blížia k jednej 4500, takže skrinka na úrovni boxu s 4500 spočíva na rýchlosti na používateľa, latencii, jednom 32GB pamäťovom fonde a FP4.

Toto je porovnanie jednej karty s jej predchodcom na platforme Metrum AI® Bench Platform na edge serveri s modelmi, ktoré sa pohodlne zmestia do 24 GB a 32 GB. RTX PRO 4500 Server Edition tiež patrí do širšieho porovnania so zvyškom inferenčného radu NVIDIA a toto testovanie už prebieha v samostatnom článku. V tomto prípade je najrelevantnejším porovnaním L4 a pridali sme jeden súbor údajov RTX PRO 6000 Blackwell, aby sme ukázali, ako vyzerá NVFP4 na modeli 26B, keď je k dispozícii väčšia karta na porovnanie. RTX PRO 6000 nie je podporovaná v edge serveri HPE.

Kľúčové poznatky

  • 2.7x L4 na tom istom serveri: V 18 kombináciách vstupov a výstupov na Qwen3.5-4B a Gemma 4 E4B poskytovala RTX PRO 4500 medián 2.7-násobku výstupných tokenov za sekundu L4 pri 8 až 32 súbežných požiadavkách a 3.0x až 3.2x pri 256, pričom obe karty boli v rovnakom HPE ProLiant DL145 Gen11.
  • Latencia je väčšia medzera: Model 4500 generuje s časom 12 až 15 ms na token v porovnaní s 35 až 40 ms na L4 a pri 256 súbežných požiadavkách zostal jeho medián času do prvého tokenu na 264 ms až 650 ms pri výzvach s 256 tokenmi, zatiaľ čo L4 sa vyšplhal na 9 a 39 sekúnd.
  • O 105 W viac pri stene, 2.7x viac žetónov: DL145 odoberal približne 196 W na L4 a približne 301 W na 4500 pri 32 súbežných zariadeniach. Výstupný výkon na systémový watt sa zvýšil z 2.7 na 5.1 na Qwen3.5-4B a z 2.9 na 5.6 na Gemma 4 E4B.
  • Rýchlosť na používateľa sa v rámci výziev v tvare chatu drží na úrovni 256 relácií: Ak vydelíme výstup súbežnosťou, model 4500 stále poskytuje každému používateľovi 11 až 22 tokenov za sekundu pri 256 súbežných reláciách na odpovediach s 256 tokenmi alebo dlhšími na krátke a stredne dlhé výzvy, zatiaľ čo L4 klesla na 3.7 až 8.7. L4 spadá pod hranicu 10 tokenov za sekundu medzi 32 a 256 reláciami na väčšine tvarov a medzi 8 a 16 na tvare 1 024/32 s vysokým obsahom predbežného dopĺňania; model 4500 sa drží nad touto hranicou pri 256 okrem tvarov s krátkou odpoveďou a výzvami s 1 024 tokenmi.
  • 32 GB a FP4 otvárajú modelovú triedu, ktorú L4 nemôže natívne spustiť: Na Gemma 4 26B-A4B v NVFP4 s vyrovnávacou pamäťou FP8 KV vyprodukoval 4500 1 613 výstupných tokenov za sekundu pri 32 súbežných operáciách a spotrebe 165 W, čo je približne polovica toho, čo RTX PRO 6000 Blackwell zvládla na pracovnej stanici pri spotrebe 266 až 471 W pri 8 až 32 súbežných operáciách. Pri 256 súbežných operáciách sa rozdiel zväčšuje na približne 2.5-násobok.

Na čo je určená serverová edícia RTX PRO 4500?

Spoločnosť NVIDIA na konferencii GTC 2026 oznámila RTX PRO 4500 Blackwell Server Edition ako vstupnú úroveň svojej rodiny serverov RTX PRO a nástupcu L4. Zdieľa názov s kartou pre pracovnú stanicu RTX PRO 4500 Blackwell a obe majú spoločný kremík a 10 496 jadier CUDA, ale ide o odlišné produkty. Server Edition znižuje výstupy na displej a ventilátor, ponecháva výkon dosky na 165 W a pridáva sadu funkcií pre dátové centrá: MIG s až dvoma 16GB inštanciami, dôverné výpočty, tretí NVENC a NVDEC a podporu vGPU. NVIDIA udáva rýchlosť pamäte na 800 GB/s a maximálny výkon FP4 Tensor na 1.6 PFLOPS so sparsitou a kartu opisuje ako „energeticky úspornú grafickú kartu Blackwell pre podnikovú umelú inteligenciu“ zameranú na „bežné dátové centrá a edge servery“. Túto tému sme rozoberali v našom spravodajstve z konferencie HPE GTC 2026.

NVIDIA tiež zmenila tvarový faktor: L4, ktorú sme recenzovali v roku 2024, je karta s polovičnou výškou a polovičnou dĺžkou, spotrebou 72 W s 24 GB GDDR6 pri 300 GB/s, zatiaľ čo RTX PRO 4500 Server Edition je jednoslotová doska s plnou výškou a plnou dĺžkou so spotrebou 165 W, takže stále zaberá jeden slot, ale potrebuje rozširujúci konektor plnej dĺžky a 16-pinový napájací kábel. Štandardný slot DL145 Gen11 je s plnou výškou a polovičnou dĺžkou a HPE našu jednotku nakonfigurovalo s rozširujúcim konektorom plnej dĺžky a napájacím káblom. Na papieri prináša 4500 2.7-násobok pamäťovej šírky pásma L4, o 33 % viac pamäte a 1.7-násobok vrcholu FP8 Tensor pri 2.3-násobnom výkone, plus cestu FP4, pre ktorú L4 nemá žiadny hardvér.

špecifikácia RTX PRO 4500 Blackwell Server Edition NVIDIA L4
Prehľad platformy
architektúra Blackwell Ada Lovelace
CUDA jadrá 10,496 7,424
Memory Masážne stoly 32 GB GDDR7 s ECC 24GB GDDR6
Šírka pásma pamäte 800GB / s 300GB / s
Výkon (špičkové hodnoty NVIDIA, s riedkosťou)
FP32 51 TFLOPS 30.3 TFLOPS
Tenzor FP8 811 TFLOPS 485 TFLOPS
Tenzor FP4 1.6 PFLOPS Nie je podporované
Výkon a tvarový faktor
Napájanie dosky 165 W 72 W
Tvarový faktor Jeden slot, plná výška, plná dĺžka, pasívny Jeden slot, polovičná výška, polovičná dĺžka, pasívny
Napájací konektor 1x PCIe CEM5 16-pinový Napájanie z drážky
Rozhranie PCIe 5.0 x16 PCIe 4.0 x16
Vlastnosti
MIG Až 2 inštancie s kapacitou 16 GB Nie
NVENC / NVDEC 3 / 3 2 / 4
Dôverná výpočtová technika schopný Nie

Okrajový server: HPE ProLiant DL145 Gen11

Spoločnosť HPE umiestňuje DL145 Gen11 ako server pre lokality, ktoré nemajú serverovňu. V popise riešenia pre DL145 a NVIDIA Nemotron sa opisuje nástenná, takmer tichá skrinka s teplotným rozsahom od -5 °C do 55 °C pre rozvádzače s malým prúdením vzduchu, prašné miesta a horúce alebo studené lokality, s iLO a Compute Ops Management pre integráciu stoviek lokalít, ktoré majú iba napájanie a Ethernet. Spoločnosť HPE navrhuje ako cieľové odvetvia maloobchod, zdravotníctvo, financie, výrobu a energetiku a pracovné zaťaženia, ktoré uvádza, sú tie, ktoré meria táto recenzia: modely malých jazykov, RAG a vektorové vyhľadávanie bežiace lokálne, takže údaje citlivé na latenciu a regulované údaje nikdy neopúšťajú lokalitu. DL145 Gen11 sme recenzovali pri jeho uvedení na trh, takže tu nebudeme opakovať prehliadku platformy.

Predný panel HPE ProLiant DL145 Gen11 s dvoma 2.5-palcovými pozíciami pre jednotky, tromi krytmi slotov PCIe, štvorportovým sieťovým adaptérom a 700W napájacím zdrojom

Jednotka, ktorú spoločnosť HPE poslala na toto testovanie, je nakonfigurovaná s jedným procesorom AMD EPYC 8534P, 64-jadrovým procesorom Siena so 128 vláknami, 96 GB pamäte DDR5-4800 v šiestich 16GB moduloch DIMM a grafickou kartou RTX PRO 4500 Blackwell Server Edition na rozširujúcej základnej doske plnej dĺžky. Šasi má dvojšachtovú základnú dosku U.3; naša jednotka bola dodávaná s káblami iba SATA, takže sme bootovali z 6.4 TB SSD disku Solidigm D7-P5620 NVMe na PCIe slot, čo nemá žiadny vplyv na výsledky GPU. Porovnanie L4 použilo presne rovnakú konfiguráciu servera. 4500 je karta, ktorú spoločnosť HPE dodáva na tejto platforme pre svoje edge riešenie Nemotron; L4 je to, čo má dnes v tomto slote s najväčšou pravdepodobnosťou majiteľ DL145 z posledných dvoch rokov.

Recenzia RTX PRO 4500 edge: pohľad zhora nadol na dovnútra HPE ProLiant DL145 Gen11 s RTX PRO 4500 Server Edition nainštalovanou na riser doske plnej dĺžky a pripojeným 16-pinovým napájacím káblom.

Dve ďalšie čísla platformy slúžia na analýzu uvedenú nižšie: DL145 hlási výkon celého servera prostredníctvom iLO a Bench Platform ho zaznamenáva spolu s výkonom samotnej dosky GPU pri každom behu, takže môžeme hovoriť o wattoch pri napájaní zo siete a wattoch pri karte. Vzduchová cesta servera udržiavala obe pasívne karty v rámci ich limitov: 4500 dosiahla počas najdlhších behov priemernú teplotu GPU 84 °C a L4 86 °C, obe pri trvalom zaťažení plným výkonom v 2U krátkom šasi.

Ako sme testovali

Všetky inferenčné údaje v tejto recenzii boli zhromaždené pomocou platformy Metrum AI Bench Platform (verzia 3.9.2, zaznamenaná v súboroch spustenia pod jej predchádzajúcim názvom Metrum Insights) s spusteným vLLM 0.24.0 ako obslužným enginom. Platforma Bench Platform spúšťa pevnú mriežku scenárov pre každý systém, zaznamenáva priepustnosť, percentily latencie, telemetriu GPU a výkon hostiteľa pre každý scenár a exportuje výsledky ako jeden súbor údajov pre každú úlohu. O práci spoločnosti Metrum AI s Oregon State sme už písali a spoločnosť Dell použila rovnakú platformu pre svoj technický brief R770AP; toto je prvýkrát, čo sme ju použili na vykonanie vlastného komplexného porovnania GPU. Inžinieri spoločnosti Metrum AI a naše laboratórium vykonávali úlohy spoločne, pričom platforma Bench Platform vykonávala zber údajov a náš tím nastavoval hardvér, modely a otázky.

Spoločnosť Metrum AI tiež vydáva open-source doplnkový nástroj, Metrum AI Bench CLI , ktorý môžu čitatelia použiť na spustenie rovnakého štýlu testov na svojich vlastných systémoch. Metrum AI je registrovaná ochranná známka a Metrum AI Bench CLI a Metrum AI Bench Platform sú ochranné známky spoločnosti Metrum AI, Inc. Používanie Metrum AI Bench neznamená schválenie spoločnosťou Metrum AI.

Mriežka má deväť tvarov výziev: každá kombinácia 32, 256 a 1 024 vstupných tokenov s maximálnym počtom 32, 256 a 1 024 výstupných tokenov, pričom každý beží s 1, 8, 16, 32 a 256 súbežnými požiadavkami, pre 45 scenárov na model a GPU. Beh Gemma 4 na L4 zahŕňal aj 64 a 128 súbežných požiadaviek, čo sa ukázalo ako užitočné na nájdenie jeho stropu. Každý scenár odosiela 15 požiadaviek na stream od 1 do 32 súbežných požiadaviek a 1 280 požiadaviek s 256. Úloha Gemma 4 E4B na 4500 bola spustená trikrát; rozptyl medzi opakovaniami medzi scenármi bol pod 2 % a uvádzame medián. Úlohy L4 a 4500 BF16 a dve úlohy Gemma 4 26B, jedna na každej karte, predstavujú 378 spustení scenárov a v rámci nich sa vyskytla jedna neúspešná požiadavka v jednom opakovaní jedného scenára 4500, ktorý spomíname len na účely zverejnenia.

Testu sa venovali tri modely: Qwen3.5-4B a Gemma 4 E4B, oba obsluhované v BF16 s vyrovnávacou pamäťou BF16 KV, sú to dva modely, ktoré bežali na L4 aj 4500, a ich veľkosť zodpovedá dnešnému reálnemu nasadeniu na 24GB karte. Gemma 4 26B-A4B, 26B model so zmiešanou expertnou kapacitou a približne 4B aktívnymi parametrami, bežal v NVFP4 s vyrovnávacou pamäťou FP8 KV iba na 4500, s RTX PRO 6000 Blackwell Workstation Edition (600W) v Dell Pro Max Tower T2 ako referenčným bodom. L4 nemá natívny výpočtový výkon FP4 a pre tento model nie je v BF16 miesto, takže túto časť testu vynecháva.

Tri poznámky k čítaniu grafov: grafy priepustnosti začíname pri 8 súbežných požiadavkách. Scenáre s jednou požiadavkou sú dostatočne krátke (15 požiadaviek, každá s dĺžkou niekoľkých sekúnd), takže prvá požiadavka každého scenára Qwen s jedným používateľom na čipe 4500, ktorá dosiahla oneskorenie prvého tokenu 37 až 39 sekúnd, skresľuje údaj o priepustnosti behu, takže v prípade jedného používateľa uvádzame latenciu a čas odozvy na token, ktoré nie sú ovplyvnené. Výkon GPU je vzorkovaný priemer, takže tokeny na watt počítame iba z behov dostatočne dlhých na to, aby sa priemer ustálil, čo v praxi znamená 16 súbežných a viac. A pri 256 súbežných požiadavkách s dlhými výzvami sa obom kartám vyčerpá vyrovnávacia pamäť KV a požiadavky na fronty vLLM; tieto body sú stále skutočné čísla priepustnosti, ale údaje o čase do prvého tokenu pri tomto zaťažení opisujú front a 32 súbežných požiadaviek považujeme za pracovný rozsah pre použitie citlivé na latenciu.

Qwen3.5-4B

Nižšie uvedená mriežka zobrazuje celé porovnanie Qwen3.5-4B v skratke: počet výstupných tokenov za sekundu na oboch kartách pri každom tvare výzvy, od 8 do 256 súbežných požiadaviek. Rovnaký tvar krivky sa opakuje na všetkých deviatich paneloch, pričom 4500 sa otvára približne na 2.5 až 2.8x oproti L4 pri 8 súbežných požiadavkách, škáluje sa o niečo rýchlejšie cez 32 a pristáva na 2.4x až 3.2x pri 256.

Tabuľka recenzie RTX PRO 4500 edge: RTX PRO 4500 Blackwell Server Edition vs. NVIDIA L4 vLLM výstupná priepustnosť na Qwen3.5-4B v deviatich tvaroch výzvy v HPE ProLiant DL145 Gen11

Ak vezmeme tvar s 256 vstupmi a 256 výstupmi ako referenciu veľkosti chatu: pri 8 súbežných operáciách L4 vyprodukoval 192 výstupných tokenov za sekundu a 4500 529 (2.76x); pri 32 súbežných operáciách 532 oproti 1 529 (2.87x); pri 256 súbežných operáciách 935 oproti 2 821 (3.02x). Najdlhší tvar, 1 024 tokenov v každom smere, ho takmer presne sleduje: 499 oproti 1 445 pri 32 súbežných operáciách a 715 oproti 2 181 pri 256 operáciách. Najmenšiu medzeru v celej mriežke predstavuje prípad s 1 024 vstupmi a 32 výstupmi s vysokým počtom prednaplnených operácií, kde si 4500 drží stabilných 2.4x od 8 súbežných operácií ďalej, pretože táto pracovná záťaž je takmer výlučne promptné spracovanie a obe karty sú naň od začiatku viazané výpočtovým výkonom. Qwen3.5-4B v tomto tvare stabilne rastie na oboch kartách. Jediný pokles na 16. mieste súbežne v BF16 mriežkach je u 4500 s Gemmou 4 E4B na 1 024/32, čo sa prejavilo vo všetkých troch opakovaniach; príčinu sme ešte neizolovali.

Tabuľka recenzie RTX PRO 4500 edge: RTX PRO 4500 Blackwell Server Edition vs NVIDIA L4 výstupné tokeny za sekundu na Qwen3.5-4B pri 256 vstupných a 256 výstupných tokenoch, 8 až 256 súbežných požiadavkách

Pre jedného používateľa pomer priepustnosti podceňuje rozdiel, pretože to, čo človek vidí, je to, ako rýchlo sa slová zobrazujú. Na tvare 256/256 generoval 4500 s mediánom 12.4 ms na token, L4 s 35.0 ms, takže odpoveď s 256 tokenmi trvala približne 3.2 sekundy na 4500 a 9.0 sekundy na L4. Pri 1 024 tokenoch v každom smere to bolo 13.1 sekundy oproti 36.6 sekundám. Latencia prvého tokenu pre tohto osamelého používateľa bola 43 ms na 4500 a 81 ms na L4 pre kratšiu výzvu, 99 ms oproti 219 ms pre dlhšiu.

Pri zaťažení sa rozdiel v latencii zväčšuje: pri 32 súbežných požiadavkách na tvare 256/256 bol medián času L4 do prvého tokenu 884 ms a u 4500 to bolo 386 ms. Pri 256 súbežných požiadavkách sa L4 dostal na 39 sekúnd, zatiaľ čo 4500 sa udržal na 650 ms. Pri 1 024/1 024 bola L4 už viac ako sekunda pri 32 súbežných požiadavkách (1 022 ms) a dosiahla 255 sekúnd pri 256, čo je požiadavka čakajúca vo fronte vLLM štyri minúty na uvoľnenie vyrovnávacej pamäte KV. 4500 prekročil hranicu jednej sekundy na tomto tvare až pri 256 súbežných požiadavkách, teda za 12.9 sekundy. V grafe nižšie opúšťajú čiary L4 oblasť grafu medzi 32 a 256; 4500 zostávajú na kratšom tvare pod sekundou až do konca.

Graf recenzie RTX PRO 4500 edge: medián času do prvého tokenu podľa súbežnosti na Qwen3.5-4B, RTX PRO 4500 Blackwell Server Edition vs NVIDIA L4, logaritmická škála, tvary tokenov 256/256 a 1024/1024

Ďalším spôsobom, ako čítať rovnaké údaje, je na používateľa: počet výstupných tokenov za sekundu vydelený počtom súbežných požiadaviek, čo je miera, ktorú vidí každá osoba vo fronte, vynesená do mriežky nižšie pre každý tvar oproti spodnej hranici 10 tokenov za sekundu, ktorá slúži ako spoločný prah pre interaktívne použitie. Pri 32 súbežných tokenoch poskytuje 4500 44 až 53 tokenov za sekundu na používateľa na každom tvare okrem 1 024 vstupov, 32 výstupov, kde je to 11, zatiaľ čo L4 je na úrovni 10 až 18 a už klesol na 4.6 na tom istom tvare. Pri súbežnom počte 256 sa číslo 4500 drží nad spodnou hranicou na štyroch kombináciách v tvare chatu (14.1 na 32/256, 12.7 na 32/1 024, 11.0 na 256/256 a 11.6 na 256/1 024), pristane na nej pri 9.9 na 32/32 a spadne pod ňu na výzvach s 1 024 žetónmi a tvaroch s krátkou odpoveďou, až po 1.5 na 1 024/32, kde je takmer všetka práca predvyplnená. L4 je pod spodnou hranicou na každom tvare na 256, medzi 0.6 a 4.5. Medzi 32 a 256 nebolo nič testované, takže bod, kde každá čiara pretína bodkovanú spodnú hranicu, sa nachádza niekde medzi týmito dvoma súbežnosťami; Graf ukazuje, že prechod L4 nastáva oveľa skôr ako 256 na každom tvare a 4500 sa na tvaroch chatu pohybuje okolo 256 alebo blízko neho.

Graf recenzie RTX PRO 4500 edge: počet tokenov za sekundu na používateľa podľa súbežnosti na Qwen3.5-4B v deviatich tvaroch výzvy, RTX PRO 4500 Blackwell Server Edition vs NVIDIA L4 s úrovňou 10 tokenov za sekundu

Obe karty bežali na úrovni alebo blízko limitov výkonu dosky, 72 W pre L4 a 165 W pre 4500, na väčšine tvarov od 16 súbežných procesorov vyššie. Tvary s krátkym výkonom mali nižší výkon, napríklad 125 W pre 4500 pre Qwen3.5-4B 32/32 pri 32 súbežných procesoroch, takže počet tokenov na watt GPU úzko kopíruje priepustnosť. Pri 256 súbežných procesoroch vyprodukovala karta 4500 medián 1.33-násobku výstupného počtu tokenov na watt oproti L4 naprieč deviatimi tvarmi, od 1.07-násobku v prípade prednaplnených 1 024/32 do 1.39-násobku v prípade 256/1 024. Vynásobte to 2.3-násobným rozdielom výkonu a získate 3-násobný náskok v priepustnosti, pričom 1.33-násobok pochádza z Blackwellu s vyšším výkonom na watt a 2.3-násobok z karty 4500 s vyšším výkonom.

Výstupné tokeny za sekundu na watt GPU na Qwen3.5-4B pri 256 súbežných požiadavkách, RTX PRO 4500 Blackwell Server Edition pri 165 W vs NVIDIA L4 pri 72 W

Gemma 4 E4B

Gemma 4 E4B je menší člen rodiny Google Gemma 4, kde E predstavuje efektívne parametre 4B a na oboch kartách sa správa ako Qwen3.5-4B s mierne lepším škálovaním v hornej časti mriežky. Mediánový pomer priepustnosti pri 8 až 32 súbežných procesoroch je 2.67x (rozsah 2.31x až 3.07x) a pri 256 je to 3.20x, pričom tvar 1 024/1 024 dosahuje 3.82x, pretože L4 je v tomto bode tak hlboko v limite svojej vyrovnávacej pamäte KV.

Tabuľka recenzie RTX PRO 4500 edge: Porovnanie priepustnosti výstupu RTX PRO 4500 Blackwell Server Edition vs NVIDIA L4 vLLM na Gemma 4 E4B v deviatich konfiguráciách výzvy v HPE ProLiant DL145 Gen11

Na krivke 256/256 L4 vyprodukoval 183 výstupných tokenov za sekundu pri 8 súbežných operáciách, 577 pri 32 operáciách a 1 269 pri 256 operáciách; 4500 vyprodukoval 479, 1 678 a 4 058. Na krivke 1 024/1 024 L4 vyprodukoval 180, 524, 826 a 4500 480, 1 454, 3 154. Hodnota 256 súbežných operácií u 4500 na dlhom krivke je 3.8-násobok hodnoty L4 a dôvod je viditeľný na krivke L4: pridal iba 302 tokenov za sekundu z 32 na 256 súbežných operácií, pretože nemal žiadnu pamäť na pridávanie relácií.

Tabuľka recenzie RTX PRO 4500 edge: RTX PRO 4500 Blackwell Server Edition vs. NVIDIA L4 výstupné tokeny za sekundu na Gemma 4 E4B pri 256 vstupných a 256 výstupných tokenoch, 8 až 256 súbežných požiadavkách

Keďže úloha L4 s Gemma 4 zahŕňala 64 a 128 súbežných tokenov, tento model presne ukazuje, kde L4 zaostáva. Jeho medián času do prvého tokenu na tvare 256/256 bol 184 ms pri 32 súbežných tokenoch, niečo vyše sekundy pri 64 a 9.1 sekundy pri 256. Na 1 024/1 024 to bolo 339 ms pri 32, viac ako sekunda pri 64, 60 sekúnd pri 128 a 191 sekúnd pri 256. Model 4500 zostal na 64 ms pri 32 súbežných tokenoch a 264 ms pri 256 na kratšom tvare a na dlhšom tvare to bolo 142 ms pri 32 a prekročil iba jednu sekundu pri 256, pri 1 036 ms. Takže pre Gemma 4 E4B pri výzvach s dĺžkou chatu je L4 na tomto serveri karta s 32 až 64 reláciami a 4500 je karta s 256 reláciami a latenciou nazvyš.

Graf recenzie RTX PRO 4500 edge: medián času do prvého tokenu podľa súbežnosti na Gemma 4 E4B, RTX PRO 4500 Blackwell Server Edition vs NVIDIA L4, logaritmická škála, tvary tokenov 256/256 a 1024/1024

Pohľad na používateľa s vyplnenými bodmi 64 a 128 pre L4 ukazuje, kde prekračuje hranicu podlahy. Na úrovni 256/256 poskytuje L4 18.0 tokenov za sekundu na používateľa pri 32 súbežných používateľoch, 14.5 pri 64, 10.3 pri 128 a 5.0 pri 256, takže prekračuje hranicu 10 tokenov za sekundu medzi 128 a 256 na tomto tvare. Na úrovni 256/1 024 je to 8.9 krát 128 a na tvaroch s krátkou odpoveďou a 1 024 vstupmi je o 64 pod hranicou podlahy (7.7 pri 256/32, 9.3 pri 1 024/256). Model 4500 má v chatovacích tvaroch s 32 súbežnými používateľmi pomer 52 až 57 na používateľa a stále je nad úrovňou limitu s 256 v šiestich z deviatich tvarov (15.9 až 21.6 v tvaroch s 32 a 256 vstupmi okrem 256/32 a 12.3 v tvare 1 024/1 024), pričom pod ňu klesá iba v troch tvaroch s krátkou odpoveďou a dlhou výzvou (8.1 v tvare 256/32, 7.4 v tvare 1 024/256 a 1.6 v tvare 1 024/32).

Graf recenzie RTX PRO 4500 edge: počet tokenov za sekundu na používateľa podľa súbežnosti na Gemma 4 E4B v deviatich tvaroch výzvy, RTX PRO 4500 Blackwell Server Edition vs NVIDIA L4 s úrovňou 10 tokenov za sekundu

Na watt GPU poskytuje Gemma 4 E4B procesoru 4500 medián 1.39x oproti L4 pri 256 súbežných procesoroch, s najväčšou rezervou, 1.68x, na 256/1 024 a 1.6x alebo lepšou na ostatných tvaroch s dlhou odpoveďou, kde L4 nemá dostatok KV vyrovnávacej pamäte, a najužšou, 1.07x, na 32/32, kde je pracovné zaťaženie príliš krátke na to, aby ho ktorákoľvek karta zvládla. Na 256/256 je to 24.6 výstupných tokenov za sekundu na watt oproti 17.7.

Výstupné tokeny za sekundu na watt GPU na Gemma 4 E4B pri 256 súbežných požiadavkách, RTX PRO 4500 Blackwell Server Edition pri 165 W vs NVIDIA L4 pri 72 W

Latencia na token pre jedného používateľa sa zhoduje s Qwen: 14.1 ms na token na 4500 oproti 39.1 ms na L4 pri 256/256 a 14.6 ms oproti 39.8 ms pri 1 024/1 024, takže odpoveď s 1 024 tokenmi trvá približne 15 sekúnd na 4500 a 41 sekúnd na L4.

Moc na stene

Okrajové servery majú často málo energie nazvyš, preto sme pri každom spustení sledovali spotrebu celého servera prostredníctvom iLO DL145. Pri nízkom zaťažení, pri spustení jedného používateľa s grafickou kartou odoberajúcou 43 až 65 W, server spotreboval približne 160 W s jednou z nainštalovaných kariet. Pri súbežnom používaní 32 serverov na grafickej karte 256/256 spotreboval v priemere 196 W s L4 a 301 W s RTX PRO 4500 a tieto priemery sa udržali pre oba modely BF16; maximum, ktoré sme zaznamenali, bolo 209 W s L4 a 308 W s 4500. Upgrade teda stojí pri záťaži približne 105 W na stene, čo sa blíži k 93 W rozdielu vo výkone dosiek kariet, plus malá strata konverzie a dodatočná réžia ventilátora.

Tabuľka recenzie RTX PRO 4500 edge: Výkon a výstupné tokeny celého servera HPE ProLiant DL145 Gen11 na systémový watt s NVIDIA L4 a RTX PRO 4500 Blackwell Server Edition na Qwen3.5-4B a Gemma 4 E4B

Pri 32 súbežných serveroch na 256/256 server vyprodukoval 2.7 výstupných tokenov za sekundu na systémový watt na Qwen3.5-4B s L4 a 5.1 s 4500; na Gemma 4 E4B, 2.9 a 5.6. Zvýšenie efektivity na úrovni systému je väčšie ako na úrovni karty, pretože veľká časť spotreby DL145 tvoria fixné náklady: CPU, pamäť, ventilátory a úložisko spotrebúvajú približne rovnako, či už GPU produkuje 532 tokenov za sekundu alebo 1 529. Stránka, ktorá platí za zariadenie, už získava 1.9-násobok tokenov na watt na stene zo swapu, oproti 1.3-násobku na karte. Pre flotilu s rozpočtom na energiu na stránku je to číslo, s ktorým sa treba počítať.

Čo pridáva 32 GB a NVFP4

Všetko vyššie uvedené je práca, ktorú L4 dokáže vykonať, len pomalšie. Ďalším argumentom 4500 je modelová trieda, ktorú L4 nedokáže natívne obslúžiť: Gemma 4 26B-A4B v NVFP4, 26B model zmesi expertov s približne 4B aktívnych parametrov na token, obsluhovaný vyrovnávacou pamäťou FP8 KV. V BF16 samotné váhy tohto modelu presahujú 24 GB; v NVFP4 sa zmestia do 32 GB pamäte 4500 s priestorom pre funkčnú vyrovnávaciu pamäť KV a tenzorové jadrá Blackwell FP4 spúšťajú tento formát natívne. vLLM dokáže načítať váhy NVFP4 na architektúru Ada L4 prostredníctvom jadra, ktoré pracuje iba s váhami, a 4-bitové váhy s veľkosťou približne 14 GB by sa zmestili do 24 GB, ale L4 nemá natívny výpočtový výkon FP4, takže sme ho tam nespustili. Pre meranie sme spustili rovnakú úlohu na grafickej karte RTX PRO 6000 Blackwell Workstation Edition s kapacitou 96 GB a spotrebou 600 W v počítači Dell Pro Max Tower T2. Je to iný hostiteľ a iná trieda karty a uvádzame ju len preto, aby čísla z modelu 4500 mali referenčný bod.

Tabuľka recenzie RTX PRO 4500 edge: RTX PRO 4500 Blackwell Server Edition vs RTX PRO 6000 Blackwell počet výstupných tokenov za sekundu na Gemma 4 26B-A4B NVFP4 pri 256 vstupných a 256 výstupných tokenoch

Na úrovni 256/256 model 4500 vyprodukoval 647 výstupných tokenov za sekundu pri 8 súbežných operáciách, 1 613 pri 32 a 4 607 pri 256; RTX PRO 6000 vyprodukoval 1 198, 3 252 a 11 682. Od 8 do 32 súbežných operácií sa model 4500 nachádza na úrovni 48 % až 55 % z modelu 6000 na každom tvare okrem prípadu 1 024/32 s prednaplnením, kde klesne na 29 % pri 32 súbežných operáciách, a to pri 165 W oproti 266 W až 471 W nameraným na modeli 6000 pre uvedené tvary. Pri 256 súbežných operáciách klesne na 23 % až 42 %, keď sa jeho 32 GB zaplní.

Latencia prvého tokenu vypovedá rovnaký príbeh ako modely BF16: pri 32 súbežných tokenoch bol medián 4500 67 ms na 256/256 a 103 ms na 1 024/1 024, čo je v priebehu niekoľkých desiatok milisekúnd od 6000 v oboch prípadoch, a pri 256 súbežných tokenoch sa udržal na 204 ms na krátkom grafe. Na 1 024/1 024 pri 256 súbežných tokenoch sa 4500 zaradil do fronty na 62 sekúnd, zatiaľ čo 6000 s trojnásobnou pamäťou sa udržal na 560 ms. Pre 26B MoE je 4500 karta s 32 reláciami pri dlhom kontexte a karta s 256 reláciami pri dĺžke chatu a model beží na hardvéri FP4, ktorý L4 nemá.

Medián času do prvého tokenu podľa súbežnosti na Gemma 4 26B-A4B NVFP4, RTX PRO 4500 Blackwell Server Edition vs RTX PRO 6000 Blackwell, tvary tokenov 256/256 a 1024/1024

DL145 odoberal maximálne 306 W pri modeli 26B na grafickej karte 4500, oproti špičke 308 W pri modeloch 4B, pretože karta má v oboch prípadoch spotrebu 165 W. Model triedy 26B v edge boxe s výkonom 300 W pri zásuvke predstavuje vylepšenie výkonu a nespotrebúva o nič viac energie ako malé modely.

Záver

NVIDIA hodnotí RTX PRO 4500 Blackwell Server Edition ako viac ako 5-násobok L4, čo je hodnota, ktorá sa opiera o FP4 a NIM. V porovnaní s BF16 na rovnakom DL145 Gen11, 4500 dosiahla medián 2.7-násobku výstupnej priepustnosti L4 na dvoch malých modeloch pri súbežnom používaní a 3.0x až 3.2x pri saturácii, generovala tokeny 2.8x rýchlejšie pre jedného používateľa a udržala latenciu prvého tokenu pod sekundu pri záťažiach, kde L4 čakala v rade desiatky sekúnd. L4 udržiava každého používateľa nad 10 výstupných tokenov za sekundu na 32 až 256 reláciách na väčšine tvarov a iba na 8 na tvare 1 024/32 s vysokým počtom predplnení, zatiaľ čo 4500 to dosahuje na 256 pri výzvach s dĺžkou chatu. Model 4500 tiež slúžil pre Gemma 4 26B-A4B v NVFP4, model, ktorý L4 nedokáže natívne spustiť.

Recenzia RTX PRO 4500 edge: RTX PRO 4500 Blackwell Server Edition postavená na HPE ProLiant DL145 Gen11

Náklady sú 105 W pri zásuvke, od približne 196 W do približne 301 W pre celý server pri zaťažení a 2.3-násobok výkonu dosky pri karte. Merané na GPU je 4500 1.3 až 1.4-násobok účinnosti ako L4 na výstupný token; merané na zásuvke, kde sa spotrebúva zvyšok systému bez ohľadu na to, je to približne 1.9-násobok. Stránky, ktoré majú rozpočet na energiu na jednotku zariadenia, zistia, že 4500 lepšie využíva watty, ktoré už míňajú, a stránky, ktoré majú na sloty, nájdu jednu 4500, ktorá zodpovedá priepustnosti jednotky troch L4 pri 32 reláciách na jednotku, s 2.8-násobne rýchlejšou generáciou na používateľa a jedným 32GB poolom.

Výhrada rozsahu z úvodu recenzie platí, pretože ide o jednu kartu proti svojmu predchodcovi v jednom edge serveri na troch malých modeloch a miesto RTX PRO 4500 Server Edition medzi L40S, RTX PRO 6000 Server Edition a zvyškom súčasnej rady inference je samostatná otázka, ktorou sa zaoberáme v širšej časti. Na otázku, ktorú si kladie majiteľ DL145 s L4, je odpoveďou, že 4500 je upgrade, na ktorý je platforma postavená, za predpokladu, že šasi má plnohodnotný riser a 16-pinové napájanie, ktoré ho zvládne, a že spárovanie tejto karty HPE s týmto serverom pre Nemotron na okraji siete je dobre zladené s tým, čo hardvér dokáže.
Samotný DL145 Gen11 sa nachádza v okrajovej časti nášho Najlepšie servery rebríček, kde tento výsledok teraz ukotvuje príbeh o odvodení hrán.

Produktová stránka NVIDIA RTX PRO 4500 Blackwell Server Edition

Zapojte sa do StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS kanál

Brian Beeler

Brian sídli v Cincinnati v štáte Ohio a je hlavným analytikom a prezidentom spoločnosti StorageReview.com.