Edge servery usnadňují rozhodování v reálném čase tím, že poskytují výpočetní zdroje mimo datová centra a cloud. V tomto článku provádíme několik benchmarků na serveru SuperMicro IoT SuperServer SYS-210SE-31A, všestranném víceuzlovém edge serveru. Je zřejmé, že inženýři měli při jeho návrhu na mysli edge inferencing , protože tento server byl vytvořen právě pro inferenci.
Přehled superserveru SuperMicro IoT SYS-210SE-31A
Naše kompletní recenze serveru SuperMicro IoT SuperServer SYS-210SE-31A odhaluje jeho potenciál nejen pro 5G a IoT, ale i pro maloobchod a dokonce i pro úložiště, pokud je spárován s paměťovou kartou PCIe a vysokorychlostní síťovou kartou.
Víceuzlová povaha tohoto serveru ho činí velmi všestranným. Pojme tři uzly CPU, každý s následujícími vlastnostmi:
- Jeden škálovatelný procesor Intel Xeon třetí generace („Ice Lake“) až do 32C/64T a 205 W, s možností použití čipů s výkonem 270 W ve speciální konfiguraci.
- Čtyři moduly ventilátorů.
- Osm slotů DIMM; maximální paměťový strop je 2 TB s použitím 256GB 3DS DIMM.
- Dva sloty M.2 2280/22110 PCIe Gen4.
- Dva PCIe Gen4 x16 plné výšky/poloviční délky a jeden PCIe Gen4 x16 poloviční výšky/poloviční délky.
- Jeden GbE pro IMPI 2.0 a KVM dongle.
Zde vidíte vytažené uzly, jako by šlo o miniaturní rackové servery.
Toto je vnitřek uzlu. Všimněte si, jak pevně k sobě všechno zapadá.
Hlavní slabinou tohoto serveru je úložiště, přičemž úložiště v uzlu je omezeno na dva sloty pro bootovací disky M.2 a neexistuje žádná nativní pozice pro 2.5palcové nebo 3.5palcové disky. Jak již bylo zmíněno, úložiště PCIe lze poměrně snadno přidat. Možností je také síťové úložiště; jeho konektivita nad 1GbE závisí na rozšiřujících kartách.
Hlavní výhodou tohoto serveru pro edge computing je jeho schopnost pracovat v prostředí s teplotou až 45 °C s krátkodobým provozem při 55 °C a dostupný prachový filtr.
Edge Inferencing: Argumenty pro edge servery
Náš článek s názvem „ Edge Inferencing se bere vážně díky novému hardwaru“ vysvětluje stav edge computingu. Dnešní přechod na edge computing by se v minulosti jevil jako krok zpět, kdy hierarchický přístup „hub and spoke“ spočíval v přenosu dat zpět do centrálního umístění. Rozhodování v reálném čase je hnací silou dnešního přechodu na edge computing, což přináší rychlejší poznatky a doby odezvy a menší závislost na síťovém připojení.
Inferencování na okraji sítě lze provádět v cloudu, i když obvykle pouze pro časově nezávislé a nekritické aplikace. Nedostatek síťového připojení samozřejmě znamená, že cloud je nepřijatelný.
Testování Edge na serveru SuperMicro IoT SuperServer SYS-210SE-31A
A nyní k našemu testování. Schopnost GPU zpracovávat data je základem edge inferencingu a edge servery se obvykle drží jednoslotových, nízkoprofilových karet, jako je NVIDIA A2 a starší, ale populární T4. SuperMicro IoT SuperServer SYS-210SE-31A, který testujeme, má T4. Níže jsou uvedeny dvě karty, T4 vpravo a A2 vlevo. Hardwarová konfigurace každého uzlu zahrnovala procesor Intel Xeon Gold 6330 a 128 GB paměti DDR4 RAM.
A tady je T4 nainstalovaný v jednom z uzlů SuperMicro.
70wattový profil T4 znamená, že veškerý svůj výkon získává ze slotu PCIe. Jeho architektura Turing využívá tenzorová jádra pro mnohem lepší výkon s přesností FP32, FP16, INT8 a INT4, než by dokázal zvládnout procesor. NVIDIA A2 má o něco nižší profil spotřeby 40 W až 60 W, ale novější a efektivnější architekturu. Srovnání obou karet naleznete v našem článku o edge inference , kde jsme je testovali v Lenovo ThinkEdge SE450.
Pracujeme s benchmarkovou sadou MLPerf Inference: Edge, která porovnává výkon inference pro populární modely DL v různých reálných scénářích na okraji sítě. V našem testování máme k dispozici čísla pro model klasifikace obrázků ResNet50 a model BERT-Large NLP pro úlohy odpovídání na otázky. Oba běží v konfiguracích Offline a SingleStream.
Offline scénář vyhodnocuje výkon inference v „dávkovém režimu“, kdy jsou všechna testovací data okamžitě k dispozici a latence se nebere v úvahu. V tomto úkolu může inferenční skript zpracovávat testovací data v libovolném pořadí a cílem je maximalizovat počet dotazů za sekundu (QPS = propustnost). Čím vyšší je číslo QPS, tím lépe.
Naproti tomu konfigurace Single Stream zpracovává jeden testovací vzorek najednou. Jakmile je provedena inference na jednom vstupu (v případě ResNet50 je vstupem jeden obrázek), změří se latence a další vzorek je zpřístupněn inferenčnímu nástroji. Cílem je minimalizovat latenci pro zpracování každého dotazu; čím nižší latence, tím lépe. Pro stručnost je jako cílová metrika zachycena latence 90. percentilu datového proudu dotazu.
Obrázek níže pochází z blogového příspěvku společnosti NVIDIA o inferenci MLPerf 0.5, který scénáře velmi dobře vizualizuje. Více o různých scénářích si můžete přečíst v původním článku o inferenci MLPerf zde.
Testovali jsme pracovní zátěž pracující na dvou uzlech uvnitř serveru SuperMicro IoT SuperServer SYS-210SE-31A. Třetí uzel byl nastaven jako záložní.
| měřítko | Uzel 1 (NVIDIA T4) | Uzel 3 (NVIDIA T4) |
| RestNet50 Offline | 5,587 vzorků/s | 5,492 vzorků/s |
| BERT SingleStream | 6.8 ms (90th procent) | 7.0 ms (90th procent) |
| BERT offline | 397 vzorků/s | 396 vzorků/s |
Celkově NVIDIA T4 zapůsobila. Node 1 vykázal o něco lepší výkon. Nicméně T4 je starší karta s vyšším energetickým profilem než novější A2. Při testování A2 v ThinkEdge SE450 jsme zjistili, že má v určitých bodech také nižší latenci než T4 a zároveň spotřebovává mnohem méně energie. Volbu mezi těmito dvěma kartami by měly ovlivnit aplikace a energetické aspekty. Prozatím jsme však spokojeni s hustotou, kterou šasi Supermicro dokáže pro tyto typy úloh poskytnout.
Závěrečné myšlenky
Závod o hranici sítě přináší rychlý pokrok v oblasti edge computingu. Nikde to není patrnější než u grafických procesorů (GPU), konkrétně u nízkoprofilových a energeticky úsporných variant, jako je NVIDIA T4 a novější A2. Testovali jsme T4 v serveru SuperMicro IoT SuperServer SYS-210SE-31A, což je vysoce všestranný tříuzlový edge server.
T4 předvedl vynikající výkon, což je vzhledem k jeho stáří ještě působivější. Spotřebovává však o něco více energie než A2, takže vybírejte moudře v závislosti na vašich potřebách v oblasti edge inferencingu. Očekáváme, že tato úctyhodná grafická karta má ještě hodně před sebou, protože společnosti zaměřené na edge inference nadále optimalizují využití GPU.
Server Supermicro IoT je navíc velmi dobře vybaven pro práci s těmito kartami a poskytuje velmi hustý inferenciální výkon na okraji sítě.




Amazon