StorageReview.com

Wnioskowanie brzegowe z serwerem brzegowym SuperMicro

Enterprise   ◇ 

Serwery brzegowe ułatwiają podejmowanie decyzji w czasie rzeczywistym, udostępniając zasoby obliczeniowe poza centrami danych i chmurą. W tym artykule przeprowadzamy kilka testów wydajności brzegowej na serwerze SuperMicro IoT SuperServer SYS-210SE-31A, wszechstronnym, wielowęzłowym serwerze brzegowym. Inżynierowie najwyraźniej mieli na myśli wnioskowanie brzegowe już na etapie projektowania, ponieważ to urządzenie zostało stworzone z myślą o wnioskowaniu.

Przegląd SuperMicro IoT SuperServer SYS-210SE-31A

Nasza pełna recenzja serwera SuperMicro IoT SuperServer SYS-210SE-31A ujawnia, że ​​nadaje się on nie tylko do zastosowań 5G i IoT, ale także do sprzedaży detalicznej, a nawet przechowywania danych, jeśli zostanie sparowany z kartą pamięci PCIe i szybką kartą sieciową.

SuperMicro IoT SuperServer SYS-210SE-31A

Wielowęzłowa natura tego serwera sprawia, że ​​jest on niezwykle wszechstronny. Obsługuje trzy węzły procesora, każdy z następującymi funkcjami:

  • Jeden procesor Intel Xeon Scalable trzeciej generacji („Ice Lake”) o mocy do 32 rdzeni/64 wątków i mocy 205 W, z możliwością montażu układów o mocy 270 W przy zastosowaniu specjalnej konfiguracji.
  • Cztery moduły wentylatorowe.
  • Osiem gniazd DIMM; maksymalna pojemność pamięci wynosi 2TB przy użyciu modułów DIMM 3DS o pojemności 256 GB.
  • Dwa gniazda M.2 2280/22110 PCIe Gen4.
  • Dwa gniazda PCIe Gen4 x16 pełnej wysokości/połowy długości i jedno gniazdo PCIe Gen4 x16 połowy wysokości/połowy długości.
  • Jeden GbE dla IMPI 2.0 i klucz KVM.

Tutaj widać wyciągnięte węzły, wyglądające jak osobne miniaturowe serwery montowane w szafie.

Widok z boku wyciągniętych węzłów Supermicro SuperEdge

To wnętrze węzła. Zwróć uwagę, jak ściśle wszystko do siebie pasuje.

Węzeł SuperMicro IoT SuperServer SYS-210SE-31A

Główną słabością tego serwera jest pamięć masowa, ponieważ pamięć masowa w węźle jest ograniczona do dwóch gniazd na dyski rozruchowe M.2 i nie ma natywnych zatok 2.5-calowych ani 3.5-calowych. Jak wspomniano, można dość łatwo dodać pamięć masową PCIe. Dostępna jest również pamięć sieciowa; łączność poza 1 GbE jest zależna od kart rozszerzeń.

Cechą charakterystyczną tego serwera jest możliwość pracy w temperaturach do 45 stopni Celsjusza, z krótkimi okresami w temperaturze 55 stopni Celsjusza, a także dostępny filtr przeciwkurzowy.

Wnioskowanie brzegowe: argumenty za serwerami brzegowymi

Nasz artykuł „ Wnioskowanie brzegowe staje się coraz poważniejsze dzięki nowemu sprzętowi ” wyjaśnia stan przetwarzania brzegowego. Dzisiejsze przejście na przetwarzanie brzegowe wydawałoby się krokiem wstecz w porównaniu z tradycyjnymi czasami, kiedy hierarchiczne podejście „hub and spoke” polegało na przesyłaniu danych do centralnej lokalizacji. Podejmowanie decyzji w czasie rzeczywistym napędza dzisiejszy rozwój przetwarzania brzegowego, zapewniając szybsze analizy i krótszy czas reakcji oraz mniejszą zależność od łączności sieciowej.

Wnioskowanie brzegowe można przeprowadzić w chmurze, choć zazwyczaj tylko w przypadku aplikacji, które nie są wrażliwe na czas i nie mają krytycznego znaczenia. Oczywiście brak połączenia sieciowego wyklucza chmurę.

Testowanie krawędzi na serwerze SuperMicro IoT SuperServer SYS-210SE-31A

A teraz czas na nasze testy. Zdolność procesora graficznego do przetwarzania danych napędza wnioskowanie brzegowe, a serwery brzegowe zazwyczaj korzystają z jednoslotowych, niskoprofilowych kart, takich jak NVIDIA A2 i starsza, ale popularna T4. Oceniany przez nas serwer SuperMicro IoT SuperServer SYS-210SE-31A ma kartę T4. Poniżej znajdują się dwie karty: T4 po prawej, a A2 po lewej. Konfiguracja sprzętowa każdego węzła obejmowała procesor Intel Xeon Gold 6330 i 128 GB pamięci RAM DDR4.

wnioskowanie krawędziowe nvidia a2 i t4

A oto T4 zainstalowany w jednym z węzłów SuperMicro.

SuperMicro IoT SuperServer SYS-210SE-31A Nvidia T4

Dzięki 70-watowemu profilowi ​​mocy T4 cała moc pobierana jest z gniazda PCIe. Architektura Turing wykorzystuje rdzenie tensorowe, co zapewnia znacznie lepszą precyzję obliczeń FP32, FP16, INT8 i INT4 niż procesory CPU. Karta NVIDIA A2 charakteryzuje się nieco niższym profilem mocy (40–60 W), ale nowszą, bardziej wydajną architekturą. Porównanie obu kart można znaleźć w naszym artykule o wnioskowaniu brzegowym, w którym testowaliśmy je w Lenovo ThinkEdge SE450.

Pracujemy z pakietem benchmarków MLPerf Inference: Edge, który porównuje wydajność wnioskowania popularnych modeli DL w różnych rzeczywistych scenariuszach brzegowych. W naszych testach uzyskaliśmy wyniki dla modelu klasyfikacji obrazów ResNet50 oraz modelu BERT-Large NLP dla zadań typu „pytanie-odpowiedź”. Oba są uruchamiane w konfiguracji offline i SingleStream.

Scenariusz offline ocenia wydajność wnioskowania w „trybie wsadowym”, gdy wszystkie dane testowe są natychmiast dostępne, a opóźnienie nie ma znaczenia. W tym zadaniu skrypt wnioskowania może przetwarzać dane testowe w dowolnej kolejności, a celem jest maksymalizacja liczby zapytań na sekundę (QPS = przepustowość). Im wyższa wartość QPS, tym lepiej.

Natomiast konfiguracja Single Stream przetwarza jedną próbkę testową na raz. Po przeprowadzeniu wnioskowania na pojedynczym wejściu (w przypadku ResNet50 wejściem jest pojedynczy obraz), mierzone jest opóźnienie, a kolejna próbka jest udostępniana narzędziu wnioskowania. Celem jest minimalizacja opóźnienia przetwarzania każdego zapytania; im niższe opóźnienie, tym lepiej. 90. percentyl opóźnienia strumienia zapytania jest mierzony jako docelowa metryka zwięzłości.

Poniższy obraz pochodzi z wpisu na blogu firmy NVIDIA dotyczącego wnioskowania MLPerf 0.5, który bardzo dobrze wizualizuje te scenariusze. Więcej informacji o różnych scenariuszach można znaleźć w oryginalnym artykule na temat wnioskowania MLPerf tutaj.

Scenariusze Nvidia MLPerf

Przetestowaliśmy obciążenie działające na dwóch węzłach wewnątrz serwera SuperMicro IoT SuperServer SYS-210SE-31A. Trzeci węzeł został ustawiony jako zapasowy.

Benchmark Węzeł 1 (NVIDIA T4) Węzeł 3 (NVIDIA T4)
RestNet50 offline 5,587 próbek/s 5,492 próbek/s
BERT SingleStream 6.8 ms (90th (w procentach) 7.0 ms (90th (w procentach)
BERT Offline 397 próbek/s 396 próbek/s

Karta NVIDIA T4 ogólnie zrobiła wrażenie. Node 1 wykazał nieznacznie lepszą wydajność. Należy jednak pamiętać, że T4 to starsza karta o wyższym profilu poboru mocy niż nowsza A2. Testując A2 w ThinkEdge SE450, zauważyliśmy, że w niektórych miejscach charakteryzuje się ona również niższymi opóźnieniami niż T4, a jednocześnie zużywa znacznie mniej energii. Wybór między nimi powinien zależeć od aplikacji i poboru mocy. Na razie jednak jesteśmy zadowoleni z gęstości, jaką obudowa Supermicro może zapewnić w tego typu obciążeniach.

Uwagi końcowe

Wyścig do krawędzi przynosi szybki postęp w dziedzinie przetwarzania brzegowego. Nigdzie nie jest to bardziej widoczne niż w przypadku procesorów graficznych, a zwłaszcza niskoprofilowych i energooszczędnych opcji, takich jak NVIDIA T4 i nowszy A2. Testowaliśmy T4 w SuperMicro IoT SuperServer SYS-210SE-31A, niezwykle wszechstronnym, trzywęzłowym serwerze brzegowym.

T4 zaprezentował doskonałą wydajność, co jest tym bardziej imponujące, biorąc pod uwagę jego wiek. Zużywa jednak nieco więcej energii niż A2, więc wybierz mądrze, w zależności od swoich potrzeb w zakresie wnioskowania brzegowego. Spodziewamy się, że ten szanowany procesor graficzny ma jeszcze przed sobą długą drogę, ponieważ firmy zorientowane na krawędzie sieci nieustannie optymalizują wykorzystanie GPU.

Co więcej, serwer IoT Supermicro jest doskonale przygotowany do obsługi tych kart i zapewnia bardzo wysoką wydajność wnioskowania na brzegu sieci.

Skontaktuj się z StorageReview

Biuletyn | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Kanał RSS

Charles P. Jefferies

Jestem entuzjastą technologii od zawsze i recenzuję urządzenia konsumenckie i korporacyjne od 2005 roku. Specjalizuję się w laptopach, tabletach i sprzęcie korporacyjnym. Jestem absolwentem Rochester Institute of Technology. Poza pracą uwielbiam siłownię, czytanie i fotografię.