StorageReview.com

Test termiczny NVIDIA DGX Spark: porównanie projektów chłodzenia OEM

konsument  ◇  Workstation

Po długim oczekiwaniu, NVIDIA DGX Spark została wydana w zeszłym roku, z nadzieją, że zainspiruje nową falę inżynierów i badaczy AI. W StorageReview otrzymaliśmy wiele systemów DGX Spark od różnych partnerów do ewaluacji i rozwijamy kilka ekscytujących projektów klastrowych. Jednak charakterystyki termiczne i energetyczne tych różnych wdrożeń okazały się zbyt interesujące, aby trzymać je w tajemnicy do czasu zakończenia naszych pełnych recenzji.

NVIDIA DGX Spark Thermal

To porównanie jest szczególnie przekonujące, ponieważ pozwala zaobserwować, jak różni partnerzy OEM zinterpretowali referencyjny projekt firmy NVIDIA. O ile rdzeń elektroniki i płyta główna pozostają niezmienne we wszystkich implementacjach, rozwiązania w zakresie zarządzania temperaturą, konstrukcje obudów i strategie przepływu powietrza znacznie się różnią. Te decyzje inżynieryjne przekładają się na mierzalne różnice w temperaturach pracy, a zrozumienie tych różnic dostarcza cennych informacji użytkownikom końcowym poszukującym niektórych modeli DGX Sparks.

W tej analizie przedstawiamy porównanie wydajności cieplnej i energetycznej pięciu systemów DGX Spark: NVIDIA Founders Edition , Gigabyte, Dell, Acer i ASUS.

Metodologia testów termicznych NVIDIA DGX Spark

Dane przedstawione w tym miejscu zostały zebrane podczas testów porównawczych usług online vLLM z wykorzystaniem modelu GPT-OSS-120B firmy OpenAI. Test składa się z trzech odrębnych scenariuszy testowych, zaprojektowanych w celu sprawdzenia różnych aspektów procesu wnioskowania.

Scenariusz „równy” przedstawia zrównoważone obciążenie z 256 tokenami wejściowymi i 256 tokenami wyjściowymi, co skutkuje krótkimi, symetrycznymi wymaganiami zarówno w fazie wstępnego wypełniania, jak i dekodowania. Scenariusz z dużym obciążeniem wstępnym przesuwa intensywność obliczeniową w kierunku przetwarzania danych wejściowych, gdzie 4096 tokenów wejściowych generuje 512 tokenów wyjściowych; taka konfiguracja nasyca rdzenie tensorowe podczas szybkiej fazy wstępnego wypełniania/kodowania, jednocześnie utrzymując umiarkowane wymagania dekodowania, jak w scenariuszach uzupełniania kodu.

Natomiast scenariusz z intensywnym dekodowaniem odwraca tę zależność, wykorzystując 512 tokenów wejściowych do wygenerowania 4096 tokenów wyjściowych. Jest to podobne do żądania od modelu napisania aplikacji przy użyciu jednego monitu, co powoduje stałe obciążenie przepustowości pamięci podczas fazy generowania tokenów autoregresyjnych.

Każdy scenariusz został przetestowany w partiach po 1, 2, 4, 8, 16, 32, 64 i 128, co dało łącznie 24 etapy testu. Pomiędzy każdym kolejnym etapem obowiązywał również 30-sekundowy okres wyciszenia. Te okresy wyciszenia są widoczne na wykresach jako krótkie spadki między etapami testu, oznaczone pionowymi liniami przerywanymi, oddzielającymi zacieniowane obszary scenariusza.

Wyrównanie wykresu i kontrola środowiska

Prezentowane wykresy wykorzystują oś czasu wyrównaną z etapem, co oznacza, że ​​dane ze wszystkich systemów są synchronizowane etapem testowym, a nie bezwzględnym czasem zegara. Ta metodologia umożliwia bezpośrednie porównanie zachowania systemu w identycznych fazach obciążenia, mimo że poszczególne systemy ukończyły etapy z nieznacznie różną szybkością ze względu na ich dławienie termiczne i stałe parametry wydajnościowe.

Pięć systemów testowano jednocześnie w identycznych warunkach środowiskowych, umieszczając je obok siebie w kontrolowanym pomieszczeniu o stałej temperaturze otoczenia przez cały czas trwania testu. To równoległe podejście do testowania gwarantuje, że wszelkie zaobserwowane różnice wynikają bezpośrednio z konstrukcji termicznej systemów, a nie ze zmiennych środowiskowych, takich jak dryft temperatury otoczenia, wzorce przepływu powietrza czy zmiany w zależności od pory dnia.

Dodatkowo na wszystkich modelach zainstalowano najnowszy obraz NVIDIA Ubuntu.

Gromadzenie danych

Dane systemowe zbierano w odstępach 1-sekundowych za pomocą niestandardowego skryptu monitorującego, który odczytuje dane bezpośrednio z interfejsów jądra Linux i nvidia-smi. Nie wykonywaliśmy bezpośrednich pomiarów za pomocą sond termicznych ani żadnego zewnętrznego systemu monitorowania zasilania.

Należy pamiętać, że temperatur dysków NVMe nie można bezpośrednio porównywać, ponieważ nie wszystkie systemy mają identyczne dyski pamięci masowej. Warto zauważyć, że system Asus był jedynym systemem wyposażonym w dysk Phison o pojemności 1 TB, Dell posiadał dysk Phison o pojemności 4 TB, a wszystkie pozostałe testowane przez nas systemy miały dysk Samsung o pojemności 4 TB. W kolejnych recenzjach będziemy szczegółowo omawiać parametry termiczne dysków NVMe, ponieważ nawet takie czynniki, jak mostki termiczne między dyskiem a spodem obudowy, nie są takie same we wszystkich modelach Spark.

Analiza termiczna NVIDIA DGX Spark

Zanim przejdziemy do poszczególnych wskaźników, warto zrozumieć, że DGX Spark wykorzystuje zintegrowany system chłodzenia, w którym komponenty współdzielą ścieżki termiczne. Jak widać w projekcie Founders Edition, ciepło generowane przez GPU bezpośrednio wpływa na temperatury sąsiednich komponentów, w tym procesora, pamięci masowej NVMe i interfejsów sieciowych. Ta współzależność termiczna oznacza, że ​​obciążenia intensywnie wykorzystujące GPU generują kaskadowe efekty termiczne w całym systemie, wyjaśniając, dlaczego obserwujemy skorelowane wzorce temperatur w różnych komponentach.

Temperatura procesora

Dane dotyczące temperatury procesora ujawniają najbardziej drastyczne różnice między implementacjami. System Acer wyróżnia się od razu, osiągając temperaturę szczytową na poziomie zaledwie 74.6°C w wymagającym scenariuszu Prefill Heavy, podczas gdy wszystkie inne systemy osiągały wartości od 85°C do ponad 85°C. To przewaga o 10-14°C nad konkurencją, co oznacza znaczny zapas termiczny sugerujący, że Acer zainwestował znacząco w wydajność chłodzenia.

Temperatury procesora NVIDIA DGX Spark

Płyty główne Founders Edition, Dell i Gigabyte łączą się ze sobą, osiągając niemal identyczne profile termiczne, wszystkie osiągając 87-88°C podczas szczytowego obciążenia. To podobieństwo wskazuje, że większość partnerów zasadniczo dorównała referencyjnemu projektowi chłodzenia firmy NVIDIA, zamiast go przewyższyć. ASUS plasuje się pośrodku, osiągając o kilka stopni niższą temperaturę niż ta grupa, ale wciąż znacznie przewyższając wydajność Acera.

Zęby piły w testach Equal i Prefill Heavy odzwierciedlają cykliczny charakter testu, z wyraźną regeneracją w okresach schładzania. W trybie Decode Heavy temperatury stabilizują się na bardziej stabilnym poziomie; wskazuje to również na intensywne wykorzystanie pamięci podczas generowania tokenów i na to, że konfiguracja pamięci stanowi wyraźne wąskie gardło w tym obciążeniu.

Temperatura GPU

Temperatury GPU podążają podobną ścieżką, biorąc pod uwagę wspólną infrastrukturę chłodzenia. Acer osiąga szczytową temperaturę zaledwie 68°C podczas intensywnego napełniania, podczas gdy pozostałe cztery systemy osiągają 80-82°C, co daje stałą przewagę 12-14°C, co odzwierciedla wyniki CPU.

Temperatury procesora graficznego NVIDIA DGX Spark

Ścisłe powiązanie między Founders Edition, Dell, Gigabyte i ASUS sugeruje, że implementacje te zbliżają się do podobnych limitów termicznych, prawdopodobnie tam, gdzie zaczyna ingerować kontrolowane przez oprogramowanie układowe zarządzanie temperaturą procesora graficznego.

Temperatura NVMe

Temperatury przechowywania pokazują, jak dobrze każda obudowa izoluje wnękę dysku od ciepła generowanego przez komputer. Acer ponownie prowadzi z temperaturą szczytową 51.8°C, podczas gdy inni producenci osiągają 58–63°C.

Temperatury termiczne dysku SSD NVIDIA DGX Spark

Stopniowy wzrost temperatury podczas testów, niezależny od skoków obciążenia, wskazuje na kumulację ciepła z sąsiednich komponentów w miarę upływu czasu. W przypadku długotrwałych, precyzyjnych prób dostrajania lub częstej wymiany modeli, ma to istotne znaczenie dla trwałości dysku i stałej wydajności zapisu.

Jak wspomniano wcześniej, konfiguracje dysków różniły się w zależności od systemu, więc porównania te niosą ze sobą pewne zastrzeżenia. Jednak stała przewaga Acera w każdym parametrze termicznym wskazuje na rzeczywistą poprawę chłodzenia, a nie na różnice w wydajności dysków.

Temperatura karty sieciowej

Patrząc na temperatury karty sieciowej ConnectX-7, Acer osiąga szczyt 62°C, podczas gdy Founders Edition osiąga 75°C, co stanowi różnicę 13°C, zgodną ze schematem obserwowanym w przypadku innych podzespołów. Gigabyte faktycznie radzi sobie tutaj chłodniej niż Dell i ASUS, pomimo wyższej temperatury procesora, co sugeruje, że rozkład ciepła różni się w zależności od konstrukcji obudowy.

Pobór mocy GPU

Na koniec chcieliśmy sprawdzić pobór mocy przez GPU. Nic dziwnego, że wszystkie pięć systemów wykazywało zadziwiająco podobne szczytowe zużycie energii podczas trybu Prefill Heavy, wahające się od 69.3 W (Acer) do 76.0 W (Gigabyte).

Jedzenie na wynos

Dane jasno pokazują: testowany przez nas model Acer działał o 10-15°C chłodniej niż konkurencyjne modele pod każdym względem, co sugeruje zasadniczo lepsze rozwiązanie chłodzenia. Modele Founders Edition, Dell i Gigabyte plasują się w podobnej sytuacji termicznej, zasadniczo pokrywając się z referencyjnym projektem firmy NVIDIA. ASUS plasuje się w środku stawki. Pobór mocy jest równomierny, co potwierdza, że ​​różnice w temperaturze wynikają wyłącznie z zastosowanego systemu chłodzenia. Gigabyte jednak wyróżniał się na tle konkurencji. Zaoferował jeden z najlepszych profili chłodzenia z jednym z najwyższych poziomów mocy GPU, zapewniając najlepszą równowagę między chłodzeniem a poborem mocy.

Ogólnie rzecz biorąc, modele partnerskie działają bardzo podobnie i użytkownicy nie mogą się pomylić z żadnym z nich. Warto jednak śledzić szczegółowe recenzje każdego systemu, obejmujące wydajność obciążenia i ulubiony przez wszystkich aspekt: ​​demontaż.

Skontaktuj się z StorageReview

Biuletyn | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Kanał RSS

Divyansh Jain

Inżynier uczenia maszynowego, homelabber i entuzjasta technologii. W StorageReview kieruję testami sztucznej inteligencji i nowych obciążeń, dostarczając analizy i analizy wydajności.