StorageReview.com

Recenzja ASUS ExpertCenter Pro ET900N G3: Stacja GB300 DGX z uchwytami, tytanową obudową i chłodzoną optyką

konsument  ◇  Workstation

ASUS ExpertCenter Pro ET900N G3 to druga stacja GB300 DGX, którą testowaliśmy, i pierwsza, którą mieliśmy okazję przetestować w laboratorium; testy MSI XpertStation WS300 przeprowadziliśmy zdalnie. Wykorzystuje ona ten sam układ NVIDIA, który testowaliśmy w MSI XpertStation WS300: układ Grace Blackwell Ultra Desktop Superchip z 72 rdzeniami Grace, procesor graficzny B300, 252 GB pamięci HBM3e, 496 GB pamięci LPDDR5X oraz kartę sieciową ConnectX-8 SuperNIC z dwoma portami 400 GbE. ASUS umieścił tę platformę rdzeni w schludnej obudowie typu tower, zaprojektowanej z myślą o sztucznej inteligencji przy biurku, dodając kilka udoskonaleń, których nie ma w WS300: dwa uchwyty do przenoszenia na górze, dedykowany wentylator skierowany na klatki z optyką ConnectX-8 oraz zasilacz o mocy 1,600 W z certyfikatem 80 PLUS Titanium.

Stacja robocza ASUS ExpertCenter Pro ET900N G3 GB300 DGX Station na stole laboratoryjnym StorageReview, widok z trzech czwartych pokazujący srebrne otwory wentylacyjne na panelu bocznym, siatkę z przodu, górne uchwyty do przenoszenia i znaczek ASUS

ASUS wysłał ET900N G3 do laboratorium na około tydzień testów porównawczych, sesji zdjęciowych i testów fizycznych z zainstalowaną kartą RTX PRO 2000. Jeśli chodzi o samą platformę, B300, Grace, NVLink-C2C, MIG i do czego służy stacja DGX, recenzja WS300 omawia te zagadnienia. Niniejsza recenzja dotyczy tego, co ASUS zbudował wokół Superchipa i czy wyniki wypadają dobrze w porównaniu z pierwszą testowaną przez nas wieżą GB300.

Specyfikacja ASUS ExpertCenter Pro ET900N G3

Specyfikacja ASUS ExpertCenter Pro ET900N G3
Omówienie platformy
Superchip NVIDIA GB300 Grace Blackwell Ultra Desktop Superchip
CPU NVIDIA Grace, 72-ramienne rdzenie Neoverse V2
GPU NVIDIA Blackwell Ultra (B300), do 20 PFLOPS NVFP4 z rozrzedzeniem
Połączenie CPU-GPU NVLink-C2C, 900 GB/s dwukierunkowy
Pamięć
Pamięć koherentna 748GB
Pamięć GPU 252 GB HBM3e, 7.1 TB/s
Pamięć procesora 496 GB LPDDR5X, 396 GB/s, 4x SOCAMM
Dyski
Dyski rozruchowe 2x M.2 2280 PCIe 5.0 x4 (klucz M), wypełnione 2x 2TB NVMe w RAID 1
Napędy rozszerzeń 2x M.2 2280 (klucz M), PCIe 6.0 x4 według ASUS, otwarte fabrycznie
Sieci
SuperNIC NVIDIA ConnectX-8, 2x QSFP112 400GbE
Ethernet 1x Marvell 10GbE
1x Realtek 1GbE (BMC)
Ekspansja
Sloty PCIe 1x PCIe 5.0 x16
2x PCIe 5.0 x16 (sygnały x8)
Dodatkowy procesor graficzny Do jednej karty NVIDIA RTX PRO Blackwell; egzemplarz testowy dostarczany z kartą RTX PRO 2000 Blackwell
I / O
Przód 2x USB 10 Gb/s typu C
2x USB 10 Gb/s typu A
1x USB 2.0
Gniazda słuchawkowe i mikrofonowe
Tył 4x USB 10 Gb/s typu A
1x Micro-USB COM (konsola szeregowa BMC)
1x Mini DisplayPort (BMC)
3x gniazda audio
Zarządzanie i bezpieczeństwo
BMC ASPEED AST2600 z oprogramowaniem układowym AMI MegaRAC, IPMI i Redfish
Ochrona Wbudowany moduł TPM 2.0
Zasilanie i chłodzenie
Zasilacz laboratoryjny 1x 1,600 W ATX, 80 PLUS Titanium
Chłodzenie Zamknięty obieg chłodzenia cieczą AIO (według firmy ASUS) z płytkami chłodzącymi na płytach GB300, SOCAMM i ConnectX-8; radiatory z przodu i z góry, wentylator z tyłu obudowy, dedykowany wentylator nad klatkami QSFP112
temperatura robocza 10C do 35C
Oprogramowanie i współczynnik kształtu
System operacyjny Ubuntu z narzędziami programistycznymi NVIDIA AI; ASUS twierdzi, że planowane jest wsparcie rozwoju AI w systemie Windows
Wymiary 584 x 232 x 565 mm (23.0 x 9.1 x 22.3 cala), zgodnie z deklaracją firmy ASUS
Waga 27 kg netto, 32 kg brutto

Zaprojektuj i zbuduj

ASUS ubiera ET900N G3 jako biznesową stację roboczą, ze szczotkowaną srebrną obudową, ciemną siatką z przodu, chromowaną nasadką i stopką oraz nisko umieszczonym logo ASUS z przodu. Proporcje są takie, jakie dyktuje platforma: 584 x 232 x 565 mm według specyfikacji ASUS, co jest nieco wyższe i węższe niż WS300 o wysokości 529 mm, głębokości 570 mm i szerokości 246 mm. Przy wadze 27 kg nie jest to system, który ktokolwiek przenosi swobodnie, i to właśnie tutaj wchodzi w grę pierwsza decyzja specyficzna dla ASUS-a. Dwa metalowe uchwyty na górnej krawędzi, jeden z przodu i jeden z tyłu, pozwalają dwóm osobom podnieść wieżę na biurko lub wózek bez chwytania za panele. Wyglądają nieco nie na miejscu na maszynie biurowej, dopóki nie trzeba będzie przenieść wieży GB300 przez laboratorium.

Przód ASUS ExpertCenter Pro ET900N G3 z ciemnym panelem siatkowym, górnym uchwytem do przenoszenia, przyciskiem zasilania, przednimi portami USB typu A i typu C, gniazdami audio i logo ASUS

Na przednim panelu znajdują się przycisk zasilania, dwa porty USB typu A 10 Gb/s, dwa porty USB typu C 10 Gb/s, port USB 2.0 oraz oddzielne gniazda słuchawkowe i mikrofonowe, ułożone w pionowym pasku w prawym górnym rogu siatki. Panel boczny to duża, wentylowana płyta z długą, perforowaną kolumną z przodu, służącą do wlotu powietrza do chłodnicy, oraz mniejszą, kwadratową kratką z tyłu, która jest ustawiona w linii z wentylatorami systemowymi. Brakuje okna i oświetlenia, co odpowiada docelowemu klientowi.

Panel boczny ASUS ExpertCenter Pro ET900N G3 pokazujący wysoką, perforowaną kolumnę wlotową chłodnicy i mniejszy, kwadratowy otwór wentylacyjny, który jest ustawiony w jednej linii z wentylatorem systemowym

Z tyłu, układ oddziela porty wejścia/wyjścia stacji roboczej od sprzętu serwerowego znajdującego się pod spodem. Górny klaster zawiera cztery porty USB typu A 10 Gb/s, gniazda RJ45 10 GbE i 1 GbE, trzy gniazda audio, port konsoli Micro-USB BMC oraz port Mini DisplayPort, który BMC obsługuje w celach konfiguracyjnych. Dwie klatki QSFP112 dla ConnectX-8 znajdują się u góry osłony portów wejścia/wyjścia; obok nich znajduje się wentylator wyciągowy; pośrodku biegną trzy pokrywy gniazd rozszerzeń; a zasilacz z wejściem C19 znajduje się u dołu. Podobnie jak w modelu WS300, port Mini DisplayPort jest wyjściem BMC do wstępnej konfiguracji i rozwiązywania problemów; każdy, kto chce mieć komputer stacjonarny na tym komputerze, potrzebuje karty RTX PRO.

Tylny panel ASUS ExpertCenter Pro ET900N G3 z klatkami QSFP112 i klastrem USB u góry, wentylatorem wyciągowym, trzema osłonami gniazd rozszerzeń i gniazdem zasilania C19 u dołu

Wewnątrz ET900N G3

Po zdjęciu panelu bocznego, ET900N G3 wydaje się być bliskim krewnym WS300, co jest zrozumiałe, biorąc pod uwagę, że oba korzystają z tej samej płyty głównej NVIDIA. Układ GB300 Superchip znajduje się pod miedzianą płytą chłodzącą po lewej stronie obudowy, moduły SOCAMM pod własnymi miedzianymi płytami obok niego, a ConnectX-8 pod trzecim blokiem w pobliżu tylnego panelu I/O. Oplot rurowy biegnie od bloków do kolektora rozdzielczego zamontowanego na belce poprzecznej obudowy, a stamtąd do radiatorów. Trzy pełnowymiarowe gniazda PCIe znajdują się pod układem Superchip, zasilacz zajmuje dolny przedni narożnik, a metalowa osłona zakrywa ścieżkę kablową wzdłuż dolnej krawędzi.

Widok z góry na wnętrze ASUS ExpertCenter Pro ET900N G3 z miedzianymi płytami chłodzącymi nad układem GB300 Superchip, plecionymi przewodami chłodzącymi, kolektorem rozdzielczym, wentylatorami chłodnicy, gniazdami PCIe i zasilaczem

Układ wnętrza jest taki sam jak w modelu WS300: jedna chłodnica zamontowana pionowo za przednią siatką i druga u góry, każda z rzędem wentylatorów, plus wentylator podwozia z tyłu. Przewody płynu chłodzącego są osłonięte i przymocowane do belki poprzecznej za pomocą pasów na rzepy, a kolektor konsoliduje przewody z czterech płyt chłodzących, tak że do każdej chłodnicy docierają tylko dwa przewody.

Widok z boku wnętrza ASUS ExpertCenter Pro ET900N G3 ukazujący przedni radiator z trzema wentylatorami, drugi radiator u góry, tylny wentylator obudowy i miedziane płyty chłodzące Kolektor rozprowadzający środek chłodzący wewnątrz ASUS ExpertCenter Pro ET900N G3 z przewodami osłonowymi od płyt chłodzących przymocowanych do belki poprzecznej podwozia

Wentylator optyczny

Jedynym elementem chłodzącym, który nie ma odpowiednika w WS300, jest mały wentylator zamontowany na wsporniku nad płytą chłodzącą ConnectX-8, skierowany na klatki QSFP112. Pętla cieczowa obsługuje sam krzem SuperNIC, ale transceivery optyczne 400G generują własne ciepło i są umieszczone w metalowych klatkach, do których płytka chłodząca może dotrzeć tylko poprzez przewodzenie. W innych testach zauważyliśmy, że ConnectX-8 nagrzewa się pod stałym obciążeniem, a sama optyka może się nagrzewać, więc dedykowana ścieżka przepływu powietrza przez klatki jest dobrym elementem konstrukcyjnym dla każdego, kto planuje uruchamiać ET900N G3 na światłowodzie przez wiele godzin. Z przetwornikami cyfrowo-analogowymi (DAC), którymi podłączyliśmy go do drugiej stacji GB300 w ramach dogłębnego badania z wykorzystaniem klastrów, które wciąż trwa, wentylator ma mniej zadań.

Zbliżenie małego wentylatora zamontowanego nad płytą chłodzącą ConnectX-8 w obudowie ASUS ExpertCenter Pro ET900N G3, skierowanego na klatki z optyką QSFP112, z wentylatorem radiatora i tylnym wentylatorem wyciągowym za nim Miedziane płyty chłodzące nad układem GB300 Superchip i pamięcią SOCAMM w obudowie ASUS ExpertCenter Pro ET900N G3, z blokiem ConnectX-8 i jego małym wentylatorem u góry po lewej stronie oraz trzema dyskami M.2 pod radiatorami u dołu po prawej stronie

Przechowywanie, rozbudowa i zasilanie

ASUS dostarczył model ET900N G3 z pojedynczym dyskiem NVMe o pojemności 2 TB na system operacyjny i oprogramowanie NVIDIA, umieszczonym w dwóch gniazdach M.2 2280 podłączonych do płyty Grace przez PCIe 5.0 x4. Druga para gniazd jest przymocowana do zintegrowanego przełącznika PCIe ConnectX-8 i dostarczana jest pusta.

Dyski SSD M.2 pod radiatorami w obudowie ASUS ExpertCenter Pro ET900N G3 obok miedzianej płyty chłodzącej GB300

Nasz egzemplarz testowy został wyposażony w kartę graficzną NVIDIA RTX PRO 2000 Blackwell w gnieździe PCIe 5.0 x16, co jest jedną z konfiguracji wymienionych przez ASUS. Karta zapewnia wyjście wideo bez znaczącego obciążenia budżetu mocy GB300, a ASUS twierdzi, że obudowa pomieści nawet jedną kartę RTX PRO Blackwell. Przed testem porównawczym wyjęliśmy kartę RTX PRO 2000, aby Superchip miał pełny budżet akceleratora, podobnie jak w przypadku WS300. Nie testowaliśmy również karty RTX PRO o dużej mocy w tej obudowie; ta ścieżka i jej wpływ na współdzielony budżet mocy zostaną omówione w nadchodzącej recenzji stacji GB300.

Karta graficzna NVIDIA RTX PRO 2000 Blackwell zainstalowana w gnieździe PCIe 5.0 x16 obudowy ASUS ExpertCenter Pro ET900N G3, z miedzianymi płytkami chłodzącymi i osłoniętymi przewodami chłodzącymi za nią

Zasilacz to jednostka ATX o mocy 1,600 W, którą ASUS ocenia na 80 PLUS Titanium, poziom wyżej niż jednostkę Platinum w WS300. Titanium wymaga 94% sprawności przy 50% obciążeniu przy wejściu 115 V w porównaniu z 92% dla Platinum i jest to jedyny poziom, który ustala dolną granicę obciążenia na 10%, więc ET900N G3 powinien marnować kilkadziesiąt watów mniej na ścianie przy pełnym obciążeniu GB300. Budżet jest nadal wspólny: Grace, B300, pompy, wentylatory, pamięć masowa i dowolna karta RTX PRO pobierają z tych samych 1,600 W, a usługa vsloshd firmy NVIDIA przesuwa margines mocy między Superchipem a dodatkowym GPU w miarę zmiany ich poboru, bez ustalonego limitu dla żadnego z nich. Recenzja WS300 omawia tę politykę i tutaj pozostaje ona niezmieniona. Dedykowany obwód 20 A pozostaje wymogiem dla instalacji w Ameryce Północnej.

Łączność

Dwa porty QSFP112 w ConnectX-8 stanowią łącznik ET900N G3 ze wszystkim innym: pamięcią masową, drugą stacją DGX lub strukturą klastra. Porty te są już używane w laboratorium, a ET900N G3 jest podłączony do drugiej stacji GB300 za pośrednictwem przetworników DAC 400G, co pozwala na dogłębną analizę wnioskowania klastrowego, którą opublikujemy osobno. Port Marvell 10GbE obsługuje standardowy ruch hosta, a port Realtek 1GbE jest dedykowany dla kontrolera BMC.

Dwa kable DAC 400G podłączone do portów QSFP112 z tyłu obudowy ASUS ExpertCenter Pro ET900N G3, z tylną kratką wentylatora wyciągowego obok nich i szafką laboratoryjną StorageReview z tyłu

Notatki testowe

Wszystkie wyniki w tej recenzji pochodzą z urządzenia dostarczonego przez firmę ASUS do naszego laboratorium, w konfiguracji z pamięcią fabryczną, z 252 GB pamięci HBM3e i 496 GB pamięci LPDDR5X. System działał bez zainstalowanej karty RTX PRO, więc układ GB300 Superchip miał pełny budżet mocy akceleratora, co odpowiadało warunkom naszych testów WS300. Stos oprogramowania, konfiguracja vLLM, profile obciążeń i analiza współbieżności są takie same jak te, których użyliśmy w przypadku WS300, więc obie obudowy można bezpośrednio porównać. Niniejsza recenzja dotyczy wyłącznie wydajności; nie wykonywaliśmy pomiarów poboru mocy ani temperatury w tym urządzeniu.

Obciążenia to te same dwa profile wnioskowania na żywo vLLM, które uruchamiamy w każdym lokalnym systemie AI: równe obciążenie z 512 tokenami wejściowymi i 512 tokenami wyjściowymi oraz obciążenie z dużym wstępnym wypełnianiem z 8,192 tokenami wejściowymi i 1,024 tokenami wyjściowymi, przemiatanymi od jednego do 128 współbieżnych strumieni. W przypadku modeli o skali granicznej porównujemy je z serwerem GPU Dell PowerEdge XE7740 wyposażonym w dwie lub cztery karty RTX PRO 6000 , najbliższą alternatywą w jednym pudełku dla tych punktów kontrolnych. W przypadku mniejszych modeli porównujemy je z pojedynczą kartą RTX PRO 6000 w tej samej obudowie XE7740, pojedynczą kartą H200 NVL w obudowie Dell PowerEdge R770 oraz kartą GB10 DGX Spark reprezentowaną przez kartę Acer Veriton GN100 , tę samą kartę Spark, której użyliśmy w przeglądzie modelu WS300. Podane poniżej wartości dla ET900N G3 to dokładne wartości z dzienników uruchomień; wartości porównawcze pochodzą z naszych wykresów wyników.

Wydajność wnioskowania

Modele graniczne w puli pamięci koherentnej

Powodem istnienia GB300 jest obsługa modeli po obu stronach granicy 252 GB pamięci HBM3e B300, dlatego zaczynamy od czterech punktów kontrolnych, które ją obejmują: pamięć Flash DeepSeek V4 i MiniMax M2.7 mieszczą się w pamięci HBM z zapasem miejsca, MiniMax M3 ledwo się mieści i przenosi część swoich zasobów do pamięci Grace, a GLM-5.2 odciąża mniej więcej połowę swojej wagi. Po drugiej stronie każdego wykresu znajduje się najbliższa alternatywa w jednym pudełku: karty RTX PRO 6000 razem w obudowie PowerEdge XE7740, z odciążeniem zasobów eksperckich, aby pomieścić pamięć tam, gdzie jest potrzebna.

DeepSeek V4 Flash to prosty przypadek: natywny punkt kontrolny FP8 o rozmiarze około 20 GB, który B300 obsługuje bezproblemowo. Przepustowość wyjściowa przy tym samym obciążeniu wzrosła ze 152 tokenów na sekundę przy 1 strumieniu do 1,766 przy 32 strumieniach, co daje łączną przepustowość tokenów do 3,532. W profilu z dużym obciążeniem wstępnym, ET900N G3 zwiększył przepustowość tokenów wyjściowych ze 148 do 954 tokenów wyjściowych na sekundę, osiągając łącznie 8,587 tokenów. Para kart RTX PRO 6000 osiągnęła szczytową wartość blisko 800 tokenów wyjściowych na sekundę przy tym samym obciążeniu i około 490 przy długich monitach, z nierównomierną krzywą przy niskiej współbieżności.

Przepustowość tokena wyjściowego vLLM dla DeepSeek V4 Flash FP8 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z dwiema kartami RTX PRO 6000, obciążenie 512/512 przy współbieżności Przepustowość tokena wyjściowego vLLM dla DeepSeek V4 Flash FP8 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z dwiema kartami RTX PRO 6000, obciążeniem wstępnym 8,192/1,024 przy jednoczesnym wykonywaniu wielu zadań

Karta MiniMax M2.7 w kwantyzacji NVFP4 firmy NVIDIA zajmuje około 125 GB pamięci HBM i skaluje się najmocniej spośród czterech. Równe obciążenie wzrosło z 214 tokenów wyjściowych na sekundę dla jednego strumienia do 4,793 dla 128 strumieni, a całkowita przepustowość osiągnęła 9,586. Przebieg z dużą ilością prefillu skalował się do 1,744 tokenów wyjściowych na sekundę i 15 700 tokenów na sekundę przy 64 strumieniach. Dwie karty RTX PRO 6000 podążały za tym samym kształtem, ale o mniej niż połowę niższej wysokości, osiągając maksymalnie 1,930 tokenów wyjściowych na sekundę przy równym obciążeniu i około 510 dla długich monitów.

Przepustowość tokena wyjściowego vLLM dla MiniMax M2.7 NVFP4 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z dwiema kartami RTX PRO 6000, obciążenie 512/512 przy współbieżności Przepustowość tokena wyjściowego vLLM dla MiniMax M2.7 NVFP4 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z dwiema kartami RTX PRO 6000, obciążeniem wstępnym 8,192/1,024 przy jednoczesnym wykonywaniu wielu zadań

MiniMax M3 pokazuje, jak trudno zmieścić się w pamięci. Punkt kontrolny NVFP4 jest mniejszy niż 252 GB, ale pamięć podręczna środowiska wykonawczego i KV również wymagają przestrzeni, dlatego część ekspertów znajduje się w pamięci Grace, a każdy krok dekodowania, który ich dotyka, przechodzi przez NVLink-C2C. Dzięki dekodowaniu spekulatywnemu EAGLE3, ET900N G3 osiągnął 1,041 tokenów wyjściowych na sekundę przy 32 strumieniach i równym obciążeniu. Profil z dużym obciążeniem wstępnym osiągnął szczyt na poziomie 282 przy dwóch strumieniach, utrzymał się na poziomie 271 przy czterech i spadł do 103 przy ośmiu, gdy długie monity zużywały pozostałą pamięć podręczną. Cztery karty RTX PRO 6000 z tym samym dekoderem spekulatywnym dotrzymywały kroku przy ośmiu strumieniach i wyprzedziły przy 16 strumieniach z około 1,180 tokenami wyjściowymi na sekundę, a następnie spadły do ​​około 760 przy 32 strumieniach. W profilu z dużym udziałem wstępnego wypełniania, czterokartowe pudełko mieściło około 349 tokenów wyjściowych na sekundę przy czterech strumieniach w porównaniu do 271 tokenów stacji. Model znajdujący się na granicy HBM to jedyne miejsce w tym zestawie, w którym 384 GB pamięci VRAM na czterech kartach konkuruje z 252 GB pamięci HBM plus odciążenie.

Przepustowość tokena wyjściowego vLLM dla MiniMax M3 NVFP4 z odciążeniem Grace na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z czterema kartami RTX PRO 6000, obciążenie 512/512 przy współbieżności Przepustowość tokenów wyjściowych vLLM dla MiniMax M3 NVFP4 z odciążeniem Grace na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z czterema kartami RTX PRO 6000, obciążeniem wstępnym 8,192/1,024 przy współbieżności

GLM-5.2 to przypadek użycia, który jest możliwy tylko dzięki puli koherentnej. Punkt kontrolny NVFP4 przechowuje około 215 GB wag eksperckich w pamięci Grace z dekodowaniem spekulatywnym MTP, a ET900N G3 obsłużył go z prędkością 35 tokenów wyjściowych na sekundę dla jednego strumienia i 139 dla 32 strumieni przy równym obciążeniu, a całkowita przepustowość osiągnęła 277. W profilu z dużym obciążeniem wstępnym, przeszukiwanie objęło 32 strumienie, osiągając 120 tokenów wyjściowych na sekundę i łącznie 1,079 tokenów. Cztery karty RTX PRO 6000, z których każda odciążała pamięć hosta z około 30 GB, obsłużyły około 40 tokenów wyjściowych na sekundę przy 32 strumieniach, spłaszczając tę ​​wartość do około 9-10 przy długich monitach od czterech strumieni w górę. Żaden z systemów nie sprawia wrażenia szybkiego modelu 433 GB, ale GB300 oferuje przepustowość 396 GB/s LPDDR5X i 900 GB/s NVLink-C2C, co pozwala ekspertom w dziedzinie odciążania pamięci, a jednocześnie oferuje skalowalność na poziomie, na jakim kończy się pamięć hosta podłączona przez PCIe na czterech kartach.

Przepustowość tokena wyjściowego vLLM dla GLM-5.2 NVFP4 z 215 GB ekspertów przeniesionych do pamięci Grace na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z czterema kartami RTX PRO 6000 z przeciążeniem hosta, obciążeniem 512/512 przy współbieżności Przepustowość tokena wyjściowego vLLM dla GLM-5.2 NVFP4 z 215 GB ekspertów przeniesionych do pamięci Grace na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z czterema kartami RTX PRO 6000 z przeciążeniem hosta, 8,192/1,024 obciążeniami o dużym stopniu wstępnego wypełniania w trybie współbieżnym

W porównaniu z MSI WS300, wyniki modelu granicznego ET900N G3 mieszczą się w granicach około 1% w każdym porównywalnym punkcie: 1,766 tokenów wyjściowych na sekundę na DeepSeek V4 Flash przy 32 strumieniach na obu wieżach, 4,793 w porównaniu z 4,801 na MiniMax M2.7 przy 128, 1,041 na MiniMax M3 przy 32 strumieniach na obu i 139 na GLM-5.2 przy 32 strumieniach na obu.

Modele współdzielone dla RTX PRO 6000, H200 NVL i DGX Spark

Druga część benchmarku wykorzystuje modele na tyle małe, że obsługuje je każdy system: GPT-OSS-20B i 120B w natywnym MXFP4; Llama 3.1 8B w BF16 i FP8; Mistral Small 24B w BF16 i FP8; oraz Qwen3 Coder 30B w BF16 i FP8. Nowością od czasu testu WS300 jest pojedyncza karta H200 NVL, karta Hopper firmy NVIDIA o pojemności 141 GB, co pozwala na porównanie z akceleratorem centrów danych o jedną generację wstecz.

GPT-OSS-20B to najłatwiejszy test w zestawie, punkt kontrolny, który każdy system bez problemu przechodzi. Przy takim samym obciążeniu ET900N G3 osiągnął 22 041 tokenów wyjściowych na sekundę przy 128 strumieniach, czyli łącznie 44 082, w porównaniu do około 7,920 dla RTX PRO 6000, 6,010 dla H200 NVL i 1,420 dla DGX Spark. W trybie pojedynczego strumienia, Stacja produkowała 536 tokenów wyjściowych na sekundę, w porównaniu do 354 kart, 489 kart H200 i 120 kart Spark. Profil z dużą ilością wstępnego wypełniania pogłębił tę różnicę: 9,555 tokenów wyjściowych na sekundę i łącznie 85 994 przy 128 strumieniach dla Stacji, przy czym RTX PRO 6000 produkował około 2,480 tokenów, H200 NVL — 3,410, a Spark — 445.

Przepustowość tokena wyjściowego vLLM dla GPT-OSS-20B MXFP4 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z pojedynczą kartą RTX PRO 6000, H200 NVL i DGX Spark, obciążenie 512/512 przy współbieżności Przepustowość tokena wyjściowego vLLM dla GPT-OSS-20B MXFP4 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z pojedynczą kartą RTX PRO 6000, H200 NVL i DGX Spark, obciążeniem o dużej wartości wstępnego wypełnienia 8,192/1,024 przy współbieżności

GPT-OSS-120B to miejsce, w którym pamięć zaczyna porządkować pole. ET900N G3 osiągnął 9,280 tokenów wyjściowych na sekundę przy tym samym obciążeniu i 128 strumieniach, czyli około trzy razy więcej niż RTX PRO 6000 (3,060), 2.8 razy więcej niż H200 NVL (3,370) i ​​ponad 19 razy więcej niż Spark (480). Przy długich monitach mniejsze systemy szybko wyczerpały zapas pamięci podręcznej KV: RTX PRO 6000 osiągnął szczyt na poziomie około 1,170 tokenów wyjściowych na sekundę, a H200 NVL prawie 1,820, podczas gdy stacja wciąż rosła, osiągając 128 strumieni i kończąc na poziomie 5,023, z całkowitą przepustowością 45 205 tokenów na sekundę.

Przepustowość tokena wyjściowego vLLM dla GPT-OSS-120B MXFP4 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z pojedynczą kartą RTX PRO 6000, H200 NVL i DGX Spark, obciążenie 512/512 przy współbieżności Przepustowość tokena wyjściowego vLLM dla GPT-OSS-120B MXFP4 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z pojedynczą kartą RTX PRO 6000, H200 NVL i DGX Spark, obciążeniem o dużej wartości wstępnego wypełnienia 8,192/1,024 przy współbieżności

Llama 3.1 8B z FP8 to najwyższa wartość w zestawie. Karta ET900N G3 przesłała 25 602 tokeny wyjściowe na sekundę w 128 strumieniach przy tym samym obciążeniu, łącznie 51 205, w porównaniu z około 8,060 dla RTX PRO 6000 i 11 040 dla H200 NVL. Przejście z BF16 do FP8 podniosło wydajność Stacji o około 50% (z 17 074 do 25 602), podczas gdy RTX PRO 6000 zyskał około 70%, a H200 NVL około 37% dzięki tej samej zmianie. Profil z dużą ilością tokenów prefill skompresował wszystko: Stacja osiągnęła 6,164 tokeny wyjściowe na sekundę, karta 1,480, a H200 2,040.

Przepustowość tokena wyjściowego vLLM dla Llama 3.1 8B FP8 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z pojedynczą kartą RTX PRO 6000, H200 NVL i DGX Spark, obciążenie 512/512 przy współbieżności Przepustowość tokena wyjściowego vLLM dla Llama 3.1 8B FP8 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z pojedynczą kartą RTX PRO 6000, H200 NVL i DGX Spark, obciążeniem o dużej wartości wstępnego wypełnienia 8,192/1,024 przy współbieżności

Mistral Small 24B podczas FP8 osiągnął najwyższe wskaźniki. ET900N G3 osiągnął szczytową wydajność 11 075 tokenów wyjściowych na sekundę przy tym samym obciążeniu, 3.4 razy więcej niż RTX PRO 6000 (3,240), 2.4 razy więcej niż H200 NVL (4,610) i prawie 20 razy więcej niż Spark (559). Przy długich promptach RTX PRO 6000 osiągnął szczytową wydajność 32 strumieni i około 480 tokenów wyjściowych na sekundę, po czym nastąpił spadek; H200 NVL osiągnął szczytową wydajność około 854, a Stacja osiągnęła 2,302 przy 128 strumieniach.

Przepustowość tokena wyjściowego vLLM dla Mistral Small 24B FP8 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z pojedynczą kartą RTX PRO 6000, H200 NVL i DGX Spark, obciążenie 512/512 przy współbieżności Przepustowość tokena wyjściowego vLLM dla Mistral Small 24B FP8 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z pojedynczą kartą RTX PRO 6000, H200 NVL i DGX Spark, obciążeniem o dużej wartości wstępnego wypełnienia 8,192/1,024 przy współbieżności

Qwen3 Coder 30B, model łączący w sobie ekspertów i małą liczbę aktywnych parametrów, to miejsce, w którym różnica między pojedynczym strumieniem się zawęża. Przy jednym strumieniu i równym obciążeniu, RTX PRO 6000 dostarczył około 232 tokeny wyjściowe na sekundę do 319 tokenów wyjściowych w Stacji i 308 tokenów NVL w H200. Przetwarzanie wsadowe przywraca porządek: przy 128 strumieniach, ET900N G3 osiągnął 12 439 tokenów wyjściowych na sekundę w FP8, 3.1 razy więcej niż karta (3,990) i 1.7 razy więcej niż H200 NVL (7,450). W profilu z dużą ilością prefill, Stacja osiągnęła 3,837 tokenów wyjściowych na sekundę, podczas gdy RTX PRO 6000 osiągnął szczyt na poziomie około 880 tokenów wyjściowych na sekundę przy 64 strumieniach, a H200 NVL na poziomie około 1,820.

Przepustowość tokena wyjściowego vLLM dla Qwen3 Coder 30B FP8 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z pojedynczą kartą RTX PRO 6000, H200 NVL i DGX Spark, obciążenie 512/512 przy współbieżności Przepustowość tokena wyjściowego vLLM dla Qwen3 Coder 30B FP8 na ASUS ExpertCenter Pro ET900N G3 GB300 w porównaniu z pojedynczą kartą RTX PRO 6000, H200 NVL i DGX Spark, obciążeniem o dużej liczbie pre-fill 8,192/1,024 przy współbieżności

Wśród współdzielonych modeli, ET900N G3 uzyskał wyniki od 2.8 do 3.4 razy lepsze od pojedynczego RTX PRO 6000 i od 1.7 do 3.7 razy lepsze od H200 NVL przy pełnej współbieżności, przy czym przewaga nad nimi rosła w przypadku długich monitów, gdy ich zapas pamięci podręcznej KV się wyczerpał. W porównaniu z WS300, te cztery modele ponownie plasują się w granicach 1%: 22 041 w porównaniu z 22 161 na GPT-OSS-20B, 9,280 w porównaniu z 9,294 na GPT-OSS-120B, 11 075 w porównaniu z 11 157 na Mistral Small FP8 i 12 439 w porównaniu z 12 425 na Qwen3 Coder FP8. Pełne porównanie 14 modeli, w tym trzech modeli z większymi różnicami, znajduje się w następnej sekcji.

Dwie wieże, jedna płyta główna: ASUS ET900N G3 kontra MSI WS300

ET900N G3 i MSI XpertStation WS300 to ta sama płyta bazowa NVIDIA GB300 DGX Station w dwóch obudowach OEM. Obie zostały sprawdzone na tych samych 14 modelach, tych samych dwóch obciążeniach i tym samym cyklu współbieżności w tej samej konfiguracji vLLM. Poniższy wykres porównuje szczytową przepustowość wyjściową ET900N G3 we wszystkich modelach z WS300.

Maksymalna przepustowość wyjściowa vLLM ASUS ExpertCenter Pro ET900N G3 wyrażona jako procent MSI XpertStation WS300 w 14 modelach przy obciążeniach 512/512 i 8,192/1,024, przy czym 24 z 28 par mieściło się w granicach parzystości 2%

Spośród 28 par model-obciążenie, 24 mieszczą się w zakresie 2% od siebie, a większość z nich stanowi ułamek procenta na korzyść WS300. Cztery znajdują się poza tym zakresem, trzy z nich przy równym obciążeniu: Llama 3.1 8B FP8 ze spadkiem o 3.5% w stosunku do WS300 (25 602 w porównaniu do 26 536 tokenów wyjściowych na sekundę), Qwen3 Coder 30B BF16 ze spadkiem o 4.6% w stosunku do WS300 (10 000 w porównaniu do 10 486) i Nemotron 3 Ultra 550B ze spadkiem o 5.2% w stosunku do (159 w porównaniu do 168), plus Qwen3 Coder 30B BF16 ponownie ze spadkiem o 2.1% w stosunku do długich monitów. Każda wartość tutaj to pojedynczy przebieg dla każdej wieży, więc różnica od 2 do 5% między trzema modelami z 14 nie jest czymś, co przypiszemy obudowie; Po prostu notujemy dane i różnicę między nimi. Modele korzystające z puli pamięci koherentnej, MiniMax M3 i GLM-5.2, osiągają parzystość lub wyższą w obu obciążeniach; to wynik, który naszym zdaniem ma największe znaczenie dla platformy: ścieżka odciążania Grace działa tak samo w obudowach ASUS-a, jak i MSI.

Model WS300 512/512 ET900N G3 512/512 Delta WS300 8,192/1,024 ET900N G3 8,192/1,024 Delta
GPT-OSS-20B MXFP4 22,161 22,041 -0.5% 9,572 9,555 -0.2%
GPT-OSS-120B MXFP4 9,294 9,280 -0.2% 5,038 5,023 -0.3%
Lama 3.1 8B BF16 17,278 17,074 -1.2% 3,520 3,498 -0.6%
Lama 3.1 8B FP8 26,536 25,602 -3.5% 6,189 6,164 -0.4%
Lama 3.1 8B NVFP4 28,698 28,400 -1.0% 6,744 6,737 -0.1%
Mistral Small 24B BF16 7,922 7,861 -0.8% 1,643 1,633 -0.6%
Mistral Small 24B FP8 11,157 11,075 -0.7% 2,316 2,302 -0.6%
Koder Qwen3 30B BF16 10,486 10,000 -4.6% 3,830 3,749 -2.1%
Koder Qwen3 30B FP8 12,425 12,439 + 0.1% 3,851 3,837 -0.4%
DeepSeek V4 Flash FP8 1,766 1,766 0.0% 948 954 + 0.6%
MiniMax M2.7 NVFP4 4,801 4,793 -0.2% 1,743 1,744 + 0.1%
MiniMax M3 NVFP4 1,041 1,041 0.0% 278 282 + 1.3%
GLM-5.2 NVFP4 138 139 + 0.4% 118 120 + 1.7%
Nemotron 3 Ultra 550B NVFP4 168 159 -5.2% 142 140 -1.1%

GPT-OSS-20B, przypadek o najwyższej przepustowości i GLM-5.2, przypadek odciążenia, pokazują nakładanie się bez współczynnika: w obu przypadkach przebieg WS300 śledzi punkt po punkcie układ ET900N G3.

Przepustowość tokena wyjściowego vLLM dla GPT-OSS-20B MXFP4 na urządzeniu ASUS ExpertCenter Pro ET900N G3 z nałożoną kartą MSI XpertStation WS300, w porównaniu z pojedynczą kartą RTX PRO 6000, H200 NVL i DGX Spark, obciążenie 512/512 przy współbieżności Przepustowość tokena wyjściowego vLLM dla GLM-5.2 NVFP4 z 215 GB pamięci ekspertów w Grace na urządzeniu ASUS ExpertCenter Pro ET900N G3 z nałożoną stacją MSI XpertStation WS300, w porównaniu z czterema kartami RTX PRO 6000 z odciążeniem hosta, obciążeniem 512/512 przy współbieżności

To porównanie będziemy rozwijać, gdy kolejne wieże GB300 przejdą przez laboratorium. Następny jest HP ZGX, a po nim kolejne, a każdy z nich przechodzi przez ten sam cykl, więc wszelkie różnice między implementacjami OEM będą widoczne tutaj, na oddzielnym wykresie dla każdej wieży, a wykresy modeli będą zawierały surowe krzywe.

Wniosek

ASUS ExpertCenter Pro ET900N G3 robi to, co powinna druga implementacja platformy referencyjnej: potwierdza pierwszą. W 14 modelach i dwóch obciążeniach, jego szczytowa przepustowość vLLM mieściła się w granicach 2% przepustowości MSI XpertStation WS300 w 24 z 28 porównań, od 1,766 tokenów wyjściowych na sekundę w DeepSeek V4 Flash do 22 041 w GPT-OSS-20B, z czterema pojedynczymi wartościami odstającymi od normy, od 2 do 5% poniżej, i obsługiwał GLM-5.2 z 215 GB pamięci ekspertów w pamięci Grace z szybkością, której nie były w stanie osiągnąć cztery karty RTX PRO 6000. Superchip GB300 wyznacza nowy poziom, a ASUS wykonał dobrą robotę.

Widok z góry na otwartą obudowę ASUS ExpertCenter Pro ET900N G3 w laboratorium StorageReview, z trzema wentylatorami na przednim radiatorze, trzema wentylatorami na górnym radiatorze, osłoniętymi przewodami chłodzącymi i miedzianymi płytkami chłodzącymi nad GB300 Superchip

ASUS dodaje coś praktycznego: uchwyty sprawiają, że wieża o wadze 27 kg staje się czymś, co dwie osoby mogą przenosić bez chwytania za panele, wentylator nad klatkami QSFP112 rozwiązuje potencjalny problem dla każdego, kto korzysta z optyki 400G przez wiele godzin, a zasilacz Titanium oszczędza kilka watów mocy pobieranej z gniazdka ściennego. Host ARM, obwód 20 A, wyjście wyświetlacza tylko dla BMC i współdzielony budżet 1,600 W po zainstalowaniu dużej karty to cechy platformy, które dotyczą w równym stopniu obu wież.

Stacja GB300 DGX pozostaje najwydajniejszym urządzeniem, jakie kiedykolwiek umieściliśmy na biurku, a firma ASUS sprawiła, że ​​jej wersja jest świetną okazją do jej zakupu.
Na naszym Najlepsze komputery stacjonarne dla lokalnej sztucznej inteligencji leaderboard, the ET900N G3 now stands alongside the WS300 as a tested alternative in the Best GB300 System slot.

Strona produktu ASUS ExpertCenter Pro ET900N G3

Skontaktuj się z StorageReview

Biuletyn | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Kanał RSS

Brian Beeler

Brian mieszka w Cincinnati w stanie Ohio i jest głównym analitykiem oraz prezesem StorageReview.com.