ArmazenamentoReview.com

Análise do ASUS ExpertCenter Pro ET900N G3: A estação GB300 DGX ganha alças, alimentação em titânio e sistema óptico refrigerado.

Consumidores   ◇  Workstation

O ASUS ExpertCenter Pro ET900N G3 é a segunda estação GB300 DGX que testamos e a primeira que tivemos em mãos no laboratório; nossos testes com a MSI XpertStation WS300 foram realizados remotamente. Ele utiliza o mesmo chip NVIDIA que testamos na MSI XpertStation WS300: um Grace Blackwell Ultra Desktop Superchip com 72 núcleos Grace, uma GPU B300, 252 GB de HBM3e, 496 GB de LPDDR5X e uma placa de rede ConnectX-8 SuperNIC com duas portas 400GbE. A ASUS integra essa plataforma de núcleo fixo em uma torre compacta, projetada para IA em mesas de trabalho, adicionando alguns detalhes não encontrados na WS300: duas alças de transporte na parte superior, uma ventoinha dedicada direcionada para as gaiolas ópticas da ConnectX-8 e uma fonte de alimentação de 1,600 W com certificação 80 PLUS Titanium.

Gabinete ASUS ExpertCenter Pro ET900N G3 GB300 DGX Station na bancada de laboratório da StorageReview, vista em três quartos mostrando as aberturas de ventilação do painel lateral prateado, a frente em malha, as alças de transporte superiores e o logotipo da ASUS.

A ASUS enviou o ET900N G3 para o laboratório para cerca de uma semana de testes de benchmark, fotografia e verificações físicas, com uma RTX PRO 2000 instalada. Para informações sobre a plataforma em si, o chipset B300, Grace, NVLink-C2C, MIG e a função de uma DGX Station, a análise do WS300 aborda esses tópicos. Esta análise se concentra no que a ASUS construiu em torno do Superchip e se os números se comparam aos do primeiro gabinete torre GB300 que testamos.

Especificações do ASUS ExpertCenter Pro ET900N G3

Especificação ASUS ExpertCenter Pro ET900N G3
Visão geral da plataforma
superchip NVIDIA GB300 Grace Blackwell Ultra Desktop Superchip
CPU NVIDIA Grace, 72 núcleos Arm Neoverse V2
GPU NVIDIA Blackwell Ultra (B300), até 20 PFLOPS NVFP4 com esparsidade
Interconexão CPU-GPU NVLink-C2C, bidirecional de 900 GB/s
Memória
Memória coerente 748GB
Memória GPU 252 GB HBM3e, 7.1 TB/s
Memória CPU 496 GB LPDDR5X, 396 GB/s, 4x SOCAMM
Armazenamento
Unidades de Inicialização 2 slots M.2 2280 PCIe 5.0 x4 (Key M), configurados com 2 SSDs NVMe de 2 TB em RAID 1.
Expansão impulsiona 2 slots M.2 2280 (Key M), PCIe 6.0 x4 de acordo com a ASUS, abertos de fábrica.
Networking
SuperNIC NVIDIA ConnectX-8, 2x QSFP112 400GbE
Ethernet 1x Marvell 10GbE
1x Realtek 1GbE (BMC)
Expansão
Slots PCIe 1x PCIe 5.0 x16
2x PCIe 5.0 x16 (sinais x8)
GPU adicional Até uma placa NVIDIA RTX PRO Blackwell; a unidade de teste foi enviada com uma RTX PRO 2000 Blackwell.
I / O
Frente 2 portas USB 10Gbps Tipo-C
2 portas USB 10Gbps Tipo A
1x USB 2.0
Conectores para fone de ouvido e microfone
Traseiro 4 portas USB 10Gbps Tipo A
1x Micro-USB COM (console serial BMC)
1x Mini DisplayPort (BMC)
3 conectores de áudio
Gerenciamento e Segurança
BMC ASPEED AST2600 com firmware AMI MegaRAC, IPMI e Redfish
Total TPM 2.0 integrado
Potência e refrigeração
Fonte de alimentação do laboratório 1x ATX de 1,600 W, 80 PLUS Titanium
Resfriamento Sistema de refrigeração líquida AIO de circuito fechado (segundo a ASUS) com placas frias no GB300, SOCAMM e ConnectX-8; radiadores frontais e superiores, ventoinha traseira do gabinete e ventoinha dedicada sobre os slots QSFP112.
Temperatura de Operação 10C para 35C
Software e formato
Sistema Operacional Ubuntu com ferramentas de desenvolvimento de IA da NVIDIA; ASUS afirma que está planejado suporte para desenvolvimento de IA baseado em Windows.
Dimensões 584 x 232 x 565 mm (23.0 x 9.1 x 22.3 polegadas), conforme especificado pela ASUS.
Peso 27 kg líquido, 32 kg bruto

Design e Construção

A ASUS apresenta o ET900N G3 como uma estação de trabalho empresarial, com um chassi prateado escovado, uma frente em malha escura, tampa e pés com acabamento cromado e o logotipo da ASUS na parte inferior frontal. As proporções são as que a plataforma dita: 584 x 232 x 565 mm, segundo a especificação da ASUS, o que o torna um pouco mais alto e ligeiramente mais estreito do que o WS300, com 529 mm de altura, 570 mm de profundidade e 246 mm de largura. Com 27 kg, não é um sistema que se mova casualmente, e é aí que entra a primeira decisão específica da ASUS. Duas alças de metal na borda superior, uma na frente e outra na parte traseira, permitem que duas pessoas levantem a torre para uma mesa ou para dentro de um carrinho sem precisar segurar os painéis. Elas parecem um pouco deslocadas em uma máquina de escritório até você ter que carregar uma torre GB300 por um laboratório.

Parte frontal do ASUS ExpertCenter Pro ET900N G3 com seu painel de malha escura, alça de transporte superior, botão liga/desliga, portas USB Tipo A e Tipo C frontais, conectores de áudio e logotipo da ASUS.

O painel frontal apresenta o botão liga/desliga, duas portas USB Tipo-A de 10 Gbps, duas portas USB Tipo-C de 10 Gbps, uma porta USB 2.0 e entradas separadas para fone de ouvido e microfone, todas dispostas em uma faixa vertical no canto superior direito da tela de malha. O painel lateral é uma grande placa ventilada, com uma longa coluna perfurada na parte frontal para a entrada de ar do radiador e uma grade quadrada menor na parte traseira, alinhada com as ventoinhas do sistema. Não há janela nem iluminação, o que atende ao perfil do público-alvo.

Painel lateral do ASUS ExpertCenter Pro ET900N G3 mostrando a coluna de entrada de ar perfurada do radiador e a pequena abertura quadrada alinhada com a ventoinha do sistema.

Na parte traseira, o layout separa as E/S da estação de trabalho do hardware do servidor abaixo. O cluster superior abriga as quatro portas USB Tipo A de 10 Gbps, os conectores RJ45 de 10 GbE e 1 GbE, os três conectores de áudio, a porta de console Micro-USB do BMC e a Mini DisplayPort que o BMC utiliza para configuração. Os dois slots QSFP112 para o ConnectX-8 ficam na parte superior do painel de E/S; um ventilador de exaustão fica ao lado; as três tampas dos slots de expansão percorrem o centro; e a fonte de alimentação com sua entrada C19 está na parte inferior. Assim como no WS300, a Mini DisplayPort é uma saída do BMC para configuração inicial e solução de problemas; quem quiser uma área de trabalho nesta máquina precisa da placa RTX PRO.

Painel traseiro do ASUS ExpertCenter Pro ET900N G3 com as baias QSFP112 e o conjunto de portas USB na parte superior, uma ventoinha de exaustão, três tampas de slots de expansão e a entrada de energia C19 na parte inferior.

Por dentro do ET900N G3

Com o painel lateral removido, o ET900N G3 parece ser um parente próximo do WS300, o que é esperado, visto que ambos compartilham a mesma placa-mãe NVIDIA. O Superchip GB300 fica sob um conjunto de placa fria de cobre à esquerda do chassi, com os módulos SOCAMM sob suas próprias placas de cobre ao lado e o ConnectX-8 sob um terceiro bloco próximo ao painel traseiro de E/S. Tubos trançados conectam os blocos a um coletor de distribuição montado na travessa do chassi e, deste, aos radiadores. Os três slots PCIe de tamanho normal ficam abaixo do Superchip, a fonte de alimentação ocupa o canto inferior frontal e uma cobertura metálica protege o caminho dos cabos na parte inferior.

Vista superior do interior do ASUS ExpertCenter Pro ET900N G3, mostrando as placas frias de cobre sobre o Superchip GB300, as linhas de refrigeração trançadas, o coletor de distribuição, as ventoinhas do radiador, os slots PCIe e a fonte de alimentação.

A disposição interna segue o mesmo padrão do WS300: um radiador montado verticalmente atrás da grade frontal e um segundo na parte superior, cada um com uma fileira de ventoinhas, além de uma ventoinha de chassi na parte traseira. As linhas de refrigeração são revestidas e fixadas à travessa com abraçadeiras de velcro, e o coletor consolida as conexões das quatro placas frias, de modo que apenas duas linhas cheguem a cada radiador.

Vista lateral do interior do ASUS ExpertCenter Pro ET900N G3 mostrando o radiador frontal com suas três ventoinhas, o segundo radiador na parte superior, a ventoinha traseira do gabinete e as placas frias de cobre. Coletor de distribuição de líquido refrigerante dentro do ASUS ExpertCenter Pro ET900N G3 com tubos revestidos das placas frias fixados à travessa do chassi.

O fã de óptica

O único elemento de resfriamento que não tem equivalente no WS300 é um pequeno ventilador montado em um suporte acima da placa fria ConnectX-8, direcionado para os slots QSFP112. O circuito de refrigeração líquida lida com o próprio silício do SuperNIC, mas os transceptores ópticos de 400G geram seu próprio calor e ficam em slots de metal que a placa fria só alcança por condução. Em outros testes , observamos que o ConnectX-8 esquenta sob carga contínua e que os próprios componentes ópticos podem aquecer bastante, portanto, um caminho de fluxo de ar dedicado através dos slots é um ótimo recurso de design para quem planeja usar o ET900N G3 em fibra óptica por horas seguidas. Com DACs, que foi como o conectamos a uma segunda estação GB300 para um estudo aprofundado de inferência em cluster que ainda está em andamento, o ventilador tem menos trabalho a fazer.

Detalhe da pequena ventoinha montada acima da placa fria ConnectX-8 no ASUS ExpertCenter Pro ET900N G3, direcionada para os slots de óptica QSFP112, com uma ventoinha do radiador e a ventoinha de exaustão traseira atrás dela. Placas frias de cobre sobre o Superchip GB300 e a memória SOCAMM na placa-mãe ASUS ExpertCenter Pro ET900N G3, com o bloco ConnectX-8 e sua pequena ventoinha no canto superior esquerdo e três unidades M.2 sob dissipadores de calor no canto inferior direito.

Armazenamento, expansão e energia

A ASUS enviou o ET900N G3 com um único SSD NVMe de 2 TB para o sistema operacional e o pacote de software da NVIDIA, instalado nos dois slots M.2 2280 conectados à placa Grace via PCIe 5.0 x4. O segundo par de slots, conectado ao switch PCIe integrado do ConnectX-8, foi enviado vazio.

SSDs M.2 sob dissipadores de calor no ASUS ExpertCenter Pro ET900N G3, ao lado da placa fria de cobre GB300.

Nossa unidade de teste chegou com uma NVIDIA RTX PRO 2000 Blackwell no slot PCIe 5.0 x16, uma das configurações listadas pela ASUS. A placa fornece saída de vídeo sem consumir significativamente do orçamento de energia do GB300, e a ASUS afirma que o gabinete comporta até uma placa RTX PRO Blackwell. Removemos a RTX PRO 2000 antes dos testes de benchmark para que o Superchip tivesse o orçamento de aceleração total disponível, a mesma condição que usamos para o WS300, e não testamos uma placa RTX PRO de alto consumo neste gabinete; esse caminho, e seu impacto no orçamento de energia compartilhado, será abordado em uma futura análise do GB300 Station.

Placa de vídeo NVIDIA RTX PRO 2000 Blackwell instalada no slot PCIe 5.0 x16 da placa-mãe ASUS ExpertCenter Pro ET900N G3, com as placas de cobre e os tubos de refrigeração revestidos atrás dela.

A fonte de alimentação é uma unidade ATX de 1,600 W com certificação 80 PLUS Titanium da ASUS, um nível acima da unidade Platinum presente no WS300. A certificação Titanium exige 94% de eficiência com 50% de carga em uma entrada de 115 V, em comparação com 92% para a Platinum, e é a única que estabelece um limite mínimo de 10% de carga. Portanto, a ET900N G3 deve desperdiçar algumas dezenas de watts a menos na tomada sob carga máxima da placa-mãe GB300. O consumo de energia continua sendo compartilhado: Grace, a placa-mãe B300, as bombas, as ventoinhas, o armazenamento e qualquer placa RTX PRO consomem os mesmos 1,600 W, e o serviço vsloshd da NVIDIA ajusta a margem de consumo entre o Superchip e uma GPU adicional conforme o consumo de cada um varia, sem um limite fixo para nenhum dos dois. A análise do WS300 detalha essa política, que permanece inalterada aqui. Um circuito dedicado de 20 A continua sendo o requisito para instalações na América do Norte.

Conectividade

As duas portas QSFP112 do ConnectX-8 são a ligação do ET900N G3 a todos os outros componentes: armazenamento, uma segunda Estação DGX ou uma malha de cluster. Essas portas já estão em uso no laboratório, com o ET900N G3 conectado a uma segunda Estação GB300 por meio de DACs de 400G para uma análise detalhada de inferência em cluster que publicaremos separadamente. A porta Marvell de 10GbE lida com o tráfego de host comum e a porta Realtek de 1GbE é dedicada ao BMC.

Dois cabos DAC de 400G conectados às portas QSFP112 na parte traseira do ASUS ExpertCenter Pro ET900N G3, com a grade de exaustão do ventilador traseiro ao lado e o rack de laboratório da StorageReview atrás.

Anotações para teste

Todos os resultados desta análise são da unidade que a ASUS enviou para o nosso laboratório, na configuração de memória de fábrica com 252 GB de HBM3e e 496 GB de LPDDR5X. O sistema funcionou sem uma placa RTX PRO instalada, portanto o Superchip GB300 teve acesso a toda a sua capacidade de aceleração, correspondendo às condições dos nossos testes com o WS300. O conjunto de softwares, a configuração do vLLM, os perfis de carga de trabalho e a varredura de concorrência são os mesmos que usamos para o WS300, permitindo uma comparação direta entre os dois gabinetes. Esta análise foca apenas no desempenho; não medimos o consumo de energia nem a temperatura desta unidade.

As cargas de trabalho são os mesmos dois perfis de inferência ao vivo do vLLM que executamos em todos os sistemas de IA locais: uma carga de trabalho equilibrada com 512 tokens de entrada e 512 de saída, e uma carga de trabalho com preenchimento automático intensivo, com 8,192 tokens de entrada e 1,024 de saída, variando de um a 128 fluxos simultâneos. Para os modelos de escala de fronteira, comparamos com um servidor Dell PowerEdge XE7740 com GPU, equipado com duas ou quatro placas RTX PRO 6000 , a alternativa de caixa única mais próxima para esses pontos de verificação. Para os modelos menores, comparamos com uma única RTX PRO 6000 no mesmo XE7740, uma única H200 NVL em um Dell PowerEdge R770 e um Spark GB10 DGX representado pelo Acer Veriton GN100 , o mesmo Spark que usamos na análise do WS300. Os valores do ET900N G3 abaixo são os valores exatos dos registros de execução; Os dados do sistema de comparação são obtidos a partir de nossos gráficos de resultados.

Desempenho de inferência

Modelos de fronteira no pool de memória coerente

A razão de ser da GB300 é atender modelos que estejam em ambos os lados do limite de 252 GB de HBM3e da B300, então começamos com quatro pontos de verificação que abrangem essa faixa: DeepSeek V4 Flash e MiniMax M2.7 cabem na HBM com folga, MiniMax M3 cabe por pouco e transfere parte de seus recursos para a memória Grace, e GLM-5.2 descarrega aproximadamente metade de sua carga. Do outro lado de cada gráfico está a alternativa mais próxima em um único gabinete: placas RTX PRO 6000 juntas no PowerEdge XE7740, com transferência de recursos para a memória do host quando necessário.

O DeepSeek V4 Flash é o caso mais simples: um checkpoint FP8 nativo de cerca de 20 GB que o B300 processa sem dificuldades. A taxa de transferência de saída na mesma carga de trabalho subiu de 152 tokens por segundo com 1 fluxo para 1,766 com 32 fluxos, elevando a taxa total de transferência de tokens para 3,532. No perfil com uso intensivo de pré-preenchimento, o ET900N G3 aumentou de 148 para 954 tokens de saída por segundo, com um total de 8,587 tokens. Um par de placas RTX PRO 6000 atingiu um pico próximo a 800 tokens de saída por segundo na mesma carga de trabalho e cerca de 490 nos prompts longos, com uma curva irregular em baixa concorrência.

Taxa de transferência de tokens de saída vLLM para DeepSeek V4 Flash FP8 no ASUS ExpertCenter Pro ET900N G3 GB300 contra duas placas RTX PRO 6000, carga de trabalho 512/512 em simultaneidade. Taxa de transferência de tokens de saída vLLM para DeepSeek V4 Flash FP8 no ASUS ExpertCenter Pro ET900N G3 GB300 contra duas placas RTX PRO 6000, carga de trabalho com preenchimento prévio intenso de 8,192/1,024 em simultaneidade.

O MiniMax M2.7, com quantização NVFP4 da NVIDIA, ocupa cerca de 125 GB de HBM e apresentou o maior potencial de escalabilidade entre os quatro processadores. A carga de trabalho equivalente aumentou de 214 tokens de saída por segundo em um fluxo para 4,793 em 128 fluxos, e a taxa de transferência total atingiu 9,586. A execução com uso intensivo de pré-preenchimento alcançou 1,744 tokens de saída por segundo e 15,700 tokens totais por segundo em 64 fluxos. Duas placas RTX PRO 6000 seguiram o mesmo padrão, porém com menos da metade da altura, atingindo um pico próximo a 1,930 tokens de saída por segundo na carga de trabalho equivalente e cerca de 510 nos prompts longos.

Taxa de transferência de tokens de saída vLLM para MiniMax M2.7 NVFP4 no ASUS ExpertCenter Pro ET900N G3 GB300 contra duas placas RTX PRO 6000, carga de trabalho 512/512 em simultaneidade. Taxa de transferência de tokens de saída vLLM para MiniMax M2.7 NVFP4 no ASUS ExpertCenter Pro ET900N G3 GB300 contra duas placas RTX PRO 6000, carga de trabalho com pré-preenchimento intensivo de 8,192/1,024 em simultaneidade.

O MiniMax M3 demonstra o que significa ter espaço de sobra na memória. O ponto de verificação NVFP4 é menor que 252 GB, mas o cache de tempo de execução e o cache KV também precisam de espaço, então uma parte dos recursos reside na memória Grace, e cada etapa de decodificação que os utiliza passa pelo NVLink-C2C. Com a decodificação especulativa EAGLE3, o ET900N G3 atingiu 1,041 tokens de saída por segundo com 32 fluxos na mesma carga de trabalho, e o perfil com uso intensivo de pré-preenchimento atingiu um pico de 282 com dois fluxos, manteve-se em 271 com quatro e caiu para 103 com oito, à medida que os prompts longos consumiam o cache restante. Quatro placas RTX PRO 6000 com o mesmo decodificador especulativo acompanharam o ritmo com oito fluxos e ultrapassaram o ET900N G3 com 16 fluxos, atingindo cerca de 1,180 tokens de saída por segundo, antes de recuar para aproximadamente 760 com 32 fluxos. No perfil com uso intensivo de pré-carregamento, o conjunto de quatro placas comportava cerca de 349 tokens de saída por segundo, com quatro fluxos conectados aos 271 da Estação. Um modelo que se situa exatamente no limite da HBM é o único ponto neste conjunto onde 384 GB de VRAM distribuídos em quatro placas competem com 252 GB de HBM mais o recurso de descarregamento.

Taxa de transferência de tokens de saída vLLM para MiniMax M3 NVFP4 com Grace offload no ASUS ExpertCenter Pro ET900N G3 GB300 contra quatro placas RTX PRO 6000, carga de trabalho 512/512 em simultaneidade. Taxa de transferência de tokens de saída vLLM para MiniMax M3 NVFP4 com Grace offload no ASUS ExpertCenter Pro ET900N G3 GB300 contra quatro placas RTX PRO 6000, carga de trabalho com pré-preenchimento intensivo de 8,192/1,024 em simultaneidade.

O GLM-5.2 é o caso de uso que somente o pool coerente torna possível. O checkpoint NVFP4 mantém cerca de 215 GB de pesos de especialistas na memória Grace com decodificação especulativa MTP, e o ET900N G3 o serviu a 35 tokens de saída por segundo para um fluxo e 139 para 32 fluxos em uma carga de trabalho equivalente, com taxa de transferência total atingindo 277. No perfil com uso intensivo de pré-preenchimento, a varredura foi executada em 32 fluxos, atingindo 120 tokens de saída por segundo e 1,079 tokens no total. Quatro placas RTX PRO 6000, cada uma descarregando cerca de 30 GB para a memória do host, conseguiram cerca de 40 tokens de saída por segundo em 32 fluxos, estabilizando em aproximadamente 9 a 10 em prompts longos a partir de quatro fluxos. Nenhum dos sistemas faz com que um modelo de 433 GB pareça rápido, mas a conexão LPDDR5X de 396 GB/s e o caminho NVLink-C2C de 900 GB/s do GB300 para aplicações com memória dedicada continuam a escalar onde a memória host conectada via PCIe em quatro placas para.

Taxa de transferência de tokens de saída vLLM para GLM-5.2 NVFP4 com 215 GB de especialistas descarregados para a memória Grace no ASUS ExpertCenter Pro ET900N G3 GB300 contra quatro placas RTX PRO 6000 com descarregamento do host, carga de trabalho 512/512 em simultaneidade. Taxa de transferência de tokens de saída vLLM para GLM-5.2 NVFP4 com 215 GB de especialistas descarregados para a memória Grace no ASUS ExpertCenter Pro ET900N G3 GB300 contra quatro placas RTX PRO 6000 com descarregamento do host, carga de trabalho com preenchimento prévio de 8,192/1,024 em simultaneidade.

Em comparação com o MSI WS300, os resultados do modelo de ponta ET900N G3 ficam dentro de uma margem de aproximadamente 1% em todos os pontos que podemos comparar: 1,766 tokens de saída por segundo no DeepSeek V4 Flash com 32 fluxos em ambas as torres, 4,793 contra 4,801 no MiniMax M2.7 com 128 fluxos, 1,041 no MiniMax M3 com 32 fluxos em ambas as torres e 139 no GLM-5.2 com 32 fluxos em ambas as torres.

Modelos compartilhados com o RTX PRO 6000, H200 NVL e DGX Spark.

A segunda parte dos testes comparativos utiliza modelos suficientemente pequenos para serem executados em qualquer sistema: GPT-OSS-20B e 120B em MXFP4 nativo; Llama 3.1 8B em BF16 e FP8; Mistral Small 24B em BF16 e FP8; e Qwen3 Coder 30B em BF16 e FP8. A novidade desde a análise do WS300 é a inclusão de uma única H200 NVL, a placa Hopper de 141 GB da NVIDIA, que coloca na comparação um acelerador de data center de uma geração anterior.

O GPT-OSS-20B é o teste mais amigável do conjunto, um ponto de verificação que todos os sistemas executam com facilidade, e com a mesma carga de trabalho, o ET900N G3 alcançou 22,041 tokens de saída por segundo a 128 fluxos, ou 44,082 no total, contra cerca de 7,920 para o RTX PRO 6000, 6,010 para o H200 NVL e 1,420 para o DGX Spark. No modo de fluxo único, a Station produziu 536 tokens de saída por segundo, em comparação com os 354 da placa, os 489 da H200 e os 120 da Spark. O perfil com uso intensivo de pré-carregamento ampliou a diferença: 9,555 tokens de saída por segundo e 85,994 no total com 128 fluxos para a Station, com a RTX PRO 6000 em torno de 2,480, a H200 NVL em 3,410 e a Spark em 445.

Taxa de transferência de tokens de saída vLLM para GPT-OSS-20B MXFP4 no ASUS ExpertCenter Pro ET900N G3 GB300 contra uma única RTX PRO 6000, H200 NVL e DGX Spark, carga de trabalho 512/512 em simultaneidade. Taxa de transferência de tokens de saída vLLM para GPT-OSS-20B MXFP4 no ASUS ExpertCenter Pro ET900N G3 GB300 contra uma única RTX PRO 6000, H200 NVL e DGX Spark, carga de trabalho com preenchimento prévio intenso de 8,192/1,024 em concorrência.

O GPT-OSS-120B é onde a memória começa a separar o jogo. O ET900N G3 atingiu 9,280 tokens de saída por segundo com a mesma carga de trabalho e 128 fluxos, aproximadamente três vezes mais que o RTX PRO 6000 (3,060), 2.8 vezes mais que o H200 NVL (3,370) e mais de 19 vezes mais que o Spark (480). Sob longas solicitações de dados, os sistemas menores esgotaram rapidamente a capacidade do cache KV: o RTX PRO 6000 atingiu um pico de cerca de 1,170 tokens de saída por segundo e o H200 NVL, quase 1,820, enquanto o Station, ainda em fase de crescimento com 128 fluxos, terminou com 5,023 tokens, totalizando uma taxa de transferência de 45,205 tokens por segundo.

Taxa de transferência de tokens de saída vLLM para GPT-OSS-120B MXFP4 no ASUS ExpertCenter Pro ET900N G3 GB300 contra uma única RTX PRO 6000, H200 NVL e DGX Spark, carga de trabalho 512/512 em simultaneidade. Taxa de transferência de tokens de saída vLLM para GPT-OSS-120B MXFP4 no ASUS ExpertCenter Pro ET900N G3 GB300 contra uma única RTX PRO 6000, H200 NVL e DGX Spark, carga de trabalho com preenchimento prévio intenso de 8,192/1,024 em concorrência.

O perfil Llama 3.1 8B em FP8 apresentou o maior valor individual no conjunto de testes. A placa ET900N G3 gerou 25,602 tokens de saída por segundo em 128 fluxos com a mesma carga de trabalho, totalizando 51,205 tokens, em comparação com cerca de 8,060 para a RTX PRO 6000 e 11,040 para a H200 NVL. A mudança de BF16 para FP8 aumentou o desempenho da Station em cerca de 50% (de 17,074 para 25,602), enquanto a RTX PRO 6000 obteve um aumento de cerca de 70% e a H200 NVL de cerca de 37% com a mesma alteração. O perfil com uso intensivo de pré-preenchimento comprimiu tudo, resultando em 6,164 tokens de saída por segundo para a Station, 1,480 para a placa de vídeo e 2,040 para a H200.

Taxa de transferência de tokens de saída vLLM para Llama 3.1 8B FP8 no ASUS ExpertCenter Pro ET900N G3 GB300 contra uma única RTX PRO 6000, H200 NVL e DGX Spark, carga de trabalho 512/512 em simultaneidade. Taxa de transferência de tokens de saída vLLM para Llama 3.1 8B FP8 no ASUS ExpertCenter Pro ET900N G3 GB300 contra uma única RTX PRO 6000, H200 NVL e DGX Spark, carga de trabalho com uso intensivo de pré-preenchimento em vários níveis de simultaneidade.

O Mistral Small 24B em FP8 produziu as maiores taxas de variação. O ET900N G3 atingiu um pico de 11,075 tokens de saída por segundo com a mesma carga de trabalho, 3.4 vezes o RTX PRO 6000 com 3,240, 2.4 vezes o H200 NVL com 4,610 e quase 20 vezes o Spark com 559. Sob prompts longos, o RTX PRO 6000 atingiu um pico de 32 fluxos e cerca de 480 tokens de saída por segundo antes de diminuir a taxa; o H200 NVL atingiu um máximo de cerca de 854 e o Station alcançou 2,302 com 128 fluxos.

Taxa de transferência de tokens de saída vLLM para Mistral Small 24B FP8 no ASUS ExpertCenter Pro ET900N G3 GB300 contra uma única RTX PRO 6000, H200 NVL e DGX Spark, carga de trabalho 512/512 em simultaneidade. Taxa de transferência de tokens de saída vLLM para Mistral Small 24B FP8 no ASUS ExpertCenter Pro ET900N G3 GB300 contra uma única RTX PRO 6000, H200 NVL e DGX Spark, carga de trabalho com uso intensivo de pré-preenchimento em vários níveis de simultaneidade.

O modelo Qwen3 Coder 30B, que utiliza uma combinação de especialistas e possui um número reduzido de parâmetros ativos, é onde a diferença em fluxo único diminui. Com um fluxo único e carga de trabalho equivalente, a RTX PRO 6000 entregou cerca de 232 tokens de saída por segundo, contra 319 da Station e 308 da H200 NVL. O processamento em lote restaura a ordem: com 128 fluxos, a ET900N G3 atingiu 12,439 tokens de saída por segundo em FP8, 3.1 vezes mais que a placa (3,990) e 1.7 vezes mais que a H200 NVL (7,450). No perfil com uso intensivo de pré-preenchimento, a Station alcançou 3,837 tokens de saída por segundo, enquanto a RTX PRO 6000 atingiu um pico de cerca de 880 com 64 fluxos, e a H200 NVL, cerca de 1,820.

Taxa de transferência de tokens de saída vLLM para o Qwen3 Coder 30B FP8 no ASUS ExpertCenter Pro ET900N G3 GB300 contra uma única RTX PRO 6000, H200 NVL e DGX Spark, carga de trabalho 512/512 em concorrência. Taxa de transferência de tokens de saída vLLM para o Qwen3 Coder 30B FP8 no ASUS ExpertCenter Pro ET900N G3 GB300 contra uma única RTX PRO 6000, H200 NVL e DGX Spark, carga de trabalho com uso intensivo de pré-preenchimento em vários níveis de concorrência.

Nos modelos compartilhados, o ET900N G3 apresentou desempenho de 2.8 a 3.4 vezes superior ao de uma única RTX PRO 6000 e de 1.7 a 3.7 vezes superior ao de uma H200 NVL em concorrência máxima, com a margem sobre ambas aumentando sob prompts longos à medida que a capacidade do cache KV se esgotava. Em comparação com o WS300, esses quatro modelos novamente apresentam diferenças de menos de 1%: 22,041 contra 22,161 no GPT-OSS-20B, 9,280 contra 9,294 no GPT-OSS-120B, 11,075 contra 11,157 no Mistral Small FP8 e 12,439 contra 12,425 no Qwen3 Coder FP8. A comparação completa dos 14 modelos, incluindo os três modelos com maiores diferenças, está na próxima seção.

Duas torres, uma placa-mãe: ASUS ET900N G3 vs MSI WS300

O ET900N G3 e o MSI XpertStation WS300 utilizam a mesma placa-mãe NVIDIA GB300 DGX Station em dois chassis OEM diferentes. Ambos foram submetidos aos mesmos 14 modelos, às mesmas duas cargas de trabalho e à mesma varredura de concorrência na mesma compilação vLLM. O gráfico abaixo compara a taxa de transferência máxima do ET900N G3 em todos os modelos com a do WS300.

Taxa de transferência máxima de saída vLLM do ASUS ExpertCenter Pro ET900N G3 em porcentagem da MSI XpertStation WS300 em 14 modelos nas cargas de trabalho 512/512 e 8,192/1,024, com 24 de 28 pares dentro de 2% de paridade.

Entre os 28 pares modelo-carga de trabalho, 24 apresentam uma diferença de no máximo 2% entre si, e a maioria deles representa uma diferença de fração de um por cento a favor do WS300. Quatro estão fora dessa faixa, três deles com a mesma carga de trabalho: Llama 3.1 8B FP8 com 3.5% a menos que o WS300 (25,602 versus 26,536 tokens de saída por segundo), Qwen3 Coder 30B BF16 com 4.6% a menos (10,000 versus 10,486) e Nemotron 3 Ultra 550B com 5.2% a menos (159 versus 168), além do Qwen3 Coder 30B BF16 novamente com 2.1% a menos nos prompts longos. Cada valor aqui representa uma única execução em cada torre, portanto, uma diferença de 2 a 5% em três modelos de um total de 14 não é algo que atribuiremos ao chassi; Estamos apenas registrando os dados e a diferença entre os dois. Os modelos que dependem do pool de memória coerente, MiniMax M3 e GLM-5.2, atingem paridade ou desempenho superior em ambas as cargas de trabalho; esse é o resultado que consideramos mais importante para a plataforma: o caminho de descarregamento Grace tem o mesmo desempenho no chassi da ASUS e no da MSI.

Modelo WS300 512/512 ET900N G3 512/512 Delta WS300 8,192/1,024 ET900N G3 8,192/1,024 Delta
GPT-OSS-20B MXFP4 22,161 22,041 -0.5% 9,572 9,555 -0.2%
GPT-OSS-120B MXFP4 9,294 9,280 -0.2% 5,038 5,023 -0.3%
Lhama 3.1 8B BF16 17,278 17,074 -1.2% 3,520 3,498 -0.6%
Lhama 3.1 8B FP8 26,536 25,602 -3.5% 6,189 6,164 -0.4%
Lhama 3.1 8B NVFP4 28,698 28,400 -1.0% 6,744 6,737 -0.1%
Mistral Pequeno 24B BF16 7,922 7,861 -0.8% 1,643 1,633 -0.6%
Mistral Pequeno 24B FP8 11,157 11,075 -0.7% 2,316 2,302 -0.6%
Qwen3 Coder 30B BF16 10,486 10,000 -4.6% 3,830 3,749 -2.1%
Qwen3 Coder 30B FP8 12,425 12,439 + 0.1% 3,851 3,837 -0.4%
DeepSeek V4 Flash FP8 1,766 1,766 0.0% 948 954 + 0.6%
MiniMax M2.7 NVFP4 4,801 4,793 -0.2% 1,743 1,744 + 0.1%
MiniMax M3 NVFP4 1,041 1,041 0.0% 278 282 + 1.3%
GLM-5.2 NVFP4 138 139 + 0.4% 118 120 + 1.7%
Nemotron 3 Ultra 550B NVFP4 168 159 -5.2% 142 140 -1.1%

O GPT-OSS-20B, o caso denso de maior taxa de transferência no conjunto, e o GLM-5.2, o caso de descarregamento, mostram a sobreposição sem uma proporção: em ambos, a execução do WS300 segue o ET900N G3 ponto a ponto.

Taxa de transferência de tokens de saída vLLM para GPT-OSS-20B MXFP4 no ASUS ExpertCenter Pro ET900N G3 com a execução do MSI XpertStation WS300 sobreposta, contra uma única RTX PRO 6000, H200 NVL e DGX Spark, carga de trabalho 512/512 em simultaneidade. Taxa de transferência de tokens de saída vLLM para GLM-5.2 NVFP4 com 215 GB de especialistas na memória Grace no ASUS ExpertCenter Pro ET900N G3 com o MSI XpertStation WS300 sobreposto, contra quatro placas RTX PRO 6000 com descarregamento de host, carga de trabalho 512/512 em simultaneidade.

Esta é a comparação que aprimoraremos à medida que mais torres GB300 passarem pelo laboratório. A próxima é a ZGX da HP, e outras virão em seguida. Cada uma delas executa a mesma varredura, portanto, quaisquer diferenças entre as implementações dos fabricantes aparecerão aqui, em um gráfico por torre, com os gráficos dos modelos contendo as curvas brutas.

Conclusão

O ASUS ExpertCenter Pro ET900N G3 faz o que uma segunda implementação de uma plataforma de referência deve fazer: confirma a primeira. Em 14 modelos e duas cargas de trabalho, seu desempenho máximo no teste vLLM ficou dentro de 2% do MSI XpertStation WS300 em 24 das 28 comparações, variando de 1,766 tokens de saída por segundo no DeepSeek V4 Flash a 22,041 no GPT-OSS-20B, com quatro outliers pontuais entre 2% e 5% abaixo do esperado. Além disso, atendeu ao GLM-5.2 com 215 GB de especialistas na memória Grace em taxas que quatro placas RTX PRO 6000 não conseguiram alcançar. O Superchip GB300 define o limite, e a ASUS fez um excelente trabalho ao executá-lo.

Vista superior do gabinete ASUS ExpertCenter Pro ET900N G3 aberto no laboratório da StorageReview, mostrando o radiador frontal de três ventoinhas, o radiador superior de três ventoinhas, as linhas de refrigeração revestidas e as placas frias de cobre sobre o Superchip GB300.

O que a ASUS adiciona é prático: as alças transformam uma torre de 27 kg em algo que duas pessoas podem mover sem precisar segurar os painéis; a ventoinha sobre os slots QSFP112 resolve um problema potencial para quem usa ópticas de 400G por horas; e a fonte Titanium reduz o consumo de energia na tomada. O host Arm, o circuito de 20 A, a saída de vídeo exclusiva para BMC e o orçamento compartilhado de 1,600 W quando uma placa de vídeo grande está instalada são características da plataforma que se aplicam igualmente a ambas as torres.

A estação GB300 DGX continua sendo o dispositivo mais completo que já colocamos em uma mesa, e a ASUS tornou sua versão uma ótima opção para adquiri-la.
No nosso Melhores desktops para IA local leaderboard, the ET900N G3 now stands alongside the WS300 as a tested alternative in the Best GB300 System slot.

Página do produto ASUS ExpertCenter Pro ET900N G3

Envolva-se com a StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Feed RSS

Brian Beeler

Brian está localizado em Cincinnati, Ohio e é analista-chefe e presidente da StorageReview.com.