Nossas análises atuais de sistemas de IA se concentram na inferência em laboratório, com modelos de peso aberto das famílias Llama, Qwen, DeepSeek e gpt-oss executados por meio de vLLM ou SGLang e medidos em termos de taxa de transferência de saída e latência do primeiro token. A cobertura abrange desde a borda até o nó de GPU completo: a NVIDIA RTX PRO 4500 Server Edition apresentou uma mediana de 2.7 vezes mais tokens de saída por segundo do que a GPU de camada 4 que ela foi projetada para substituir em um HPE ProLiant DL145 Gen11, com um consumo de energia cerca de 105 W maior; as versões da Dell, GIGABYTE e HP do DGX Spark executaram inferência distribuída como clusters de dois nós em uma rede de 200 Gb; e o programa JumpStart da Supermicro nos proporcionou experiência prática com um sistema NVIDIA HGX B200 e um AMD Instinct MI350X. O armazenamento recebe o mesmo tratamento, pois o caminho dos dados determina o nível de ocupação das GPUs. Por isso, medimos a taxa de transferência do GPUDirect Storage com GDSIO e testamos o descarregamento do cache KV para memória flash em cargas de trabalho de contexto longo e com agentes.
Se você estiver dimensionando o hardware para IA, a página Melhores Servidores lista nossas escolhas atuais de inferência de IA e edge computing com base nos dados dessas análises; a página Melhores SSDs Empresariais aborda os drives que alimentam as GPUs; e a página Melhores Arrays de Armazenamento abrange as plataformas de armazenamento de IA por trás de clusters de treinamento e neoclouds.