ArmazenamentoReview.com

RAM, GPU e armazenamento para IA agente: quanto você realmente precisa?

Atualizado em 16 de agosto de 2026: Publicação inicial. Tamanhos dos modelos e valores de memória verificados com base nos lançamentos oficiais dos modelos até esta data; esta tabela é atualizada trimestralmente devido à variação nos tamanhos dos modelos.

Todo guia de hardware para IA local acaba se resumindo a uma pergunta: o modelo é compatível? Esta página responde a essa pergunta com números e vai além dos cálculos das especificações técnicas. Quando uma classe de modelo aparece nas tabelas abaixo, significa que a executamos no laboratório da StorageReview, e as recomendações de hardware incluem links para sistemas que testamos de fato em nossos rankings de IA local para desktops e laptops.

NVIDIA Agent Toolkit em execução em uma DGX Station, a classe de hardware de mesa usada para cargas de trabalho de IA com agentes locais.

Resumindo: a contagem de parâmetros por si só já não prevê os requisitos de hardware. A quantização reduz os pesos em cerca de 4 vezes, os modelos de mistura de especialistas têm um desempenho muito mais leve do que o sugerido pela contagem total de parâmetros, e as cargas de trabalho com agentes adicionam uma sobrecarga de memória que a maioria dos guias de dimensionamento ignora completamente. Veja como otimizar o uso desses três recursos.

Requisitos de memória do modelo

Os tamanhos de arquivo abaixo correspondem às versões quantizadas comuns do Q4_K_M (ou ao formato nativo, quando indicado), conforme publicado no Ollama e no Hugging Face em agosto de 2026. A coluna "Memória para Executar" adiciona a sobrecarga de processamento e uma janela de contexto moderada; os valores marcados com um asterisco são estimativas calculadas, enquanto os valores do GPT-OSS e do DeepSeek 671B são declarações dos próprios fornecedores.

Modelo Parâmetros Técnicos Q4 / Download nativo Memória para executar* Corre em
Lhama 3.1 8B 8B 4.9 GB ~6 a 8 GB Notebooks com 8 GB de VRAM para cima
Phi-4 14B 14.7B 9.1 GB ~11 a 12 GB 16 GB de VRAM ou laptops com memória compartilhada de 64 GB
GPT-OSS 20B (MXFP4) 21B (3.6B ativo) 12 a 14 GB ~13 a 16 GB 16 GB de RAM, laptops de memória compartilhada
Mistral Pequeno 3.2 24B 24B 15 GB ~18 a 20 GB Notebooks com RTX PRO de 24 GB
Gema 3 27B 27B 17 GB ~20 a 22 GB Notebooks com RTX PRO de 24 GB, desktops de memória unificada
Qwen3 30B-A3B 30.5B (3.3B ativo) 19 GB ~22 a 24 GB 24 GB de VRAM (apertada) ou memória unificada
QwQ 32B / DeepSeek-R1 32B 32B 20 GB ~22 a 24 GB 24 GB de VRAM (apertada) ou memória unificada
Lhama 3.3 70B / R1 Destilação 70B 70B 43 GB ~48 a 50 GB Memória unificada de 96 GB ou mais, Torres RTX PRO 6000
GPT-OSS 120B (MXFP4) 117B (5.1B ativo) 65 GB ~65 a 80 GB Memória unificada de 96 GB a 128 GBGPUs de 96 GB
DeepSeek-R1 671B (completo) 671B (37B ativo) 404 GB Mais de 450 GB Fora do alcance de desktops; território de escala de rack.

*As estimativas consideram aproximadamente 8 KB de contexto ativo e cerca de 15% de sobrecarga de tempo de execução além do arquivo de pesos. Contextos maiores custam substancialmente mais; veja o custo adicional de agentes abaixo.

Dois padrões merecem atenção. Primeiro, a combinação de especialistas altera os cálculos: o GPT-OSS 120B possui 117 bilhões de parâmetros, mas ativa apenas 5.1 bilhões por token, portanto, é executado em um único pool de memória de 96 GB a 128 GB, e a OpenAI indica como meta uma única GPU de 80 GB. Nós o executamos no HP Z2 Mini G1a , uma máquina de 1 litro sem GPU dedicada. Segundo, o DeepSeek-R1 completo, com 671 bilhões de parâmetros, está em um universo completamente diferente: 404 GB apenas para download no quarto trimestre, e aproximadamente 450 GB de memória combinada para executá-lo de forma aceitável. Nenhum computador em nossos rankings consegue executá-lo, e nenhum desktop deveria tentar.

O que corre onde

Notebooks com 8 GB de VRAM (classe RTX PRO 500 a 2000). Modelos 7B a 8B no quarto trimestre e as variantes menores Phi e Gemma são ideais. O limite é real: em nossos testes, um modelo 13B que exigia cerca de 12 GB de memória gráfica simplesmente não conseguiu atingir o desempenho esperado com placas de 8 GB. Nossa página "Melhores Notebooks para IA Local" aborda esse tema.

Sistemas com 24 GB de VRAM (notebooks RTX PRO 5000, placas de vídeo RTX para desktops). O ponto ideal para modelos de 14 a 27 bits com contexto de sobra, e a maneira mais rápida de executá-los; nosso Dell Pro Max 18 Plus lidera esse segmento com 185 tokens por segundo no Phi. A classe de 32 bits se encaixa no Q4, mas deixa pouco espaço para contexto, o que importa mais do que você imagina quando agentes estão envolvidos.

Sistemas de memória unificada e compartilhada (96 GB a 128 GB). As máquinas AMD Strix Halo podem alocar até 96 GB de RAM do sistema para a GPU, e sistemas GB10, como o NVIDIA DGX Spark, possuem 128 GB de memória coerente. Essa classe utiliza modelos de 70 bits no Q4 e GPT-OSS de 120 bits, priorizando velocidade em detrimento da capacidade. O ranking "Melhores Desktops para IA Local" os classifica, e a mesma arquitetura chega aos laptops HP ZBook Ultra G1a 14 , que utilizou o DeepSeek-R1 de 70 bits em nossos testes.

Torres para estações de trabalho RTX PRO 6000 (96 GB por placa, até 384 GB testados). Velocidade e capacidade em um só produto: modelos de 70 bits com quantização mais alta e contexto completo, GPT-OSS de 120 bits com margem de segurança, ou vários modelos residentes simultaneamente para pipelines multiagentes. Nossa lista das Melhores Estações de Trabalho para Desktop abrange a categoria, liderada pela HP Z8 Fury G6i com capacidade para quatro GPUs.

O Imposto Agencial: Contexto é um Segundo Orçamento de Memória

O dimensionamento baseado apenas no arquivo de pesos funciona para sessões de bate-papo curtas. Os agentes quebram essa premissa. Um agente entra em um loop: ele lê a saída da ferramenta, arquivos e etapas anteriores de volta para sua janela de contexto, e cada token mantido no contexto custa memória no cache chave-valor, além dos pesos. Os custos não são pequenos.

Classe de modelo Cache KV em Contexto de 32K Cache KV em Contexto de 128K Custo aproximado por 1,000 tokens
8B (Lhama 3.1 8B, FP16 KV) 4.19 GB 16.78 GB ~ 0.13 GB
70B (Lhama 3.3 70B, FP16 KV) 10.49 GB 41.94 GB ~ 0.33 GB

Ao comparar essa tabela com a tabela de dimensionamento acima, o problema fica óbvio. Um modelo de 70 bits no quartil (Q4) utiliza 43 GB de pesos, mas em um contexto completo de 128 KB, ele precisa de aproximadamente 85 GB no total, o que representa o dobro dos pesos. Um modelo de 8 bits no quartil (Q4) gasta mais memória com o contexto (16.78 GB) do que com seus próprios pesos no quartil (4.9 GB). A quantização de cache KV ajuda, com FP8 reduzindo esses valores pela metade e INT4 reduzindo-os a um quarto, com alguma perda de qualidade, mas a regra de planejamento permanece: para trabalho com agentes, aloque o contexto como se fosse um segundo modelo.

Servir multiplica o custo novamente. Se um sistema hospeda vários agentes ou usuários simultaneamente, cada solicitação mantém seu próprio cache chave-valor (KV). O vLLM, a pilha de servidor que usamos como referência em nossos rankings de IA local, pré-aloca 90% da memória da GPU por padrão, justamente porque o espaço KV é o que determina quantas solicitações simultâneas sobrevivem sem a preempção que prejudica a taxa de transferência. Uma máquina que executa um chat confortavelmente pode ser insuficiente para três agentes.

Memória RAM do sistema: a terceira perna esquecida

Para inferência somente com GPU, a RAM do sistema precisa apenas ficar livre, e 32 GB a 64 GB é um mínimo confortável nas máquinas que testamos. Isso se torna decisivo em dois casos. O offloading, onde as camadas que não cabem na VRAM são utilizadas pela CPU, funciona por meio de arquivos de modelo mapeados em memória, portanto, a RAM do sistema deve ser pelo menos igual ao tamanho do arquivo do modelo mais a folga do sistema operacional. E em máquinas com memória unificada, a RAM do sistema é a memória da GPU, que é exatamente por isso que as configurações de 64 GB e 128 GB dominam nossos rankings de IA local. A própria recomendação mínima da Ollama é de 8 GB de RAM para modelos de 7 bilhões, 16 GB para 13 bilhões e 32 GB para a classe de 33 bilhões; considere esses valores como mínimos, não como metas.

Armazenamento: A Etapa Que Todos Ignoram

As bibliotecas de modelos crescem rapidamente. Os dez modelos em nossa tabela de dimensionamento totalizam aproximadamente 240 GB em suas quantizações comuns, e uma biblioteca funcional com algumas variantes, incorporando modelos para recuperação e armazenamento vetorial para memória do agente pode ultrapassar 500 GB antes mesmo da chegada de quaisquer dados do projeto. Além disso, os fluxos de trabalho com agentes geram tráfego temporário real: logs, pontos de verificação e índices de recuperação que coexistem com os modelos.

O tempo de carregamento é onde a classe da unidade entra em jogo. A aritmética é simples: um arquivo GPT-OSS de 65 GB e 120 bytes é lido em cerca de 109 segundos em velocidades SATA, aproximadamente 17 segundos em uma unidade NVMe Gen3 e menos de 9 segundos em velocidades Gen4, considerando apenas o primeiro carregamento, já que o cache de páginas do sistema operacional torna as recargas quase instantâneas. Em situações reais, os carregadores nem sempre mantêm a velocidade máxima da unidade, por isso planejamos publicar nossos próprios números de carregamento medidos para diferentes classes de unidades; acompanhe o changelog. Nosso ranking de armazenamento abrange as próprias unidades.

Orientações práticas: 2 TB de NVMe é o mínimo sensato para uma estação de trabalho dedicada à IA, 4 TB se a máquina hospedar agentes que acumulam estado e Gen4 ou superior se você alternar entre modelos grandes regularmente.

Perguntas frequentes sobre hardware de IA agenic

De quanta VRAM eu preciso para executar um modelo 70B localmente?

Cerca de 48 a 50 GB em Q4 com contexto moderado, razão pela qual esta classe pertence a máquinas com memória unificada de 96 GB e GPUs de workstation de 96 GB, em vez de placas de vídeo para consumidores. Aumente o contexto para 128 KB e o total se aproxima de 85 GB. Execute em Q8 e os pesos sozinhos ocupam 75 GB.

Posso executar o DeepSeek-R1 completo localmente?

Não consta em nenhum ranking deste site. O modelo completo de 671B tem um download de 404 GB no quarto trimestre e requer aproximadamente 450 GB de memória combinada para funcionar de forma aceitável. A opção mais prática para uso local são as versões oficiais, e as versões de 32B e 70B em nossa tabela de dimensionamento abrangem grande parte da capacidade para requisitos de desktop.

Os modelos de mistura de especialistas alteram os cálculos de hardware?

Essencialmente. Os modelos MoE ativam uma fração de seus parâmetros por token, então o uso de memória escala com o número total de parâmetros, mas a velocidade escala mais diretamente com os parâmetros ativos. O GPT-OSS 120B (5.1B ativos) e o Qwen3 30B-A3B (3.3B ativos) são executados mais rapidamente do que seus tamanhos sugerem, considerando os pools de memória disponíveis. Você ainda precisa de memória para todos os pesos; apenas obtém mais velocidade por gigabyte.

De quanto espaço de armazenamento uma estação de trabalho com IA precisa?

Planeje um SSD NVMe de no mínimo 2 TB e 4 TB para os hosts dos agentes. Uma biblioteca de modelos modesta, por si só, ocupa centenas de gigabytes; os agentes acumulam logs e vetores de armazenamento, e os arquivos individuais maiores (65 GB ou mais) tornam os discos rígidos lentos problemáticos sempre que você carrega ou troca um modelo.

Que tipo de hardware devo comprar especificamente para agentes locais?

Priorize a memória em vez da velocidade bruta. Os agentes mantêm contextos longos e, às vezes, são executados simultaneamente, portanto, o orçamento de cache chave-valor é tão importante quanto o orçamento de peso. Um sistema de memória unificada de 96 GB a 128 GB em nosso ranking de IA local para desktops é a opção mais econômica, e as torres RTX PRO 6000 no ranking de estações de trabalho são a solução ideal quando velocidade e simultaneidade são igualmente importantes.

Análise: Os números do GB300 estão disponíveis.

Tudo acima reflete o hardware que testamos, e o sistema que dissemos que mudaria os cálculos agora mudou. Nossa análise da MSI XpertStation WS300 , a primeira estação GB300 DGX que testamos, já está disponível: um pool de memória coerente de 748 GB, abrangendo 252 GB de HBM3e e 496 GB de LPDDR5X, 20 petaFLOPS de FP4 e, em nossos testes, ela serviu como um checkpoint GLM-5.2 de 433 GB, algo que não deveria ser executado em uma estação de trabalho, com 216 GB de pesos de especialistas armazenados na memória Grace.

A razão pela qual isso é importante para este guia é a memória. Todas as recomendações nesta página levam em consideração um limite rígido, dividindo os modelos entre as GPUs, utilizando quantização ou aceitando a descarga da CPU quando os pesos e o cache KV não cabem. A NVIDIA especifica os sistemas de mesa GB300 com várias centenas de gigabytes de memória coerente endereçável pelo acelerador, o que é uma ordem de magnitude diferente das placas de 96 GB que servem de base para as tabelas acima. Classes de modelos que atualmente exigem uma torre com múltiplas GPUs, ou que consideramos impraticáveis ​​para execução local, passam a ser executáveis ​​em um único computador.

Não vamos apresentar números até que tenhamos executado o teste. Nenhum dado nesta página se baseia no GB300, e nada aqui foi ajustado em antecipação a ele. Quando a análise for publicada, este guia será revisado com base nos resultados medidos e a alteração será registrada no log abaixo.

Como mantemos este guia

Os tamanhos dos modelos e a lista de modelos populares mudam trimestralmente, mais rápido do que qualquer ciclo de hardware. Revisamos a tabela de dimensionamento com base nos lançamentos oficiais trimestralmente, e os resultados dos testes de laboratório são adicionados à medida que novos sistemas passam por nossos testes locais de IA. As alterações são registradas na nota com data no topo da página. Os valores de dimensionamento marcados como estimativas utilizam o arquivo de pesos publicado, além dos custos de cache KV medidos e da sobrecarga de tempo de execução padrão; os valores declarados pelo fornecedor são identificados como tal.