OpslagReview. com

RAM, GPU en opslag voor agentische AI: hoeveel heb je daadwerkelijk nodig?

Bijgewerkt op 16 augustus 2026: Eerste publicatie. Modelafmetingen en geheugenspecificaties zijn geverifieerd aan de hand van de officiële modelreleases van deze datum; deze tabel wordt elk kwartaal bijgewerkt omdat de modelafmetingen wijzigen.

Elke hardwaregids voor lokale AI komt uiteindelijk neer op één vraag: past het model? Deze pagina beantwoordt die vraag met cijfers en gaat zelfs nog een stap verder dan de berekeningen op het specificatieblad. Waar een modelklasse in de onderstaande tabellen voorkomt, hebben we deze getest in het StorageReview-lab. De hardwareaanbevelingen linken naar systemen die we daadwerkelijk hebben getest op onze desktop- en laptop -ranglijsten voor lokale AI.

NVIDIA Agent Toolkit draait op een DGX Station, het type desktophardware dat wordt gebruikt voor lokale AI-workloads.

Kort gezegd: het aantal parameters alleen voorspelt niet langer de hardwarevereisten. Kwantisatie verkleint de gewichten met ongeveer een factor 4, modellen met een mix van experts draaien veel lichter dan hun totale aantal parameters doet vermoeden, en agentische workloads zorgen voor extra geheugenbelasting die de meeste richtlijnen voor het bepalen van de benodigde capaciteit volledig negeren. Hieronder leggen we uit hoe je met al deze factoren rekening kunt houden.

Modelgeheugenvereisten

De bestandsgroottes hieronder zijn de gangbare Q4_K_M gekwantiseerde releases (of het native formaat waar aangegeven) zoals gepubliceerd op Ollama en Hugging Face in augustus 2026. De kolom "Memory to Run" voegt overhead en een bescheiden contextvenster toe; cijfers gemarkeerd met een asterisk zijn berekende schattingen, terwijl de cijfers voor GPT-OSS en DeepSeek 671B de eigen verklaringen van de leveranciers zijn.

Model Kenmerken Q4 / Native Download Geheugen om uit te voeren* Draait op
Lama 3.1 8B 8B 4.9 GB ~6 tot 8 GB Laptops met 8 GB VRAM en omhoog
Phi-4 14B 14.7B 9.1 GB ~11 tot 12 GB 16 GB VRAM of Laptops met 64 GB gedeeld geheugen
GPT-OSS 20B (MXFP4) 21B (3.6B actief) 12 tot 14 GB ~13 tot 16 GB 16 GB VRAM, laptops met gedeeld geheugen
Mistral Klein 3.2 24B 24B 15 GB ~18 tot 20 GB 24GB RTX PRO laptops
Gemma 3 27B 27B 17 GB ~20 tot 22 GB 24GB RTX PRO laptops, desktops met uniform geheugen
Qwen3 30B-A3B 30.5B (3.3B actief) 19 GB ~22 tot 24 GB 24 GB VRAM (krap) of verenigd geheugen
QwQ 32B / DeepSeek-R1 32B 32B 20 GB ~22 tot 24 GB 24 GB VRAM (krap) of verenigd geheugen
Llama 3.3 70B / R1 Distill 70B 70B 43 GB ~48 tot 50 GB 96 GB+ geïntegreerd geheugen, RTX PRO 6000 towers
GPT-OSS 120B (MXFP4) 117B (5.1B actief) 65 GB ~65 tot 80 GB 96 GB tot 128 GB aan gecombineerd geheugen, 96GB GPU's
DeepSeek-R1 671B (volledig) 671B (37B actief) 404 GB 450+ GB Buiten bereik voor desktops; rack-schaal.

*De schattingen gaan uit van ongeveer 8 KB actieve context en ongeveer 15 procent extra runtimekosten bovenop het gewichtsbestand. Grotere contexten kosten aanzienlijk meer; zie de agentbelasting hieronder.

Twee patronen vallen op. Ten eerste verandert de mix van experts de berekeningen: GPT-OSS 120B bevat 117 miljard parameters, maar activeert er slechts 5.1 miljard per token. Het draait dus op een enkele geheugenpool van 96 tot 128 GB, terwijl OpenAI een GPU van 80 GB als doel stelt. Wij hebben het getest op de HP Z2 Mini G1a , een machine van 1 liter zonder aparte GPU. Ten tweede is de volledige DeepSeek-R1 met 671 miljard parameters een heel ander verhaal: 404 GB alleen al om te downloaden in het vierde kwartaal, en ongeveer 450 GB aan gecombineerd geheugen om het acceptabel te laten draaien. Geen enkele computer in onze ranglijsten kan het draaien, en geen enkele desktopcomputer zou het moeten proberen.

Wat loopt waar

Laptops met 8 GB VRAM (RTX PRO 500 tot 2000-klasse). Modellen met 7 tot 8 GB VRAM in de Q4-serie en de kleinere Phi- en Gemma-varianten zijn prima. De limiet is echter wel degelijk aanwezig: in onze tests bleek een model met 13 GB VRAM, dat ongeveer 12 GB grafisch geheugen nodig had, simpelweg niet krachtig genoeg voor een kaart met 8 GB VRAM. Onze pagina ' Beste laptops voor lokale AI' behandelt dit onderwerp uitgebreider.

Systemen met 24 GB VRAM (RTX PRO 5000 laptops, RTX desktopkaarten). De ideale configuratie voor modellen met 14 tot 27 bytes, met voldoende context, en de snelste manier om ze uit te voeren; onze Dell Pro Max 18 Plus loopt voorop met 185 tokens per seconde op Phi. De 32 bytes-klasse past in het vierde kwartaal, maar laat weinig ruimte voor context, wat belangrijker is dan je denkt zodra er agents bij betrokken zijn.

Gecombineerde en gedeelde geheugensystemen (96 GB tot 128 GB). AMD Strix Halo-machines kunnen tot 96 GB systeem-RAM aan de GPU toewijzen, en GB10-systemen zoals de NVIDIA DGX Spark beschikken over 128 GB coherent geheugen. Deze klasse draait op 70B-modellen met Q4 en GPT-OSS 120B, waarbij snelheid wordt ingeleverd voor capaciteit. Ze staan ​​hoog aangeschreven in de ranglijst van beste desktops voor lokale AI , en dezelfde architectuur is terug te vinden in laptops zoals de HP ZBook Ultra G1a 14 , die in onze tests was uitgerust met een DeepSeek-R1 70B.

RTX PRO 6000 workstation towers (96 GB per kaart, tot 384 GB getest). Snelheid en capaciteit in één: 70B-modellen met hogere kwantisering en volledige context, GPT-OSS 120B met extra capaciteit, of meerdere modellen tegelijk voor multi-agent pipelines. Onze ranglijst van beste desktop workstations omvat deze klasse, met als topmodel de HP Z8 Fury G6i met vier GPU's.

De agentische belasting: context is een tweede geheugenbudget.

Het bepalen van de grootte op basis van het gewichtsbestand alleen werkt prima voor korte chatsessies. Agents doorbreken die aanname. Een agent doorloopt een lus: hij leest de uitvoer van tools, bestanden en eerdere stappen terug in zijn contextvenster, en elk token dat in de context wordt bewaard, kost geheugen in de KV-cache bovenop de gewichten. De kosten zijn niet gering.

Modelklasse KV-cache bij 32K-context KV-cache bij 128K-context Geschatte kosten per 1,000 tokens
8B (Llama 3.1 8B, FP16 KV) 4.19 GB 16.78 GB ~ 0.13 GB
70B (Llama 3.3 70B, FP16 KV) 10.49 GB 41.94 GB ~ 0.33 GB

Als je die tabel vergelijkt met de tabel hierboven, is het probleem overduidelijk. Een model van 70 bytes in Q4 gebruikt 43 GB aan gewichten, maar in een volledige context van 128 kB heeft het in totaal ongeveer 85 GB nodig, wat het dubbele is van de gewichten. Een model van 8 bytes in 128 kB gebruikt meer geheugen voor de context (16.78 GB) dan voor zijn eigen Q4-gewichten (4.9 GB). Kwantisering van de KV-cache helpt, waarbij FP8 die cijfers halveert en INT4 ze tot een kwart reduceert, ten koste van de kwaliteit, maar de planningsregel blijft: voor agentisch werk moet je de context budgetteren als een tweede model.

Het gelijktijdig verwerken van taken verhoogt de belasting nogmaals. Als een systeem meerdere agents of gebruikers tegelijk host, heeft elk verzoek zijn eigen KV-cache. vLLM, de serverstack die we gebruiken voor onze lokale AI-ranglijsten, reserveert standaard 90 procent van het GPU-geheugen, juist omdat de KV-ruimte bepaalt hoeveel gelijktijdige verzoeken kunnen worden verwerkt zonder dat de doorvoer wordt belemmerd door onderbrekingen. Een machine die één chat probleemloos kan verwerken, is mogelijk te klein voor drie agents.

Systeem-RAM: De vergeten derde poot

Voor GPU-only inferentie hoeft het systeem-RAM niet in de weg te zitten, en 32 GB tot 64 GB is een comfortabele ondergrens op de machines die we testen. Het wordt doorslaggevend in twee gevallen. Offloading, waarbij lagen die niet in het VRAM passen naar de CPU worden verplaatst, werkt via memory-mapped modelbestanden, dus het systeem-RAM moet minstens overeenkomen met de grootte van het modelbestand plus de beschikbare ruimte van het besturingssysteem. En op machines met unified memory is het systeem-RAM het GPU-geheugen, en dat is precies de reden waarom configuraties met 64 GB en 128 GB onze Local AI-ranglijsten domineren. Ollama's eigen richtlijnen voor de ondergrens gebruiken 8 GB RAM voor 7B-modellen, 16 GB voor 13B en 32 GB voor de 33B-klasse; beschouw dit als minimumwaarden, niet als streefwaarden.

Opslag: Het been dat iedereen overslaat

Modelbibliotheken worden snel groot. De tien modellen in onze tabel met afmetingen beslaan in hun meest voorkomende kwantificaties samen ongeveer 240 GB, en een werkende bibliotheek met een paar varianten, ingebedde modellen voor retrieval en vectoropslag voor agentgeheugen kan al meer dan 500 GB groot zijn voordat er projectgegevens binnenkomen. Bovendien genereren agentworkflows daadwerkelijk tijdelijk dataverkeer: logbestanden, checkpoints en retrievalindexen die naast de modellen bestaan.

De laadtijd is waar de schijfklasse een rol speelt. De berekening is eenvoudig: een 65 GB GPT-OSS 120B-bestand wordt in ongeveer 109 seconden ingelezen met SATA-snelheden, ongeveer 17 seconden op een Gen3 NVMe-schijf en minder dan 9 seconden met Gen4-snelheden, alleen bij de eerste keer laden, omdat de paginacache van het besturingssysteem herladen vrijwel direct mogelijk maakt. In de praktijk halen gebruikers niet altijd de volledige schijfsnelheid, dus we zijn van plan onze eigen gemeten laadtijden voor verschillende schijfklassen te publiceren; houd de changelog in de gaten. Ons Storage Leaderboard behandelt de schijven zelf.

Praktische richtlijnen: 2 TB NVMe is een verstandige ondergrens voor een speciaal AI-werkstation, 4 TB als de machine agents host die statusinformatie opslaan, en Gen4 of beter als u regelmatig wisselt tussen grote modellen.

Veelgestelde vragen over Agentic AI-hardware

Hoeveel VRAM heb ik nodig om een ​​70B-model lokaal te draaien?

Ongeveer 48 tot 50 GB in Q4 met een gemiddelde context, vandaar dat deze klasse eerder thuishoort bij machines met 96 GB unified memory en workstation GPU's met 96 GB dan bij consumentenkaarten. Verhoog de context naar 128 KB en het totaal loopt op tot ongeveer 85 GB. Draai het op Q8 en de bestandsgrootte alleen al bedraagt ​​75 GB.

Kan ik de volledige DeepSeek-R1 lokaal draaien?

Niet op basis van de ranglijsten van deze site. Het volledige 671B-model is een download van 404 GB in het vierde kwartaal en vereist ongeveer 450 GB aan gecombineerd geheugen om naar behoren te functioneren. De praktische lokale weg is de officiële versie, en de 32B- en 70B-versies in onze tabel voor het bepalen van de benodigde capaciteit bieden een groot deel van de mogelijkheden voor desktopgebruik.

Veranderen modellen gebaseerd op een combinatie van experts de berekeningen voor de hardware?

Substantieel. MoE-modellen activeren een fractie van hun parameters per token, waardoor het geheugenverbruik evenredig is met het totale aantal parameters, maar de snelheid evenredig is met het aantal actieve parameters. GPT-OSS 120B (5.1B actief) en Qwen3 30B-A3B (3.3B actief) draaien beide sneller dan hun grootte doet vermoeden op de geheugenpools die ze ondersteunen. Je hebt nog steeds geheugen nodig voor alle gewichten; je krijgt alleen meer snelheid per gigabyte.

Hoeveel opslagruimte heeft een AI-werkstation nodig?

Plan minimaal 2 TB NVMe-schijfruimte, 4 TB voor agenthosts. Een bescheiden modelbibliotheek alleen al neemt honderden gigabytes in beslag, agents verzamelen logbestanden en vectorgegevens, en de grootste afzonderlijke bestanden (65 GB en meer) belasten trage schijven elke keer dat u een model laadt of wisselt.

Welke hardware moet ik specifiek voor lokale agenten aanschaffen?

Geef prioriteit aan geheugen boven pure snelheid. Agenten bewaren lange contexten en draaien soms gelijktijdig, dus het cachebudget voor Key Values ​​is net zo belangrijk als het gewichtsbudget. Een systeem met 96 tot 128 GB aan uniform geheugen op ons desktop Local AI leaderboard is de meest economische optie, terwijl RTX PRO 6000 towers op het workstation leaderboard de oplossing zijn wanneer zowel snelheid als gelijktijdigheid belangrijk zijn.

Recensie: De GB300-cijfers zijn binnen

Alles hierboven weerspiegelt de hardware die we hebben getest, en het systeem waarvan we zeiden dat het de berekeningen zou veranderen, heeft dat nu gedaan. Onze review van de MSI XpertStation WS300 , de eerste GB300 DGX Station die we in handen hebben gehad, is nu beschikbaar: een coherent geheugen van 748 GB, bestaande uit 252 GB HBM3e en 496 GB LPDDR5X, 20 petaFLOPS FP4, en in onze tests draaide het een GLM-5.2 checkpoint van 433 GB, wat eigenlijk niet thuishoort op een workstation, met 216 GB aan expert-gewichten in het Grace-geheugen.

De reden waarom dit belangrijk is voor deze handleiding, is het geheugen. Elke aanbeveling op deze pagina werkt met een harde limiet, waarbij modellen over meerdere GPU's worden verdeeld, gebruik wordt gemaakt van kwantisatie of CPU-offload wordt geaccepteerd wanneer gewichten en KV-cache niet passen. NVIDIA specificeert de GB300 desktopsystemen met enkele honderden gigabytes aan coherent geheugen dat door de accelerator kan worden geadresseerd, wat een andere orde van grootte is dan de 96GB-kaarten die de basis vormen voor de bovenstaande tabellen. Modelklassen die momenteel een multi-GPU-tower vereisen, of die we als onpraktisch beschouwen om lokaal uit te voeren, vallen nu binnen het bereik van een systeem met één computer.

We gaan daar pas cijfers aan koppelen nadat we het hebben getest. Geen enkel cijfer op deze pagina is gebaseerd op GB300, en er is hier niets aangepast in afwachting daarvan. Wanneer de review wordt gepubliceerd, wordt deze handleiding herzien op basis van de gemeten resultaten en de wijziging wordt hieronder in het logboek vermeld.

Hoe wij deze handleiding onderhouden

De afmetingen van de modellen en de lijst met populaire modellen veranderen elk kwartaal, sneller dan welke hardwarecyclus dan ook. We controleren de tabel met afmetingen elk kwartaal opnieuw aan de hand van officiële releases, en labontvangsten worden toegevoegd zodra nieuwe systemen onze lokale AI-tests doorstaan. Wijzigingen worden opgenomen in de gedateerde notitie bovenaan de pagina. Afmetingen die als schatting zijn gemarkeerd, zijn gebaseerd op het gepubliceerde gewichtsbestand plus gemeten KV-cachekosten en standaard overhead tijdens de uitvoering; door de leverancier opgegeven cijfers worden als zodanig aangeduid.