Bijgewerkt op 19 augustus 2026: Eerste publicatie. Onderzoek actueel tot op deze datum.
Er zijn vier redenen om een taalmodel op je eigen hardware te draaien in plaats van in een browsertabblad, en slechts één daarvan is ideologisch. Privacy: een document dat je aan een lokaal model geeft, verlaat de machine nooit. Dit geldt voor clientcode, contracten, patiëntgegevens en nog niet uitgebrachte producten. Kostenstructuur: cloud-AI werkt op basis van verbruik, en de belasting van agenten zorgt ervoor dat het aantal tokens zo snel toeneemt dat een krachtig werkstation zichzelf terugverdient; hardware die je zelf bezit, werkt tegen de elektriciteitsprijs. Beschikbaarheid: geen limieten, geen storingen, geen afschrijvingsmail die je workflow op een dinsdag verstoort. En controle: het model dat je hebt gevalideerd, is het model dat je gebruikt totdat je anders besluit.
Het tegenargument is dat geavanceerde cloudmodellen nog steeds beter presteren, en voor agentgestuurd werk op de lange termijn is het verschil reëel. Lokale modellen hebben een gelijkwaardig niveau bereikt bij afgebakende taken: chatten, samenvatten, code in één bestand en vragen en antwoorden over documenten. Dat is toevallig het grootste deel van wat de meeste mensen de hele dag doen. Als maximale prestaties tegen elke prijs uw drijfveer zijn, gebruik dan de cloud. Als privacy, kosten of controle uw drijfveer zijn, is een lokale oplossing vandaag de dag nog steeds haalbaar, en deze pagina biedt u de routekaart.
Die kadering zou je hardwarebudget moeten bepalen, want de uitgaven voor lokale AI zijn in de eerste plaats een geheugenbeslissing. 16 GB VRAM of 32 GB unified memory dekt de 7 tot 8B-klasse, die de beperkte taken hierboven aankan. 24 tot 32 GB VRAM, of 48 GB unified memory, bereikt de 30B-klasse, waar agentische codering geen demonstratie meer is. 96 tot 128 GB unified memory draait de modellen van 100B en hoger, die de grens van de mogelijkheden benaderen. Te veel kopen levert snelheid op die je misschien niet merkt; te weinig kopen betekent dat de gewenste modelklasse helemaal niet laadt. Onze overzichten van de beste laptops voor lokale AI en de beste desktops voor lokale AI rangschikken de machines per categorie. Deze pagina beschrijft wat je erop kunt draaien.
De softwarekant is niet zo soepel meegeëvolueerd als de hardware. Ongeveer een derde van de tools die je tegenwoordig in zoekresultaten vindt, is verouderd, en de meeste pagina's die ze aanbevelen, hebben dat niet door.
Deze pagina houdt bij wat werkt en op welke hardware, tot augustus 2026. We rangschikken voorlopig op basis van GitHub-sterren, omdat dit een neutrale en verifieerbare indicator is. We geven aan wanneer een tool closed source is en geen sterren heeft. Elke toolnaam in de tabellen linkt naar de officiële download. Naarmate we elk platform in het lab testen, wordt de kolom 'Handleiding' aangevuld met een praktische installatiehandleiding en onze eigen resultaten.
Drie regels voor deze pagina. Ten eerste maken we onderscheid tussen een lokaal model en een lokale agent . Verschillende producten draaien op uw computer, terwijl elke inferentie-aanroep naar een cloud van een leverancier gaat; dat is een privacymaatregel, geen offline-functionaliteit, en die tools worden apart onderaan vermeld in plaats van weggelaten. Ten tweede heeft elke vermelding een realistische minimale hardware-vereiste, omdat "het draait op een laptop" betekenisloos is zonder een geheugenspecificatie. Ten derde houden we in de FAQ bij welke producten niet meer werken, inclusief de datums.
De Keuzes
Beste algehele lokale LLM-runtime: Ollama
Het standaardantwoord, en het antwoord waarmee de meeste andere tools communiceren. Onder MIT-licentie, ongeveer 179,000 GitHub-sterren, en het levert nu naast de CLI ook een desktop-GUI mee. Het haalt modellen op met één commando, biedt een OpenAI-compatibel eindpunt op localhost en voegde in januari 2026 compatibiliteit met de Anthropic Messages API toe, waarmee gebruikers Claude Code nu naar een lokaal model laten verwijzen. Minimumvereisten: 8 GB systeem-RAM voor een 3B-model, 16 GB voor 7-8B, 24 GB VRAM voor de 30B-klasse.
Het beste voor het benchmarken van hardware: LM Studio
Closed source, dus het heeft geen sterrenwaardering, maar het verdient zijn plek desondanks. LM Studio bundelt zowel llama.cpp als MLX en biedt toegang tot de belangrijke instellingen wanneer je een machine meet in plaats van er een te gebruiken: GPU-offloadlagen, kwantiseringsopties, contextlengte en multi-GPU-gedrag. Het is sinds juli 2025 gratis voor commercieel gebruik. Dit is de tool die ten grondslag ligt aan de meeste tokens-per-seconde-cijfers op onze workstation- en laptoptests. Minimumvereisten: 16 GB RAM; 24 GB VRAM of 32 GB unified memory is aan te raden voor een interessant resultaat.
Beste onderliggende engine: llama.cpp
Vrijwel alles op deze pagina is afgeleid van llama.cpp. Het is gelicentieerd onder de MIT-licentie, heeft ongeveer 124,700 sterren en er worden dagelijks meerdere getagde builds gepubliceerd. Het is om een specifieke reden belangrijk voor hardwaregebruikers: de lijst met backends is enorm en omvat CUDA, ROCm, Metal, Vulkan, SYCL, CANN en OpenCL, en engineers van leveranciers dragen nu rechtstreeks bij aan optimalisaties. Een verbetering van de Intel Arc-prefill in build 8688 was ongeveer vijf keer zo waardevol, en elke Ollama- en LM Studio-gebruiker kreeg deze zonder iets te installeren. Minimumvereisten: draait alleen op de CPU; 8 GB RAM is nodig voor bruikbaar gebruik.
Beste desktop-app met prioriteit voor lokale gebruikers: Jan
Apache 2.0, ongeveer 44,100 sterren, versie 0.8.4 (juli 2026). Jan bundelt llama.cpp, dus er hoeft verder niets geïnstalleerd te worden, en het werkt zelfs als de netwerkkabel is losgekoppeld. Dat klinkt misschien als een lage drempel, totdat je bedenkt hoeveel apps in deze categorie cloudclients zijn met een Ollama-veld. Dit is de ideale app voor een collega die nooit een terminal zal openen. Document RAG is het zwakke punt. Minimumvereisten: 8 GB RAM.
Beste lokale document RAG: AnythingLLM
MIT, ongeveer 64,800 sterren. Het bevat een vectordatabase en verwerkt chunking en embedding zonder configuratie, waardoor het de meest gebruiksvriendelijke documentchat voor desktops is. Twee dingen die we niet zullen verzwijgen: een kwetsbaarheid uit maart 2026 met een CVSS-rating van 9.6 maakte het mogelijk om op afstand code uit te voeren via de gestreamde respons van het model zelf. Deze kwetsbaarheid is verholpen in versie 1.11.2, dus update voordat je het gebruikt. Telemetrie is standaard ingeschakeld in een app die als 'local-first' wordt gepresenteerd, maar je kunt deze uitschakelen in de instellingen. Minimumvereisten: 16 GB RAM voor documentverwerking.
Beste zelfgehoste multi-useroplossing: Open WebUI
Ongeveer 149,000 sterren en de meest uitgebreide configuratiemogelijkheden voor het ophalen van informatie vind je hier, met versie 0.11.0 die in juli 2026 wordt uitgebracht. Het is een zelfgehoste server in plaats van een desktopapplicatie, dus Docker is het toegangspunt. Een belangrijk punt om te weten voordat je ermee aan de slag gaat: de licentie is in april 2025 gewijzigd van BSD-3 naar een aangepaste licentie die niet door OSI is goedgekeurd. Deze licentie bevat een clausule die het verwijderen van de Open WebUI-merknaam verbiedt, met een uitzondering voor gebruikers kleiner dan vijftig binnen een periode van dertig dagen. Draai het ongewijzigd op kleine schaal en er verandert niets voor jou. Minimumvereisten: een aparte runtime plus 4 GB voor de container.
Beste lokale codeeragent: Cline
Apache 2.0, ongeveer 63,900 sterren. Cline heeft meer daadwerkelijke engineering verricht aan de lokale oplossing dan welke concurrent dan ook, inclusief een compacte systeemprompt die specifiek is gebouwd voor Ollama en LM Studio en native toolaanroepen per modelfamilie. Hun eigen documentatie is ongebruikelijk openhartig over waar de cloud nog steeds wint. Minimumvereisten: 24 GB VRAM of 36 GB unified memory, en stel de context in op 32K of hoger.
Beste offline terminalprogrammering: Aider
Apache 2.0, met zo'n 48,300 sterren, is architectonisch gezien de meest betrouwbare lokale optie, en dat is niet zonder reden. Aider gebruikt helemaal geen JSON-toolaanroepen. Het parseert diff- en volledige bestandsbewerkingsformaten uit platte tekst, waardoor precies het soort fout wordt vermeden dat de meeste agents op lokale modellen laat vastlopen. Het nadeel is het onderhoud: één auteur schreef 96 procent van de commits en de releasefrequentie is teruggebracht tot ongeveer één stabiele release in 2026. Minimum: 24 GB VRAM of 36 GB gecombineerd.
Beste zelfgehoste agentplatform: OpenHands
MIT, ongeveer 84,500 sterren. OpenHands documenteert lokale modellen correct en, nog nuttiger, vertelt je wanneer het probleem niet aan je configuratie ligt: in de eigen documentatie staat dat als de agent zich als een chatbot gedraagt of constant tools niet aankan, het model de beperkende factor is. Het vereist minimaal 22K contextgeheugen en adviseert 32K. Minimum: 24 GB VRAM voor gekwantiseerde modellen, of 64 GB unified memory.
Beste gratis offline verrassing: GitHub Copilot CLI
Sinds april 2026 werkt de Copilot CLI met Ollama, vLLM en Foundry Local. GitHub-authenticatie is optioneel en een Copilot-abonnement is niet vereist. Door COPILOT_OFFLINE in te stellen, worden alle telemetrie- en netwerkverbindingen gestopt en nemen de subagents uw lokale provider over. De meeste vergelijkingsartikelen vermelden het nog steeds als cloud-only. Let op de splitsing: de IDE-extensie stuurt nog steeds inline-aanvullingen naar de cloud, zelfs bij gebruik van uw eigen sleutel. Minimumvereisten: een model met een contextvenster van 128 KB, dus 32 GB VRAM of 64 GB gecombineerd.
Beste server met leveranciersondersteuning: Lemonade
Apache 2.0, met ongeveer 5,400 sterren, is de enige tool van een fabrikant die we hier op basis van verdienste zouden aanbevelen in plaats van vanwege hardwarevoorkeuren. Het wordt onderhouden door AMD-engineers en draait op NVIDIA CUDA, Apple Metal, Vulkan en gewone CPU's, evenals op Radeon- en Ryzen AI-NPU's. Er verschijnt ongeveer elke twee weken een nieuwe versie en de desktop-app is in april 2026 overgezet van Electron naar Tauri. Minimumvereisten: 16 GB RAM; Ryzen AI 300-serie of nieuwer voor de NPU-variant.
Beste lokale RAG voor het hele bestandssysteem: Nexa AI Hyperlink
Gesloten broncode en gratis. Het indexeert je volledige bestandssysteem op het apparaat en geeft antwoorden met inline citaten. Het staat op deze lijst omdat het de enige nieuwe lokale RAG-tool is met gepubliceerde versnellingscijfers voor consumentenhardware: ongeveer 3x sneller indexeren en 2x snellere inferentie op een RTX 5090, waarbij een map van 1 GB van ongeveer vijftien minuten naar vier of vijf minuten wordt verwerkt. Minimumvereisten: een moderne RTX GPU; 16 GB RAM.
Uitvoeringstijden: Wat voert het model daadwerkelijk uit?
Dit is de engine. Alles in de volgende twee tabellen is een front-end die met een van deze engines communiceert. Gesorteerd op GitHub-sterren.
| Runtime | Sterren | Vergunning | Minimale hardware | Versnelling | Gids |
|---|---|---|---|---|---|
| Ollama | ~ 179,000 | MIT | 8 GB RAM (3B), 16 GB (7-8B), 24 GB VRAM (30B-klasse) | CUDA, ROCm, Metal, Vulkan | Binnenkort beschikbaar |
| lama.cpp | ~ 124,700 | MIT | 8 GB RAM, alleen de CPU werkt | CUDA, ROCm, Metal, Vulkan, SYCL, CANN, OpenCL | Binnenkort beschikbaar |
| MLX / mlx-lm | ~ 27,500 | MIT | Apple Silicon, 16 GB gecombineerd | Metaal; CUDA-backend toegevoegd in 2026 | Binnenkort beschikbaar |
| LM Studio | Gesloten bron | Eigendomsrechtelijk beschermd, vrij te gebruiken voor commerciële doeleinden. | 16 GB RAM; 24 GB VRAM of 32 GB gecombineerd | Bundelt llama.cpp en MLX | Binnenkort beschikbaar |
| vLLM | Productie ten behoeve van | Apache 2.0 | 24 GB VRAM realistische vloer | CUDA, ROCm | Binnenkort beschikbaar |
Desktop-apps en lokale RAG
De apps die een lezer installeert. De kolom 'Lokaal eerst' moet je goed lezen: deze maakt onderscheid tussen software die een model op je computer uitvoert en software die een veld voor een Ollama-URL heeft toegevoegd.
| app | Sterren | Vergunning | Lokaal eerst | Minimale hardware | Gids |
|---|---|---|---|---|---|
| Open WebUI | ~ 149,000 | Op maat gemaakt, niet goedgekeurd door OSI. | Geschikt, server, geen desktop | Aparte runtime + 4 GB voor de container | Binnenkort beschikbaar |
| AllesLLM | ~ 64,800 | MIT | Geschikt; telemetrie standaard ingeschakeld. | RAM 16GB | Binnenkort beschikbaar |
| jan | ~ 44,100 | Apache 2.0 | Ja, bundelt llama.cpp | RAM 8GB | Binnenkort beschikbaar |
| LM Studio | Gesloten bron | Proprietary | Ja | 16 GB RAM; 24 GB VRAM, dat wordt interessant. | Binnenkort beschikbaar |
| Machtig | Gesloten bron | Eigendomsrechtelijk beschermd, gratis niveau | Ja, bundels Ollama, MLX, llama.cpp | RAM 8GB | Binnenkort beschikbaar |
| Nexa AI-hyperlink | Gesloten bron | Eigendomsrechtelijk beschermd, gratis | Ja, indexering op het apparaat zelf. | Moderne RTX GPU, 16 GB RAM | Binnenkort beschikbaar |
Codeer- en agenttools
Dit zijn de meest hardware-intensieve onderdelen op de pagina, omdat agentisch werk een groot contextvenster en lange sessies vereist. Beschouw 32 GB VRAM of 64 GB aan verenigd geheugen als het punt waarop dit geen demonstratie meer is.
| Gereedschap | Sterren | Vergunning | Lokaal pad | Minimale hardware | Gids |
|---|---|---|---|---|---|
| OpenHanden | ~ 84,500 | MIT | LM Studio, Ollama, vLLM, SGLang | 24 GB VRAM of 64 GB gecombineerd; 32K context | Binnenkort beschikbaar |
| Cline | ~ 63,900 | Apache 2.0 | Ollama, LM Studio, OpenAI-compatibel | 24 GB VRAM of 36 GB gecombineerd | Binnenkort beschikbaar |
| Gans | ~ 52,900 | Apache 2.0 | Ollama eersteklas; nu Linux Foundation | 24 GB VRAM of 36 GB gecombineerd | Binnenkort beschikbaar |
| aider | ~ 48,300 | Apache 2.0 | Ollama, OpenAI-compatibel; geen toolaanroep | 24 GB VRAM of 36 GB gecombineerd | Binnenkort beschikbaar |
| Zed | v1.0, april 2026 | Apache 2.0 | LM Studio, Ollama, llama.cpp | 24 GB VRAM of 36 GB gecombineerd | Binnenkort beschikbaar |
| GitHub Copilot-CLI | Gesloten bron | Eigendomsrechtelijk beschermd, geen abonnement vereist | Ollama, vLLM, Foundry Local | 32 GB VRAM of 64 GB gecombineerd; 128K context | Binnenkort beschikbaar |
Initiatieven van leveranciers
Elke chip- en besturingssysteemleverancier levert wel iets voor lokale AI, en deze categorie verdient een eigen post, omdat de naamgeving verwarrend is en het sterftecijfer hoog ligt. Het patroon in 2026 is consistent: de leveranciers zijn gestopt met concurreren met de software van derden en zijn deze juist gaan voeden. NVIDIA heeft beide eigen lokale AI-producten stopgezet en publiceert nu optimalisaties voor Ollama, llama.cpp en ComfyUI. AMD werkt samen met LM Studio. Qualcomm heeft zijn NPU-functionaliteit op de markt gebracht door een applicatie van iemand anders te porteren.
Eén ding dat tools van leveranciers wel kunnen en Ollama en LM Studio niet: ze bereiken de NPU . llama.cpp heeft geen NPU-backend, dus op een AI-machine met Snapdragon of Ryzen-processors laten die tools de neurale engine voor nul procent benut worden. Als je betaald hebt voor 40 tot 60 TOPS, dan maakt alleen een door de leverancier geleverde oplossing daar gebruik van. Stel je verwachtingen echter bij. NPU's halen momenteel een maximum van ongeveer 7 miljard modellen, en de winst zit hem in de batterijduur bij continu gebruik van kleine modellen, niet in de doorvoer. Een aparte GPU is qua snelheid altijd sneller dan een NPU.
| Verkoper | Wat het is | Type | Hardware vereist | Status | Gids |
|---|---|---|---|---|---|
| AMD-limonade | Server, GUI en SDK; ~5,400 sterren, Apache 2.0 | App + server | 16 GB RAM; Ryzen AI 300+ als NPU. Draait ook op NVIDIA- en Apple-CPU's. | Actief, verzendt ongeveer tweewekelijks. | Binnenkort beschikbaar |
| Intel OpenVINO GenAI | Runtime en SDK; ~10,700 sterren | SDK | Core Ultra, Arc A/B-serie; 16 GB RAM | Actief, 2026.3 in augustus 2026 | Binnenkort beschikbaar |
| Apple Foundation-modellen | Op het apparaat zelf weergegeven modellen die door het besturingssysteem beschikbaar worden gesteld. | OS-framework | Apple Silicon; reeds geïnstalleerd | Actief; open voor elke aanbieder tijdens WWDC 2026 | Binnenkort beschikbaar |
| Microsoft Foundry Local | Lokale inferentie-SDK en CLI; ~2,400 sterren | SDK | Windows, macOS, Linux; NPU/GPU/CPU | GA april 2026; samengestelde modelcatalogus | Binnenkort beschikbaar |
| AMD GAIA | Lokale LLM-app voor Ryzen AI; ~1,400 sterren, MIT | App + SDK | Minimaal een Ryzen AI 300-serie; 16 GB RAM, 64 GB aanbevolen. | Actief, v0.20.0 juni 2026 | Binnenkort beschikbaar |
| Intel AI Playground | Desktop-app; ~900 sterren | app | Arc A-serie 8GB+, Arc B-serie, Core Ultra | Actief, maar na twee jaar nog steeds in bèta. | Binnenkort beschikbaar |
| Qualcomm GenieX | GGUF-runtime op het apparaat zelf voor Snapdragon NPU | Runtime | Snapdragon X / X Elite, 8 Elite | Ontwikkelaarspreview, juli 2026 | Binnenkort beschikbaar |
| NVIDIA Project G-Assist | 8B-assistent op het apparaat voor systeembeheer | app | RTX 20-serie of nieuwer, 6 GB VRAM | Actief, maar nog steeds aangeduid als pre-release. | Binnenkort beschikbaar |
Een opmerking over de naamgeving. NVIDIA's "RTX AI Garage" klinkt als een product, maar dat is het niet; het is een blogserie. De stack van Microsoft is herhaaldelijk hernoemd: Copilot Runtime API's werden Windows AI API's, Azure AI Foundry werd Microsoft Foundry en DirectML bevindt zich nu in de onderhoudsmodus met alleen beveiligingsupdates. Qualcomm AI Hub is een cloudservice waarmee fysieke apparaten op afstand kunnen worden geconfigureerd, niet iets dat je lokaal uitvoert.
Wat gaat er meestal kapot?
De meeste meldingen dat lokale modellen "niet werken" betreffen configuratieproblemen, geen modelproblemen. Vier specifieke problemen zijn verantwoordelijk voor een groot deel ervan, en het zijn alle vier zaken die een hardware-liefhebber zou moeten weten voordat ze de schuld bij de chip leggen.
1. Ollama gebruikt standaard een context van 4,096 tokens. Er wordt geen foutmelding gegenereerd wanneer deze limiet wordt overschreden. De context wordt stilzwijgend afgekapt, waardoor een agentische lus geruisloos stopt. Elk serieus testsysteem heeft meer tokens nodig: OpenHands vereist minimaal 22 en adviseert 32, Codex heeft 32 tokens nodig, Copilot CLI heeft 128 tokens nodig en Cline stelt 262,144 tokens in. Deze ene instelling is waarschijnlijk de meest voorkomende oorzaak van de foutmeldingen die u online zult vinden.
2. KV-cachequantisatie verslechtert met name de aanroep van tools , en dit gebeurt voordat de algemene uitvoerkwaliteit zichtbaar achteruitgaat. De documentatie van llama.cpp waarschuwt hier expliciet voor. Als u een agent gebruikt, schakel deze functie dan uit.
3. Het aantal tools is een steile afgrond, geen geleidelijke helling. Hierboven zijn er ruwweg vijf of zes tools beschikbaar; sommige modellen stoppen stilletjes met het verzenden van geldige JSON-toolaanroepen en beginnen in plaats daarvan XML in de responsbody in te sluiten, wat het testsysteem interpreteert als "geen tool gebruikt". Een populaire agent leverde standaard elf tools mee en verstoorde daarmee zijn eigen aanbevolen model tot begin 2026. Het praktische gevolg is contra-intuïtief: het laden van veel MCP-servers is actief schadelijk voor lokale modellen op een manier die niet het geval is voor grensmodellen.
4. Q4_K_M is de praktische ondergrens. Daaronder neemt de betrouwbaarheid van de toolaanroepen sneller af dan de algemene kwaliteit, waardoor het model weliswaar goed klinkt, maar in werkelijkheid niets doet.
Geheugen is de beperkende factor.
Bij alle tools op deze pagina is de hoeveelheid geheugen die de accelerator kan gebruiken bepalend voor wat je kunt uitvoeren. Dit zijn de combinaties die we het vaakst tegenkomen in experimenten met agentia, en die we zelf in het lab willen verifiëren.
| Hardware | Model | Footprint | Gerapporteerde doorvoer |
|---|---|---|---|
| RTX 5090, 32 GB | Qwen3.6-35B-A3B Q4_K_M | ~21 GB | 160-180 toks/s, 262K context |
| RTX 5090, 32 GB | Qwen3-Coder-30B-A3B Q4_K_M | ~19 GB | 50-90 tok/s op 24GB-kaarten |
| RTX 5090, 32 GB | Devstral Small 24B Q4_K_M | ~14 GB | Speciaal ontworpen voor gereedschapsoproepen |
| RTX PRO 6000, 96 GB | GPT-OSS 120B MXFP4 | ~63 GB | De 100B-klasse op één enkele workstation-kaart; de GPU uit onze labreview. |
| RTX PRO 5000 laptop, 24GB GDDR7 | Qwen3-Coder-30B-A3B Q4_K_M | ~19 GB | De grootste laptop-GPU die we hebben getest (ThinkPad P16 Gen 3); de 30B-klasse past er met gemak in. |
| 96-128 GB uniform geheugen, M-serie | gpt-oss-120b Q6_K | ~93 GB | 14-20 tok/s; de schoonste tool-call JSON van elk open-weight model. |
Het is belangrijk om te vermelden, omdat de marketing dit niet doet: de grootste open-weight modellen zijn geen workstation-modellen. GLM-5.2 heeft ongeveer 744B parameters en vereist circa 744GB in FP8, wat een datacenter-node met acht GPU's is. Kimi K2 en DeepSeek V4 vallen in dezelfde categorie. Elke handleiding die je aanraadt deze op een desktop te gebruiken, heeft het mis.
De bovenstaande doorvoercijfers zijn afkomstig van gepubliceerde tests door derden en materiaal van leveranciers, en zijn nog geen laboratoriumresultaten van StorageReview. We zullen ze vervangen door onze eigen cijfers zodra elk platform het Guide-proces doorloopt.
Cloud-First Tools, en waarom ze hier niet in de ranglijst staan.
De meeste AI-gebruikers zijn bekend met de populaire en gebruiksvriendelijke online AI-tools. Een lokale agent is geen lokaal model. Elk van deze tools draait op uw eigen computer en stuurt elke inferentie-aanroep naar de cloud van een leverancier.
| Gereedschap | Lokale modelondersteuning | Note |
|---|---|---|
| Cursor | Nee | Volgens de officiële documentatie worden alle verzoeken via Cursor-servers verwerkt; aangepaste toetsen werken alleen met grote cloudproviders en tab-aanvulling maakt altijd gebruik van Cursor-modellen. Overgenomen door SpaceX in 2026. |
| Devin Desktop (voorheen Windsurf) | Nee | Hernoemd in juni 2026. Elk model wordt in de cloud gehost. |
| Google Antigravity | Nee | In de documentatie staat expliciet vermeld dat Ollama, LM Studio of een aangepast eindpunt niet gebruikt kunnen worden. |
| Gemini CLI | Nee | Lokale ondersteuning bestaat alleen in community forks. |
| Qodo | Nee | "On-premise" verwijst naar zelfgehoste infrastructuur, terwijl cloudmodellen nog steeds zo worden genoemd. |
| GitHub Copilot in de IDE | Partieel | Chat kan gebruikmaken van lokale modellen; inline-aanvullingen blijven in de cloud, zelfs bij een 'bring-your-own-key'-aanpak. |
| ChatGPT | Nee | De desktop- en mobiele apps zijn clients voor de cloudmodellen van OpenAI. De open-weight gpt-oss-modellen van OpenAI kunnen wel lokaal worden uitgevoerd, maar via de bovenstaande runtimes, niet via de ChatGPT-app. |
| Claude | Nee | Claude-apps en Cowork draaien op de cloudmodellen van Anthropic. Claude Code kan via de Anthropic-compatibele API van Ollama naar een lokaal model worden gekoppeld, wat werkt, maar geen ondersteunde configuratie is. |
| Algemene agentschapsassistenten | Nee | De tools in deze categorie draaien op uw eigen computer, maar zijn voor de berekening afhankelijk van een cloudmodel. |
Er bestaat een veelvoorkomend genre van handleidingen over "Cursor verbinden met Ollama". De documentatie van Cursor zelf spreekt deze echter tegen. Als offline gebruik voor u een vereiste is, is dat onderscheid cruciaal.
En hoe zit het met het genereren van afbeeldingen en video's?
Lokale beeldgeneratie is een van de grootste communities binnen lokale AI. ComfyUI alleen al overtreft de meeste tools in de bovenstaande ranglijst op basis van GitHub-sterren, en lokale videogeneratie ontpopt zich als de meest VRAM-intensieve consumententaak die er is. Het verdient een eigen ranglijst in plaats van een vierde categorie die aan deze wordt toegevoegd, en die zal er ook komen. Tot die tijd is de hardwarelogica op deze pagina direct van toepassing: beeld- en videobewerking is nog geheugenintensiever dan taalmodellen, en dezelfde niveaus zijn van toepassing.
Hoe deze pagina werkt
Drie regels. Ten eerste, de rangschikking is voorlopig gebaseerd op GitHub-sterren. Het is niet ideaal, maar het is neutraal, verifieerbaar en het vereist niet dat we doen alsof we dingen hebben getest die we niet hebben getest. Tools met gesloten broncode worden als zodanig gemarkeerd in plaats van een verzonnen score te krijgen. Naarmate onze eigen tests duidelijke favorieten opleveren, zal de rangschikking verschuiven om de gemeten resultaten weer te geven, en dat zullen we ook vermelden. Ten tweede, elke vermelding heeft een minimale geheugenvereiste, omdat dat getal bepaalt of een model laadt. Ten derde, de kolom 'Handleiding' is een toezegging: voor elk platform wordt een praktische installatiehandleiding met onze cijfers voor onze hardware beschreven, en de link verschijnt hier zodra deze gepubliceerd is.
Veelgestelde vragen over lokale LLM-tools
Met welke lokale LLM-tool moet ik beginnen?
Ollama is geschikt als je graag in een terminal werkt, LM Studio als je liever een venster met bedieningselementen hebt, en Jan als je iets wilt dat direct werkt en waarvoor je nooit iets hoeft te installeren. Alle drie zijn gratis, alle drie werken volledig offline en alle drie gebruiken llama.cpp als onderliggende code, dus het modelgedrag is hetzelfde. Het verschil zit hem in de interface, niet in de snelheid.
Wat is er gebeurd met NVIDIA ChatRTX, GPT4All en Continue.dev?
Ze zijn verdwenen, samen met een verrassend groot aantal van hun concurrenten, en dit is het allerbelangrijkste om te weten voordat je een oudere aanbeveling opvolgt. NVIDIA ChatRTX is op 21 januari 2026 stopgezet, de repository is gearchiveerd en het ondersteuningsforum is gesloten, zonder dat er een vervanger is genoemd. GPT4All is het lastigste geval: er zijn al twaalf maanden geen commits meer geweest en de laatste release was in februari 2025, maar de repository is niet gearchiveerd en heeft nog steeds een groot aantal sterren, dus het lijkt nog steeds actief. Het ondersteunde slechts een beperkt aantal kwantiseringsformaten en kan de meeste recente modelreleases niet laden. Continue.dev , twee jaar lang de standaardaanbeveling voor programmeren met lokale modellen, werd overgenomen door Cursor en in juni 2026 stopgezet. Roo Code werd in mei 2026 gesloten, Void werd in juni 2026 gearchiveerd, Twinny in november 2025 en Reor in maart 2026. Khoj beëindigde zijn gehoste service in april 2026, hoewel de zelfgehoste versie blijft bestaan. Aan de leverancierskant werd Intel IPEX-LLM in januari 2026 gearchiveerd en gemarkeerd vanwege bekende beveiligingsproblemen zonder gepubliceerd migratieplan, en NVIDIA RTX AI Toolkit werd in november 2025 afgeschreven.
Hoeveel VRAM heb ik nodig om een lokale LLM te draaien?
Voor chattoepassingen draait 8 GB systeem-RAM een 3B-model, en 16 GB draait een 7- tot 8B-model acceptabel op alleen de CPU. Voor bruikbare snelheid is het model in VRAM of unified memory (VRAM) gewenst: 16 GB ondersteunt de 7- tot 14B-klasse, 24 GB bereikt de 30B-klasse in het vierde kwartaal, en met 32 GB of meer is agentisch coderen niet langer frustrerend. Daarboven is capaciteit belangrijker dan bandbreedte, vandaar dat machines met 96 tot 128 GB VRAM modellen draaien die geen enkele consumentenvideokaart aankan.
Maken lokale LLM-tools gebruik van mijn NPU?
Meestal niet. llama.cpp heeft geen NPU-backend, dus Ollama en LM Studio laten de neurale engine op nul procent draaien op een Snapdragon- of Ryzen AI-machine en draaien in plaats daarvan op de CPU of GPU. Om de NPU te bereiken, moet je momenteel een route via een externe leverancier kiezen: Qualcomm GenieX, AMD Lemonade met zijn NPU-runtime, Intel OpenVINO of Apple's Neural Engine via de frameworks van het besturingssysteem. Het is de moeite waard om te weten wat je ermee wint, namelijk een langere batterijduur en een energiezuinige, altijd actieve werking, in plaats van snelheid. NPU's hebben tegenwoordig ook niet veel rekenkracht, en een aparte GPU zal qua doorvoer altijd beter presteren.
Moet ik lokale AI op Windows of Linux draaien?
Voor de desktop-apps op deze pagina zijn Windows en macOS de meest soepele keuze. LM Studio, Jan, AnythingLLM en Ollama kunnen allemaal native worden geïnstalleerd, GPU-drivers zijn verkrijgbaar via de gebruikelijke kanalen en er is geen terminal nodig. Linux bewijst zijn waarde een niveau lager: de productieserverengines, vLLM en SGLang, zijn primair voor Linux ontwikkeld, multi-GPU-servers gaan er in feite vanuit dat Linux beschikbaar is, en enkele van de nieuwste acceleratiepaden verschijnen daar als eerste, waaronder AMD's Ryzen AI NPU-ondersteuning, die op Linux is uitgebracht en een zeer recente kernel vereist. Het verschil is kleiner dan voorheen. AMD heeft zijn ROCm-releases in 2026 geharmoniseerd voor Windows en Linux, en WSL2 dekt het grootste deel van de rest, waardoor op Docker gebaseerde tools zoals Open WebUI probleemloos op een Windows-machine draaien. De praktische regel: als je installeert vanuit de tabel met desktop-apps, blijf dan op het besturingssysteem dat je al hebt; als je een dedicated server bouwt of alle acceleratiepaden wilt benutten, bouw het dan op Linux.
Zijn lokale modellen goed genoeg om een cloudmodel voor programmeren te vervangen?
Het hangt volledig af van de taak, en het verschil is groter dan de meeste onderzoeken doen vermoeden. Bij afgebakende taken, zoals het genereren van afzonderlijke bestanden, unit tests, boilerplate-code en het uitleggen van code, presteren de huidige open-source modellen op een goed werkstation ongeveer even goed als de nieuwste cloudmodellen. Bij langdurige, agent-gebaseerde taken, zoals refactoring van meerdere bestanden in een grote repository, verliezen ze het duidelijk, en de faalmodi zijn van de onaangename soort: stille no-ops en vol vertrouwen gerapporteerd werk dat nooit is uitgevoerd. Als uw reden voor lokale ontwikkeling privacy, air-gap-vereisten of kosten zijn, is het vandaag de dag haalbaar. Als uw reden mogelijkheden zijn, is het nog niet haalbaar.
Is het veiliger om een model lokaal uit te voeren dan via een cloudservice?
Voor dataopslag is dat zeker het geval, en dat is meestal ook de bedoeling. Voor softwarebeveiliging is dat echter niet automatisch zo. Een lokale AI-app met een CVSS-score van 9.6 in maart 2026 zou door de gestreamde output van het model zelf code op de host kunnen uitvoeren, omdat de desktop-app standaard met onveilige instellingen was verpakt. Lokaal betekent dat je data op de eigen locatie blijft. Het betekent niet dat de software gehard is, en in deze categorie wordt veel snel veranderende code geleverd.
Wat is een AI-agent-sandbox en heb ik er een nodig voor lokale AI?
Een sandbox is een geïsoleerde omgeving, meestal een container of een lichtgewicht virtuele machine, waarin een AI-agent de commando's en code uitvoert die hij genereert. Hierdoor kan een fout of een kwaadaardige instructie het hostsysteem niet bereiken. Sandboxing is nodig omdat agents niet alleen vragen beantwoorden; ze voeren shellcommando's uit, bewerken bestanden en browsen, en al deze acties worden aangestuurd door modeloutput die gemanipuleerd kan worden. Het lokaal uitvoeren van het model verandert daar niets aan. Sandboxing gaat over het isoleren van wat de agent doet, niet waar het model zich bevindt, en de hierboven beschreven kwetsbaarheid voor code-executie illustreerde dit punt perfect bij een applicatie die primair lokaal draait. Sommige tools op deze pagina worden geleverd met ingebouwde sandboxing, en de tools die agents uitvoeren met onbeperkte toegang tot de host verdienen een nadere beschouwing voordat ze worden ingezet op een machine die voor u van belang is. Naarmate agents steeds vaker in zakelijke omgevingen worden gebruikt, zal sandboxing naar verwachting een belangrijk kenmerk worden in plaats van een bijzaak, en zullen we het meewegen in onze evaluatie van deze tools.
Kan lokale hardware agentische workloads met tientallen subagents uitvoeren?
Dit is de grens, en het eerlijke antwoord is dat een enkel werkstation snel vol raakt. Multi-agent workloads genereren sub-agents die elk hun eigen context bevatten, en aan de inferentiekant betekent elke actieve context een eigen KV-cache in het geheugen, waardoor de footprint schaalt met de gelijktijdigheid, niet alleen met de modelgrootte. Waar die caches naartoe gaan wanneer ze het geheugen ontgroeien, is een eigen technische uitdaging; onze diepgaande analyse van KV-cache-offload naar flashgeheugen , gebouwd op Dell- en Solidigm-hardware, is de beste behandeling van dit onderwerp die we tot nu toe hebben gepubliceerd. Een machine die comfortabel één agent-sessie van de 30B-klasse kan verwerken, kan doorgaans een paar parallelle sessies via een batchserver aan voordat de latentie verslechtert; tientallen gelijktijdige sub-agents is servergebied, met voldoende geheugen om veel actieve contexten te bevatten en een serverengine zoals vLLM die is ontworpen voor continue batchverwerking. Er is ook een kwaliteitsplafond: lokale modellen verliezen al aan betrouwbaarheid naarmate het aantal tools toeneemt, en orchestratie vermenigvuldigt tools en overdrachten. Wij zijn van mening dat werk met één of enkele agenten tegenwoordig een legitieme taak is voor een werkstation, terwijl grote vloten van subagenten een infrastructuurtaak vormen. Die grens, en de hardware die nodig is om die te overschrijden, willen we in de toekomst veel dieper onderzoeken.




Amazon