OpslagReview. com

Beste lokale LLM-tools in 2026: runtime-omgevingen, apps en agents

Bijgewerkt op 19 augustus 2026: Eerste publicatie. Onderzoek actueel tot op deze datum.

Er zijn vier redenen om een ​​taalmodel op je eigen hardware te draaien in plaats van in een browsertabblad, en slechts één daarvan is ideologisch. Privacy: een document dat je aan een lokaal model geeft, verlaat de machine nooit. Dit geldt voor clientcode, contracten, patiëntgegevens en nog niet uitgebrachte producten. Kostenstructuur: cloud-AI werkt op basis van verbruik, en de belasting van agenten zorgt ervoor dat het aantal tokens zo snel toeneemt dat een krachtig werkstation zichzelf terugverdient; hardware die je zelf bezit, werkt tegen de elektriciteitsprijs. Beschikbaarheid: geen limieten, geen storingen, geen afschrijvingsmail die je workflow op een dinsdag verstoort. En controle: het model dat je hebt gevalideerd, is het model dat je gebruikt totdat je anders besluit.

Het tegenargument is dat geavanceerde cloudmodellen nog steeds beter presteren, en voor agentgestuurd werk op de lange termijn is het verschil reëel. Lokale modellen hebben een gelijkwaardig niveau bereikt bij afgebakende taken: chatten, samenvatten, code in één bestand en vragen en antwoorden over documenten. Dat is toevallig het grootste deel van wat de meeste mensen de hele dag doen. Als maximale prestaties tegen elke prijs uw drijfveer zijn, gebruik dan de cloud. Als privacy, kosten of controle uw drijfveer zijn, is een lokale oplossing vandaag de dag nog steeds haalbaar, en deze pagina biedt u de routekaart.

Die kadering zou je hardwarebudget moeten bepalen, want de uitgaven voor lokale AI zijn in de eerste plaats een geheugenbeslissing. 16 GB VRAM of 32 GB unified memory dekt de 7 tot 8B-klasse, die de beperkte taken hierboven aankan. 24 tot 32 GB VRAM, of 48 GB unified memory, bereikt de 30B-klasse, waar agentische codering geen demonstratie meer is. 96 tot 128 GB unified memory draait de modellen van 100B en hoger, die de grens van de mogelijkheden benaderen. Te veel kopen levert snelheid op die je misschien niet merkt; te weinig kopen betekent dat de gewenste modelklasse helemaal niet laadt. Onze overzichten van de beste laptops voor lokale AI en de beste desktops voor lokale AI rangschikken de machines per categorie. Deze pagina beschrijft wat je erop kunt draaien.

De softwarekant is niet zo soepel meegeëvolueerd als de hardware. Ongeveer een derde van de tools die je tegenwoordig in zoekresultaten vindt, is verouderd, en de meeste pagina's die ze aanbevelen, hebben dat niet door.

Deze pagina houdt bij wat werkt en op welke hardware, tot augustus 2026. We rangschikken voorlopig op basis van GitHub-sterren, omdat dit een neutrale en verifieerbare indicator is. We geven aan wanneer een tool closed source is en geen sterren heeft. Elke toolnaam in de tabellen linkt naar de officiële download. Naarmate we elk platform in het lab testen, wordt de kolom 'Handleiding' aangevuld met een praktische installatiehandleiding en onze eigen resultaten.

Drie regels voor deze pagina. Ten eerste maken we onderscheid tussen een lokaal model en een lokale agent . Verschillende producten draaien op uw computer, terwijl elke inferentie-aanroep naar een cloud van een leverancier gaat; dat is een privacymaatregel, geen offline-functionaliteit, en die tools worden apart onderaan vermeld in plaats van weggelaten. Ten tweede heeft elke vermelding een realistische minimale hardware-vereiste, omdat "het draait op een laptop" betekenisloos is zonder een geheugenspecificatie. Ten derde houden we in de FAQ bij welke producten niet meer werken, inclusief de datums.

De Keuzes

Ollama-opdrachtregelinterface die een lokaal model uitvoert

Beste algehele lokale LLM-runtime: Ollama

Het standaardantwoord, en het antwoord waarmee de meeste andere tools communiceren. Onder MIT-licentie, ongeveer 179,000 GitHub-sterren, en het levert nu naast de CLI ook een desktop-GUI mee. Het haalt modellen op met één commando, biedt een OpenAI-compatibel eindpunt op localhost en voegde in januari 2026 compatibiliteit met de Anthropic Messages API toe, waarmee gebruikers Claude Code nu naar een lokaal model laten verwijzen. Minimumvereisten: 8 GB systeem-RAM voor een 3B-model, 16 GB voor 7-8B, 24 GB VRAM voor de 30B-klasse.

Het beste voor het benchmarken van hardware: LM Studio

Closed source, dus het heeft geen sterrenwaardering, maar het verdient zijn plek desondanks. LM Studio bundelt zowel llama.cpp als MLX en biedt toegang tot de belangrijke instellingen wanneer je een machine meet in plaats van er een te gebruiken: GPU-offloadlagen, kwantiseringsopties, contextlengte en multi-GPU-gedrag. Het is sinds juli 2025 gratis voor commercieel gebruik. Dit is de tool die ten grondslag ligt aan de meeste tokens-per-seconde-cijfers op onze workstation- en laptoptests. Minimumvereisten: 16 GB RAM; 24 GB VRAM of 32 GB unified memory is aan te raden voor een interessant resultaat.

LM Studio draait een lokaal model op een NVIDIA RTX Pro 6000.

Beste onderliggende engine: llama.cpp

Vrijwel alles op deze pagina is afgeleid van llama.cpp. Het is gelicentieerd onder de MIT-licentie, heeft ongeveer 124,700 sterren en er worden dagelijks meerdere getagde builds gepubliceerd. Het is om een ​​specifieke reden belangrijk voor hardwaregebruikers: de lijst met backends is enorm en omvat CUDA, ROCm, Metal, Vulkan, SYCL, CANN en OpenCL, en engineers van leveranciers dragen nu rechtstreeks bij aan optimalisaties. Een verbetering van de Intel Arc-prefill in build 8688 was ongeveer vijf keer zo waardevol, en elke Ollama- en LM Studio-gebruiker kreeg deze zonder iets te installeren. Minimumvereisten: draait alleen op de CPU; 8 GB RAM is nodig voor bruikbaar gebruik.

Beste desktop-app met prioriteit voor lokale gebruikers: Jan

Apache 2.0, ongeveer 44,100 sterren, versie 0.8.4 (juli 2026). Jan bundelt llama.cpp, dus er hoeft verder niets geïnstalleerd te worden, en het werkt zelfs als de netwerkkabel is losgekoppeld. Dat klinkt misschien als een lage drempel, totdat je bedenkt hoeveel apps in deze categorie cloudclients zijn met een Ollama-veld. Dit is de ideale app voor een collega die nooit een terminal zal openen. Document RAG is het zwakke punt. Minimumvereisten: 8 GB RAM.

Beste lokale document RAG: AnythingLLM

MIT, ongeveer 64,800 sterren. Het bevat een vectordatabase en verwerkt chunking en embedding zonder configuratie, waardoor het de meest gebruiksvriendelijke documentchat voor desktops is. Twee dingen die we niet zullen verzwijgen: een kwetsbaarheid uit maart 2026 met een CVSS-rating van 9.6 maakte het mogelijk om op afstand code uit te voeren via de gestreamde respons van het model zelf. Deze kwetsbaarheid is verholpen in versie 1.11.2, dus update voordat je het gebruikt. Telemetrie is standaard ingeschakeld in een app die als 'local-first' wordt gepresenteerd, maar je kunt deze uitschakelen in de instellingen. Minimumvereisten: 16 GB RAM voor documentverwerking.

Beste zelfgehoste multi-useroplossing: Open WebUI

Ongeveer 149,000 sterren en de meest uitgebreide configuratiemogelijkheden voor het ophalen van informatie vind je hier, met versie 0.11.0 die in juli 2026 wordt uitgebracht. Het is een zelfgehoste server in plaats van een desktopapplicatie, dus Docker is het toegangspunt. Een belangrijk punt om te weten voordat je ermee aan de slag gaat: de licentie is in april 2025 gewijzigd van BSD-3 naar een aangepaste licentie die niet door OSI is goedgekeurd. Deze licentie bevat een clausule die het verwijderen van de Open WebUI-merknaam verbiedt, met een uitzondering voor gebruikers kleiner dan vijftig binnen een periode van dertig dagen. Draai het ongewijzigd op kleine schaal en er verandert niets voor jou. Minimumvereisten: een aparte runtime plus 4 GB voor de container.

Beste lokale codeeragent: Cline

Apache 2.0, ongeveer 63,900 sterren. Cline heeft meer daadwerkelijke engineering verricht aan de lokale oplossing dan welke concurrent dan ook, inclusief een compacte systeemprompt die specifiek is gebouwd voor Ollama en LM Studio en native toolaanroepen per modelfamilie. Hun eigen documentatie is ongebruikelijk openhartig over waar de cloud nog steeds wint. Minimumvereisten: 24 GB VRAM of 36 GB unified memory, en stel de context in op 32K of hoger.

Beste offline terminalprogrammering: Aider

Apache 2.0, met zo'n 48,300 sterren, is architectonisch gezien de meest betrouwbare lokale optie, en dat is niet zonder reden. Aider gebruikt helemaal geen JSON-toolaanroepen. Het parseert diff- en volledige bestandsbewerkingsformaten uit platte tekst, waardoor precies het soort fout wordt vermeden dat de meeste agents op lokale modellen laat vastlopen. Het nadeel is het onderhoud: één auteur schreef 96 procent van de commits en de releasefrequentie is teruggebracht tot ongeveer één stabiele release in 2026. Minimum: 24 GB VRAM of 36 GB gecombineerd.

Beste zelfgehoste agentplatform: OpenHands

MIT, ongeveer 84,500 sterren. OpenHands documenteert lokale modellen correct en, nog nuttiger, vertelt je wanneer het probleem niet aan je configuratie ligt: ​​in de eigen documentatie staat dat als de agent zich als een chatbot gedraagt ​​of constant tools niet aankan, het model de beperkende factor is. Het vereist minimaal 22K contextgeheugen en adviseert 32K. Minimum: 24 GB VRAM voor gekwantiseerde modellen, of 64 GB unified memory.

Beste gratis offline verrassing: GitHub Copilot CLI

Sinds april 2026 werkt de Copilot CLI met Ollama, vLLM en Foundry Local. GitHub-authenticatie is optioneel en een Copilot-abonnement is niet vereist. Door COPILOT_OFFLINE in te stellen, worden alle telemetrie- en netwerkverbindingen gestopt en nemen de subagents uw lokale provider over. De meeste vergelijkingsartikelen vermelden het nog steeds als cloud-only. Let op de splitsing: de IDE-extensie stuurt nog steeds inline-aanvullingen naar de cloud, zelfs bij gebruik van uw eigen sleutel. Minimumvereisten: een model met een contextvenster van 128 KB, dus 32 GB VRAM of 64 GB gecombineerd.

Beste server met leveranciersondersteuning: Lemonade

Apache 2.0, met ongeveer 5,400 sterren, is de enige tool van een fabrikant die we hier op basis van verdienste zouden aanbevelen in plaats van vanwege hardwarevoorkeuren. Het wordt onderhouden door AMD-engineers en draait op NVIDIA CUDA, Apple Metal, Vulkan en gewone CPU's, evenals op Radeon- en Ryzen AI-NPU's. Er verschijnt ongeveer elke twee weken een nieuwe versie en de desktop-app is in april 2026 overgezet van Electron naar Tauri. Minimumvereisten: 16 GB RAM; Ryzen AI 300-serie of nieuwer voor de NPU-variant.

Beste lokale RAG voor het hele bestandssysteem: Nexa AI Hyperlink

Gesloten broncode en gratis. Het indexeert je volledige bestandssysteem op het apparaat en geeft antwoorden met inline citaten. Het staat op deze lijst omdat het de enige nieuwe lokale RAG-tool is met gepubliceerde versnellingscijfers voor consumentenhardware: ongeveer 3x sneller indexeren en 2x snellere inferentie op een RTX 5090, waarbij een map van 1 GB van ongeveer vijftien minuten naar vier of vijf minuten wordt verwerkt. Minimumvereisten: een moderne RTX GPU; 16 GB RAM.

Uitvoeringstijden: Wat voert het model daadwerkelijk uit?

Dit is de engine. Alles in de volgende twee tabellen is een front-end die met een van deze engines communiceert. Gesorteerd op GitHub-sterren.

Runtime Sterren Vergunning Minimale hardware Versnelling Gids
Ollama ~ 179,000 MIT 8 GB RAM (3B), 16 GB (7-8B), 24 GB VRAM (30B-klasse) CUDA, ROCm, Metal, Vulkan Binnenkort beschikbaar
lama.cpp ~ 124,700 MIT 8 GB RAM, alleen de CPU werkt CUDA, ROCm, Metal, Vulkan, SYCL, CANN, OpenCL Binnenkort beschikbaar
MLX / mlx-lm ~ 27,500 MIT Apple Silicon, 16 GB gecombineerd Metaal; CUDA-backend toegevoegd in 2026 Binnenkort beschikbaar
LM Studio Gesloten bron Eigendomsrechtelijk beschermd, vrij te gebruiken voor commerciële doeleinden. 16 GB RAM; 24 GB VRAM of 32 GB gecombineerd Bundelt llama.cpp en MLX Binnenkort beschikbaar
vLLM Productie ten behoeve van Apache 2.0 24 GB VRAM realistische vloer CUDA, ROCm Binnenkort beschikbaar

Desktop-apps en lokale RAG

De apps die een lezer installeert. De kolom 'Lokaal eerst' moet je goed lezen: deze maakt onderscheid tussen software die een model op je computer uitvoert en software die een veld voor een Ollama-URL heeft toegevoegd.

app Sterren Vergunning Lokaal eerst Minimale hardware Gids
Open WebUI ~ 149,000 Op maat gemaakt, niet goedgekeurd door OSI. Geschikt, server, geen desktop Aparte runtime + 4 GB voor de container Binnenkort beschikbaar
AllesLLM ~ 64,800 MIT Geschikt; telemetrie standaard ingeschakeld. RAM 16GB Binnenkort beschikbaar
jan ~ 44,100 Apache 2.0 Ja, bundelt llama.cpp RAM 8GB Binnenkort beschikbaar
LM Studio Gesloten bron Proprietary Ja 16 GB RAM; 24 GB VRAM, dat wordt interessant. Binnenkort beschikbaar
Machtig Gesloten bron Eigendomsrechtelijk beschermd, gratis niveau Ja, bundels Ollama, MLX, llama.cpp RAM 8GB Binnenkort beschikbaar
Nexa AI-hyperlink Gesloten bron Eigendomsrechtelijk beschermd, gratis Ja, indexering op het apparaat zelf. Moderne RTX GPU, 16 GB RAM Binnenkort beschikbaar

Codeer- en agenttools

Dit zijn de meest hardware-intensieve onderdelen op de pagina, omdat agentisch werk een groot contextvenster en lange sessies vereist. Beschouw 32 GB VRAM of 64 GB aan verenigd geheugen als het punt waarop dit geen demonstratie meer is.

Gereedschap Sterren Vergunning Lokaal pad Minimale hardware Gids
OpenHanden ~ 84,500 MIT LM Studio, Ollama, vLLM, SGLang 24 GB VRAM of 64 GB gecombineerd; 32K context Binnenkort beschikbaar
Cline ~ 63,900 Apache 2.0 Ollama, LM Studio, OpenAI-compatibel 24 GB VRAM of 36 GB gecombineerd Binnenkort beschikbaar
Gans ~ 52,900 Apache 2.0 Ollama eersteklas; nu Linux Foundation 24 GB VRAM of 36 GB gecombineerd Binnenkort beschikbaar
aider ~ 48,300 Apache 2.0 Ollama, OpenAI-compatibel; geen toolaanroep 24 GB VRAM of 36 GB gecombineerd Binnenkort beschikbaar
Zed v1.0, april 2026 Apache 2.0 LM Studio, Ollama, llama.cpp 24 GB VRAM of 36 GB gecombineerd Binnenkort beschikbaar
GitHub Copilot-CLI Gesloten bron Eigendomsrechtelijk beschermd, geen abonnement vereist Ollama, vLLM, Foundry Local 32 GB VRAM of 64 GB gecombineerd; 128K context Binnenkort beschikbaar

Initiatieven van leveranciers

Elke chip- en besturingssysteemleverancier levert wel iets voor lokale AI, en deze categorie verdient een eigen post, omdat de naamgeving verwarrend is en het sterftecijfer hoog ligt. Het patroon in 2026 is consistent: de leveranciers zijn gestopt met concurreren met de software van derden en zijn deze juist gaan voeden. NVIDIA heeft beide eigen lokale AI-producten stopgezet en publiceert nu optimalisaties voor Ollama, llama.cpp en ComfyUI. AMD werkt samen met LM Studio. Qualcomm heeft zijn NPU-functionaliteit op de markt gebracht door een applicatie van iemand anders te porteren.

Eén ding dat tools van leveranciers wel kunnen en Ollama en LM Studio niet: ze bereiken de NPU . llama.cpp heeft geen NPU-backend, dus op een AI-machine met Snapdragon of Ryzen-processors laten die tools de neurale engine voor nul procent benut worden. Als je betaald hebt voor 40 tot 60 TOPS, dan maakt alleen een door de leverancier geleverde oplossing daar gebruik van. Stel je verwachtingen echter bij. NPU's halen momenteel een maximum van ongeveer 7 miljard modellen, en de winst zit hem in de batterijduur bij continu gebruik van kleine modellen, niet in de doorvoer. Een aparte GPU is qua snelheid altijd sneller dan een NPU.

Verkoper Wat het is Type Hardware vereist Status Gids
AMD-limonade Server, GUI en SDK; ~5,400 sterren, Apache 2.0 App + server 16 GB RAM; Ryzen AI 300+ als NPU. Draait ook op NVIDIA- en Apple-CPU's. Actief, verzendt ongeveer tweewekelijks. Binnenkort beschikbaar
Intel OpenVINO GenAI Runtime en SDK; ~10,700 sterren SDK Core Ultra, Arc A/B-serie; 16 GB RAM Actief, 2026.3 in augustus 2026 Binnenkort beschikbaar
Apple Foundation-modellen Op het apparaat zelf weergegeven modellen die door het besturingssysteem beschikbaar worden gesteld. OS-framework Apple Silicon; reeds geïnstalleerd Actief; open voor elke aanbieder tijdens WWDC 2026 Binnenkort beschikbaar
Microsoft Foundry Local Lokale inferentie-SDK en CLI; ~2,400 sterren SDK Windows, macOS, Linux; NPU/GPU/CPU GA april 2026; samengestelde modelcatalogus Binnenkort beschikbaar
AMD GAIA Lokale LLM-app voor Ryzen AI; ~1,400 sterren, MIT App + SDK Minimaal een Ryzen AI 300-serie; 16 GB RAM, 64 GB aanbevolen. Actief, v0.20.0 juni 2026 Binnenkort beschikbaar
Intel AI Playground Desktop-app; ~900 sterren app Arc A-serie 8GB+, Arc B-serie, Core Ultra Actief, maar na twee jaar nog steeds in bèta. Binnenkort beschikbaar
Qualcomm GenieX GGUF-runtime op het apparaat zelf voor Snapdragon NPU Runtime Snapdragon X / X Elite, 8 Elite Ontwikkelaarspreview, juli 2026 Binnenkort beschikbaar
NVIDIA Project G-Assist 8B-assistent op het apparaat voor systeembeheer app RTX 20-serie of nieuwer, 6 GB VRAM Actief, maar nog steeds aangeduid als pre-release. Binnenkort beschikbaar

Een opmerking over de naamgeving. NVIDIA's "RTX AI Garage" klinkt als een product, maar dat is het niet; het is een blogserie. De stack van Microsoft is herhaaldelijk hernoemd: Copilot Runtime API's werden Windows AI API's, Azure AI Foundry werd Microsoft Foundry en DirectML bevindt zich nu in de onderhoudsmodus met alleen beveiligingsupdates. Qualcomm AI Hub is een cloudservice waarmee fysieke apparaten op afstand kunnen worden geconfigureerd, niet iets dat je lokaal uitvoert.

Wat gaat er meestal kapot?

Een model met 120B-parameters geladen in LM Studio op een HP Z2 G1a.

De meeste meldingen dat lokale modellen "niet werken" betreffen configuratieproblemen, geen modelproblemen. Vier specifieke problemen zijn verantwoordelijk voor een groot deel ervan, en het zijn alle vier zaken die een hardware-liefhebber zou moeten weten voordat ze de schuld bij de chip leggen.

1. Ollama gebruikt standaard een context van 4,096 tokens. Er wordt geen foutmelding gegenereerd wanneer deze limiet wordt overschreden. De context wordt stilzwijgend afgekapt, waardoor een agentische lus geruisloos stopt. Elk serieus testsysteem heeft meer tokens nodig: OpenHands vereist minimaal 22 en adviseert 32, Codex heeft 32 tokens nodig, Copilot CLI heeft 128 tokens nodig en Cline stelt 262,144 tokens in. Deze ene instelling is waarschijnlijk de meest voorkomende oorzaak van de foutmeldingen die u online zult vinden.

2. KV-cachequantisatie verslechtert met name de aanroep van tools , en dit gebeurt voordat de algemene uitvoerkwaliteit zichtbaar achteruitgaat. De documentatie van llama.cpp waarschuwt hier expliciet voor. Als u een agent gebruikt, schakel deze functie dan uit.

3. Het aantal tools is een steile afgrond, geen geleidelijke helling. Hierboven zijn er ruwweg vijf of zes tools beschikbaar; sommige modellen stoppen stilletjes met het verzenden van geldige JSON-toolaanroepen en beginnen in plaats daarvan XML in de responsbody in te sluiten, wat het testsysteem interpreteert als "geen tool gebruikt". Een populaire agent leverde standaard elf tools mee en verstoorde daarmee zijn eigen aanbevolen model tot begin 2026. Het praktische gevolg is contra-intuïtief: het laden van veel MCP-servers is actief schadelijk voor lokale modellen op een manier die niet het geval is voor grensmodellen.

4. Q4_K_M is de praktische ondergrens. Daaronder neemt de betrouwbaarheid van de toolaanroepen sneller af dan de algemene kwaliteit, waardoor het model weliswaar goed klinkt, maar in werkelijkheid niets doet.

Geheugen is de beperkende factor.

Bij alle tools op deze pagina is de hoeveelheid geheugen die de accelerator kan gebruiken bepalend voor wat je kunt uitvoeren. Dit zijn de combinaties die we het vaakst tegenkomen in experimenten met agentia, en die we zelf in het lab willen verifiëren.

AMD Ryzen AI Halo compact workstation voor lokale LLM-inferentie
Hardware Model Footprint Gerapporteerde doorvoer
RTX 5090, 32 GB Qwen3.6-35B-A3B Q4_K_M ~21 GB 160-180 toks/s, 262K context
RTX 5090, 32 GB Qwen3-Coder-30B-A3B Q4_K_M ~19 GB 50-90 tok/s op 24GB-kaarten
RTX 5090, 32 GB Devstral Small 24B Q4_K_M ~14 GB Speciaal ontworpen voor gereedschapsoproepen
RTX PRO 6000, 96 GB GPT-OSS 120B MXFP4 ~63 GB De 100B-klasse op één enkele workstation-kaart; de GPU uit onze labreview.
RTX PRO 5000 laptop, 24GB GDDR7 Qwen3-Coder-30B-A3B Q4_K_M ~19 GB De grootste laptop-GPU die we hebben getest (ThinkPad P16 Gen 3); de 30B-klasse past er met gemak in.
96-128 GB uniform geheugen, M-serie gpt-oss-120b Q6_K ~93 GB 14-20 tok/s; de schoonste tool-call JSON van elk open-weight model.

Het is belangrijk om te vermelden, omdat de marketing dit niet doet: de grootste open-weight modellen zijn geen workstation-modellen. GLM-5.2 heeft ongeveer 744B parameters en vereist circa 744GB in FP8, wat een datacenter-node met acht GPU's is. Kimi K2 en DeepSeek V4 vallen in dezelfde categorie. Elke handleiding die je aanraadt deze op een desktop te gebruiken, heeft het mis.

De bovenstaande doorvoercijfers zijn afkomstig van gepubliceerde tests door derden en materiaal van leveranciers, en zijn nog geen laboratoriumresultaten van StorageReview. We zullen ze vervangen door onze eigen cijfers zodra elk platform het Guide-proces doorloopt.

Cloud-First Tools, en waarom ze hier niet in de ranglijst staan.

De meeste AI-gebruikers zijn bekend met de populaire en gebruiksvriendelijke online AI-tools. Een lokale agent is geen lokaal model. Elk van deze tools draait op uw eigen computer en stuurt elke inferentie-aanroep naar de cloud van een leverancier.

Gereedschap Lokale modelondersteuning Note
Cursor Nee Volgens de officiële documentatie worden alle verzoeken via Cursor-servers verwerkt; aangepaste toetsen werken alleen met grote cloudproviders en tab-aanvulling maakt altijd gebruik van Cursor-modellen. Overgenomen door SpaceX in 2026.
Devin Desktop (voorheen Windsurf) Nee Hernoemd in juni 2026. Elk model wordt in de cloud gehost.
Google Antigravity Nee In de documentatie staat expliciet vermeld dat Ollama, LM Studio of een aangepast eindpunt niet gebruikt kunnen worden.
Gemini CLI Nee Lokale ondersteuning bestaat alleen in community forks.
Qodo Nee "On-premise" verwijst naar zelfgehoste infrastructuur, terwijl cloudmodellen nog steeds zo worden genoemd.
GitHub Copilot in de IDE Partieel Chat kan gebruikmaken van lokale modellen; inline-aanvullingen blijven in de cloud, zelfs bij een 'bring-your-own-key'-aanpak.
ChatGPT Nee De desktop- en mobiele apps zijn clients voor de cloudmodellen van OpenAI. De open-weight gpt-oss-modellen van OpenAI kunnen wel lokaal worden uitgevoerd, maar via de bovenstaande runtimes, niet via de ChatGPT-app.
Claude Nee Claude-apps en Cowork draaien op de cloudmodellen van Anthropic. Claude Code kan via de Anthropic-compatibele API van Ollama naar een lokaal model worden gekoppeld, wat werkt, maar geen ondersteunde configuratie is.
Algemene agentschapsassistenten Nee De tools in deze categorie draaien op uw eigen computer, maar zijn voor de berekening afhankelijk van een cloudmodel.

Er bestaat een veelvoorkomend genre van handleidingen over "Cursor verbinden met Ollama". De documentatie van Cursor zelf spreekt deze echter tegen. Als offline gebruik voor u een vereiste is, is dat onderscheid cruciaal.

En hoe zit het met het genereren van afbeeldingen en video's?

Lokale beeldgeneratie is een van de grootste communities binnen lokale AI. ComfyUI alleen al overtreft de meeste tools in de bovenstaande ranglijst op basis van GitHub-sterren, en lokale videogeneratie ontpopt zich als de meest VRAM-intensieve consumententaak die er is. Het verdient een eigen ranglijst in plaats van een vierde categorie die aan deze wordt toegevoegd, en die zal er ook komen. Tot die tijd is de hardwarelogica op deze pagina direct van toepassing: beeld- en videobewerking is nog geheugenintensiever dan taalmodellen, en dezelfde niveaus zijn van toepassing.

Hoe deze pagina werkt

Drie regels. Ten eerste, de rangschikking is voorlopig gebaseerd op GitHub-sterren. Het is niet ideaal, maar het is neutraal, verifieerbaar en het vereist niet dat we doen alsof we dingen hebben getest die we niet hebben getest. Tools met gesloten broncode worden als zodanig gemarkeerd in plaats van een verzonnen score te krijgen. Naarmate onze eigen tests duidelijke favorieten opleveren, zal de rangschikking verschuiven om de gemeten resultaten weer te geven, en dat zullen we ook vermelden. Ten tweede, elke vermelding heeft een minimale geheugenvereiste, omdat dat getal bepaalt of een model laadt. Ten derde, de kolom 'Handleiding' is een toezegging: voor elk platform wordt een praktische installatiehandleiding met onze cijfers voor onze hardware beschreven, en de link verschijnt hier zodra deze gepubliceerd is.

Veelgestelde vragen over lokale LLM-tools

Met welke lokale LLM-tool moet ik beginnen?

Ollama is geschikt als je graag in een terminal werkt, LM Studio als je liever een venster met bedieningselementen hebt, en Jan als je iets wilt dat direct werkt en waarvoor je nooit iets hoeft te installeren. Alle drie zijn gratis, alle drie werken volledig offline en alle drie gebruiken llama.cpp als onderliggende code, dus het modelgedrag is hetzelfde. Het verschil zit hem in de interface, niet in de snelheid.

Wat is er gebeurd met NVIDIA ChatRTX, GPT4All en Continue.dev?

Ze zijn verdwenen, samen met een verrassend groot aantal van hun concurrenten, en dit is het allerbelangrijkste om te weten voordat je een oudere aanbeveling opvolgt. NVIDIA ChatRTX is op 21 januari 2026 stopgezet, de repository is gearchiveerd en het ondersteuningsforum is gesloten, zonder dat er een vervanger is genoemd. GPT4All is het lastigste geval: er zijn al twaalf maanden geen commits meer geweest en de laatste release was in februari 2025, maar de repository is niet gearchiveerd en heeft nog steeds een groot aantal sterren, dus het lijkt nog steeds actief. Het ondersteunde slechts een beperkt aantal kwantiseringsformaten en kan de meeste recente modelreleases niet laden. Continue.dev , twee jaar lang de standaardaanbeveling voor programmeren met lokale modellen, werd overgenomen door Cursor en in juni 2026 stopgezet. Roo Code werd in mei 2026 gesloten, Void werd in juni 2026 gearchiveerd, Twinny in november 2025 en Reor in maart 2026. Khoj beëindigde zijn gehoste service in april 2026, hoewel de zelfgehoste versie blijft bestaan. Aan de leverancierskant werd Intel IPEX-LLM in januari 2026 gearchiveerd en gemarkeerd vanwege bekende beveiligingsproblemen zonder gepubliceerd migratieplan, en NVIDIA RTX AI Toolkit werd in november 2025 afgeschreven.

Hoeveel VRAM heb ik nodig om een ​​lokale LLM te draaien?

Voor chattoepassingen draait 8 GB systeem-RAM een 3B-model, en 16 GB draait een 7- tot 8B-model acceptabel op alleen de CPU. Voor bruikbare snelheid is het model in VRAM of unified memory (VRAM) gewenst: 16 GB ondersteunt de 7- tot 14B-klasse, 24 GB bereikt de 30B-klasse in het vierde kwartaal, en met 32 ​​GB of meer is agentisch coderen niet langer frustrerend. Daarboven is capaciteit belangrijker dan bandbreedte, vandaar dat machines met 96 tot 128 GB VRAM modellen draaien die geen enkele consumentenvideokaart aankan.

Maken lokale LLM-tools gebruik van mijn NPU?

Meestal niet. llama.cpp heeft geen NPU-backend, dus Ollama en LM Studio laten de neurale engine op nul procent draaien op een Snapdragon- of Ryzen AI-machine en draaien in plaats daarvan op de CPU of GPU. Om de NPU te bereiken, moet je momenteel een route via een externe leverancier kiezen: Qualcomm GenieX, AMD Lemonade met zijn NPU-runtime, Intel OpenVINO of Apple's Neural Engine via de frameworks van het besturingssysteem. Het is de moeite waard om te weten wat je ermee wint, namelijk een langere batterijduur en een energiezuinige, altijd actieve werking, in plaats van snelheid. NPU's hebben tegenwoordig ook niet veel rekenkracht, en een aparte GPU zal qua doorvoer altijd beter presteren.

Moet ik lokale AI op Windows of Linux draaien?

Voor de desktop-apps op deze pagina zijn Windows en macOS de meest soepele keuze. LM Studio, Jan, AnythingLLM en Ollama kunnen allemaal native worden geïnstalleerd, GPU-drivers zijn verkrijgbaar via de gebruikelijke kanalen en er is geen terminal nodig. Linux bewijst zijn waarde een niveau lager: de productieserverengines, vLLM en SGLang, zijn primair voor Linux ontwikkeld, multi-GPU-servers gaan er in feite vanuit dat Linux beschikbaar is, en enkele van de nieuwste acceleratiepaden verschijnen daar als eerste, waaronder AMD's Ryzen AI NPU-ondersteuning, die op Linux is uitgebracht en een zeer recente kernel vereist. Het verschil is kleiner dan voorheen. AMD heeft zijn ROCm-releases in 2026 geharmoniseerd voor Windows en Linux, en WSL2 dekt het grootste deel van de rest, waardoor op Docker gebaseerde tools zoals Open WebUI probleemloos op een Windows-machine draaien. De praktische regel: als je installeert vanuit de tabel met desktop-apps, blijf dan op het besturingssysteem dat je al hebt; als je een dedicated server bouwt of alle acceleratiepaden wilt benutten, bouw het dan op Linux.

Zijn lokale modellen goed genoeg om een ​​cloudmodel voor programmeren te vervangen?

Het hangt volledig af van de taak, en het verschil is groter dan de meeste onderzoeken doen vermoeden. Bij afgebakende taken, zoals het genereren van afzonderlijke bestanden, unit tests, boilerplate-code en het uitleggen van code, presteren de huidige open-source modellen op een goed werkstation ongeveer even goed als de nieuwste cloudmodellen. Bij langdurige, agent-gebaseerde taken, zoals refactoring van meerdere bestanden in een grote repository, verliezen ze het duidelijk, en de faalmodi zijn van de onaangename soort: stille no-ops en vol vertrouwen gerapporteerd werk dat nooit is uitgevoerd. Als uw reden voor lokale ontwikkeling privacy, air-gap-vereisten of kosten zijn, is het vandaag de dag haalbaar. Als uw reden mogelijkheden zijn, is het nog niet haalbaar.

Is het veiliger om een ​​model lokaal uit te voeren dan via een cloudservice?

Voor dataopslag is dat zeker het geval, en dat is meestal ook de bedoeling. Voor softwarebeveiliging is dat echter niet automatisch zo. Een lokale AI-app met een CVSS-score van 9.6 in maart 2026 zou door de gestreamde output van het model zelf code op de host kunnen uitvoeren, omdat de desktop-app standaard met onveilige instellingen was verpakt. Lokaal betekent dat je data op de eigen locatie blijft. Het betekent niet dat de software gehard is, en in deze categorie wordt veel snel veranderende code geleverd.

Wat is een AI-agent-sandbox en heb ik er een nodig voor lokale AI?

Een sandbox is een geïsoleerde omgeving, meestal een container of een lichtgewicht virtuele machine, waarin een AI-agent de commando's en code uitvoert die hij genereert. Hierdoor kan een fout of een kwaadaardige instructie het hostsysteem niet bereiken. Sandboxing is nodig omdat agents niet alleen vragen beantwoorden; ze voeren shellcommando's uit, bewerken bestanden en browsen, en al deze acties worden aangestuurd door modeloutput die gemanipuleerd kan worden. Het lokaal uitvoeren van het model verandert daar niets aan. Sandboxing gaat over het isoleren van wat de agent doet, niet waar het model zich bevindt, en de hierboven beschreven kwetsbaarheid voor code-executie illustreerde dit punt perfect bij een applicatie die primair lokaal draait. Sommige tools op deze pagina worden geleverd met ingebouwde sandboxing, en de tools die agents uitvoeren met onbeperkte toegang tot de host verdienen een nadere beschouwing voordat ze worden ingezet op een machine die voor u van belang is. Naarmate agents steeds vaker in zakelijke omgevingen worden gebruikt, zal sandboxing naar verwachting een belangrijk kenmerk worden in plaats van een bijzaak, en zullen we het meewegen in onze evaluatie van deze tools.

Kan lokale hardware agentische workloads met tientallen subagents uitvoeren?

Dit is de grens, en het eerlijke antwoord is dat een enkel werkstation snel vol raakt. Multi-agent workloads genereren sub-agents die elk hun eigen context bevatten, en aan de inferentiekant betekent elke actieve context een eigen KV-cache in het geheugen, waardoor de footprint schaalt met de gelijktijdigheid, niet alleen met de modelgrootte. Waar die caches naartoe gaan wanneer ze het geheugen ontgroeien, is een eigen technische uitdaging; onze diepgaande analyse van KV-cache-offload naar flashgeheugen , gebouwd op Dell- en Solidigm-hardware, is de beste behandeling van dit onderwerp die we tot nu toe hebben gepubliceerd. Een machine die comfortabel één agent-sessie van de 30B-klasse kan verwerken, kan doorgaans een paar parallelle sessies via een batchserver aan voordat de latentie verslechtert; tientallen gelijktijdige sub-agents is servergebied, met voldoende geheugen om veel actieve contexten te bevatten en een serverengine zoals vLLM die is ontworpen voor continue batchverwerking. Er is ook een kwaliteitsplafond: lokale modellen verliezen al aan betrouwbaarheid naarmate het aantal tools toeneemt, en orchestratie vermenigvuldigt tools en overdrachten. Wij zijn van mening dat werk met één of enkele agenten tegenwoordig een legitieme taak is voor een werkstation, terwijl grote vloten van subagenten een infrastructuurtaak vormen. Die grens, en de hardware die nodig is om die te overschrijden, willen we in de toekomst veel dieper onderzoeken.