StorageReview.com

Bästa lokala LLM-verktygen år 2026: Körtider, appar och agenter

Uppdaterad 19 augusti 2026: Första publikationen. Forskningen är aktuell från och med detta datum.

Det finns fyra skäl att köra en språkmodell på din egen hårdvara istället för i en webbläsarflik, och bara en av dem är ideologisk. Integritet: ett dokument du lämnar till en lokal modell lämnar aldrig maskinen, vilket är hela konversationen för klientkod, kontrakt, patientdata och outgivna produkter. Kostnadsstruktur: moln-AI mäts och agentiska arbetsbelastningar multipliceras med tokenantal tillräckligt snabbt för att en kapabel arbetsstation kan betala för sig själv; hårdvara du äger körs till elpriset. Tillgänglighet: inga tariffgränser, inga avbrott, inget e-postmeddelande om utfasning som ändrar ditt arbetsflöde på en tisdag. Och kontroll: den modell du validerade är den modell du kör tills du bestämmer dig för annat.

Motvikten är att molnmodeller i frontlinjen fortfarande är mer kapabla, och för långsiktigt agentarbete är gapet verkligt. Där lokala modeller har nått paritet är begränsat arbete: chatt, sammanfattningar, kod i en enda fil och frågor och svar om dokument. Det råkar vara det mesta av vad de flesta gör hela dagarna. Om din drivkraft är maximal kapacitet till varje pris, använd molnet. Om din drivkraft är integritet, kostnad eller kontroll är lokalt gångbart idag, och den här sidan är kartan.

Den inramningen bör avgöra din hårdvarubudget, eftersom lokala AI-utgifter är ett minnesbeslut framför allt annat. 16 GB VRAM eller 32 GB enhetligt minne täcker 7 till 8B-klassen, vilket hanterar det begränsade arbetet ovan. 24 till 32 GB VRAM, eller 48 GB enhetligt, når 30B-klassen där agentkodning slutar vara en demo. 96 till 128 GB enhetligt minne kör modellerna över 100B som närmar sig frontlinjekvalitet. Att köpa för mycket köper hastighet som du kanske inte märker; att köpa för lite innebär att den modellklass du ville ha aldrig laddas alls. Våra " Bästa bärbara datorer för lokal AI" och "Bästa stationära datorer för lokala AI- kort" rangordnar maskinerna efter nivå. Den här sidan beskriver vad som ska köras på dem.

Programvarusidan har inte mognat lika smidigt som hårdvaran. Ungefär en tredjedel av de verktyg du hittar rekommenderade i ett sökresultat idag är döda, och de flesta sidor som rekommenderar dem har inte märkt det.

Den här sidan spårar vad som fungerar och på vilken hårdvara, från och med augusti 2026. Vi rangordnar efter GitHub-stjärnor för tillfället, eftersom det är en neutral och verifierbar signal, och vi säger när ett verktyg är sluten källkod och inte har något stjärnantal att ge. Varje verktygsnamn i tabellerna länkar till dess officiella nedladdning. När vi testar varje plattform fylls Guide-kolumnen i med en praktisk installationsgenomgång och våra egna siffror.

Tre regler för den här sidan. För det första skiljer vi på en lokal modell från en lokal agent . Flera produkter körs på din maskin medan varje inferensanrop går till ett leverantörsmoln; det är en integritetspolicy, inte offline-funktion, och dessa verktyg listas separat längst ner snarare än tas bort. För det andra har varje post ett realistiskt hårdvaruminimum, eftersom "den körs på en bärbar dator" är meningslöst utan en minnessiffra. För det tredje spårar vi vad som dog, med datum, i FAQ.

Valen

Ollamas kommandoradsgränssnitt som kör en lokal modell

Bästa lokala LLM-körtid totalt: Ollama

Standardsvaret, och det som de flesta andra verktyg kommunicerar med. MIT-licensierad, ungefär 179 000 GitHub-stjärnor, och den levererar nu ett skrivbordsgränssnitt bredvid CLI. Den hämtar modeller med ett kommando, exponerar en OpenAI-kompatibel slutpunkt på localhost, och i januari 2026 lade den till Anthropic Messages API-kompatibilitet, vilket är hur folk nu pekar Claude Code mot en lokal modell. Minimum: 8 GB system-RAM för en 3B-modell, 16 GB för 7-8B, 24 GB VRAM för 30B-klassen.

Bäst för benchmarking av hårdvara: LM Studio

Sluten källkod, så den har inget stjärnantal, och den förtjänar sin plats ändå. LM Studio paketerar både llama.cpp och MLX och exponerar de kontroller som är viktiga när du mäter en maskin istället för att använda en: GPU-avlastningslager, kvantiseringsval, kontextlängd och beteende hos flera GPU:er. Det har varit gratis för kommersiellt bruk sedan juli 2025. Detta är verktyget bakom de flesta tokens-per-sekund-siffrorna på våra arbetsstations- och bärbara datorkort. Minimum: 16 GB RAM; 24 GB VRAM eller 32 GB enhetligt minne för att vara intressant.

LM Studio kör en lokal modell på ett NVIDIA RTX Pro 6000

Bästa underliggande motor: llama.cpp

Nästan allt annat på den här sidan är nedströms llama.cpp. MIT-licensierad, ungefär 124 700 stjärnor, med flera taggade versioner publicerade per dag. Det är viktigt för en hårdvarupublik av en specifik anledning: backend-listan är enorm och täcker CUDA, ROCm, Metal, Vulkan, SYCL, CANN och OpenCL, och leverantörsingenjörer bidrar nu med optimeringar direkt till den. En Intel Arc-förfyllningsförbättring i version 8688 var värd ungefär 5 gånger, och varje Ollama- och LM Studio-användare fick den utan att installera någonting. Minimum: körs på enbart CPU; 8 GB RAM för att vara användbar.

Bästa lokala skrivbordsapp: Jan

Apache 2.0, ungefär 44 100 stjärnor, v0.8.4 från och med juli 2026. Jan paketerar llama.cpp, så det finns inget annat att installera, och det fungerar med nätverkskabeln utdragen. Det låter som en låg ribba tills man kollar hur många appar i den här kategorin som är molnklienter med ett Ollama-fält. Det här är den man ska ge till en kollega som aldrig öppnar en terminal. Document RAG är dess svaga punkt. Minst: 8 GB RAM.

Bästa lokala dokument-RAG: AnythingLLM

MIT, ungefär 64 800 stjärnor. Den paketerar en vektordatabas och hanterar chunking och inbäddning utan konfiguration, vilket gör den till den mest kompletta dokumentchatten i skrivbordsklassen. Två saker vi inte kommer att begrava: en sårbarhet från mars 2026, klassad CVSS 9.6, tillät fjärrkodkörning utlöst av modellens eget strömmande svar, åtgärdat i 1.11.2, så uppdatera innan du använder det. Och telemetri levereras som standard i en app som marknadsförs som lokalt först, vilket du stänger av i Inställningar. Minst: 16 GB RAM för dokumentarbete.

Bästa självhostade fleranvändargränssnitt: Open WebUI

Ungefär 149 000 stjärnor och den djupaste hämtningskonfigurationsmöjligheten här, med v0.11.0 som levereras i juli 2026. Det är en självhostad server snarare än en skrivbordsapp, så Docker är startpunkten. En sak att veta innan du bygger vidare på den: licensen ändrades i april 2025 från BSD-3 till en anpassad licens som inte är OSI-godkänd, med en klausul mot att ta bort Open WebUI-varumärket, med ett undantag för under femtio användare under ett trettiodagarsfönster. Kör det omodifierat i liten skala, och ingenting ändras för dig. Minimum: en separat runtime plus 4 GB för containern.

Bästa lokala kodningsagenten: Cline

Apache 2.0, ungefär 63 900 stjärnor. Cline har gjort mer verklig ingenjörskonst på den lokala vägen än någon konkurrent, inklusive en kompakt systemprompt byggd specifikt för Ollama och LM Studio och inbyggda verktygsanrop per modellfamilj. Deras egen dokumentation är ovanligt uppriktig om var molnet fortfarande vinner. Minimum: 24 GB VRAM eller 36 GB enhetligt minne, och inställt kontext till 32 K eller högre.

Bästa offline-terminalkodning: Aider

Apache 2.0, ungefär 48 300 stjärnor, och arkitekturmässigt det mest pålitliga lokala alternativet av en anledning värd att förstå. Aider använder inte JSON-verktygsanrop alls. Den analyserar diff- och helfilsredigeringsformat från vanlig text, vilket kringgår exakt det felläge som förstör de flesta agenter på lokala modeller. Förbehållet är underhåll: en enda författare skrev 96 procent av commits, och releasekadensen har kollapsat till ungefär en stabil release år 2026. Minimum: 24 GB VRAM eller 36 GB unified.

Bästa självhostade agentplattform: OpenHands

MIT, ungefär 84 500 stjärnor. OpenHands dokumenterar lokala modeller korrekt och, ännu mer användbart, berättar när problemet inte är din konfiguration: deras egna dokument anger att om agenten beter sig som en chatbot eller ständigt misslyckas med verktyg, är modellen begränsningen. De vill ha ett minimum av 22K kontext och rekommenderar 32K. Minimum: 24 GB VRAM för kvantiserade modeller, eller 64 GB enhetligt minne.

Bästa gratis offline-överraskning: GitHub Copilot CLI

Sedan april 2026 körs Copilot CLI mot Ollama, vLLM och Foundry Local. GitHub-autentisering är valfri och ingen Copilot-prenumeration krävs. Om COPILOT_OFFLINE ställs in stoppas all telemetri och nätverkskontakt, och dess underagenter ärver din lokala leverantör. De flesta jämförelseartiklar listar det fortfarande som endast molnbaserat. Observera uppdelningen: IDE-tillägget skickar fortfarande inline-kompletteringar till molnet även under "bring-your-own-key". Minimum: en modell med ett kontextfönster på 128K, så 32 GB VRAM eller 64 GB enhetligt.

Bästa leverantörsstödda server: Lemonade

Apache 2.0, ungefär 5 400 stjärnor, och det enda leverantörsnära verktyget här som vi skulle rekommendera på meriter snarare än hårdvarulojalitet. AMD-ingenjörer underhåller det, och det körs på NVIDIA CUDA, Apple Metal, Vulkan och vanliga processorer samt på Radeon och Ryzen AI NPU:er. Det levereras ungefär varannan vecka och flyttade sin skrivbordsapp från Electron till Tauri i april 2026. Minst: 16 GB RAM; Ryzen AI 300-serien eller senare för NPU-sökvägen.

Bästa filsystemomfattande lokala RAG: Nexa AI Hyperlink

Sluten källkod och gratis. Den indexerar hela ditt filsystem på enheten och svarar med inline-citat. Den finns med på den här listan eftersom det är det enda nya lokala RAG-verktyget med publicerade accelerationssiffror på konsumenthårdvara: ungefär 3 gånger snabbare indexering och 2 gånger snabbare inferens på ett RTX 5090, där en 1 GB-mapp minskar från cirka femton minuter till fyra eller fem. Minimum: ett modernt RTX-GPU; 16 GB RAM.

Körtider: Vad som faktiskt kör modellen

Detta är motorn. Allt i de nästföljande två tabellerna är ett användargränssnitt som kommunicerar med en av dessa. Sorterat efter GitHub-stjärnor.

Runtime Stjärnor Licens Minsta hårdvara Acceleration guide
Ollama ~ 179,000 MIT 8 GB RAM (3 GB), 16 GB (7–8 GB), 24 GB VRAM (klass 30 GB) CUDA, ROCm, Metal, Vulkan Kommer snart
call.cpp ~ 124,700 MIT 8 GB RAM, fungerar endast med CPU CUDA, ROCm, Metal, Vulkan, SYCL, CANN, OpenCL Kommer snart
MLX / mlx-lm ~ 27,500 MIT Apple Silicon, 16 GB enhetligt minne Metal; CUDA-backend tillagd 2026 Kommer snart
LM Studio Sluten källa Egenutvecklad, fri för kommersiellt bruk 16 GB RAM; 24 GB VRAM eller 32 GB enhetligt minne Paketerar llama.cpp och MLX Kommer snart
vLLM Produktionsservering Apache 2.0 24 GB VRAM realistiskt golv CUDA, ROCm Kommer snart

Skrivbordsappar och lokal RAG

Apparna som en läsare installerar. Kolumnen Local-First är den du ska läsa noggrant: den skiljer programvara som kör en modell på din dator från programvara som har lagt till ett fält för en Ollama-URL.

Applikation Stjärnor Licens Lokalt först Minsta hårdvara guide
Öppna WebUI ~ 149,000 Anpassad, inte OSI-godkänd Kapabel, server, inte stationär Separat runtime + 4 GB för container Kommer snart
Vad som helst LLM ~ 64,800 MIT Kompatibel; telemetri aktiverad som standard 16GB RAM Kommer snart
jan ~ 44,100 Apache 2.0 Ja, paketerar llama.cpp 8GB RAM Kommer snart
LM Studio Sluten källa Patentskyddad Ja 16 GB RAM; 24 GB VRAM för att vara intressant Kommer snart
Msty Sluten källa Proprietär, gratis nivå Ja, paket Ollama, MLX, llama.cpp 8GB RAM Kommer snart
Nexa AI-hyperlänk Sluten källa Egenutvecklad, gratis Ja, indexering på enheten Modern RTX-grafikkort, 16 GB RAM Kommer snart

Kodnings- och agentverktyg

Det här är de mest hårdvarukrävande inläggen på sidan, eftersom agentarbete behöver ett stort kontextfönster och långa sessioner. Betrakta 32 GB VRAM eller 64 GB enhetligt minne som den punkt där detta slutar vara en demo.

Verktyget Stjärnor Licens Lokal väg Minsta hårdvara guide
ÖppnaHänder ~ 84,500 MIT LM Studio, Ollama, vLLM, SGLang 24 GB VRAM eller 64 GB enhetligt minne; 32 000 kontextminne Kommer snart
Cline ~ 63,900 Apache 2.0 Ollama, LM Studio, OpenAI-kompatibel 24 GB VRAM eller 36 GB enhetligt minne Kommer snart
Goose ~ 52,900 Apache 2.0 Ollama förstklassig; nu Linux Foundation 24 GB VRAM eller 36 GB enhetligt minne Kommer snart
hjälpa ~ 48,300 Apache 2.0 Ollama, OpenAI-kompatibel; inga verktygsanrop 24 GB VRAM eller 36 GB enhetligt minne Kommer snart
Zed v1.0, april 2026 Apache 2.0 LM Studio, Ollama, llama.cpp 24 GB VRAM eller 36 GB enhetligt minne Kommer snart
GitHub Copilot CLI Sluten källa Proprietär, ingen prenumeration krävs Ollama, vLLM, lokal gjuteriexpert 32 GB VRAM eller 64 GB enhetligt minne; 128 000 kontextminne Kommer snart

Leverantörsinitiativ

Varje leverantör av kisel och operativsystem levererar något för lokal AI, och kategorin förtjänar en egen artikel eftersom namngivningen är förvirrande och dödligheten är hög. Mönstret under 2026 är konsekvent: leverantörerna slutade konkurrera med tredjepartsstacken och började mata den. NVIDIA tog bort båda sina egna lokala AI-produkter och publicerar nu optimeringar för Ollama, llama.cpp och ComfyUI. AMD samarbetar med LM Studio. Qualcomm levererade sin NPU-kapacitet genom att porta någon annans app.

Det enda som leverantörsverktyg gör som Ollama och LM Studio inte kan: nå NPU:n . llama.cpp har ingen NPU-backend, så på en Snapdragon- eller Ryzen AI-maskin lämnar dessa verktyg den neurala motorn vid noll procents utnyttjande. Om du betalade för 40 till 60 TOPS är det bara en leverantörsväg som använder den. Sätt dock förväntningar. NPU:er når för närvarande runt 7B-modeller, och vinsten är batteritiden på ständigt påslagna småmodellsarbete, inte dataflödet. En diskret GPU slår NPU:n på hastighet varje gång.

Leverantör Vad det är Typ Hårdvara krävs Status guide
AMD-lemonad Server, GUI och SDK; ~5 400 stjärnor, Apache 2.0 App + server 16 GB RAM; Ryzen AI 300+ för NPU. Körs även med NVIDIA, Apple och processorer Aktiv, skickas ~varannan vecka Kommer snart
Intel OpenVINO GenAI Körtid och SDK; ~10 700 stjärnor SDK Core Ultra, Arc A/B-serien; 16 GB RAM Aktiv, 2026.3 i augusti 2026 Kommer snart
Apple Foundation-modeller Modeller på enheten som exponeras av operativsystemet OS-ramverk Apple Silicon; redan installerat Aktiv; öppen för alla leverantörer vid WWDC 2026 Kommer snart
Microsoft Foundry Local Lokal inferens-SDK och CLI; ~2 400 stjärnor SDK Windows, macOS, Linux; NPU/GPU/CPU GA april 2026; kurerad modellkatalog Kommer snart
AMD GAIA Lokal LLM-app för Ryzen AI; ~1 400 stjärnor, MIT App + SDK Ryzen AI 300-serien minst; 16 GB RAM, 64 GB rekommenderas Aktiv, v0.20.0 juni 2026 Kommer snart
Intel AI Playground Skrivbordsapp; ~900 stjärnor Applikation Arc A-serien 8 GB+, Arc B-serien, Core Ultra Aktiv men fortfarande beta efter två år Kommer snart
Qualcomm GenieX GGUF-körtid på enheten för Snapdragon NPU Runtime Snapdragon X / X Elite, 8 Elite Förhandsvisning för utvecklare, juli 2026 Kommer snart
NVIDIA Project G-Assist Enhetsbaserad 8B-assistent för systemkontroll Applikation RTX 20-serien eller senare, 6 GB VRAM Aktiv men fortfarande märkt som förhandsrelease Kommer snart

En anmärkning om namngivning. NVIDIAs "RTX AI Garage" låter som en produkt och är det inte; det är en bloggserie. Microsofts stack har bytt namn upprepade gånger: Copilot Runtime API:er blev Windows AI API:er, Azure AI Foundry blev Microsoft Foundry och DirectML är nu i underhållsläge med endast säkerhetsfixar. Qualcomm AI Hub är en molntjänst som tillhandahåller fysiska enheter på distans, inte något du kör lokalt.

Det som vanligtvis går sönder

En 120B-parametermodell laddad i LM Studio på en HP Z2 G1a

De flesta rapporter om att lokala modeller "inte fungerar" är konfigurationsproblem, inte modellproblem. Fyra i synnerhet står för en stor andel av dem, och alla fyra är saker en hårdvarupublik bör känna till innan de skyller på kiseln.

1. Ollama använder som standard en kontext med 4 096 tokens. Den genererar inget fel när du överskrider den. Den avkortas tyst, och en agentisk loop dör tyst. Varje seriös harness behöver mer: OpenHands vill ha minst 22K och rekommenderar 32K, Codex behöver 32K, Copilot CLI behöver 128K och Cline sätter 262 144. Denna enda inställning är förmodligen den vanligaste orsaken till de felrapporter du hittar online.

2. KV-cachekvantisering försämrar specifikt verktygsanrop , och det gör den innan den allmänna utdatakvaliteten synbart försämras. Dokumentationen llama.cpp varnar direkt för det. Om du kör en agent, stäng av den.

3. Verktygsantalet är en klippa, inte en lutning. Ovanför omfattas ungefär fem eller sex verktyg; vissa modeller slutar tyst att skicka ut giltiga JSON-verktygsanrop och börjar istället bädda in XML i svarstexten, vilket i verktygsraden står som "inget verktyg använt". En populär agent levererade elva verktyg som standard och bröt sin egen rekommenderade modell fram till början av 2026. Den praktiska konsekvensen är kontraintuitiv: att ladda många MCP-servrar är aktivt skadligt på lokala modeller på ett sätt som det inte är på frontmodeller.

4. Q4_K_M är det praktiska golvet. Under det faller verktygskvalitetens tillförlitlighet snabbare än den allmänna kvaliteten, så modellen låter fortfarande bra men gör i tysthet ingenting.

Minne är begränsningen

För alla verktyg på den här sidan är frågan som avgör vad du kan köra hur mycket minne acceleratorn kan se. Det här är de parningar vi ser citerade oftast för agentarbete, och de vi avser att verifiera i labbet.

AMD Ryzen AI Halo kompakt arbetsstation för lokal LLM-inferens
hårdvara Modell Fotavtryck Rapporterad genomströmning
RTX 5090, 32 GB Qwen3.6-35B-A3B Q4_K_M ~21 GB 160–180 tok/s, 262K kontext
RTX 5090, 32 GB Qwen3-Kodare-30B-A3B Q4_K_M ~19 GB 50-90 tok/s på 24GB-klass
RTX 5090, 32 GB Devstral Small 24B Q4_K_M ~14 GB Specialbyggd för verktygsanrop
RTX PRO 6000, 96 GB GPT-OSS 120B MXFP4 ~63 GB 100B-klassen på ett enda arbetsstationskort; GPU:n från vår labbgranskning
RTX PRO 5000 bärbar dator, 24 GB GDDR7 Qwen3-Kodare-30B-A3B Q4_K_M ~19 GB Största bärbara grafikkort vi testat (ThinkPad P16 Gen 3); 30B-klassen passar in i kontexten för att spara
96–128 GB enhetlig, M-serien gpt-oss-120b Q6_K ~93 GB 14–20 tok/s; renaste verktygsanrops-JSON av alla öppna viktmodeller

Värt att säga, eftersom marknadsföringen inte gör det: de största modellerna med öppen vikt är inte arbetsstationsmodeller. GLM-5.2 har ungefär 744B parametrar och behöver i storleksordningen 744 GB i FP8, vilket är en datacenternod med åtta GPU:er. Kimi K2 och DeepSeek V4 tillhör samma kategori. Alla guider som säger att du ska köra dessa på en stationär dator är fel.

Dataflödessiffrorna ovan är hämtade från publicerade tredjepartstester och leverantörsmaterial och är ännu inte resultat från StorageReview-labb. Vi kommer att ersätta dem med våra egna siffror allt eftersom varje plattform går igenom guideprocessen.

Molnbaserade verktyg och varför de inte rankas här

De flesta AI-användare är bekanta med de populära och lättanvända AI-verktygen online. En lokal agent är inte en lokal modell. Var och en av dessa körs på din maskin samtidigt som varje inferensanrop skickas till ett leverantörsmoln.

Verktyget Stöd för lokal modell Anmärkningar
Markör Nej Officiella dokument anger att alla förfrågningar går via Cursor-servrar; anpassade nycklar fungerar endast med större molnleverantörer, och tabbkomplettering använder alltid Cursor-modeller. Förvärvades av SpaceX 2026
Devin Desktop (tidigare Windsurf) Nej Bytte namn i juni 2026. Varje modell är molnbaserad.
Google Antigravitation Nej Dokumentationen anger uttryckligen att den inte kan använda Ollama, LM Studio eller en anpassad slutpunkt.
Gemini CLI Nej Lokalt stöd finns endast i community gafflar
Qodo Nej ”On-prem” avser självhostad infrastruktur som fortfarande anropar molnmodeller.
GitHub Copilot i IDE:n Partiell Chatten kan använda lokala modeller; inline-kompletteringar förblir molnbaserade även med "bring-your-own-key"
ChatGPT Nej Skrivbords- och mobilapparna är klienter för OpenAI:s molnmodeller. OpenAI:s öppna gpt-oss-modeller körs lokalt, men genom körtiderna ovan, inte genom ChatGPT-appen.
Claude Nej Claude-appar och Cowork körs på Anthropics molnmodeller. Claude Code kan pekas mot en lokal modell via Ollamas Anthropic-kompatibla API, vilket fungerar men är en konfiguration som inte stöds.
Allmänna agentassistenter Nej Verktyg i den här klassen körs på din dator men är beroende av en molnmodell för resonemang

Det finns en flitigt återkommande genre av guider som "anslut markören till Ollama". Cursors egen dokumentation motsäger dem. Om offline-drift är ett krav för dig, är den skillnaden hela poängen.

Vad gäller bild- och videogenerering?

Lokal bildgenerering är en av de största communitiesna inom lokal AI. ComfyUI ensamt överväger de flesta verktygen som rankas ovan av GitHub-stjärnor, och lokal videogenerering framstår som den mest VRAM-krävande konsumentarbetsbelastningen som finns. Den förtjänar en egen topplista snarare än en fjärde kategori som fästs på denna, och den kommer att få en. Fram till dess överförs hårdvarulogiken på den här sidan direkt: bild- och videoarbete är ännu mer minnesbundet än språkmodeller, och samma nivåer gäller.

Så här fungerar den här sidan

Tre regler. För det första, rankningen sker för närvarande efter GitHub-stjärnor. Det är inte idealiskt, men det är neutralt, verifierbart och kräver inte att vi låtsas att vi har testat saker vi inte har. Verktyg med sluten källkod markeras som sådana snarare än att ges en påhittad poäng. Eftersom våra egna tester ger tydliga favoriter kommer ordningen att ändras för att återspegla uppmätta resultat, och vi kommer att säga det. För det andra har varje post ett minimumminne, eftersom det är det numret som avgör om en modell laddas. För det tredje är Guide-kolumnen ett åtagande: varje plattform får en praktisk genomgång av installationen med våra siffror på vår hårdvara, och länken visas här när den publiceras.

Vanliga frågor om lokala LLM-verktyg

Vilket lokalt LLM-verktyg ska jag börja med?

Ollama om du är bekväm i en terminal, LM Studio om du hellre vill ha ett fönster med kontroller, och Jan om du vill ha något som fungerar direkt ur lådan och aldrig ber dig installera något annat. Alla tre är gratis, alla tre körs helt offline, och alla tre använder llama.cpp under, så modellens beteende är detsamma. Skillnaden är gränssnittet, inte hastigheten.

Vad hände med NVIDIA ChatRTX, GPT4All och Continue.dev?

De är borta, tillsammans med ett förvånansvärt antal av sina konkurrenter, och detta är det absolut viktigaste att veta innan man följer en äldre rekommendation. NVIDIA ChatRTX avvecklades den 21 januari 2026, dess arkiv arkiverades och dess supportforum låstes, utan någon namngiven ersättare. GPT4All är det knepigaste fallet: det har inte haft några commits på tolv månader, och dess senaste utgåva var februari 2025, men arkivet är inte arkiverat och visar fortfarande ett stort antal stjärnor, så det ser levande ut. Det stödde bara en smal uppsättning kvantiseringsformat och kan inte ladda de flesta aktuella modellutgåvor. Continue.dev , som i två år var standardrekommendationen för lokal modellkodning, förvärvades av Cursor och avvecklades i juni 2026. Roo Code stängdes ner i maj 2026, Void arkiverades i juni 2026, Twinny i november 2025 och Reor i mars 2026. Khoj lade ner sin hostade tjänst i april 2026, även om den självhostade versionen finns kvar. På leverantörssidan arkiverades Intel IPEX-LLM i januari 2026 och flaggades för kända säkerhetsproblem utan publicerad migreringsväg, och NVIDIA RTX AI Toolkit avvecklades i november 2025.

Hur mycket VRAM behöver jag för att köra en lokal LLM?

För chatt kör 8 GB system-RAM en 3B-modell, och 16 GB kör en 7 till 8B-modell acceptabelt på enbart processorn. För användbar hastighet vill du ha modellen i VRAM eller enhetligt minne: 16 GB hanterar 7 till 14B-klassen, 24 GB når 30B-klassen vid Q4, och 32 GB eller mer är där agentkodning slutar vara frustrerande. Över det spelar kapacitet större roll än bandbredd, vilket är anledningen till att maskiner med 96 till 128 GB enhetligt minne kör modeller som inget konsumentgrafikkort kan hantera.

Använder lokala LLM-verktyg min NPU?

Vanligtvis inte. llama.cpp har ingen NPU-backend, så Ollama och LM Studio kommer att lämna neuralmotorn på noll procent på en Snapdragon- eller Ryzen AI-maskin och köra på CPU eller GPU istället. För att nå NPU:n krävs för närvarande en leverantörsväg: Qualcomm GenieX, AMD Lemonade med sin NPU-körtid, Intel OpenVINO eller Apples Neural Engine genom operativsystemramverken. Det är värt att veta vad du vinner, vilket är batteritid och låg strömförbrukning och alltid påslagen drift snarare än hastighet. NPU:er toppar också runt 7B-modeller idag, och en diskret GPU kommer att slå en på dataflöde varje gång.

Ska jag köra lokal AI på Windows eller Linux?

För skrivbordsapparna på den här sidan är Windows och macOS den smidigare resan. LM Studio, Jan, AnythingLLM och Ollama installeras alla direkt, GPU-drivrutiner kommer från de vanliga platserna, och ingenting kräver en terminal. Linux förtjänar sin plats en nivå lägre: produktionsservermotorerna, vLLM och SGLang, är Linux-först, multi-GPU-server tar effektivt över det, och några av de nyaste accelerationsvägarna landar där före någon annanstans, inklusive AMD:s Ryzen AI NPU-stöd, som kom på Linux och vill ha en mycket ny kärna. Gapet är mindre än det brukade vara. AMD enhetligade sina ROCm-utgåvor över Windows och Linux 2026, och WSL2 täcker det mesta av resten, vilket är så Docker-baserade verktyg som Open WebUI körs utan problem på en Windows-maskin. Den praktiska regeln: om du installerar från skrivbordsappstabellen, håll dig till det operativsystem du har; om du bygger en dedikerad serveringsbox eller jagar varje accelerationsväg, bygg den på Linux.

Är lokala modeller tillräckligt bra för att ersätta en molnmodell för kodning?

Det beror helt på uppgiften, och uppdelningen är skarpare än vad de flesta täckningar medger. Vid begränsat arbete, generering av en enda fil, enhetstester, standardtester och att förklara kod, är nuvarande öppna modeller på en bra arbetsstation ungefär i paritet med molnmodeller på gränsen. Vid agentarbete med lång horisont, omfaktorering av flera filer över ett stort arkiv, förlorar de tydligt, och fellägena är av den obehagliga typen: tysta no-ops och självsäkert rapporterat arbete som aldrig hände. Om din anledning till att gå lokalt är integritet, krav på luftgap eller kostnad, är det gångbart idag. Om din anledning är kapacitet, är det inte det än.

Är det säkrare att köra en modell lokalt än att använda en molntjänst?

För datalagring, ja, och det är oftast poängen. För programvarusäkerhet, inte automatiskt. En lokal AI-app som fick CVSS-betyget 9.6 i mars 2026 skulle kunna drivas att exekvera kod på värden av modellens egen strömmande utdata, eftersom skrivbordsappen var paketerad med osäkra standardvärden. Lokalt betyder att dina data stannar kvar. Det betyder inte att programvaran är härdad, och den här kategorin levererar mycket snabb kod.

Vad är en sandlåda för AI-agenter, och behöver jag en för lokal AI?

En sandlåda är en isolerad miljö, vanligtvis en container eller en lätt virtuell maskin, där en AI-agent exekverar de kommandon och den kod som den genererar, så att ett misstag eller en skadlig instruktion inte kan nå värdsystemet. Den existerar eftersom agenter inte bara svarar på frågor; de kör shell-kommandon, redigerar filer och bläddrar, och var och en av dessa åtgärder drivs av modellutdata som kan manipuleras. Att köra modellen lokalt ändrar inte den matematiken alls. Sandlåda handlar om att isolera vad agenten gör, inte var modellen finns, och den kodexekveringssårbarhet som beskrivs ovan visade exakt den poängen för en lokalt-först-app. Vissa verktyg på den här sidan levereras med inbyggd sandlåda, och de som kör agenter med obegränsad värdåtkomst förtjänar en närmare titt innan de rör en maskin du bryr dig om. När agentanvändning flyttar in i affärsmiljöer, förvänta dig att sandlåda blir en rubrikfunktion snarare än en fotnot, och förvänta dig att vi börjar väga det in i hur vi utvärderar dessa verktyg.

Kan lokal hårdvara köra agentiska arbetsbelastningar med dussintals underagenter?

Detta är gränsen, och det ärliga svaret är att en enda arbetsstation snabbt får slut på utrymme. Arbetsbelastningar med flera agenter skapar underagenter som var och en bär sin egen kontext, och på inferenssidan innebär varje aktiv kontext sin egen KV-cache i minnet, så fotavtrycket skalas med samtidighet, inte bara modellstorlek. Vart dessa cacher tar vägen när de växer ur minnet är ett eget tekniskt problem; vår djupdykning i KV-cache-avlastning till flash , byggd på Dell- och Solidigm-hårdvara, är den bästa behandlingen av det ämnet som vi har publicerat. En maskin som bekvämt hanterar en agentsession i 30B-klassen kan vanligtvis hantera några parallella sessioner via en batchserver innan latensen försämras; dussintals samtidiga underagenter är serverterritorium, med tillräckligt med minne för att hålla många live-kontexter och en servermotor som vLLM byggd för kontinuerlig batchning. Det finns också ett kvalitetstak: lokala modeller förlorar redan tillförlitlighet när antalet verktyg växer, och orkestrering multiplicerar verktyg och överlämningar. Vår uppfattning är att arbete med en enda agent och få agenter är ett legitimt arbetsstationsjobb idag, och stora underagentflottor är ett infrastrukturjobb. Den gränsen, och den hårdvara som krävs för att överskrida den, är något vi planerar att utforska mycket mer ingående.