Aggiornato il 19 agosto 2026: Prima pubblicazione. Ricerca aggiornata a questa data.
Ci sono quattro motivi per eseguire un modello linguistico sul proprio hardware anziché in una scheda del browser, e solo uno di questi è di natura ideologica. Privacy: un documento consegnato a un modello locale non lascia mai la macchina, e questo vale per l'intera conversazione relativa a codice client, contratti, dati dei pazienti e prodotti non ancora rilasciati. Struttura dei costi: l'IA nel cloud è a consumo e i carichi di lavoro agentici moltiplicano il numero di token abbastanza velocemente da permettere a una workstation performante di ripagarsi da sola; l'hardware di proprietà funziona al costo dell'elettricità. Disponibilità: nessun limite di utilizzo, nessuna interruzione del servizio, nessuna email di dismissione che modifichi il flusso di lavoro di martedì. E controllo: il modello che hai validato è quello che esegui finché non decidi diversamente.
Il rovescio della medaglia è che i modelli cloud di frontiera rimangono più performanti e, per il lavoro a lungo termine che richiede un'azione mirata, il divario è reale. I modelli locali hanno raggiunto la parità per attività circoscritte: chat, riassunti, codice in file singolo e domande e risposte su documenti. Queste sono, per la precisione, le attività che la maggior parte delle persone svolge quotidianamente. Se la vostra priorità è la massima capacità a qualsiasi costo, utilizzate il cloud. Se invece la priorità è la privacy, il costo o il controllo, le soluzioni locali sono ancora valide e questa pagina ne è la guida.
Questa definizione dovrebbe guidare il tuo budget hardware, perché la spesa per l'IA locale è una decisione che riguarda la memoria prima di ogni altra cosa. 16 GB di VRAM o 32 GB di memoria unificata coprono la classe da 7 a 8 miliardi, che gestisce il lavoro limitato di cui sopra. Da 24 a 32 GB di VRAM, o 48 GB di memoria unificata, raggiungono la classe da 30 miliardi, dove la programmazione agentica smette di essere una demo. Da 96 a 128 GB di memoria unificata gestiscono i modelli da oltre 100 miliardi che si avvicinano alla qualità di frontiera. Acquistare in eccesso garantisce una velocità che potresti non notare; acquistare in difetto significa che la classe di modello che desideravi non si carica affatto. Le nostre classifiche dei migliori laptop per l'IA locale e dei migliori desktop per l'IA locale classificano le macchine per livello. Questa pagina illustra cosa eseguire su di esse.
Il lato software non è maturato con la stessa fluidità dell'hardware. Circa un terzo degli strumenti che vengono consigliati nei risultati di ricerca odierni non sono più supportati, e la maggior parte dei siti che li raccomandano non se n'è nemmeno accorta.
Questa pagina tiene traccia di ciò che funziona e su quale hardware, ad agosto 2026. Per ora, la classifica si basa sulle stelle di GitHub, perché è un indicatore neutrale e verificabile, e specifichiamo quando uno strumento è closed source e non ha un numero di stelle da assegnare. Ogni nome di strumento nelle tabelle rimanda al suo download ufficiale. Man mano che testiamo ciascuna piattaforma in laboratorio, la colonna Guida si aggiorna con una procedura di configurazione pratica e i nostri risultati.
Tre regole per questa pagina. Innanzitutto, distinguiamo un modello locale da un agente locale . Diversi prodotti vengono eseguiti sulla tua macchina, mentre ogni chiamata di inferenza viene inoltrata a un cloud di un fornitore; questa è una questione di privacy, non di funzionalità offline, e questi strumenti sono elencati separatamente in fondo alla pagina anziché essere omessi. In secondo luogo, ogni voce riporta i requisiti hardware minimi realistici, perché "funziona su un laptop" è un'affermazione priva di significato senza un dato sulla memoria. In terzo luogo, teniamo traccia, con le relative date, dei prodotti che non sono più disponibili nelle FAQ.
Le scelte
Miglior tempo di esecuzione complessivo del LLM locale: Ollama
La risposta predefinita, e quella a cui si riferiscono la maggior parte degli altri strumenti. Con licenza MIT, circa 179,000 stelle su GitHub, ora include un'interfaccia grafica desktop oltre alla riga di comando. Scarica i modelli con un solo comando, espone un endpoint compatibile con OpenAI su localhost e, a gennaio 2026, ha aggiunto la compatibilità con l'API Anthropic Messages, che è il metodo utilizzato per indirizzare Claude Code a un modello locale. Requisiti minimi: 8 GB di RAM di sistema per un modello 3B, 16 GB per modelli 7-8B, 24 GB di VRAM per la classe 30B.
Ideale per il benchmarking hardware: LM Studio
Essendo un software closed source, non ha un sistema di valutazione a stelle, ma si merita comunque il suo posto. LM Studio include sia llama.cpp che MLX ed espone i controlli importanti quando si misura una macchina anziché utilizzarla: livelli di offload GPU, scelta della quantizzazione, lunghezza del contesto e comportamento multi-GPU. È disponibile gratuitamente per uso commerciale da luglio 2025. Questo è lo strumento alla base della maggior parte dei valori di token al secondo ottenuti sulle nostre schede di workstation e laptop. Requisiti minimi: 16 GB di RAM; 24 GB di VRAM o 32 GB di memoria unificata per prestazioni ottimali.
Miglior motore di base: llama.cpp
Quasi tutto il resto in questa pagina deriva da llama.cpp. Licenza MIT, circa 124,700 stelle, con diverse build taggate pubblicate ogni giorno. È importante per un pubblico di hardware per un motivo specifico: l'elenco dei backend è enorme e comprende CUDA, ROCm, Metal, Vulkan, SYCL, CANN e OpenCL, e gli ingegneri dei fornitori ora contribuiscono direttamente con ottimizzazioni. Un miglioramento del prefill di Intel Arc nella build 8688 ha avuto un valore circa 5 volte superiore, e ogni utente di Ollama e LM Studio lo ha ricevuto senza installare nulla. Requisiti minimi: funziona solo con la CPU; 8 GB di RAM per essere utilizzabile.
Migliore app desktop con priorità locale: gennaio
Apache 2.0, circa 44,100 stelle, v0.8.4 a luglio 2026. Jan include llama.cpp, quindi non c'è altro da installare e funziona anche con il cavo di rete scollegato. Sembra un requisito minimo finché non si controlla quante app in questa categoria sono client cloud con un campo Ollama. Questa è la soluzione ideale per un collega che non aprirà mai un terminale. Il suo punto debole è la gestione dei documenti RAG. Requisiti minimi: 8 GB di RAM.
Miglior RAG di documenti locali: AnythingLLM
MIT, circa 64,800 stelle. Include un database vettoriale e gestisce il chunking e l'incorporamento senza configurazione, il che lo rende la chat di documenti più intuitiva nella sua categoria desktop. Due cose che non tralasceremo: una vulnerabilità di marzo 2026, classificata CVSS 9.6, consentiva l'esecuzione di codice remoto attivata dalla risposta in streaming del modello stesso; corretta nella versione 1.11.2, quindi aggiornate prima di utilizzarla. Inoltre, la telemetria è attiva di default in un'app commercializzata come "local-first", che si può disattivare nelle Impostazioni. Requisiti minimi: 16 GB di RAM per lavorare con i documenti.
Migliore installazione multiutente self-hosted: Open WebUI
Circa 149,000 stelle e la più profonda configurabilità di recupero qui, con la v0.11.0 in uscita a luglio 2026. Si tratta di un server self-hosted piuttosto che di un'applicazione desktop, quindi Docker è il punto di ingresso. Un'informazione importante prima di iniziare a svilupparci: la licenza è cambiata nell'aprile 2025 da BSD-3 a una licenza personalizzata non approvata da OSI, che aggiunge una clausola contro la rimozione del marchio Open WebUI, con un'eccezione per gli utenti al di sotto dei cinquanta in un arco di trenta giorni. Eseguendolo senza modifiche su piccola scala, non ci saranno problemi. Requisiti minimi: un runtime separato più 4 GB per il container.
Miglior agente di codifica locale: Cline
Apache 2.0, circa 63,900 stelle. Cline ha investito più risorse ingegneristiche sul percorso locale di qualsiasi concorrente, tra cui un prompt di sistema compatto creato specificamente per Ollama e LM Studio e la chiamata di strumenti nativi per ogni famiglia di modelli. La loro documentazione è insolitamente schietta riguardo ai punti in cui il cloud è ancora vincente. Requisiti minimi: 24 GB di VRAM o 36 GB di memoria unificata e contesto impostato a 32 KB o superiore.
Miglior programma di programmazione per terminali offline: Aider
Apache 2.0, circa 48,300 stelle, e architettonicamente l'opzione locale più affidabile per un motivo che vale la pena comprendere. Aider non utilizza affatto chiamate di strumenti JSON. Analizza i formati di modifica diff e whole-file da testo semplice, aggirando così la modalità di errore che manda in crash la maggior parte degli agenti sui modelli locali. L'avvertenza riguarda la manutenzione: un singolo autore ha scritto il 96% dei commit e la cadenza di rilascio si è ridotta a circa una versione stabile nel 2026. Requisiti minimi: 24 GB di VRAM o 36 GB unificati.
Migliore piattaforma per agenti self-hosted: OpenHands
MIT, circa 84,500 stelle. OpenHands documenta correttamente i modelli locali e, cosa ancora più utile, ti dice quando il problema non è la tua configurazione: la sua stessa documentazione afferma che se l'agente si comporta come un chatbot o fallisce costantemente gli strumenti, il modello è il limite. Richiede un contesto minimo di 22K e raccomanda 32K. Minimo: 24 GB di VRAM per modelli quantizzati o 64 GB di memoria unificata.
La migliore sorpresa offline gratuita: GitHub Copilot CLI
Da aprile 2026, la CLI di Copilot funziona con Ollama, vLLM e Foundry Local. L'autenticazione GitHub è facoltativa e non è richiesto alcun abbonamento a Copilot. Impostando COPILOT_OFFLINE si interrompono tutti i dati di telemetria e i contatti di rete, e i suoi sub-agenti ereditano il provider locale. La maggior parte degli articoli di confronto lo elenca ancora come esclusivamente cloud. Da notare la distinzione: l'estensione IDE invia comunque i suggerimenti di completamento inline al cloud anche in modalità "porta la tua chiave". Requisiti minimi: un modello con una finestra di contesto di 128 KB, quindi 32 GB di VRAM o 64 GB unificati.
Miglior server supportato dal fornitore: Lemonade
Apache 2.0, con circa 5,400 stelle, è l'unico strumento di terze parti che raccomanderemmo per meriti specifici piuttosto che per fedeltà all'hardware. È gestito dagli ingegneri AMD e funziona su NVIDIA CUDA, Apple Metal, Vulkan e CPU standard, oltre che su NPU Radeon e Ryzen AI. Viene rilasciato all'incirca ogni due settimane e la sua applicazione desktop è passata da Electron a Tauri nell'aprile 2026. Requisiti minimi: 16 GB di RAM; Ryzen AI serie 300 o successiva per il percorso NPU.
Miglior RAG locale a livello di filesystem: Nexa AI Hyperlink
Codice sorgente chiuso e gratuito. Indicizza l'intero filesystem sul dispositivo e fornisce risposte con citazioni inline. È presente in questo elenco perché è l'unico nuovo strumento RAG locale con dati di accelerazione pubblicati su hardware consumer: circa 3 volte più veloce nell'indicizzazione e 2 volte più veloce nell'inferenza su una RTX 5090, con una cartella da 1 GB che passa da circa quindici minuti a quattro o cinque. Requisiti minimi: una GPU RTX moderna; 16 GB di RAM.
Tempi di esecuzione: cosa esegue effettivamente il modello
Questo è il motore. Tutto ciò che si trova nelle due tabelle successive è un'interfaccia utente che comunica con uno di questi. Ordinato in base alle stelle di GitHub.
| Runtime | Stelle | Licenza | Hardware minimo | Accelerazione | alle taglie |
|---|---|---|---|---|---|
| Ollama | ~ 179,000 | CON | 8 GB di RAM (3B), 16 GB (7-8B), 24 GB di VRAM (classe 30B) | CUDA, ROCm, Metal, Vulkan | Presto disponibile |
| lama.cpp | ~ 124,700 | CON | 8 GB di RAM, funziona solo la CPU | CUDA, ROCm, Metal, Vulkan, SYCL, CANN, OpenCL | Presto disponibile |
| MLX / mlx-lm | ~ 27,500 | CON | Apple Silicon, 16 GB unificati | Metallo; backend CUDA aggiunto nel 2026 | Presto disponibile |
| Studio LM | Fonte chiusa | Proprietà esclusiva, utilizzo gratuito per scopi commerciali. | 16 GB di RAM; 24 GB di VRAM o 32 GB unificati | Include i pacchetti llama.cpp e MLX | Presto disponibile |
| vLLM | Servizio di produzione | Apache 2.0 | 24 GB di VRAM, livello minimo realistico | CUDA, ROCm | Presto disponibile |
Applicazioni desktop e RAG locale
Le app installate da un lettore. La colonna "Local-First" è quella da leggere attentamente: distingue il software che esegue un modello sul tuo computer dal software che ha aggiunto un campo per un URL di Ollam.
| App | Stelle | Licenza | Local-First | Hardware minimo | alle taglie |
|---|---|---|---|---|---|
| Apri l'interfaccia utente Web | ~ 149,000 | Personalizzato, non approvato da OSI | Capace, server non desktop | Runtime separato + 4 GB per il container | Presto disponibile |
| Qualunque cosaLLM | ~ 64,800 | CON | Funzionante; telemetria attiva per impostazione predefinita | RAM 16GB | Presto disponibile |
| Gen | ~ 44,100 | Apache 2.0 | Sì, bundle llama.cpp | RAM 8GB | Presto disponibile |
| Studio LM | Fonte chiusa | Proprietary | Si | 16 GB di RAM; 24 GB di VRAM per essere interessanti | Presto disponibile |
| Msty | Fonte chiusa | Livello gratuito proprietario | Sì, bundle Ollama, MLX, llama.cpp | RAM 8GB | Presto disponibile |
| Collegamento ipertestuale a Nexa AI | Fonte chiusa | Proprietà esclusiva, gratuito | Sì, indicizzazione sul dispositivo | GPU RTX moderna, 16 GB di RAM | Presto disponibile |
Strumenti di codifica e agenti
Queste sono le voci più esigenti in termini di hardware presenti nella pagina, poiché il lavoro con agenti richiede un'ampia finestra di contesto e sessioni lunghe. Considerate che 32 GB di VRAM o 64 GB di memoria unificata rappresentano il punto in cui questa non è più una demo.
| Chiavetta | Stelle | Licenza | Percorso Locale | Hardware minimo | alle taglie |
|---|---|---|---|---|---|
| ManiAperte | ~ 84,500 | CON | LM Studio, Ollam, vLLM, SGLang | 24 GB di VRAM o 64 GB unificati; contesto 32K | Presto disponibile |
| Cline | ~ 63,900 | Apache 2.0 | Ollama, LM Studio, compatibile con OpenAI | 24 GB di VRAM o 36 GB unificati | Presto disponibile |
| Oca | ~ 52,900 | Apache 2.0 | Ollama di prima classe; ora Linux Foundation | 24 GB di VRAM o 36 GB unificati | Presto disponibile |
| aider | ~ 48,300 | Apache 2.0 | Ollama, compatibile con OpenAI; nessuna chiamata di strumento | 24 GB di VRAM o 36 GB unificati | Presto disponibile |
| Zeta | v1.0, aprile 2026 | Apache 2.0 | LM Studio, Ollama, llama.cpp | 24 GB di VRAM o 36 GB unificati | Presto disponibile |
| CLI GitHub copilota | Fonte chiusa | Contenuto esclusivo, non è necessario alcun abbonamento. | Ollama, vLLM, Foundry Local | 32 GB di VRAM o 64 GB unificati; contesto 128K | Presto disponibile |
Iniziative dei fornitori
Ogni produttore di chip e sistemi operativi offre qualcosa per l'IA locale, e questa categoria merita una voce a sé stante perché la nomenclatura è confusionaria e il tasso di abbandono è elevato. Il modello che si è delineato nel 2026 è stato coerente: i produttori hanno smesso di competere con le soluzioni di terze parti e hanno iniziato a supportarle. NVIDIA ha abbandonato entrambi i suoi prodotti di IA locale e ora pubblica ottimizzazioni per Ollama, llama.cpp e ComfyUI. AMD collabora con LM Studio. Qualcomm ha implementato le sue funzionalità NPU adattando un'applicazione di terzi.
L'unica cosa che gli strumenti dei fornitori fanno e che Ollama e LM Studio non possono fare è accedere alla NPU . llama.cpp non ha un backend NPU, quindi su una macchina AI con Snapdragon o Ryzen, questi strumenti lasciano il motore neurale a un utilizzo pari allo zero percento. Se avete pagato per un massimo di 40-60 TOPS, solo un percorso del fornitore lo utilizza. Tuttavia, è bene essere realistici. Le NPU attualmente raggiungono al massimo i 7 miliardi di modelli e il vantaggio principale è la durata della batteria in caso di lavoro continuo con modelli di piccole dimensioni, non la velocità di elaborazione. Una GPU dedicata batte la NPU in velocità in ogni caso.
| Venditore | Cos'è | Tipo | Hardware richiesto | Stato | alle taglie |
|---|---|---|---|---|---|
| Limonata AMD | Server, interfaccia grafica e SDK; circa 5,400 stelle, Apache 2.0 | Applicazione + server | 16 GB di RAM; Ryzen AI 300+ per NPU. Funziona anche su CPU NVIDIA, Apple. | Attivo, spedizioni ogni due settimane | Presto disponibile |
| Intel OpenVINO GenAI | Tempo di esecuzione e SDK; ~10,700 stelle | SDK | Core Ultra, serie Arc A/B; 16 GB di RAM | Attivo, 2026.3 nell'agosto 2026 | Presto disponibile |
| Modelli della Fondazione Apple | Modelli on-device esposti dal sistema operativo | framework del sistema operativo | Apple Silicon; già installato | Attiva; aperta a tutti i fornitori alla WWDC 2026 | Presto disponibile |
| Microsoft Foundry Local | SDK e CLI per l'inferenza locale; circa 2,400 stelle | SDK | Windows, macOS, Linux; NPU/GPU/CPU | GA aprile 2026; catalogo modelli selezionato | Presto disponibile |
| AMD GAIA | Applicazione LLM locale per Ryzen AI; circa 1,400 stelle, MIT | App + SDK | Processore Ryzen AI serie 300 minimo; 16 GB di RAM, 64 GB consigliati | Attiva, v0.20.0 giugno 2026 | Presto disponibile |
| Intel AI Playground | Applicazione desktop; circa 900 stelle | App | Arc serie A 8GB+, Arc serie B, Core Ultra | Attivo ma ancora in versione beta dopo due anni | Presto disponibile |
| Qualcomm GenieX | Runtime GGUF integrato per NPU Snapdragon | Runtime | Snapdragon X / X Elite, 8 Elite | Anteprima per sviluppatori, luglio 2026 | Presto disponibile |
| Progetto NVIDIA G-Assist | Assistente 8B integrato nel dispositivo per il controllo del sistema | App | Scheda grafica RTX serie 20 o successiva, 6 GB di VRAM | Attivo ma ancora etichettato come pre-release | Presto disponibile |
Una nota sulla nomenclatura. "RTX AI Garage" di NVIDIA sembra un prodotto, ma non lo è; si tratta di una serie di articoli sul blog. Lo stack di Microsoft è stato rinominato più volte: le API di Copilot Runtime sono diventate API di Windows AI, Azure AI Foundry è diventato Microsoft Foundry e DirectML è ora in modalità di manutenzione con solo correzioni di sicurezza. Qualcomm AI Hub è un servizio cloud che effettua il provisioning di dispositivi fisici da remoto, non qualcosa che si esegue localmente.
Cosa si rompe di solito
La maggior parte delle segnalazioni di malfunzionamenti dei modelli locali riguarda problemi di configurazione, non problemi del modello stesso. Quattro di questi problemi in particolare rappresentano una quota significativa, e si tratta di aspetti che un esperto di hardware dovrebbe conoscere prima di attribuire la colpa al silicio.
1. Ollama utilizza di default un contesto di 4,096 token. Non genera un errore quando si supera questo limite. Tronca silenziosamente il contesto e un ciclo agente termina senza generare errori. Ogni framework serio richiede un numero maggiore di token: OpenHands ne richiede almeno 22 e ne raccomanda 32, Codex ne richiede 32, Copilot CLI ne richiede 128 e Cline ne imposta 262,144. Questa singola impostazione è probabilmente la causa più comune dei problemi segnalati online.
2. La quantizzazione della cache KV degrada specificamente le chiamate agli strumenti , e lo fa prima che la qualità generale dell'output ne risenta visibilmente. La documentazione di llama.cpp lo segnala esplicitamente. Se stai eseguendo un agente, disattivalo.
3. Il numero di strumenti è un ostacolo insormontabile, non una semplice pendenza. Come si può notare, all'incirca cinque o sei strumenti sono inclusi; alcuni modelli smettono silenziosamente di emettere chiamate JSON valide agli strumenti e iniziano invece a incorporare XML nel corpo della risposta, che il sistema interpreta come "nessuno strumento utilizzato". Un agente molto diffuso includeva undici strumenti di default e ha compromesso il proprio modello consigliato fino all'inizio del 2026. La conseguenza pratica è controintuitiva: sovraccaricare molti server MCP è dannoso per i modelli locali, a differenza di quanto accade per i modelli di frontiera.
4. Q4_K_M rappresenta il limite minimo pratico. Al di sotto di esso, l'affidabilità delle chiamate agli strumenti diminuisce più rapidamente rispetto alla qualità generale, quindi il modello sembra ancora valido pur non riuscendo a fare nulla in modo silenzioso.
La memoria è il vincolo
Per ogni strumento presente in questa pagina, il fattore determinante per l'esecuzione è la quantità di memoria che l'acceleratore può visualizzare. Queste sono le combinazioni di valori più frequentemente citate per il lavoro con agenti e quelle che intendiamo verificare in laboratorio.
| Hardware | Modello | Orma | Throughput riportato |
|---|---|---|---|
| RTX 5090, 32 GB | Qwen3.6-35B-A3B Q4_K_M | ~21 GB | 160-180 tok/s, contesto 262K |
| RTX 5090, 32 GB | Qwen3-Coder-30B-A3B Q4_K_M | ~19 GB | 50-90 tok/s su classe 24GB |
| RTX 5090, 32 GB | Devstral Small 24B Q4_K_M | ~14 GB | Progettato appositamente per la chiamata degli utensili |
| RTX PRO 6000, 96 GB | GPT-OSS 120B MXFP4 | ~63 GB | La classe 100B su una singola scheda workstation; la GPU della nostra recensione di laboratorio |
| Laptop con RTX PRO 5000, 24 GB GDDR7 | Qwen3-Coder-30B-A3B Q4_K_M | ~19 GB | La GPU per laptop più potente che abbiamo testato (ThinkPad P16 Gen 3); la classe 30B ci sta a pennello, con spazio a sufficienza. |
| 96-128 GB unificati, serie M | gpt-oss-120b Q6_K | ~93 GB | 14-20 tok/s; JSON di chiamate di strumento più pulito di qualsiasi modello open-weight |
Vale la pena precisarlo, perché il marketing non lo specifica: i modelli open-weight più grandi non sono modelli per workstation. GLM-5.2 ha circa 744 miliardi di parametri e richiede circa 744 GB in FP8, che corrisponde a un nodo data center con otto GPU. Kimi K2 e DeepSeek V4 rientrano nella stessa categoria. Qualsiasi guida che suggerisca di eseguirli su un computer desktop è errata.
I dati relativi al throughput riportati sopra provengono da test di terze parti pubblicati e da materiale fornito dai produttori, e non sono ancora risultati di laboratorio di StorageReview. Li sostituiremo con i nostri dati man mano che ogni piattaforma completerà il processo di valutazione della Guida.
Strumenti cloud-first e perché non sono inclusi in questa classifica.
La maggior parte degli utenti di IA ha familiarità con i popolari e facili da usare strumenti di IA online. Un agente locale non è un modello locale. Ognuno di questi viene eseguito sul computer dell'utente, inviando ogni chiamata di inferenza a un servizio cloud del fornitore.
| Chiavetta | Supporto per modelli locali | Note: |
|---|---|---|
| Cursore | Nodo | La documentazione ufficiale afferma che tutte le richieste vengono instradate attraverso i server di Cursor; i tasti personalizzati funzionano solo con i principali provider di servizi cloud e il completamento automatico tramite tab utilizza sempre i modelli di Cursor. Acquisita da SpaceX nel 2026. |
| Devin Desktop (precedentemente Windsurf) | Nodo | Rinominato a giugno 2026. Ogni modello è ospitato nel cloud. |
| Google Antigravità | Nodo | La documentazione afferma esplicitamente che non è possibile utilizzare Ollama, LM Studio o un endpoint personalizzato. |
| Gemini CLI | Nodo | Il supporto locale esiste solo nei fork della community |
| Qodo | Nodo | Il termine "on-premise" si riferisce a un'infrastruttura self-hosted che continua a richiamare i modelli cloud. |
| GitHub Copilot nell'IDE | Parziale | La chat può utilizzare modelli locali; i completamenti in linea rimangono nel cloud anche con la modalità "porta la tua chiave" |
| ChatGPT | Nodo | Le applicazioni desktop e mobile sono client per i modelli cloud di OpenAI. I modelli gpt-oss open-weight di OpenAI vengono eseguiti localmente, ma tramite i runtime sopra menzionati, non tramite l'applicazione ChatGPT. |
| Claude | Nodo | Le app Claude e Cowork funzionano sui modelli cloud di Anthropic. Claude Code può essere indirizzato a un modello locale tramite l'API di Ollama compatibile con Anthropic, che funziona ma è una configurazione non supportata. |
| Assistenti di agenzia generali | Nodo | Gli strumenti di questa classe vengono eseguiti sulla tua macchina ma dipendono da un modello cloud per il ragionamento |
Esiste un genere di guide molto diffuso che spiega come "collegare Cursor a Ollama". La documentazione di Cursor stessa, tuttavia, le contraddice. Se il funzionamento offline è un requisito fondamentale, questa distinzione è di primaria importanza.
E per quanto riguarda la generazione di immagini e video?
La generazione locale di immagini è una delle comunità più numerose nell'ambito dell'IA locale. ComfyUI da solo supera la maggior parte degli strumenti classificati sopra in base alle stelle di GitHub, e la generazione locale di video si sta affermando come il carico di lavoro per utenti finali più esigente in termini di VRAM. Merita una classifica a sé stante, piuttosto che una quarta categoria aggiunta a questa, e la otterrà. Fino ad allora, la logica hardware di questa pagina si applica direttamente: l'elaborazione di immagini e video è ancora più limitata dalla memoria rispetto ai modelli linguistici, e si applicano le stesse categorie.
Come funziona questa pagina
Tre regole. Primo, per ora la classifica si basa sulle stelle di GitHub. Non è l'ideale, ma è neutrale, verificabile e non ci obbliga a fingere di aver testato cose che non abbiamo testato. Gli strumenti closed-source sono contrassegnati come tali, anziché ricevere un punteggio inventato. Man mano che i nostri test individueranno i preferiti, l'ordine cambierà per riflettere i risultati misurati e lo comunicheremo. Secondo, ogni voce indica un requisito minimo di memoria, perché è questo il valore che determina se un modello viene caricato. Terzo, la colonna Guida è un impegno: per ogni piattaforma è disponibile una guida pratica di configurazione con i nostri dati sull'hardware, e il link appare qui non appena viene pubblicata.
Domande frequenti sugli strumenti LLM locali
Da quale strumento LLM locale dovrei iniziare?
Ollama è l'ideale se preferisci lavorare da terminale, LM Studio se preferisci una finestra con i controlli, e Jan è perfetto se desideri un programma pronto all'uso che non richieda l'installazione di nulla. Tutti e tre sono gratuiti, funzionano completamente offline e utilizzano il file llama.cpp, quindi il comportamento del modello è identico. La differenza sta nell'interfaccia, non nella velocità.
Che fine hanno fatto NVIDIA ChatRTX, GPT4All e Continue.dev?
Sono scomparsi, insieme a un numero sorprendente di altri, e questa è la cosa più utile da sapere prima di seguire un vecchio consiglio. NVIDIA ChatRTX è stato deprecato il 21 gennaio 2026, il suo repository è stato archiviato e il suo forum di supporto è stato bloccato, senza che sia stato nominato un sostituto. GPT4All è il caso più insidioso: non ha ricevuto commit negli ultimi dodici mesi e la sua ultima release risale a febbraio 2025, ma il repository non è archiviato e mostra ancora un elevato numero di stelle, quindi sembra attivo. Ha sempre supportato solo un set ristretto di formati di quantizzazione e non può caricare la maggior parte delle release di modelli attuali. Continue.dev , per due anni la raccomandazione standard per la programmazione con modelli locali, è stato acquisito da Cursor e chiuso nel giugno 2026. Roo Code ha cessato le attività nel maggio 2026, Void è stato archiviato nel giugno 2026, Twinny nel novembre 2025 e Reor nel marzo 2026. Khoj ha interrotto il suo servizio ospitato nell'aprile 2026, sebbene la versione self-hosted sia ancora disponibile. Per quanto riguarda i fornitori, Intel IPEX-LLM è stato archiviato nel gennaio 2026 e segnalato per problemi di sicurezza noti senza un percorso di migrazione pubblicato, e NVIDIA RTX AI Toolkit è stato deprecato nel novembre 2025.
Di quanta VRAM ho bisogno per eseguire un LLM locale?
Per la chat, 8 GB di RAM di sistema eseguono un modello da 3 miliardi, mentre 16 GB eseguono un modello da 7 a 8 miliardi in modo accettabile utilizzando solo la CPU. Per una velocità utile, è preferibile che il modello sia in VRAM o memoria unificata: 16 GB gestiscono la classe da 7 a 14 miliardi, 24 GB raggiungono la classe da 30 miliardi nel quarto trimestre e con 32 GB o più il lavoro di programmazione con agenti smette di essere frustrante. Oltre tale soglia, la capacità è più importante della larghezza di banda, motivo per cui i computer con 96-128 GB di memoria unificata eseguono modelli che nessuna scheda grafica consumer è in grado di gestire.
Gli strumenti LLM locali utilizzano la mia NPU?
Di solito no. llama.cpp non ha un backend NPU, quindi Ollama e LM Studio lasceranno il motore neurale allo 0% su una macchina AI con Snapdragon o Ryzen e funzioneranno invece su CPU o GPU. Attualmente, per accedere all'NPU è necessario utilizzare soluzioni proprietarie: Qualcomm GenieX, AMD Lemonade con il suo runtime NPU, Intel OpenVINO o Neural Engine di Apple tramite i framework del sistema operativo. Vale la pena sapere cosa si ottiene, ovvero maggiore durata della batteria e funzionamento always-on a basso consumo, piuttosto che maggiore velocità. Inoltre, le NPU oggi raggiungono al massimo i 7 miliardi di modelli e una GPU dedicata le supererà sempre in termini di throughput.
Devo eseguire l'IA in locale su Windows o su Linux?
Per le applicazioni desktop presenti in questa pagina, Windows e macOS offrono un'esperienza più fluida. LM Studio, Jan, AnythingLLM e Ollama si installano nativamente, i driver GPU provengono dalle fonti usuali e non è necessario utilizzare il terminale. Linux si guadagna il suo posto a un livello inferiore: i motori di server per la produzione, vLLM e SGLang, sono progettati principalmente per Linux, il server multi-GPU lo presuppone di fatto e alcuni dei più recenti percorsi di accelerazione vengono implementati prima su Linux che altrove, incluso il supporto per le NPU AI di AMD Ryzen, disponibile su Linux e che richiede un kernel molto recente. Il divario è più ridotto rispetto al passato. AMD ha unificato le sue release ROCm tra Windows e Linux nel 2026 e WSL2 copre la maggior parte delle restanti, motivo per cui strumenti basati su Docker come Open WebUI funzionano senza problemi su una macchina Windows. La regola pratica: se si installa dalla tabella delle applicazioni desktop, è meglio rimanere sul sistema operativo in uso; se si sta creando un server dedicato o si stanno sfruttando tutti i percorsi di accelerazione disponibili, è consigliabile installarlo su Linux.
I modelli locali sono sufficientemente validi per sostituire un modello cloud nella programmazione?
Dipende interamente dal compito, e la differenza è più netta di quanto la maggior parte delle analisi lasci intendere. Per lavori circoscritti, come la generazione di singoli file, i test unitari, il codice boilerplate e la spiegazione del codice, gli attuali modelli open-weight su una buona workstation sono più o meno alla pari con i modelli cloud di ultima generazione. Per lavori a lungo termine e complessi, come i refactoring di più file in un repository di grandi dimensioni, perdono nettamente, e le conseguenze sono spiacevoli: operazioni silenziose e lavoro segnalato con sicurezza che in realtà non è mai stato eseguito. Se la ragione per cui si opta per una soluzione locale è la privacy, i requisiti di isolamento dalla rete o i costi, oggi è fattibile. Se invece la ragione è la capacità, non lo è ancora.
È più sicuro eseguire un modello in locale piuttosto che utilizzare un servizio cloud?
Per quanto riguarda la residenza dei dati, sì, e di solito è proprio questo il punto. Per la sicurezza del software, non automaticamente. Un'app di intelligenza artificiale locale con classificazione CVSS 9.6 a marzo 2026 potrebbe essere indotta a eseguire codice sull'host dall'output in streaming del modello stesso, perché l'app desktop era stata impacchettata con impostazioni predefinite non sicure. Locale significa che i dati rimangono nella stessa posizione. Non significa che il software sia protetto, e questa categoria include molto codice che si evolve rapidamente.
Cos'è una sandbox per agenti AI e ne ho bisogno per l'IA locale?
Una sandbox è un ambiente isolato, solitamente un container o una macchina virtuale leggera, in cui un agente di intelligenza artificiale esegue i comandi e il codice che genera, in modo che un errore o un'istruzione dannosa non possano raggiungere il sistema host. La sua esistenza è dovuta al fatto che gli agenti non si limitano a rispondere alle domande; eseguono comandi di shell, modificano file e navigano, e ognuna di queste azioni è guidata dall'output del modello, che può essere manipolato. L'esecuzione del modello in locale non cambia minimamente questo meccanismo. La sandboxing consiste nell'isolare ciò che fa l'agente, non dove risiede il modello, e la vulnerabilità di esecuzione del codice descritta in precedenza ha evidenziato proprio questo punto in un'applicazione "local-first". Alcuni strumenti presenti in questa pagina includono la sandboxing integrata, e quelli che eseguono agenti con accesso illimitato all'host meritano un'analisi più approfondita prima di essere utilizzati su una macchina a cui tenete. Con la diffusione degli agenti in ambito aziendale, aspettatevi che la sandboxing diventi una caratteristica fondamentale piuttosto che una nota a piè di pagina, e aspettatevi che iniziamo a tenerne conto nella valutazione di questi strumenti.
È possibile che l'hardware locale esegua carichi di lavoro agenti con decine di sub-agenti?
Questa è la frontiera, e la risposta onesta è che una singola workstation esaurisce rapidamente lo spazio disponibile. I carichi di lavoro multi-agente generano sub-agenti, ognuno dei quali porta con sé il proprio contesto, e sul lato inferenza ogni contesto attivo implica la propria cache KV in memoria, quindi l'ingombro aumenta con la concorrenza, non solo con le dimensioni del modello. Dove finiscono queste cache quando la memoria non è più sufficiente è un problema ingegneristico a sé stante; la nostra analisi approfondita sull'offload della cache KV su memoria flash , realizzata su hardware Dell e Solidigm, è la migliore trattazione di questo argomento che abbiamo pubblicato. Una macchina in grado di gestire agevolmente una sessione agentica di classe 30B può in genere gestire alcune sessioni parallele tramite un server di batching prima che la latenza si degradi; decine di sub-agenti concorrenti sono territorio server, con memoria sufficiente per contenere molti contesti attivi e un motore di servizio come vLLM progettato per il batching continuo. Esiste anche un limite di qualità: i modelli locali perdono già affidabilità con l'aumentare del numero di strumenti, e l'orchestrazione moltiplica strumenti e passaggi di consegne. A nostro avviso, il lavoro con un singolo agente o con pochi agenti è oggi un'attività legittima da svolgere in una postazione fissa, mentre le grandi flotte di sub-agenti rappresentano un'attività infrastrutturale. Questo confine, e l'hardware necessario per superarlo, è un aspetto che intendiamo esplorare in modo molto più approfondito.




Amazon