IA locale: definizione, funzionamento ed esempi concreti

Un'IA locale è un modello linguistico che calcola le proprie risposte su una macchina sotto il Suo controllo, senza inviare i Suoi testi a un fornitore. Questa guida spiega cosa contiene questo modello, cosa significa eseguirlo in casa propria e cosa ci si può ragionevolmente aspettare.

Un comando, un download, poi più nulla esce

La documentazione di Ollama, un software libero disponibile per macOS, Windows e Linux, condensa il punto di partenza in una riga: un comando digitato in un terminale, che scarica un modello e apre una conversazione. Per il modello preso a esempio, Gemma 4 E2B, il file pesa circa 7,2 GB e la documentazione raccomanda 8 GB di memoria grafica, o di memoria unificata su un Mac. Una volta che il file è sul disco, ogni risposta viene calcolata dai processori della macchina. Si può scollegare il cavo di rete e la conversazione continua.

È la definizione più semplice di un'IA locale: un modello di intelligenza artificiale eseguito su un hardware che si possiede o che si controlla, si tratti di un computer portatile, di un server riposto in un armadio tecnico o di un apparato dedicato. Il suo opposto è un servizio remoto. ChatGPT, Gemini o Le Chat ricevono il Suo testo sui loro server, lo elaborano là e Le restituiscono il risultato.

Per capire cosa accade nei due casi bisogna aprire la scatola: che cos'è un modello linguistico, cosa contiene il file scaricato e cosa fa esattamente la macchina quando produce una risposta.

Un modello linguistico prevede il seguito di un testo

Un grande modello linguistico, spesso abbreviato LLM da large language model, è un programma addestrato a un compito d'apparenza modesta: indovinare il frammento di testo che viene dopo. La tastiera del Suo telefono, che propone la parola successiva sopra i tasti, fa la stessa cosa in scala minuscola. L'LLM lo fa con una finezza tale che, concatenando le previsioni, produce paragrafi, riassunti, codice o traduzioni.

Il modello non manipola parole ma token, frammenti di testo che possono corrispondere a una parola intera, a una sillaba o a un segno di punteggiatura. La documentazione di OpenAI fornisce un ordine di grandezza per l'inglese: un token corrisponde a circa quattro caratteri, cioè ai tre quarti di una parola. Questa unità serve a misurare tutto, dalla lunghezza massima di uno scambio, detta finestra di contesto, alla velocità di generazione.

L'architettura che ha reso possibili questi modelli si chiama Transformer. È stata descritta nel 2017 in un articolo di ricerca intitolato « Attention Is All You Need ». La sua idea centrale, il meccanismo di attenzione, permette al modello di ponderare, per ogni token, l'importanza di tutti gli altri token del testo. Nella frase « il contratto che il cliente ha firmato ieri scade a marzo », è questo meccanismo a collegare « scade » a « contratto » nonostante le parole intercalate.

Occorre tenere a mente cosa implica questo meccanismo. Il modello produce il seguito più plausibile rispetto a ciò che ha visto durante l'addestramento. Plausibile non significa esatto, e questa sfumatura spiega la maggior parte dei suoi limiti.

I pesi: cosa contiene il file

Ciò che si scarica quando si installa un modello sono i suoi pesi, detti anche parametri. Sono numeri, miliardi di numeri, regolati uno a uno durante l'addestramento affinché le previsioni diventino buone. Si possono paragonare ai cursori di un immenso mixer: nessun cursore preso da solo significa granché, ma la loro posizione d'insieme determina il suono.

La dimensione di un modello si conta in parametri. Mistral 7B, pubblicato dall'azienda francese Mistral AI il 27 settembre 2023, ne conta 7,3 miliardi. È stato distribuito con licenza Apache 2.0, che consente di scaricarlo, di usarlo e di installarlo dove si vuole, anche per un uso commerciale. Si parla di modello a pesi aperti: l'azienda pubblica il file stesso, e non soltanto un accesso remoto.

Nella vita di un modello si succedono due fasi. L'addestramento fabbrica i pesi a partire da immensi volumi di testo; mobilita mezzi di calcolo considerevoli e resta affare di pochi laboratori. L'inferenza utilizza poi questi pesi fissati per rispondere a una domanda; è questa, e soltanto questa, che si esegue in locale. La differenza somiglia a quella che separa la redazione di un dizionario dalla sua consultazione: la prima richiede anni, la seconda qualche secondo, e nessuno ha bisogno di riscrivere il dizionario per cercarvi una parola.

Eseguire un modello: motore, formato e quantizzazione

Per eseguire questi pesi serve un motore di inferenza, il programma che carica il file in memoria e concatena i calcoli. Il più diffuso nel mondo del locale si chiama llama.cpp. Scritto in C e C++ senza dipendenze esterne, mira a eseguire modelli con un'installazione minima su un'ampia gamma di hardware: chip Apple, processori x86 tradizionali, schede grafiche NVIDIA tramite CUDA, o di altri produttori tramite Vulkan. Applicazioni più accessibili, come Ollama o LM Studio, sanno leggere lo stesso formato di file.

Questo formato si chiama GGUF. Secondo la documentazione di Hugging Face, la principale piattaforma di condivisione di modelli, un file GGUF riunisce in un unico binario i pesi e un insieme normalizzato di metadati: l'architettura, il vocabolario di token, le impostazioni necessarie al caricamento. Lo si copia, lo si carica, funziona, un po' come un PDF che incorpora i propri caratteri tipografici.

Il fattore che decide quasi tutto è la memoria. Nella sua forma originaria, ogni parametro è memorizzato su 16 bit, cioè due byte. Un modello da 7,3 miliardi di parametri occupa allora quasi 15 GB, più della memoria della maggior parte dei computer da ufficio. La quantizzazione risolve il problema arrotondando i pesi su meno bit, come si riduce il numero di colori di una foto senza che l'occhio veda la differenza a prima vista. llama.cpp supporta quantizzazioni da 1,5 a 8 bit. Il tipo Q4_K, molto utilizzato, equivale a 4,5 bit per peso secondo la documentazione di Hugging Face: lo stesso modello scende allora intorno a 4 GB.

Questa compressione ha un prezzo, una lieve perdita di precisione che si accentua man mano che si scende di bit. E la memoria non serve soltanto a conservare i pesi. La documentazione di Ollama ricorda che una finestra di contesto più lunga richiede più memoria, poiché la macchina tiene traccia di tutto il testo in corso di elaborazione. Se manca la memoria grafica, il software può ripiegare sulla normale memoria RAM, con risposte più lente. La scelta dell'hardware discende da tre parametri: la dimensione del modello, il suo livello di quantizzazione e la lunghezza dei testi da elaborare.

Perché è diventato realistico in pochi anni

Fino a poco tempo fa, eseguire un modello competente su una sola macchina era una dimostrazione da laboratorio. Tre misure pubblicate nell'AI Index 2025 dell'Università di Stanford mostrano cosa è cambiato.

La prima riguarda la dimensione. Nel 2022, il più piccolo modello a superare il 60% di risposte corrette al MMLU, un test a scelta multipla che copre numerose discipline, era PaLM di Google, con 540 miliardi di parametri. Nel 2024, Phi-3-mini di Microsoft ha superato la stessa soglia con 3,8 miliardi di parametri, cioè un modello 142 volte più piccolo. Una volta quantizzato, un modello di questa taglia sta nella memoria di un computer portatile.

La seconda riguarda il divario tra modelli chiusi e modelli a pesi aperti. All'inizio di gennaio 2024, nella classifica Chatbot Arena, in cui gli utenti di internet confrontano alla cieca le risposte di due modelli, il miglior modello chiuso precedeva il miglior modello aperto dell'8,04%. A febbraio 2025, il divario era soltanto dell'1,70%.

La terza riguarda il costo. Sempre secondo Stanford, il costo di inferenza di un sistema del livello di GPT-3.5 è stato ridotto di oltre 280 volte tra novembre 2022 e ottobre 2024. Nello stesso periodo, il costo dell'hardware è calato di circa il 30% all'anno e la sua efficienza energetica è migliorata del 40% all'anno.

Queste cifre descrivono una tendenza, non un'uguaglianza. I maggiori modelli chiusi mantengono il vantaggio sui compiti più difficili, e una classifica fondata sulle preferenze degli utenti non misura tutto. Il confine di ciò che si può fare senza un data center si è comunque spostato in modo netto.

Locale o ChatGPT: la questione è dove viaggia il testo

Dal punto di vista dell'utente, le due esperienze si assomigliano: un campo di inserimento, una risposta che compare parola dopo parola. La differenza sta nel percorso. Con un servizio online, la domanda, i documenti allegati e la risposta transitano dai server del fornitore. Con un'IA locale, non lasciano la macchina.

Questo percorso ha conseguenze concrete. OpenAI indica che le conversazioni degli account ChatGPT gratuiti e Plus possono servire a migliorare i suoi modelli finché l'utente non ha disattivato l'opzione, mentre i dati delle sue offerte professionali e della sua API non sono utilizzati per impostazione predefinita. La CNIL, nelle sue domande e risposte sull'IA generativa pubblicate nel luglio 2024, osserva che con un utilizzo tramite API il controllo del sistema si trova « quasi esclusivamente » nelle mani del fornitore. Raccomanda un'installazione in sede quando si trattano dati personali o sensibili, al fine di limitare i rischi di estrazione da parte di terzi.

L'ANSSI, l'agenzia nazionale francese per la sicurezza dei sistemi informativi, va nella stessa direzione nelle sue raccomandazioni di sicurezza per i sistemi di IA generativa, pubblicate il 29 aprile 2024. La sua raccomandazione R34 sconsiglia gli strumenti di IA generativa accessibili su internet per un uso professionale che implichi dati sensibili: l'organizzazione non controlla il servizio e non può quindi garantire la riservatezza di ciò che vi invia.

Il locale ha altre proprietà. Funziona senza connessione. Il suo costo non dipende dal numero di domande poste, trattandosi di un hardware acquistato anziché di un contatore. Non cambia da un giorno all'altro perché un fornitore ha sostituito o ritirato un modello. In cambio, l'organizzazione gestisce da sé la macchina, gli aggiornamenti e i backup, e non ha accesso ai maggiori modelli chiusi, che sono offerti solo online. Molte organizzazioni combinano i due approcci: il locale per ciò che è riservato o ripetitivo, un servizio remoto per esigenze occasionali e senza dati sensibili.

Cosa si può fare concretamente con un'IA locale

Gli usi che funzionano meglio sono quelli in cui il modello lavora su un testo che gli viene fornito, anziché attingere alla propria memoria. Riassumere un verbale di riunione di trenta pagine. Riformulare una lettera in un registro più neutro. Estrarre da una fattura il fornitore, la data e l'importo per riporli in una tabella. Tradurre un manuale tecnico. Classificare le e-mail in arrivo in base all'oggetto prima di indirizzarle all'ufficio giusto.

Il caso più richiesto in azienda consiste nell'interrogare i propri documenti: procedure interne, contratti, convenzioni, base di conoscenza dell'assistenza. La tecnica impiegata, detta RAG da generazione aumentata dal recupero, ritrova prima i passaggi pertinenti, poi chiede al modello di rispondere a partire da essi citando le fonti. Le dedichiamo un articolo dettagliato.

Seguono usi più tecnici: aiuto alla scrittura di codice, trascrizione di riunioni da parte di un modello di riconoscimento vocale anch'esso eseguito in sede, analisi di registri di errori. Questi usi si diffondono rapidamente. Secondo Eurostat, il 20% delle imprese europee con almeno dieci dipendenti utilizzava una tecnologia di intelligenza artificiale nel 2025, contro il 13,5% un anno prima.

In tutti questi casi, la macchina produce una prima bozza o una selezione, e una persona convalida. È in questa configurazione che il rapporto tra il tempo guadagnato e il rischio assunto è più favorevole.

I limiti, senza edulcorarli

Un modello linguistico può affermare con sicurezza una cosa falsa. Questo fenomeno, detto allucinazione, discende direttamente dal suo funzionamento: produce un testo plausibile, e un testo plausibile può contenere una data inventata, un riferimento giuridico inesistente o una cifra copiata male. Eseguirlo in locale non cambia nulla su questo punto. Il rimedio consiste nel fornirgli le fonti anziché contare sulla sua memoria, e nel far rileggere tutto ciò che impegna l'organizzazione.

Le sue conoscenze si fermano alla fine dell'addestramento. Un modello pubblicato un anno fa ignora l'ultima riforma, l'ultimo tariffario, l'ultima versione di un software. Non consulta internet da solo: un'IA locale isolata dalla rete sa soltanto ciò che ha appreso e ciò che le si dà da leggere.

Un modello piccolo resta un modello piccolo. I progressi misurati da Stanford sono reali, ma un modello di qualche miliardo di parametri sbaglia più spesso di un modello gigante su un ragionamento in più passaggi, su un calcolo o su una questione molto specialistica. La velocità dipende dall'hardware: su un computer privo di un processore grafico adeguato, una risposta lunga può farsi attendere.

Infine, un'installazione locale è un sistema informatico come un altro. Bisogna amministrarla, applicare le correzioni, controllare chi vi accede. L'ANSSI dedica una parte delle sue raccomandazioni all'isolamento dei sistemi di IA, alla registrazione delle elaborazioni e alla gestione dei diritti. Locale non significa sicuro per impostazione predefinita; significa che la sicurezza dipende dall'organizzazione che lo gestisce.

Come iniziare

Il modo più semplice è provare su un computer recente con un'applicazione come Ollama o LM Studio. Scelga un piccolo modello a pesi aperti, di qualche miliardo di parametri, quantizzato a 4 bit. Lo metta alla prova su compiti reali ma senza dati riservati: riassumere un documento pubblico, riformulare un testo, estrarre informazioni da un modulo vuoto. Annoti la qualità, la velocità e gli errori.

Questa prima fase serve a circoscrivere le esigenze prima di qualsiasi spesa: gli usi che ritornano ogni settimana, il volume di documenti da elaborare, il numero di persone che utilizzeranno il sistema contemporaneamente. Questi elementi determinano la dimensione del modello, quindi la memoria necessaria, quindi l'hardware.

Per un uso di squadra, il portatile di prova non basta più. Serve una macchina che resti accesa, accessibile sulla rete interna, con gestione di account, diritti e registri. È il ruolo di un server o di un apparato dedicato.

In HOMN, è quest'ultima configurazione che costruiamo: il modello, i documenti e i registri restano su una macchina installata presso l'utente, e il ricorso a un servizio esterno resta una scelta esplicita. L'approccio vale quale che sia lo strumento scelto: sapere dove gira il modello, cosa contiene e dove vanno i dati.

Che cos'è un'IA locale?

Un'IA locale è un modello di intelligenza artificiale, il più delle volte un modello linguistico, che viene eseguito su un hardware controllato dall'utente: computer, server o apparato installato nei suoi locali. Le domande e i documenti elaborati non vengono inviati ai server di un fornitore. Il modello è un file scaricato una volta, poi utilizzato senza connessione.

Serve una connessione a internet per usare un'IA locale?

No, non per funzionare. Internet serve a scaricare il modello e gli aggiornamenti del software, ma il calcolo delle risposte avviene interamente sulla macchina. Un'IA locale può quindi girare su una rete isolata.

Un'IA locale è efficace quanto ChatGPT?

Non su tutto: i maggiori modelli chiusi restano avanti sui compiti di ragionamento più difficili. Il divario si è tuttavia ridotto fortemente: secondo l'AI Index 2025 di Stanford è passato dall'8,04% all'1,70% nella classifica Chatbot Arena tra gennaio 2024 e febbraio 2025. Per riassumere, riformulare, estrarre o interrogare documenti, un buon modello a pesi aperti basta nella maggior parte dei casi.

Che hardware serve per eseguire un LLM in locale?

Dipende dalla dimensione del modello e dalla sua quantizzazione. Un modello da 7 miliardi di parametri quantizzato a 4 bit occupa circa 4 GB, e la documentazione di Ollama raccomanda 8 GB di memoria grafica o unificata per il suo modello di esempio. Per un uso condiviso da un team serve una macchina dedicata dotata di più memoria.