Modelli open source nel 2026: pesi aperti contro modelli chiusi

A maggio 2023, 174 punti separavano il miglior modello di IA chiuso dal miglior modello aperto nella classifica Arena, in cui gli utenti confrontano alla cieca le risposte di due modelli. Ad agosto 2024, il divario era di soli 7 punti. A marzo 2026 era risalito a 49. Queste cifre, tratte dall'AI Index 2026 dell'Università di Stanford, mostrano che i modelli che si possono scaricare e far girare in casa propria restano vicini ai migliori senza superarli, e che il divario varia al ritmo delle uscite di poche aziende.

Pesi aperti e open source: cosa coprono le parole

Un modello linguistico è un programma che legge testo e ne produce, dopo un addestramento su immensi corpus. Ciò che ha appreso è conservato nei suoi parametri, detti anche pesi: miliardi di numeri regolati durante l'addestramento. Un modello a pesi aperti è un modello i cui numeri sono pubblicati e scaricabili. Chiunque può allora farlo funzionare sulla propria macchina, adattarlo o studiarlo. Un modello chiuso, al contrario, è accessibile solo tramite l'interfaccia del suo editore: gli si invia una richiesta, restituisce una risposta, e i suoi pesi restano sui server dell'editore.

L'espressione « open source » viene spesso impiegata per i primi due casi, a torto in senso stretto. L'Open Source Initiative, l'organizzazione di riferimento per le licenze di software libero, ha pubblicato a fine ottobre 2024 la versione 1.0 della sua definizione di IA open source. Richiede tre elementi: un'informazione sufficientemente dettagliata sui dati di addestramento perché una persona competente possa ricostruire un sistema comparabile, il codice completo che serve ad addestrare e a far girare il modello, e i parametri stessi.

La maggior parte dei modelli noti pubblica il terzo elemento, talvolta una parte del secondo, quasi mai il primo. I dati di addestramento restano segreti, per ragioni di concorrenza e di diritto d'autore. Alcuni progetti di ricerca, come OLMo dell'Allen Institute for AI, pubblicano anche i propri dati, ma non figurano tra i più performanti. Il termine esatto per DeepSeek, Qwen, Mistral o gpt-oss è quindi « modelli a pesi aperti ». Questo articolo parla di modelli aperti per comodità.

Cosa consentono le licenze

La licenza è il contratto che fissa ciò che l'utente ha il diritto di fare con il modello. Le licenze Apache 2.0 e MIT, derivate dal software libero, sono le più permissive: consentono l'uso commerciale, la modifica e la ridistribuzione, a condizione di conservare la menzione dell'autore e il testo della licenza. Qwen3.5 di Alibaba, gpt-oss di OpenAI e Mistral Large 3 sono pubblicati con licenza Apache 2.0. DeepSeek V4 è pubblicato con licenza MIT.

Meta ha scelto una licenza propria per Llama 4, datata 5 aprile 2025. Consente l'uso commerciale, con tre condizioni degne di nota. Un'azienda i cui prodotti superano i 700 milioni di utenti attivi al mese deve richiedere una licenza a Meta, il che riguarda solo una manciata di gruppi nel mondo. Ogni azienda che distribuisce un prodotto basato su Llama deve esporre la menzione « Built with Llama ». Infine, ogni modello derivato distribuito deve portare un nome che inizia con « Llama ».

Queste condizioni restano accettabili per la maggior parte delle aziende, ma cambiano il lavoro dell'ufficio legale. Una licenza Apache 2.0 è un testo standard, già noto ai giuristi che hanno convalidato software libero. Una licenza propria di un editore va letta per intero, e può cambiare da una versione del modello alla successiva.

I principali modelli aperti disponibili nell'autunno 2026

I maggiori modelli aperti poggiano quasi tutti su un'architettura detta a miscela di esperti. Il modello è suddiviso in numerose sottoreti, e per ogni parola prodotta un instradatore ne richiama solo alcune. Si distinguono quindi due cifre: il numero totale di parametri, che determina la memoria necessaria, e il numero di parametri attivi, che determina il volume di calcolo per ogni parola.

DeepSeek, laboratorio cinese finanziato dal fondo di investimento High-Flyer, ha pubblicato a fine aprile 2026 un'anteprima della sua famiglia V4 con licenza MIT. Secondo la scheda pubblicata su Hugging Face, V4-Pro conta 1.600 miliardi di parametri, di cui 49 miliardi attivi, e V4-Flash 284 miliardi, di cui 13 miliardi attivi. Entrambi accettano un contesto di un milione di token. Il contesto è la quantità di testo che il modello può considerare in una sola volta, e un token corrisponde a un frammento di parola.

Alibaba ha pubblicato Qwen3.5 il 16 febbraio 2026 con licenza Apache 2.0: 397 miliardi di parametri, di cui 17 miliardi attivi, e il supporto di 201 lingue e dialetti. Secondo un'analisi pubblicata da Summit School, che non abbiamo potuto verificare presso Alibaba, la serie Qwen3.6, uscita ad aprile, comprende modelli più facili da ospitare, tra cui un modello da 35 miliardi di parametri che ne attiva solo 3 miliardi. Il modello di punta successivo, Qwen3.7-Max, presentato a maggio 2026, è invece accessibile solo tramite API, senza pesi scaricabili.

In Europa, l'azienda francese Mistral AI ha pubblicato il 2 dicembre 2025 Mistral Large 3, un modello da 675 miliardi di parametri di cui 41 miliardi attivi, accompagnato da tre piccoli modelli da 3, 8 e 14 miliardi di parametri, tutti con licenza Apache 2.0. Negli Stati Uniti, OpenAI ha pubblicato nell'agosto 2025 gpt-oss, il suo primo modello aperto dai tempi di GPT-2: la versione più grande conta 117 miliardi di parametri di cui 5,1 miliardi attivi, la più piccola 21 miliardi di cui 3,6 miliardi attivi.

Meta, che portava l'apertura sul versante americano con la sua famiglia Llama, ha cambiato rotta. L'8 aprile 2026 l'azienda ha presentato Muse Spark, primo modello del suo laboratorio Meta Superintelligence Labs. È chiuso: lo si utilizza nelle applicazioni di Meta o tramite un'API aperta a partner selezionati. Meta ha scritto di sperare di pubblicare in open source versioni future, senza calendario. I modelli Llama già pubblicati restano scaricabili.

Misurare il divario: classifica indipendente e cifre degli editori

Un benchmark è una batteria di domande standardizzate che serve a valutare i modelli. Ogni editore sceglie di mettere in evidenza quelli in cui ottiene i risultati migliori, il che rende fragili i confronti. La classifica Arena procede diversamente: gli utenti sottopongono una domanda, ricevono due risposte anonime e votano per la migliore. I voti alimentano un punteggio di tipo Elo, il sistema di classificazione dei giocatori di scacchi.

L'AI Index 2026, pubblicato dall'Institute for Human-Centered AI di Stanford, si basa su questa classifica. A marzo 2026, il miglior modello chiuso, Claude Opus 4.6 di Anthropic, otteneva 1.503 punti. Il miglior modello aperto, GLM-5 della cinese Zhipu AI, ne otteneva 1.454, cioè 49 punti o il 3,4% di divario. Sei dei primi dieci modelli della classifica erano chiusi. Il rapporto osserva anche che le prime quattro aziende, Anthropic, xAI, Google e OpenAI, si trovavano entro 25 punti, seguite da Alibaba a 1.449 e da DeepSeek a 1.424.

Il rapporto descrive un movimento a pendolo. Mixtral, WizardLM e poi Llama 3.1 405B avevano riportato il divario a 7 punti nell'agosto 2024. L'arrivo di nuovi modelli chiusi, come o1-preview di OpenAI e Gemini 2.5 Pro di Google, lo ha scavato di nuovo. Il divario si riduce quando i laboratori aperti pubblicano, e si riapre quando i laboratori chiusi rilasciano una nuova generazione.

Gli editori forniscono le proprie stime, che vanno lette come tali. DeepSeek afferma che V4-Pro accusa un ritardo da tre a sei mesi su GPT-5.4 e Gemini 3.1 Pro nel ragionamento, una stima che il sito WinBuzzer presenta come non verificata da laboratori indipendenti. Per Qwen3.5, le cifre pubblicate da Alibaba e riprese da The Decoder lo collocano in vantaggio nei test di aderenza alle istruzioni, come IFBench con 76,5, ma dietro GPT-5.2 nella matematica da competizione, con 91,3 contro 96,7 su AIME26, e nella programmazione, con 83,6 contro 87,7 su LiveCodeBench.

Considerate insieme, queste cifre indicano che un buon modello aperto si colloca a pochi mesi dai migliori modelli chiusi. Per la maggior parte dei compiti d'ufficio, l'utente non vede la differenza. Sui problemi più difficili, come i ragionamenti lunghi o i compiti che concatenano numerosi passaggi senza supervisione, resta misurabile.

La memoria necessaria e il ruolo della quantizzazione

Per funzionare, un modello deve caricare tutti i suoi parametri in memoria, compresi quelli degli esperti inattivi in un dato momento. La miscela di esperti riduce il calcolo, non la memoria. In precisione standard a 16 bit, ogni parametro occupa due byte. I 117 miliardi di parametri di gpt-oss richiederebbero quindi circa 234 gigabyte, cioè quasi tre volte la memoria di una scheda Nvidia H100, che ne conta 80.

La quantizzazione risolve una parte del problema. Consiste nel memorizzare ogni parametro con meno bit, 8 o 4 anziché 16. La documentazione della libreria Transformers di Hugging Face la descrive come un modo di ridurre la memoria necessaria cercando di preservare il più possibile la precisione del modello. L'analogia più corretta è quella di una fotografia compressa: il file è molto più leggero, e se la compressione è fatta bene la differenza si vede solo guardando da vicino.

Gli editori consegnano ormai modelli già quantizzati. OpenAI distribuisce gpt-oss con i pesi dei suoi esperti nel formato MXFP4, su circa 4 bit, il che permette alla versione grande di stare su una sola scheda da 80 gigabyte, e alla piccola di funzionare con 16 gigabyte di memoria. DeepSeek pubblica V4 in un formato misto: 4 bit per gli esperti, 8 bit per la maggior parte degli altri parametri. Anche compresso, V4-Pro richiede diverse centinaia di gigabyte e resta un modello da cluster di server.

In pratica si delineano tre livelli. I modelli da 3 a 20 miliardi di parametri funzionano su una postazione di lavoro dotata di una scheda grafica recente. Quelli da 30 a 120 miliardi richiedono una macchina dedicata con una o due schede di grande capacità, il che resta alla portata di una PMI. Oltre qualche centinaio di miliardi, serve un server di calcolo completo. La compressione ha un costo: sul codice, sul calcolo o sui testi molto tecnici, una quantizzazione troppo forte degrada i risultati. L'unico metodo affidabile consiste nel testarla sui propri documenti.

I compiti in cui bastano, quelli in cui faticano

I modelli aperti di taglia media danno buoni risultati sul lavoro circoscritto e ripetitivo: riassumere verbali, classificare e-mail, estrarre campi da una fattura, rispondere a domande a partire da una base di documenti interni, redigere una prima bozza, tradurre. Per questi usi, un modello da 20 a 120 miliardi di parametri ben configurato produce risposte che la maggior parte degli utenti non distingue da quelle di un modello chiuso. Ospitato in sede, offre inoltre un costo prevedibile e un comportamento che non cambia senza una decisione interna.

Sono più fragili in tre situazioni. La prima riguarda i compiti lunghi in cui il modello agisce da solo, concatenando decine di azioni: una piccola probabilità di errore a ogni passaggio finisce per accumularsi. La seconda riguarda le conoscenze recenti, poiché un modello sa soltanto ciò che ha letto prima della fine del suo addestramento, a meno che gli si forniscano documenti aggiornati. La terza riguarda le lingue e i gerghi meno rappresentati nei dati di addestramento, che sono soprattutto inglesi e cinesi. Il francese giuridico o tecnico richiede quindi test specifici prima di qualsiasi implementazione.

Un modello aperto è un file, non un servizio. Gli aggiornamenti di sicurezza, la sorveglianza, la registrazione degli accessi e la gestione dei diritti restano a carico di chi lo ospita. È il lavoro che gli editori di modelli chiusi fatturano con la loro API, e che va previsto quando si sceglie di ospitare in proprio.

Stati Uniti, Cina, Europa: tre modi di pubblicare

I laboratori americani più avanzati, Anthropic, Google e OpenAI, tengono chiusi i loro migliori modelli e li vendono tramite API. OpenAI fa eccezione parziale con gpt-oss, che resta al di sotto dei suoi modelli di punta. Meta si è allineata ai concorrenti con Muse Spark.

I laboratori cinesi, come DeepSeek, Alibaba o Zhipu AI, pubblicano molti pesi aperti con licenze permissive. L'AI Index 2026 constata che il divario tra modelli americani e cinesi si è quasi chiuso: a marzo 2026, il miglior modello americano precedeva il miglior modello cinese, Dola-Seed-2.0 Preview di ByteDance, di 39 punti, cioè del 2,7%. Secondo WinBuzzer, Huawei ha confermato che i suoi cluster di calcolo basati sui processori Ascend potevano far girare DeepSeek V4, che è stato però addestrato su chip Nvidia. L'apertura cinese non è tuttavia una dottrina: Alibaba tiene ormai il suo modello più potente dietro un'API, e il miglior modello cinese della classifica, quello di ByteDance, è chiuso.

L'Europa conta pochi laboratori di primo piano, con Mistral AI in testa, e pesa soprattutto per la regolamentazione. Gli obblighi dell'AI Act per i modelli di IA per finalità generali si applicano dal 2 agosto 2025, e la Commissione può farli rispettare dal 2 agosto 2026. I modelli pubblicati con una licenza libera, tranne quelli classificati a rischio sistemico, sono dispensati da una parte degli obblighi di documentazione tecnica, ma devono comunque pubblicare una sintesi dei propri dati di addestramento e una politica di rispetto del diritto d'autore. Il codice di buone pratiche che accompagna queste norme, pubblicato il 10 luglio 2025, contava 26 firmatari a metà agosto 2025, tra cui OpenAI, Google, Microsoft, Amazon e Anthropic. Meta e le aziende cinesi non vi figuravano.

Per un acquirente francese, la conseguenza è pratica: prima di implementare un modello, bisogna sapere quale gira realmente, con quale licenza, con quale documentazione, e chi ne è l'editore.

Cambiare modello senza rifare i propri strumenti

La classifica di oggi non sarà quella dell'anno prossimo. In dodici mesi, DeepSeek ha pubblicato una nuova generazione, Alibaba ne ha presentate tre e ha riservato l'ultima alla propria API, Meta ha lanciato il suo primo grande modello chiuso. Un'azienda che collega direttamente i propri software a un modello preciso scommette su uno stato del mercato che sarà cambiato prima della fine dell'anno.

La risposta è di ordine tecnico. Le applicazioni non si rivolgono direttamente al modello, ma a uno strato intermedio che sceglie il modello in base al compito. Un insieme di test interno, costituito dai documenti e dalle domande reali dell'azienda, verifica che un nuovo modello faccia almeno altrettanto bene del precedente prima di sostituirlo. Cambiare modello diventa allora un'operazione di manutenzione, pianificata e verificabile.

Questa disciplina protegge da più rischi insieme: un editore che smette di pubblicare i propri pesi, una licenza che si inasprisce, una tariffa che aumenta, un modello ritirato. Un articolo del sito tedesco Digital Chiefs, dedicato alla svolta di Meta, raccomanda alle direzioni informatiche lo stesso approccio: più famiglie di modelli anziché un fornitore unico, di cui almeno un modello aperto per gli usi regolamentati o offline, un inventario delle applicazioni e dei modelli che usano, e clausole di uscita nei contratti.

Cosa cambia per un'azienda lo stato dei modelli aperti

Nell'autunno 2026, i migliori modelli aperti si collocano a pochi punti dai migliori modelli chiusi secondo la misura indipendente più seguita. Le loro licenze vanno dall'Apache 2.0, che non pone quasi nessuna condizione, a testi propri che occorre far rileggere. La loro disponibilità dipende dalla strategia dei loro autori, che può cambiare da una versione all'altra. Per la maggior parte degli usi correnti bastano, e permettono di trattare i documenti dell'azienda senza inviarli a terzi.

Il criterio che conta nel tempo è la capacità di sostituire un modello con un altro senza toccare il resto. È la scelta di architettura di HOMN: il modello è un componente intercambiabile, testato sui documenti del cliente prima di ogni sostituzione, e l'infrastruttura che lo circonda resta in sede da una generazione all'altra.

Qual è la differenza tra un modello open source e un modello a pesi aperti?

Un modello a pesi aperti pubblica i propri parametri, il che permette di scaricarlo e di farlo girare sulla propria macchina. Secondo la definizione dell'Open Source Initiative, un modello open source deve inoltre pubblicare il codice di addestramento e un'informazione dettagliata sui propri dati di addestramento. La maggior parte dei modelli noti, come DeepSeek, Qwen o Mistral, è a pesi aperti.

Qual è il miglior modello di IA open source nel 2026?

Secondo l'AI Index 2026 di Stanford, il miglior modello aperto della classifica Arena a marzo 2026 era GLM-5 di Zhipu AI, con 1.454 punti. DeepSeek V4, Qwen3.5 e Mistral Large 3 figurano tra i maggiori modelli aperti pubblicati da allora. La scelta giusta dipende dall'hardware disponibile, dalla licenza e dai test sui propri compiti.

I modelli open source sono bravi quanto ChatGPT o Claude?

Ci vanno vicino. A marzo 2026, il miglior modello aperto accusava 49 punti, cioè il 3,4%, di ritardo sul miglior modello chiuso della classifica Arena. Per i compiti d'ufficio correnti, la differenza è poco visibile, ma resta misurabile sui ragionamenti lunghi e sui compiti autonomi complessi.

Che hardware serve per eseguire un LLM open source in locale?

Un modello da 3 a 20 miliardi di parametri gira su una postazione dotata di una scheda grafica recente, e gpt-oss-20b funziona con 16 gigabyte di memoria. Un modello di circa 120 miliardi di parametri quantizzato a 4 bit, come gpt-oss-120b, sta su una scheda da 80 gigabyte. I modelli da diverse centinaia di miliardi di parametri richiedono un server completo.