Modèles open source : où en sont les IA à poids ouverts face aux modèles fermés en 2026

En mai 2023, 174 points séparaient le meilleur modèle d'IA fermé du meilleur modèle ouvert sur le classement Arena, où des utilisateurs comparent à l'aveugle les réponses de deux modèles. En août 2024, l'écart n'était plus que de 7 points. En mars 2026, il était remonté à 49. Ces chiffres, tirés de l'AI Index 2026 de l'université Stanford, montrent que les modèles que l'on peut télécharger et faire tourner chez soi restent proches des meilleurs sans les dépasser, et que l'écart varie au rythme des sorties de quelques entreprises.

Poids ouverts et open source : ce que recouvrent les mots

Un modèle de langage est un programme qui lit du texte et en produit, après un entraînement sur d'immenses corpus. Ce qu'il a appris est stocké dans ses paramètres, aussi appelés poids : des milliards de nombres ajustés pendant l'entraînement. Un modèle à poids ouverts est un modèle dont ces nombres sont publiés et téléchargeables. N'importe qui peut alors le faire fonctionner sur sa propre machine, l'adapter ou l'étudier. Un modèle fermé, à l'inverse, n'est accessible que par l'interface de son éditeur : on lui envoie une requête, il renvoie une réponse, et ses poids restent sur les serveurs de l'éditeur.

L'expression « open source » est souvent employée pour les deux premiers cas, à tort au sens strict. L'Open Source Initiative, l'organisation qui fait référence pour les licences de logiciels libres, a publié fin octobre 2024 la version 1.0 de sa définition de l'IA open source. Elle exige trois éléments : une information suffisamment détaillée sur les données d'entraînement pour qu'une personne compétente puisse reconstruire un système comparable, le code complet qui sert à entraîner et à faire tourner le modèle, et les paramètres eux-mêmes.

La plupart des modèles connus publient le troisième élément, parfois une partie du deuxième, presque jamais le premier. Les données d'entraînement restent secrètes, pour des raisons de concurrence et de droit d'auteur. Quelques projets de recherche, comme OLMo de l'Allen Institute for AI, publient aussi leurs données, mais ils ne figurent pas parmi les plus performants. Le terme exact pour DeepSeek, Qwen, Mistral ou gpt-oss est donc « modèles à poids ouverts ». Cet article parle de modèles ouverts par commodité.

Ce que les licences autorisent

La licence est le contrat qui fixe ce que l'utilisateur a le droit de faire du modèle. Les licences Apache 2.0 et MIT, issues du logiciel libre, sont les plus permissives : elles autorisent l'usage commercial, la modification et la redistribution, à condition de conserver la mention de l'auteur et le texte de la licence. Qwen3.5 d'Alibaba, gpt-oss d'OpenAI et Mistral Large 3 sont publiés sous Apache 2.0. DeepSeek V4 est publié sous licence MIT.

Meta a choisi une licence maison pour Llama 4, datée du 5 avril 2025. Elle autorise l'usage commercial, avec trois conditions notables. Une entreprise dont les produits dépassent 700 millions d'utilisateurs actifs par mois doit demander une licence à Meta, ce qui ne concerne qu'une poignée de groupes dans le monde. Toute entreprise qui distribue un produit fondé sur Llama doit afficher la mention « Built with Llama ». Enfin, tout modèle dérivé distribué doit porter un nom qui commence par « Llama ».

Ces conditions restent acceptables pour la plupart des entreprises, mais elles changent le travail du service juridique. Une licence Apache 2.0 est un texte standard, déjà connu des juristes qui ont validé des logiciels libres. Une licence propre à un éditeur doit être lue en entier, et elle peut changer d'une version du modèle à la suivante.

Les principaux modèles ouverts disponibles à l'automne 2026

Les plus grands modèles ouverts reposent presque tous sur une architecture dite à mélange d'experts. Le modèle est découpé en nombreux sous-réseaux, et pour chaque mot produit, un aiguillage n'en sollicite que quelques-uns. On distingue donc deux chiffres : le nombre total de paramètres, qui détermine la mémoire nécessaire, et le nombre de paramètres actifs, qui détermine le volume de calcul à chaque mot.

DeepSeek, laboratoire chinois financé par le fonds d'investissement High-Flyer, a publié fin avril 2026 une préversion de sa famille V4 sous licence MIT. Selon la fiche publiée sur Hugging Face, V4-Pro compte 1 600 milliards de paramètres, dont 49 milliards actifs, et V4-Flash 284 milliards, dont 13 milliards actifs. Les deux acceptent un contexte d'un million de jetons. Le contexte est la quantité de texte que le modèle peut prendre en compte en une seule fois, et un jeton correspond à un fragment de mot.

Alibaba a publié Qwen3.5 le 16 février 2026 sous Apache 2.0 : 397 milliards de paramètres, dont 17 milliards actifs, et une prise en charge de 201 langues et dialectes. Selon une analyse publiée par Summit School, que nous n'avons pas pu recouper auprès d'Alibaba, la série Qwen3.6, sortie en avril, comprend des modèles plus faciles à héberger, dont un modèle de 35 milliards de paramètres qui n'en active que 3 milliards. Le modèle phare suivant, Qwen3.7-Max, présenté en mai 2026, n'est en revanche accessible que par API, sans poids téléchargeables.

En Europe, la société française Mistral AI a publié le 2 décembre 2025 Mistral Large 3, un modèle de 675 milliards de paramètres dont 41 milliards actifs, accompagné de trois petits modèles de 3, 8 et 14 milliards de paramètres, tous sous Apache 2.0. Aux États-Unis, OpenAI a publié en août 2025 gpt-oss, son premier modèle ouvert depuis GPT-2 : la version la plus grande compte 117 milliards de paramètres dont 5,1 milliards actifs, la plus petite 21 milliards dont 3,6 milliards actifs.

Meta, qui portait l'ouverture côté américain avec sa famille Llama, a changé de cap. Le 8 avril 2026, l'entreprise a présenté Muse Spark, premier modèle de son laboratoire Meta Superintelligence Labs. Il est fermé : on l'utilise dans les applications de Meta ou par une API ouverte à des partenaires sélectionnés. Meta a écrit espérer publier en open source de futures versions, sans calendrier. Les modèles Llama déjà publiés restent téléchargeables.

Mesurer l'écart : classement indépendant et chiffres des éditeurs

Un benchmark est une batterie de questions standardisées qui sert à noter les modèles. Chaque éditeur choisit de mettre en avant ceux où il obtient ses meilleurs résultats, ce qui rend les comparaisons fragiles. Le classement Arena procède autrement : des utilisateurs soumettent une question, reçoivent deux réponses anonymes et votent pour la meilleure. Les votes alimentent un score de type Elo, le système de classement des joueurs d'échecs.

L'AI Index 2026, publié par l'Institute for Human-Centered AI de Stanford, s'appuie sur ce classement. En mars 2026, le meilleur modèle fermé, Claude Opus 4.6 d'Anthropic, obtenait 1 503 points. Le meilleur modèle ouvert, GLM-5 du chinois Zhipu AI, en obtenait 1 454, soit 49 points ou 3,4 % d'écart. Six des dix premiers modèles du classement étaient fermés. Le rapport note aussi que les quatre premières entreprises, Anthropic, xAI, Google et OpenAI, se tenaient en moins de 25 points, suivies d'Alibaba à 1 449 et de DeepSeek à 1 424.

Le rapport décrit un mouvement de balancier. Mixtral, WizardLM puis Llama 3.1 405B avaient ramené l'écart à 7 points en août 2024. L'arrivée de nouveaux modèles fermés, comme o1-preview d'OpenAI et Gemini 2.5 Pro de Google, l'a creusé de nouveau. L'écart se réduit quand les laboratoires ouverts publient, et se rouvre quand les laboratoires fermés sortent une nouvelle génération.

Les éditeurs donnent leurs propres estimations, qu'il faut lire comme telles. DeepSeek affirme que V4-Pro accuse un retard de trois à six mois sur GPT-5.4 et Gemini 3.1 Pro en raisonnement, une estimation que le site WinBuzzer présente comme non vérifiée par des laboratoires indépendants. Pour Qwen3.5, les chiffres publiés par Alibaba et repris par The Decoder le placent devant sur des tests de respect des consignes, comme IFBench avec 76,5, mais derrière GPT-5.2 en mathématiques de compétition, avec 91,3 contre 96,7 sur AIME26, et en programmation, avec 83,6 contre 87,7 sur LiveCodeBench.

Pris ensemble, ces chiffres indiquent qu'un bon modèle ouvert se situe à quelques mois des meilleurs modèles fermés. Pour la majorité des tâches de bureau, l'utilisateur ne voit pas la différence. Sur les problèmes les plus difficiles, comme les raisonnements longs ou les tâches qui enchaînent de nombreuses étapes sans supervision, elle reste mesurable.

La mémoire nécessaire et le rôle de la quantification

Pour fonctionner, un modèle doit charger tous ses paramètres en mémoire, y compris ceux des experts inactifs à un instant donné. Le mélange d'experts réduit le calcul, pas la mémoire. En précision standard de 16 bits, chaque paramètre occupe deux octets. Les 117 milliards de paramètres de gpt-oss demanderaient donc environ 234 gigaoctets, soit près de trois fois la mémoire d'une carte Nvidia H100, qui en compte 80.

La quantification résout une partie du problème. Elle consiste à stocker chaque paramètre avec moins de bits, 8 ou 4 au lieu de 16. La documentation de la bibliothèque Transformers de Hugging Face la décrit comme une façon de réduire la mémoire nécessaire en cherchant à préserver autant que possible la précision du modèle. L'analogie la plus juste est celle d'une photographie compressée : le fichier est beaucoup plus léger, et si la compression est bien faite, la différence ne se voit qu'en regardant de près.

Les éditeurs livrent désormais des modèles déjà quantifiés. OpenAI distribue gpt-oss avec les poids de ses experts au format MXFP4, sur 4 bits environ, ce qui permet à la grande version de tenir sur une seule carte de 80 gigaoctets, et à la petite de fonctionner avec 16 gigaoctets de mémoire. DeepSeek publie V4 dans un format mixte : 4 bits pour les experts, 8 bits pour la plupart des autres paramètres. Même compressé, V4-Pro réclame plusieurs centaines de gigaoctets et reste un modèle de grappe de serveurs.

En pratique, trois paliers se dessinent. Les modèles de 3 à 20 milliards de paramètres fonctionnent sur un poste de travail équipé d'une carte graphique récente. Ceux de 30 à 120 milliards demandent une machine dédiée avec une ou deux cartes de grande capacité, ce qui reste à la portée d'une PME. Au-delà de quelques centaines de milliards, il faut un serveur de calcul complet. La compression a un coût : sur le code, le calcul ou les textes très techniques, une quantification trop forte dégrade les résultats. La seule méthode fiable consiste à la tester sur ses propres documents.

Les tâches où ils suffisent, celles où ils peinent

Les modèles ouverts de taille moyenne donnent de bons résultats sur le travail borné et répétitif : résumer des comptes rendus, classer des courriels, extraire des champs d'une facture, répondre à des questions à partir d'une base de documents internes, rédiger un premier jet, traduire. Pour ces usages, un modèle de 20 à 120 milliards de paramètres bien configuré produit des réponses que la plupart des utilisateurs ne distinguent pas de celles d'un modèle fermé. Hébergé sur place, il offre en plus un coût prévisible et un comportement qui ne change pas sans décision interne.

Ils sont plus fragiles dans trois situations. La première concerne les tâches longues où le modèle agit seul, en enchaînant des dizaines d'actions : une petite probabilité d'erreur à chaque étape finit par s'accumuler. La deuxième concerne les connaissances récentes, puisqu'un modèle ne sait que ce qu'il a lu avant la fin de son entraînement, sauf si on lui fournit des documents à jour. La troisième concerne les langues et les jargons moins représentés dans les données d'entraînement, qui sont surtout anglaises et chinoises. Le français juridique ou technique demande donc des tests spécifiques avant tout déploiement.

Un modèle ouvert est un fichier, pas un service. Les mises à jour de sécurité, la supervision, la journalisation des accès et la gestion des droits restent à la charge de celui qui l'héberge. C'est le travail que les éditeurs de modèles fermés facturent avec leur API, et qu'il faut prévoir lorsqu'on choisit d'héberger soi-même.

États-Unis, Chine, Europe : trois façons de publier

Les laboratoires américains les plus avancés, Anthropic, Google et OpenAI, gardent leurs meilleurs modèles fermés et les vendent par API. OpenAI fait exception partielle avec gpt-oss, qui reste en deçà de ses modèles phares. Meta s'est aligné sur ses concurrents avec Muse Spark.

Les laboratoires chinois, comme DeepSeek, Alibaba ou Zhipu AI, publient beaucoup de poids ouverts sous licences permissives. L'AI Index 2026 constate que l'écart entre modèles américains et chinois s'est presque refermé : en mars 2026, le meilleur modèle américain devançait le meilleur modèle chinois, Dola-Seed-2.0 Preview de ByteDance, de 39 points, soit 2,7 %. Selon WinBuzzer, Huawei a confirmé que ses grappes de calcul fondées sur ses processeurs Ascend pouvaient faire tourner DeepSeek V4, qui a pourtant été entraîné sur des puces Nvidia. L'ouverture chinoise n'est pas pour autant une doctrine : Alibaba garde désormais son modèle le plus puissant derrière une API, et le meilleur modèle chinois du classement, celui de ByteDance, est fermé.

L'Europe compte peu de laboratoires de premier plan, avec Mistral AI en tête, et pèse surtout par la réglementation. Les obligations de l'AI Act pour les modèles d'IA à usage général s'appliquent depuis le 2 août 2025, et la Commission peut les faire respecter depuis le 2 août 2026. Les modèles publiés sous une licence libre, sauf ceux classés à risque systémique, sont dispensés d'une partie des obligations de documentation technique, mais doivent toujours publier un résumé de leurs données d'entraînement et une politique de respect du droit d'auteur. Le code de bonnes pratiques qui accompagne ces règles, publié le 10 juillet 2025, comptait 26 signataires à la mi-août 2025, dont OpenAI, Google, Microsoft, Amazon et Anthropic. Meta et les entreprises chinoises n'y figuraient pas.

Pour un acheteur français, la conséquence est pratique : avant de déployer un modèle, il faut savoir lequel tourne réellement, sous quelle licence, avec quelle documentation, et qui en est l'éditeur.

Changer de modèle sans refaire ses outils

Le classement d'aujourd'hui ne sera pas celui de l'an prochain. En douze mois, DeepSeek a publié une nouvelle génération, Alibaba en a présenté trois et a réservé la dernière à son API, Meta a lancé son premier grand modèle fermé. Une entreprise qui relie directement ses logiciels à un modèle précis parie sur un état du marché qui aura changé avant la fin de l'année.

La réponse est d'ordre technique. Les applications ne s'adressent pas directement au modèle, mais à une couche intermédiaire qui choisit le modèle selon la tâche. Un jeu de tests interne, constitué des documents et des questions réelles de l'entreprise, vérifie qu'un nouveau modèle fait au moins aussi bien que l'ancien avant de le remplacer. Changer de modèle devient alors une opération de maintenance, planifiée et vérifiable.

Cette discipline protège contre plusieurs risques à la fois : un éditeur qui cesse de publier ses poids, une licence qui se durcit, un tarif qui augmente, un modèle retiré. Un article du site allemand Digital Chiefs, consacré au virage de Meta, recommande aux directions informatiques la même démarche : plusieurs familles de modèles plutôt qu'un fournisseur unique, dont au moins un modèle ouvert pour les usages réglementés ou hors connexion, un inventaire des applications et des modèles qu'elles utilisent, et des clauses de sortie dans les contrats.

Ce que l'état des modèles ouverts change pour une entreprise

À l'automne 2026, les meilleurs modèles ouverts se situent à quelques points des meilleurs modèles fermés selon la mesure indépendante la plus suivie. Leurs licences vont de l'Apache 2.0, qui ne pose presque aucune condition, à des textes maison qu'il faut faire relire. Leur disponibilité dépend de la stratégie de leurs auteurs, qui peut changer d'une version à l'autre. Pour la plupart des usages courants, ils suffisent, et ils permettent de traiter les documents de l'entreprise sans les envoyer chez un tiers.

Le critère qui compte sur la durée est la capacité à remplacer un modèle par un autre sans toucher au reste. C'est le choix d'architecture de HOMN : le modèle est une pièce interchangeable, testée sur les documents du client avant chaque remplacement, et l'infrastructure qui l'entoure reste en place d'une génération à l'autre.

Quelle est la différence entre un modèle open source et un modèle à poids ouverts ?

Un modèle à poids ouverts publie ses paramètres, ce qui permet de le télécharger et de le faire tourner sur sa propre machine. Selon la définition de l'Open Source Initiative, un modèle open source doit en plus publier le code d'entraînement et une information détaillée sur ses données d'entraînement. La plupart des modèles connus, comme DeepSeek, Qwen ou Mistral, sont à poids ouverts.

Quel est le meilleur modèle d'IA open source en 2026 ?

Selon l'AI Index 2026 de Stanford, le meilleur modèle ouvert du classement Arena en mars 2026 était GLM-5 de Zhipu AI, avec 1 454 points. DeepSeek V4, Qwen3.5 et Mistral Large 3 figurent parmi les plus grands modèles ouverts publiés depuis. Le bon choix dépend du matériel disponible, de la licence et des tests sur ses propres tâches.

Les modèles open source sont-ils aussi bons que ChatGPT ou Claude ?

Ils en sont proches. En mars 2026, le meilleur modèle ouvert accusait 49 points, soit 3,4 %, de retard sur le meilleur modèle fermé du classement Arena. Pour les tâches de bureau courantes, la différence est peu visible, mais elle reste mesurable sur les raisonnements longs et les tâches autonomes complexes.

Quel matériel faut-il pour faire tourner un LLM open source en local ?

Un modèle de 3 à 20 milliards de paramètres tourne sur un poste équipé d'une carte graphique récente, et gpt-oss-20b fonctionne avec 16 gigaoctets de mémoire. Un modèle d'environ 120 milliards de paramètres quantifié sur 4 bits, comme gpt-oss-120b, tient sur une carte de 80 gigaoctets. Les modèles de plusieurs centaines de milliards de paramètres demandent un serveur complet.