IA locale : définition, fonctionnement et exemples concrets

Une IA locale est un modèle de langage qui calcule ses réponses sur une machine que vous contrôlez, sans envoyer vos textes chez un fournisseur. Ce guide explique ce que contient ce modèle, ce que signifie le faire tourner chez soi et ce qu'on peut raisonnablement en attendre.

Une commande, un téléchargement, puis plus rien ne sort

La documentation d'Ollama, un logiciel libre disponible pour macOS, Windows et Linux, fait tenir le point de départ en une ligne : une commande tapée dans un terminal, qui télécharge un modèle et ouvre une conversation. Pour le modèle pris en exemple, Gemma 4 E2B, le fichier pèse environ 7,2 Go et la documentation recommande 8 Go de mémoire graphique, ou de mémoire unifiée sur un Mac. Une fois ce fichier sur le disque, chaque réponse est calculée par les processeurs de la machine. On peut débrancher le câble réseau, la conversation continue.

C'est la définition la plus simple d'une IA locale : un modèle d'intelligence artificielle exécuté sur un matériel que l'on possède ou que l'on contrôle, qu'il s'agisse d'un ordinateur portable, d'un serveur rangé dans une baie technique ou d'un boîtier dédié. Son contraire est un service distant. ChatGPT, Gemini ou Le Chat reçoivent votre texte sur leurs serveurs, le traitent là-bas et vous renvoient le résultat.

Pour comprendre ce qui se passe dans les deux cas, il faut ouvrir la boîte : ce qu'est un modèle de langage, ce que contient le fichier téléchargé, et ce que fait exactement la machine quand elle produit une réponse.

Un modèle de langage prédit la suite d'un texte

Un grand modèle de langage, souvent abrégé LLM pour large language model, est un programme entraîné à une tâche d'apparence modeste : deviner le morceau de texte qui vient ensuite. Le clavier de votre téléphone, qui propose le mot suivant au-dessus des touches, fait la même chose à une échelle minuscule. Le LLM le fait avec une telle finesse qu'en enchaînant les prédictions, il produit des paragraphes, des résumés, du code ou des traductions.

Le modèle ne manipule pas des mots mais des tokens, des fragments de texte qui peuvent correspondre à un mot entier, à une syllabe ou à un signe de ponctuation. La documentation d'OpenAI donne un ordre de grandeur pour l'anglais : un token représente environ quatre caractères, soit les trois quarts d'un mot. Cette unité sert à tout mesurer, de la longueur maximale d'un échange, appelée fenêtre de contexte, jusqu'à la vitesse de génération.

L'architecture qui a rendu ces modèles possibles s'appelle le Transformer. Elle a été décrite en 2017 dans un article de recherche intitulé « Attention Is All You Need ». Son idée centrale, le mécanisme d'attention, permet au modèle de pondérer, pour chaque token, l'importance de tous les autres tokens du texte. Dans la phrase « le contrat que le client a signé hier expire en mars », c'est ce mécanisme qui relie « expire » à « contrat » malgré les mots intercalés.

Il faut garder en tête ce que cette mécanique implique. Le modèle produit la suite la plus plausible au regard de ce qu'il a vu pendant son entraînement. Plausible ne veut pas dire exact, et cette nuance explique la plupart de ses limites.

Les poids : ce que contient le fichier

Ce que l'on télécharge quand on installe un modèle, ce sont ses poids, aussi appelés paramètres. Ce sont des nombres, des milliards de nombres, ajustés un à un pendant l'entraînement pour que les prédictions deviennent bonnes. On peut les comparer aux curseurs d'une immense table de mixage : aucun curseur pris isolément ne signifie grand-chose, mais leur position d'ensemble détermine le son.

La taille d'un modèle se compte en paramètres. Mistral 7B, publié par la société française Mistral AI le 27 septembre 2023, en compte 7,3 milliards. Il a été diffusé sous licence Apache 2.0, qui autorise à le télécharger, à l'utiliser et à l'installer où l'on veut, y compris pour un usage commercial. On parle de modèle à poids ouverts : l'entreprise publie le fichier lui-même, et pas seulement un accès à distance.

Deux phases se succèdent dans la vie d'un modèle. L'entraînement fabrique les poids à partir d'immenses volumes de texte ; il mobilise des moyens de calcul considérables et reste l'affaire de quelques laboratoires. L'inférence utilise ensuite ces poids figés pour répondre à une question ; c'est elle, et elle seule, que l'on fait tourner en local. La différence ressemble à celle qui sépare la rédaction d'un dictionnaire de sa consultation : la première prend des années, la seconde quelques secondes, et personne n'a besoin de réécrire le dictionnaire pour y chercher un mot.

Faire tourner un modèle : moteur, format et quantification

Pour exécuter ces poids, il faut un moteur d'inférence, le programme qui charge le fichier en mémoire et enchaîne les calculs. Le plus répandu dans l'univers du local s'appelle llama.cpp. Écrit en C et C++ sans dépendance extérieure, il vise à faire tourner des modèles avec une installation minimale sur une large gamme de matériels : puces Apple, processeurs x86 classiques, cartes graphiques NVIDIA via CUDA, ou d'autres constructeurs via Vulkan. Des applications plus faciles d'accès, comme Ollama ou LM Studio, savent lire le même format de fichier.

Ce format s'appelle GGUF. Selon la documentation de Hugging Face, la principale plateforme de partage de modèles, un fichier GGUF réunit dans un seul binaire les poids et un ensemble normalisé de métadonnées : l'architecture, le vocabulaire de tokens, les réglages nécessaires au chargement. On le copie, on le charge, il fonctionne, un peu comme un PDF qui embarque ses propres polices.

Le facteur qui décide de presque tout est la mémoire. Dans sa forme d'origine, chaque paramètre est stocké sur 16 bits, soit deux octets. Un modèle de 7,3 milliards de paramètres occupe alors près de 15 Go, davantage que la mémoire de la plupart des ordinateurs de bureau. La quantification résout ce problème en arrondissant les poids sur moins de bits, comme on réduit le nombre de couleurs d'une photo sans que l'œil voie la différence au premier regard. llama.cpp prend en charge des quantifications de 1,5 à 8 bits. Le type Q4_K, très utilisé, revient à 4,5 bits par poids d'après la documentation de Hugging Face : le même modèle descend alors autour de 4 Go.

Cette compression a un prix, une légère perte de précision qui s'accentue à mesure qu'on descend en bits. Et la mémoire ne sert pas qu'à stocker les poids. La documentation d'Ollama rappelle qu'une fenêtre de contexte plus longue réclame davantage de mémoire, puisque la machine garde la trace de tout le texte en cours de traitement. Si la mémoire graphique manque, le logiciel peut se rabattre sur la mémoire vive ordinaire, avec des réponses plus lentes. Le choix du matériel découle de trois paramètres : la taille du modèle, son niveau de quantification et la longueur des textes à traiter.

Pourquoi c'est devenu réaliste en quelques années

Il y a peu, faire tourner un modèle compétent sur une seule machine relevait de la démonstration de laboratoire. Trois mesures publiées dans l'AI Index 2025 de l'université Stanford montrent ce qui a changé.

La première concerne la taille. En 2022, le plus petit modèle dépassant 60 % de bonnes réponses au MMLU, un test à choix multiples couvrant de nombreuses disciplines, était PaLM de Google, avec 540 milliards de paramètres. En 2024, Phi-3-mini de Microsoft a franchi le même seuil avec 3,8 milliards de paramètres, soit un modèle 142 fois plus petit. Une fois quantifié, un modèle de ce gabarit tient dans la mémoire d'un ordinateur portable.

La deuxième concerne l'écart entre modèles fermés et modèles à poids ouverts. Début janvier 2024, sur le classement Chatbot Arena, où des internautes comparent à l'aveugle les réponses de deux modèles, le meilleur modèle fermé devançait le meilleur modèle ouvert de 8,04 %. En février 2025, l'écart n'était plus que de 1,70 %.

La troisième concerne le coût. Toujours selon Stanford, le coût d'inférence d'un système du niveau de GPT-3.5 a été divisé par plus de 280 entre novembre 2022 et octobre 2024. Dans le même temps, le coût du matériel a baissé d'environ 30 % par an et son efficacité énergétique a progressé de 40 % par an.

Ces chiffres décrivent une tendance, pas une égalité. Les plus grands modèles fermés gardent l'avantage sur les tâches les plus difficiles, et un classement fondé sur les préférences d'internautes ne mesure pas tout. La frontière de ce qu'on peut faire sans centre de données s'est néanmoins nettement déplacée.

Local ou ChatGPT : la question est de savoir où voyage le texte

Vu de l'utilisateur, les deux expériences se ressemblent : une zone de saisie, une réponse qui s'affiche mot après mot. La différence se joue dans le trajet. Avec un service en ligne, la question, les documents joints et la réponse transitent par les serveurs du fournisseur. Avec une IA locale, ils ne quittent pas la machine.

Ce trajet a des conséquences concrètes. OpenAI indique que les conversations des comptes ChatGPT gratuits et Plus peuvent servir à améliorer ses modèles tant que l'utilisateur n'a pas désactivé l'option, alors que les données de ses offres professionnelles et de son API ne sont pas utilisées par défaut. La CNIL, dans ses questions-réponses sur l'IA générative publiées en juillet 2024, observe qu'avec une utilisation par API, la maîtrise du système se trouve « quasi exclusivement » entre les mains du fournisseur. Elle recommande un déploiement sur site lorsque des données personnelles ou sensibles sont traitées, afin de limiter les risques d'extraction par un tiers.

L'ANSSI, l'agence nationale de la sécurité des systèmes d'information, va dans le même sens dans ses recommandations de sécurité pour les systèmes d'IA générative, publiées le 29 avril 2024. Sa recommandation R34 déconseille les outils d'IA générative accessibles sur internet pour un usage professionnel impliquant des données sensibles : l'organisation ne contrôle pas le service et ne peut donc pas garantir la confidentialité de ce qu'elle y envoie.

Le local a d'autres propriétés. Il fonctionne sans connexion. Son coût ne dépend pas du nombre de questions posées, puisqu'il s'agit d'un matériel acheté plutôt que d'un compteur. Il ne change pas du jour au lendemain parce qu'un fournisseur a remplacé ou retiré un modèle. En contrepartie, l'organisation gère elle-même la machine, les mises à jour et les sauvegardes, et elle n'a pas accès aux plus grands modèles fermés, qui ne sont proposés qu'en ligne. Beaucoup d'organisations combinent les deux : le local pour ce qui est confidentiel ou répétitif, un service distant pour des besoins ponctuels et sans données sensibles.

Ce qu'on peut faire concrètement avec une IA locale

Les usages qui fonctionnent le mieux sont ceux où le modèle travaille sur un texte qu'on lui fournit, plutôt que de puiser dans sa mémoire. Résumer un compte rendu de réunion de trente pages. Reformuler un courrier dans un registre plus neutre. Extraire d'une facture le fournisseur, la date et le montant pour les ranger dans un tableau. Traduire une notice technique. Classer les courriels entrants selon leur objet avant de les orienter vers le bon service.

Le cas le plus demandé en entreprise consiste à interroger ses propres documents : procédures internes, contrats, conventions, base de connaissances du support. La technique employée, appelée RAG pour génération augmentée par récupération, retrouve d'abord les passages pertinents, puis demande au modèle de répondre à partir d'eux en citant ses sources. Nous lui consacrons un article détaillé.

Viennent ensuite des usages plus techniques : aide à l'écriture de code, transcription de réunions par un modèle de reconnaissance vocale lui aussi exécuté sur place, analyse de journaux d'erreurs. Ces usages se diffusent vite. Selon Eurostat, 20 % des entreprises européennes d'au moins dix salariés utilisaient une technologie d'intelligence artificielle en 2025, contre 13,5 % un an plus tôt.

Dans tous ces cas, la machine produit un premier jet ou un tri, et une personne valide. C'est dans cette configuration que le rapport entre le temps gagné et le risque pris est le plus favorable.

Les limites, sans les maquiller

Un modèle de langage peut affirmer avec aplomb une chose fausse. Ce phénomène, appelé hallucination, découle directement de son fonctionnement : il produit un texte plausible, et un texte plausible peut contenir une date inventée, une référence juridique inexistante ou un chiffre mal recopié. Tourner en local ne change rien à ce point. La parade consiste à lui fournir les sources plutôt que de compter sur sa mémoire, et à faire relire tout ce qui engage l'organisation.

Ses connaissances s'arrêtent à la fin de son entraînement. Un modèle publié il y a un an ignore la dernière réforme, le dernier barème, la dernière version d'un logiciel. Il ne consulte pas internet de lui-même : une IA locale isolée du réseau ne sait que ce qu'elle a appris et ce qu'on lui donne à lire.

Un petit modèle reste un petit modèle. Les progrès mesurés par Stanford sont réels, mais un modèle de quelques milliards de paramètres se trompe plus souvent qu'un modèle géant sur un raisonnement en plusieurs étapes, un calcul ou une question très spécialisée. La vitesse dépend du matériel : sur un ordinateur sans processeur graphique adapté, une réponse longue peut se faire attendre.

Enfin, une installation locale est un système informatique comme un autre. Il faut l'administrer, appliquer les correctifs, contrôler qui y accède. L'ANSSI consacre une partie de ses recommandations à l'isolement des systèmes d'IA, à la journalisation des traitements et à la gestion des droits. Local ne veut pas dire sûr par défaut ; cela veut dire que la sécurité dépend de l'organisation qui l'exploite.

Comment démarrer

Le plus simple est d'essayer sur un ordinateur récent avec une application comme Ollama ou LM Studio. Choisissez un petit modèle à poids ouverts, de quelques milliards de paramètres, quantifié sur 4 bits. Testez-le sur des tâches réelles mais sans données confidentielles : résumer un document public, reformuler un texte, extraire des informations d'un formulaire vierge. Notez la qualité, la vitesse et les erreurs.

Cette première étape sert à cerner les besoins avant toute dépense : les usages qui reviennent chaque semaine, le volume de documents à traiter, le nombre de personnes qui utiliseront le système en même temps. Ces éléments déterminent la taille du modèle, donc la mémoire nécessaire, donc le matériel.

Pour un usage d'équipe, le portable de test ne suffit plus. Il faut une machine qui reste allumée, accessible sur le réseau interne, avec une gestion des comptes, des droits et des journaux. C'est le rôle d'un serveur ou d'un boîtier dédié.

Chez HOMN, c'est cette dernière configuration que nous construisons : le modèle, les documents et les journaux restent sur une machine installée chez l'utilisateur, et le recours à un service extérieur reste un choix explicite. La démarche vaut quel que soit l'outil retenu : savoir où tourne le modèle, ce qu'il contient et où partent les données.

Qu'est-ce qu'une IA locale ?

Une IA locale est un modèle d'intelligence artificielle, le plus souvent un modèle de langage, qui s'exécute sur un matériel que l'utilisateur contrôle : ordinateur, serveur ou boîtier installé dans ses locaux. Les questions et les documents traités ne sont pas envoyés aux serveurs d'un fournisseur. Le modèle est un fichier téléchargé une fois, puis utilisé sans connexion.

Faut-il une connexion internet pour utiliser une IA locale ?

Non, pas pour fonctionner. Internet sert à télécharger le modèle et les mises à jour du logiciel, mais le calcul des réponses se fait entièrement sur la machine. Une IA locale peut donc tourner sur un réseau isolé.

Une IA locale est-elle aussi performante que ChatGPT ?

Pas sur tout : les plus grands modèles fermés restent devant sur les tâches de raisonnement les plus difficiles. L'écart s'est toutefois fortement réduit, puisque selon l'AI Index 2025 de Stanford il est passé de 8,04 % à 1,70 % sur le classement Chatbot Arena entre janvier 2024 et février 2025. Pour résumer, reformuler, extraire ou interroger des documents, un bon modèle à poids ouverts suffit dans la plupart des cas.

Quel matériel faut-il pour faire tourner un LLM en local ?

Tout dépend de la taille du modèle et de sa quantification. Un modèle de 7 milliards de paramètres quantifié sur 4 bits occupe environ 4 Go, et la documentation d'Ollama recommande 8 Go de mémoire graphique ou unifiée pour son modèle d'exemple. Pour un usage partagé par une équipe, il faut une machine dédiée dotée de davantage de mémoire.