IA locale ou cloud : où vont les données de l'entreprise, et comment choisir

Le 2 mai 2023, Samsung Electronics a interdit à ses salariés d'utiliser ChatGPT et les autres assistants d'IA générative sur les ordinateurs, téléphones et tablettes de l'entreprise, ainsi que sur son réseau interne. Quelques semaines plus tôt, des ingénieurs avaient collé du code source interne dans ChatGPT. Personne n'avait piraté quoi que ce soit. Le code était parti chez un tiers par le chemin prévu, celui que suit chaque requête envoyée à un assistant en ligne.

Le chemin d'une requête envoyée à un assistant en ligne

Un modèle de langage est un programme entraîné sur de très grandes quantités de texte, qui calcule la suite de mots la plus probable à partir de ce qu'on lui soumet. Le faire répondre s'appelle l'inférence. Elle demande des processeurs graphiques, ou GPU, des puces conçues pour enchaîner des milliards de multiplications, et ces puces coûtent cher.

Une entreprise a deux façons d'y accéder. Elle peut louer la capacité d'un fournisseur par Internet : c'est le cloud. Le texte de la requête, les pièces jointes et l'historique de la conversation quittent alors son réseau, sont traités dans un centre de données qui appartient au fournisseur, puis la réponse revient. Elle peut aussi installer le modèle sur une machine qu'elle possède, dans ses locaux. On parle alors d'IA locale, ou de déploiement « sur site ». La requête ne sort pas du bâtiment.

Pour la personne qui tape la question, les deux se ressemblent : une fenêtre, un texte, une réponse en quelques secondes. La différence porte sur ce qui arrive ensuite au texte. Dans le cloud, son sort dépend des conditions générales du fournisseur, de sa nationalité, de ses sous-traitants et des tribunaux devant lesquels il peut être convoqué. En local, il dépend des règles que l'entreprise s'est données.

Ce que les fournisseurs conservent, et qui peut le réclamer

Les fournisseurs gardent une trace des échanges, au moins pendant un temps, pour détecter les abus, facturer ou améliorer leur service. Selon l'offre souscrite, ces échanges peuvent aussi servir à entraîner les modèles suivants. Les contrats destinés aux entreprises excluent en général cet usage, mais la durée de conservation et la liste des sous-traitants figurent dans les annexes du contrat, pas sur la page d'accueil.

Le procès qui oppose le New York Times à OpenAI devant le tribunal fédéral du district sud de New York a montré jusqu'où peut aller cette conservation. Début décembre 2025, la juge Ona Wang a refusé de revenir sur sa décision obligeant OpenAI à remettre aux éditeurs de presse 20 millions de conversations ChatGPT dépersonnalisées. Selon le compte rendu d'eWeek, elle a relevé que cet échantillon ne représentait qu'une petite fraction des dizaines de milliards de conversations de particuliers conservées par l'entreprise. Les données ont été dépersonnalisées et placées sous une ordonnance de protection qui en réserve la lecture aux avocats.

Les utilisateurs dont les conversations figurent dans cet échantillon n'étaient pas parties au procès. Leurs échanges sont devenus des pièces dans un litige sur le droit d'auteur pour une seule raison : ils étaient stockés chez le fournisseur. Pour une entreprise, la conclusion pratique tient en une phrase. Tout ce qu'un tiers conserve peut un jour être demandé par un juge ou une autorité, dans une affaire qui ne la concerne pas.

Le Cloud Act suit la nationalité du fournisseur, pas l'adresse du serveur

Le Cloud Act est une loi américaine adoptée en mars 2018. Sa disposition la plus commentée, codifiée à la section 2713 du titre 18 du code fédéral, oblige les fournisseurs de services de communication électronique et de stockage à distance à conserver ou à communiquer les données de leurs clients qui sont en leur possession, sous leur garde ou sous leur contrôle. Le texte précise que cette obligation vaut que les données se trouvent aux États-Unis ou à l'étranger.

Un serveur installé à Paris par une société soumise au droit américain reste donc dans le champ de la loi. Le 10 juin 2025, devant la commission d'enquête du Sénat sur la commande publique, le sénateur Dany Wattebled a demandé au directeur des affaires publiques et juridiques de Microsoft France, Anton Carniaux, s'il pouvait garantir sous serment que les données de citoyens français confiées à Microsoft ne seraient jamais transmises sur injonction du gouvernement américain sans l'accord des autorités françaises. Anton Carniaux a répondu qu'il ne pouvait pas le garantir, en ajoutant que cela ne s'était jamais produit.

Le ministère américain de la Justice présente le texte comme un outil d'enquête sur les crimes graves, complété par des accords bilatéraux avec des pays partenaires. Cette description est exacte, et rien n'indique que les données d'une PME française soient une cible courante. Mais l'exposition juridique existe, elle concerne tous les clients d'un fournisseur soumis au droit américain, et l'un des plus grands d'entre eux a déclaré sous serment qu'il ne pouvait pas l'écarter. Un fournisseur qui échappe à la juridiction américaine n'est pas tenu par cette obligation. Un modèle installé dans les locaux de l'entreprise ne l'est pas davantage, puisque aucun tiers ne détient les données.

Les transferts vers les États-Unis reposent sur un accord contesté

Le RGPD, le règlement européen sur la protection des données personnelles, n'autorise l'envoi de ces données hors de l'Union que si le pays de destination offre une protection jugée équivalente, ou si des garanties contractuelles sont mises en place. Pour les États-Unis, cette équivalence repose depuis juillet 2023 sur le cadre de protection des données entre l'Union européenne et les États-Unis, appelé Data Privacy Framework.

Ses deux prédécesseurs ont été annulés par la Cour de justice de l'Union européenne, le Safe Harbor en octobre 2015 et le Privacy Shield en juillet 2020, chaque fois à la suite d'une procédure engagée par le militant autrichien Maximilian Schrems. Le troisième tient pour l'instant. Le 3 septembre 2025, le Tribunal de l'Union européenne a rejeté le recours du député français Philippe Latombe et confirmé la validité du cadre. Le 31 octobre 2025, Philippe Latombe a formé un pourvoi devant la Cour de justice. À notre connaissance, à la date de publication de cet article, la Cour ne s'est pas encore prononcée.

Une entreprise qui confie des données personnelles à un assistant hébergé par un fournisseur américain s'appuie donc sur un mécanisme dont les deux versions précédentes ont été invalidées. Si le troisième tombe, il faudra revoir les contrats, réévaluer les transferts et parfois suspendre des usages en urgence. Un traitement réalisé sur une machine installée dans l'entreprise n'implique aucun transfert et n'est pas concerné.

Ce que recommande la CNIL pour l'IA générative

La CNIL a publié le 18 juillet 2024 une série de questions-réponses sur l'utilisation des systèmes d'IA générative. Le document ne prescrit aucune technologie, mais il est clair sur un point. Lorsqu'une organisation compte fournir au système des données personnelles de clients ou de salariés, ou de la documentation sensible ou stratégique, il lui semble « généralement plus opportun et plus sécurisé » de privilégier un déploiement sur site, qui limite les risques d'extraction de données par un tiers.

La CNIL reconnaît aussi le coût de cette option. Installer et faire fonctionner un système sur site représente une dépense importante, et le recours à une infrastructure distante sera souvent plus simple. Elle ajoute que rien n'interdit aux petites entreprises ou aux collectivités de partager une infrastructure mutualisée, à condition d'encadrer les transferts de données et d'en assurer la sécurité.

Pour un service en ligne, elle demande de vérifier si les conditions générales du fournisseur l'autorisent à réutiliser les données saisies. Si c'est le cas, l'organisation doit décider au cas par cas s'il faut interdire certaines catégories d'informations, par exemple celles couvertes par le secret des affaires. Le prestataire doit être encadré par un contrat de sous-traitance qui fixe ses responsabilités et les accès autorisés. Au sens du RGPD, un sous-traitant est l'entreprise qui traite des données personnelles pour le compte d'une autre.

Héberger le modèle sur place ne dispense d'aucune obligation du RGPD. Il faut toujours définir une finalité, limiter les données à ce qui est nécessaire, fixer une durée de conservation et sécuriser la machine. Le local réduit en revanche le nombre de contrats à tenir et d'acteurs à auditer.

Le calendrier de l'AI Act après l'omnibus de juillet 2026

Le règlement européen sur l'intelligence artificielle, appelé AI Act, est entré en vigueur le 1er août 2024. Il classe les systèmes selon le risque qu'ils présentent et impose des obligations à deux catégories d'acteurs : les fournisseurs, qui conçoivent les systèmes, et les déployeurs, qui les utilisent dans leur activité. Une PME qui met un assistant à disposition de ses équipes est un déployeur.

Les pratiques interdites, comme la notation sociale des personnes, le sont depuis le 2 février 2025. Les obligations propres aux modèles d'IA à usage général, dont font partie les grands modèles de langage, s'appliquent depuis le 2 août 2025, et la Commission européenne dispose de ses pouvoirs de contrôle sur ces modèles depuis le 2 août 2026. Les règles de transparence, qui imposent par exemple d'informer une personne qu'elle échange avec une IA, s'appliquent depuis la même date.

Le règlement (UE) 2026/1744, dit omnibus numérique sur l'IA, publié au Journal officiel en juillet 2026, a repoussé deux échéances. Les systèmes à haut risque de l'annexe III, qui couvre notamment le recrutement, l'évaluation du crédit et l'éducation, devront être conformes au 2 décembre 2027. Ceux de l'annexe I, intégrés à des produits déjà réglementés comme les machines ou les dispositifs médicaux, au 2 août 2028.

Le texte ne distingue pas le cloud du local. Il demande en revanche à l'entreprise de savoir quel système elle utilise, pour quel usage et avec quelles données, et de pouvoir le documenter. Cette documentation est plus facile à tenir quand la version du modèle ne change pas à l'insu de ceux qui l'utilisent, un point sur lequel les deux options diffèrent nettement.

Le coût : payer à la requête ou acheter une capacité

Les services en ligne facturent à l'usage, en général au nombre de jetons traités. Un jeton est un fragment de mot, l'unité que le modèle lit et produit. Tant que quelques salariés font des essais, la facture reste modeste. Quand l'outil lit chaque jour des centaines de documents ou répond à chaque demande client, elle suit le volume, à un tarif fixé par le fournisseur et qu'il peut réviser.

Une machine installée sur place inverse le calcul. La plus grande part de la dépense est engagée à l'achat, puis chaque requête supplémentaire ne coûte que l'électricité et l'usure du matériel. Pour un usage occasionnel, la location reste moins chère. Pour un usage quotidien et soutenu, l'achat finit par l'emporter. Le point de bascule dépend des volumes de chaque entreprise et se calcule sur ses propres chiffres.

Deux mesures publiées par l'AI Index de l'université Stanford pèsent sur ce calcul. Selon l'édition 2025, le coût d'inférence d'un système du niveau de GPT-3.5 a été divisé par plus de 280 entre novembre 2022 et octobre 2024. La même édition indiquait que les modèles à poids ouverts, que l'on peut télécharger et faire tourner sur sa propre machine, avaient ramené leur retard sur les modèles fermés de 8 % à 1,7 % sur certains tests, en un an.

L'édition 2026 nuance ce second chiffre. En mars 2026, sur le classement Arena, établi à partir de votes d'utilisateurs qui comparent des réponses à l'aveugle, le meilleur modèle fermé devançait le meilleur modèle ouvert de 3,4 %, contre 0,5 % en août 2024. Le retard reste faible, mais il ne se réduit pas en ligne droite : il se creuse à chaque sortie d'un nouveau modèle fermé, puis se resserre.

Pannes et latence : le prix de la distance

Dans la nuit du 19 au 20 octobre 2025, la région de Virginie du Nord d'Amazon Web Services a subi une panne en chaîne. Selon le compte rendu publié par AWS, un défaut de synchronisation entre deux processus automatiques du système qui gère les adresses de sa base de données DynamoDB a produit un enregistrement DNS vide. Le DNS est l'annuaire qui traduit le nom d'un service en adresse réseau. Sans cette entrée, les applications ne trouvaient plus DynamoDB. Cette première phase a duré de 23 h 48 à 2 h 40, heure du Pacifique, soit 2 heures et 52 minutes.

La suite a duré beaucoup plus longtemps. Plusieurs services internes d'AWS qui s'appuient sur DynamoDB ont été touchés en cascade, et les clients du service de calcul EC2 ont subi des erreurs, des lenteurs et des échecs de démarrage de machines jusqu'à 13 h 50 le 20 octobre, environ quatorze heures après le début de l'incident. Les applications construites au-dessus de ces services ont été interrompues à leur tour.

Une infrastructure installée dans l'entreprise tombe en panne elle aussi. Un disque lâche, une alimentation grille, une mise à jour se passe mal. La différence tient à qui diagnostique et à qui décide de l'ordre de remise en service. Elle tient aussi à la connexion Internet, qui devient un point de défaillance supplémentaire dès que l'outil quotidien des équipes se trouve chez un tiers.

La latence, c'est-à-dire le délai entre l'envoi d'une requête et le début de la réponse, suit la même logique. Dans une conversation, une seconde de plus passe inaperçue. Pour un logiciel métier qui interroge le modèle des centaines de fois par heure, les allers-retours s'additionnent, et leur durée varie avec la charge du fournisseur. Sur le réseau interne, le délai est plus stable, à condition que la machine soit dimensionnée pour le nombre d'utilisateurs.

Quand le fournisseur change de modèle

Le 7 août 2025, OpenAI a lancé GPT-5 et en a fait le modèle par défaut de ChatGPT, en retirant de l'interface les modèles précédents, dont GPT-4o. Les protestations ont été immédiates, et dans les jours suivants Sam Altman a annoncé que les abonnés Plus pourraient de nouveau choisir GPT-4o. L'épisode concernait surtout des particuliers attachés au ton de l'ancien modèle. Dans une entreprise, le même mécanisme a des conséquences plus concrètes.

Un processus mis au point avec une version précise d'un modèle, par exemple l'extraction automatique des montants et des dates sur des factures, peut se comporter autrement avec la version suivante. Il faut alors refaire les tests, réécrire les consignes données au modèle, parfois reprendre la documentation fournie à un client ou à un auditeur. Les tarifs et les conditions d'utilisation évoluent de la même manière, à l'initiative du fournisseur. Plus l'outil est intégré, plus il coûte de partir. Les économistes appellent cela un coût de sortie, et les informaticiens parlent d'enfermement propriétaire.

Un modèle ouvert installé sur place ne change pas tant que l'entreprise ne le remplace pas. Les mêmes consignes, appliquées au même modèle avec les mêmes réglages, donnent des résultats comparables d'un mois sur l'autre, ce qui permet de documenter un usage et de le défendre. Le remplacement reste possible quand un meilleur modèle sort, au moment choisi et après des tests sur les documents de l'entreprise.

Les cas où le cloud reste préférable

Les modèles les plus puissants ne sont accessibles que par API, c'est-à-dire par une interface qui permet à un logiciel d'interroger le service à distance, et certains ne tiendraient de toute façon pas sur une machine de bureau. Pour des raisonnements très longs, de la programmation sur de grands projets ou des tâches qui enchaînent des dizaines d'étapes sans supervision, ils gardent une avance mesurable. Si le besoin réclame exactement ce niveau, le cloud est souvent la seule option raisonnable.

Le cloud convient aussi aux projets courts, comme une démonstration ou un pilote de quelques semaines avant d'investir. Il convient aux charges très irrégulières, quand une machine dimensionnée pour le pic resterait inactive le reste du mois. Et il convient aux textes sans sensibilité : reformuler une annonce déjà publique ou chercher un titre d'article n'expose rien.

Le choix se fait donc après un tri des données. Une information publique peut partir chez un fournisseur. Les données personnelles, les contrats, les chiffres non publiés et le savoir-faire technique justifient soit un traitement sur place, soit un prestataire dont on a lu le contrat, vérifié la juridiction et contrôlé la sécurité.

Traiter sur place par défaut, sortir sur décision

Une règle simple permet de combiner les deux approches. Les requêtes sont traitées par défaut sur une machine de l'entreprise. L'envoi vers un service externe devient une décision explicite, prise pour une tâche précise, enregistrée, et qu'un responsable peut refuser. La plupart des demandes courantes, comme résumer un dossier, rédiger une réponse ou retrouver une clause dans un lot de contrats, sont à la portée de modèles de taille moyenne qui tournent sur du matériel de bureau. Les autres partent à l'extérieur, en connaissance de cause.

Pour chaque outil d'IA déjà en service, trois vérifications donnent une image assez nette de la situation : où le texte est traité, qui le conserve et pendant combien de temps, et ce qui se passe si le service s'interrompt une journée. Les réponses figurent dans les contrats, les annexes de sous-traitance et les pages d'état des fournisseurs.

C'est sur ce principe que HOMN conçoit ses boîtiers : un modèle installé dans les locaux, qui travaille sur les documents de l'entreprise sans les transmettre, et qui ne se connecte à un service extérieur que lorsque son propriétaire l'a décidé.

Quelle est la différence entre une IA locale et une IA dans le cloud ?

Une IA dans le cloud fonctionne sur les serveurs d'un fournisseur : chaque requête quitte l'entreprise, est traitée dans un centre de données externe, puis la réponse revient. Une IA locale fonctionne sur une machine installée dans les locaux de l'entreprise, et les requêtes ne sortent pas de son réseau.

Le Cloud Act s'applique-t-il aux données stockées en France ?

Oui, lorsque le fournisseur est soumis au droit américain. La loi vise les données en sa possession, sous sa garde ou sous son contrôle, où qu'elles soient stockées. Le 10 juin 2025, le directeur des affaires publiques et juridiques de Microsoft France a déclaré sous serment devant le Sénat ne pas pouvoir garantir que ces données ne seraient jamais transmises aux autorités américaines.

Peut-on utiliser ChatGPT en entreprise en respectant le RGPD ?

C'est possible avec un contrat de sous-traitance, des garanties pour les transferts hors de l'Union et une règle interne sur les données autorisées. La CNIL demande de vérifier si le fournisseur peut réutiliser les données saisies, et juge généralement préférable un déploiement sur site pour les données personnelles ou sensibles.

Quand une IA locale est-elle plus rentable que le cloud ?

Quand l'usage est quotidien et soutenu. Le cloud est facturé au volume de texte traité, alors qu'une machine locale se paie à l'achat puis ne coûte que l'électricité et la maintenance. Pour un usage ponctuel ou très irrégulier, la location reste en général moins chère.