Faire parler une IA avec ses propres documents : comment fonctionne le RAG

La plupart des projets d'IA en entreprise reposent sur une même technique : retrouver les bons passages dans les documents de l'organisation, puis demander au modèle de répondre à partir d'eux. Voici comment elle fonctionne, où elle se trompe, et pourquoi les documents sensibles gagnent à rester sur place.

Une bonne source, une mauvaise réponse

Un passager interroge l'assistant conversationnel du site d'Air Canada sur les tarifs réservés aux voyages pour cause de deuil. L'assistant lui explique qu'il peut payer son billet au prix normal et demander la réduction après coup, dans un délai de 90 jours. Dans le même message, il fournit un lien vers la page officielle de la compagnie. Cette page dit l'inverse : le tarif de deuil ne s'applique pas aux demandes déposées après le voyage.

Le tribunal de résolution des litiges civils de Colombie-Britannique a tranché en février 2024. Air Canada soutenait que son assistant s'apparentait à une entité distincte, responsable de ses propres propos ; le tribunal a jugé l'argument « remarquable » et l'a écarté. La compagnie a dû verser la différence entre le prix payé et le tarif de deuil. Pour le tribunal, peu importe que l'information vienne d'une page fixe ou d'un assistant : l'entreprise répond de ce qui figure sur son site.

L'épisode résume le problème que cherche à résoudre la génération augmentée par récupération, ou RAG pour retrieval-augmented generation. Le document exact existait. Il manquait un système qui réponde à partir de lui, et qui montre d'où vient chaque affirmation.

Le principe : un examen à livre ouvert

Le terme apparaît en 2020 dans un article signé par Patrick Lewis et onze coauteurs, présenté à la conférence NeurIPS. Les auteurs y distinguent deux mémoires. La mémoire paramétrique est celle que le modèle a absorbée pendant son entraînement, inscrite dans ses paramètres. La mémoire non paramétrique est un index externe, dans leur expérience une version de Wikipédia, que le système consulte au moment de répondre. Leur conclusion : la combinaison des deux produit des textes plus précis et plus factuels que le modèle seul.

La comparaison la plus parlante est celle de l'examen. Un étudiant qui a tout appris par cœur répond vite, mais se trompe sur ce qu'il a mal retenu et ignore tout ce qui a changé depuis ses révisions. Un étudiant autorisé à ouvrir son classeur cherche d'abord la bonne page, puis rédige à partir de ce qu'il lit. Le RAG place le modèle de langage dans la situation du second.

La CNIL résume l'intérêt de la méthode : elle produit des réponses enrichies par des données externes, plus spécifiques et plus faciles à actualiser que le modèle lui-même. C'est le point décisif pour une entreprise. Réentraîner un modèle sur ses documents coûte cher et doit être refait à chaque mise à jour. L'ANSSI ajoute un argument de sécurité : une fois des données intégrées à l'entraînement, il devient impossible d'y appliquer des droits d'accès, alors que des documents stockés à côté du modèle peuvent rester soumis aux règles habituelles de qui voit quoi.

Concrètement, un RAG enchaîne quatre opérations : préparer les documents, les convertir en coordonnées, retrouver les passages utiles, puis rédiger une réponse qui les cite.

Étape 1 : préparer et découper les documents

Tout commence par l'extraction du texte. Un fichier de traitement de texte ou une page web se lisent facilement ; un PDF scanné demande une reconnaissance de caractères, un tableau ou un schéma réclament un traitement particulier. Ce travail ingrat détermine une bonne part de la qualité finale : un texte mal extrait donnera des réponses fausses, quelle que soit la puissance du modèle.

Le texte est ensuite découpé en morceaux de quelques paragraphes, que les praticiens appellent chunks. Le découpage est nécessaire parce que la recherche doit pointer un passage précis, pas un rapport de deux cents pages. Il crée aussi un piège, bien décrit par Anthropic dans une publication de septembre 2024 : un morceau isolé perd son contexte. L'exemple retenu est celui d'un rapport financier dont un extrait indique que le chiffre d'affaires a progressé de 3 % sur le trimestre, sans préciser de quelle entreprise ni de quel trimestre il s'agit.

Les parades sont connues. On fait légèrement se chevaucher les morceaux, on respecte les titres et les articles plutôt que de couper au milieu d'une phrase, et on ajoute à chaque morceau une courte description de son contexte : document d'origine, section, date. Ces métadonnées serviront plus tard à filtrer, à citer et à contrôler les accès.

Étape 2 : traduire le sens en coordonnées

Chaque morceau passe ensuite dans un modèle d'embedding, distinct du modèle qui rédigera la réponse. Son rôle est de transformer un texte en une liste de nombres, un vecteur, qui représente son sens. Deux passages qui parlent de la même chose, même avec des mots différents, obtiennent des vecteurs proches.

L'image la plus juste est celle d'une carte. Chaque passage reçoit des coordonnées, non pas sur deux axes comme une latitude et une longitude, mais sur des centaines ou des milliers de dimensions. Sur cette carte, « préavis de démission » se retrouve près de « délai à respecter avant de quitter l'entreprise », alors que les deux formules n'ont presque aucun mot en commun. C'est ce qui distingue la recherche sémantique de la recherche par mots-clés d'un moteur interne classique.

Ces vecteurs ont l'air abstraits. Ils le sont moins qu'on ne le croit. Dans un article présenté à la conférence EMNLP 2023, des chercheurs ont montré qu'on pouvait reconstituer exactement 92 % de textes courts, de 32 tokens, à partir de leurs seuls embeddings, et retrouver ainsi des noms complets dans des notes cliniques. Un index vectoriel doit donc être protégé avec le même soin que les documents dont il est tiré.

Étape 3 : ranger, puis retrouver

Les vecteurs sont stockés dans une base vectorielle, avec le texte d'origine et ses métadonnées. Quand un utilisateur pose une question, celle-ci est convertie en vecteur par le même modèle d'embedding, puis la base cherche les morceaux dont les coordonnées sont les plus proches. Le principe rappelle celui d'un bibliothécaire qui, au lieu de chercher le mot exact dans les titres, va droit au rayon où se trouvent les ouvrages traitant du sujet.

La recherche sémantique seule a ses faiblesses. Elle peut rater une référence exacte, un numéro de contrat ou un code d'article, qu'une recherche par mots-clés trouve sans peine. Les systèmes sérieux combinent donc les deux, puis ajoutent souvent une étape de reclassement : un second modèle relit les candidats retenus et les trie selon leur pertinence réelle pour la question posée.

Anthropic a chiffré l'effet de ces améliorations sur ses propres jeux de test. Avec une recherche vectorielle simple, la bonne information manquait dans les vingt premiers résultats dans 5,7 % des cas. En ajoutant du contexte à chaque morceau, ce taux tombait à 3,7 %. Combiné à une recherche par mots-clés de type BM25, il descendait à 2,9 %, puis à 1,9 % avec le reclassement. Ce sont les mesures d'un fournisseur sur ses données, mais l'ordre de grandeur montre que la recherche, plus que la rédaction, fait la qualité d'un RAG.

Étape 4 : rédiger la réponse et citer ses sources

Les quelques passages retenus sont insérés dans la consigne envoyée au modèle de langage, avec la question et des instructions explicites : répondre uniquement à partir des extraits fournis, indiquer pour chaque affirmation le document et la page, et dire clairement quand l'information n'y figure pas. Le modèle rédige alors une réponse en langage courant, et l'interface affiche les liens vers les passages cités.

La citation change la nature de l'outil. Sans elle, l'utilisateur doit croire la machine sur parole. Avec elle, il peut vérifier en un clic, et l'organisation peut retracer après coup l'origine d'une réponse contestée. Dans le cas d'Air Canada, le lien était présent mais contredisait le texte ; un système bien réglé doit produire une réponse fidèle à la source qu'il cite, et l'utilisateur doit avoir le réflexe de l'ouvrir.

Il ne faut pas non plus noyer le modèle sous les extraits. Une étude publiée en 2023 dans les Transactions of the Association for Computational Linguistics, sous le titre « Lost in the Middle », a montré que les modèles exploitent mieux une information placée au début ou à la fin du texte qu'on leur fournit, et nettement moins bien quand elle se trouve au milieu. Mieux vaut quelques passages pertinents qu'une pile de passages approximatifs.

Le RAG n'est d'ailleurs pas toujours nécessaire. Anthropic note qu'en dessous d'environ 200 000 tokens, soit à peu près 500 pages, il peut être plus simple d'insérer l'ensemble de la base dans la consigne, à condition que le modèle accepte une fenêtre de contexte aussi longue. Pour un règlement intérieur et quelques procédures, la question se pose. Pour les archives d'un cabinet, elle ne se pose pas.

Pourquoi presque tous les projets commencent par là

Un modèle de langage, même excellent, ne connaît ni les procédures internes d'une entreprise, ni ses contrats, ni ses fiches produits, ni l'historique de ses dossiers. Le RAG est la manière la plus directe de lui donner accès à cette connaissance sans le modifier. Ajouter un document revient à l'indexer ; retirer une version obsolète revient à la supprimer de l'index. L'opération relève de la gestion documentaire, pas d'un nouvel entraînement.

Les usages se ressemblent d'un secteur à l'autre. Un service RH répond aux questions récurrentes des salariés sur la convention collective ou les congés. Un support client retrouve la bonne fiche technique. Un service juridique interroge une base de contrats pour repérer les clauses de résiliation. Une collectivité aide ses agents à s'orienter dans des délibérations et des règlements accumulés depuis des années. Dans chacun de ces cas, la valeur tient moins à la rédaction qu'à la capacité de retrouver le bon passage.

Les hallucinations diminuent, elles ne disparaissent pas

Le RAG est souvent présenté comme le remède aux réponses inventées. Une étude du RegLab et de l'institut HAI de l'université Stanford, publiée en mai 2024 et menée sur plus de 200 questions juridiques, nuance fortement cette promesse. Les outils de recherche juridique de LexisNexis et de Thomson Reuters, fondés sur le RAG et dont certains revendiquaient l'absence d'hallucinations, produisaient des informations incorrectes dans plus de 17 % des cas pour Lexis+ AI et Ask Practical Law AI, et dans plus de 34 % des cas pour Westlaw AI-Assisted Research. GPT-4 utilisé seul faisait nettement pire, avec 58 à 82 % d'erreurs sur ce type de questions.

Les auteurs relèvent plusieurs causes : une recherche qui ramène des textes non applicables, une difficulté propre au raisonnement juridique, et la tendance du modèle à aller dans le sens de la question, même quand celle-ci repose sur une prémisse fausse. Le RAG déplace donc le risque plus qu'il ne le supprime. Si la recherche ramène le mauvais passage, le modèle rédige une réponse fluide à partir du mauvais passage.

Les protections sont surtout organisationnelles. On constitue un jeu de questions réelles dont on connaît les bonnes réponses, et l'on mesure le système dessus avant de le déployer, puis à chaque changement. On l'autorise à répondre qu'il ne sait pas. On réserve une validation humaine aux réponses qui engagent l'organisation. Dans son accompagnement d'un projet de France Travail, la CNIL insistait sur ce dernier point : former les agents pour qu'ils repèrent les erreurs, et leur laisser le temps de s'écarter de la suggestion de l'outil.

Droits d'accès : l'assistant voit ce que voit l'index

Le risque le plus sous-estimé n'est pas l'erreur, c'est la fuite interne. Si tous les documents d'une organisation sont indexés dans une même base, un stagiaire peut demander à l'assistant le salaire de son directeur et obtenir un extrait de fiche de paie. Le modèle n'a rien forcé ; il a lu ce que la base lui a transmis.

L'ANSSI en fait une exigence explicite : un système d'IA doit respecter, dans ses réponses, les restrictions d'accès propres à chaque utilisateur. Elle précise que c'est faisable pour les documents stockés à côté du modèle, selon les capacités de l'outil de stockage, et recommande de revoir régulièrement les droits configurés, par exemple chaque mois. Microsoft, dans sa documentation de préparation à Copilot, le formule à sa manière : l'assistant respecte les permissions existantes, ce qui revient à exposer tous les partages trop larges accumulés au fil des années. L'éditeur rappelle d'ailleurs que les réglages de partage de SharePoint sont, par défaut, les plus permissifs.

L'OWASP, fondation de référence en sécurité des applications, consacre dans l'édition 2025 de son classement des dix principaux risques liés aux modèles de langage une catégorie aux faiblesses des vecteurs et des embeddings. On y trouve les fuites entre utilisateurs ou clients qui partagent une même base vectorielle, l'empoisonnement de la base par des documents piégés et l'inversion des embeddings évoquée plus haut. L'exemple cité parle de lui-même : un CV contenant, en texte blanc sur fond blanc, une consigne destinée à faire recommander le candidat par le système de tri. Tout document indexé finira sous les yeux du modèle ; il faut savoir d'où il vient.

La conséquence pratique est simple à énoncer et longue à mettre en œuvre. Chaque morceau indexé doit porter les droits de son document d'origine, la recherche doit filtrer selon l'identité de la personne qui interroge, et chaque consultation doit être journalisée.

Documents périmés, réponses périmées

Un RAG répond à partir de ce qu'on lui a confié. Si l'index contient la note de service de 2019 et celle qui l'a remplacée, il peut citer l'une ou l'autre avec la même assurance. Le cas est courant dans les organisations où les documents s'empilent sans jamais être retirés : anciennes grilles tarifaires, procédures abandonnées, modèles de contrats dépassés.

La parade est documentaire avant d'être technique. Il faut désigner un responsable pour chaque corpus, dater les documents, archiver ce qui est remplacé, et faire en sorte que l'index suive automatiquement les ajouts, les modifications et les suppressions. Microsoft recommande lui-même d'archiver les sites inactifs pour que son assistant s'appuie sur du contenu à jour. Côté interface, afficher la date de chaque source citée permet de repérer d'un coup d'œil une réponse fondée sur un texte ancien.

Pourquoi le faire tourner en local pour des documents sensibles

Un RAG manipule, par construction, les documents les plus précieux de l'organisation. Avec un service en ligne, ces documents, leurs vecteurs, les questions des utilisateurs et les réponses transitent ou séjournent chez le fournisseur. Dans ses questions-réponses de juillet 2024 sur l'IA générative, la CNIL recommande de privilégier un déploiement sur site lorsque des données personnelles ou sensibles sont traitées, pour limiter les risques d'extraction par un tiers. L'ANSSI, dans sa recommandation R34, déconseille les outils d'IA générative en ligne pour tout usage professionnel impliquant des données sensibles.

Le service public en offre un exemple documenté. Dans le cadre de son bac à sable consacré à l'IA dans les services publics, la CNIL a accompagné en 2024 le projet « Conseils Personnalisés » de France Travail, un outil qui suggère des formations aux conseillers à partir d'un RAG alimenté par le catalogue de formations et le profil du demandeur d'emploi. Le modèle retenu, Mixtral de Mistral AI, était installé sur site. La CNIL souligne dans ses recommandations qu'un modèle utilisé dans l'environnement du fournisseur présente des risques de perte de confidentialité des données personnelles.

Pour certaines professions, la question touche au secret professionnel. L'article 226-13 du Code pénal punit d'un an d'emprisonnement et de 15 000 euros d'amende la révélation d'une information à caractère secret par la personne qui en est dépositaire du fait de sa profession. Les cabinets d'avocats et d'experts-comptables sont concernés au premier chef. Un service RH qui indexe des dossiers individuels, une collectivité qui traite des demandes d'aide sociale, manient de leur côté des données personnelles dont la divulgation causerait un tort réel aux personnes.

Le local suppose que toute la chaîne reste sur place : l'extraction du texte, le modèle d'embedding, la base vectorielle, le modèle de langage et les journaux. Garder le modèle chez soi tout en confiant les vecteurs à un service extérieur ne protège pas grand-chose, puisque ces vecteurs permettent de reconstituer une partie des textes. En contrepartie, l'organisation assume l'exploitation : sauvegardes, mises à jour, surveillance des accès.

Par où commencer

Un premier projet réussi tient en peu de choses : un corpus limité et bien tenu, par exemple les procédures d'un service, des droits d'accès clairs, un jeu de questions réelles pour mesurer la qualité, et des utilisateurs qui savent qu'ils doivent ouvrir les sources citées. Les difficultés viennent rarement du modèle. Elles viennent des documents, de leur état, de leurs versions et de la question de savoir qui a le droit de les lire.

C'est l'approche que retient HOMN : les documents, l'index et le modèle restent dans les murs de l'organisation, et le recours à un service extérieur reste un choix explicite. Quel que soit l'outil retenu, la qualité des réponses dépendra d'abord de celle du corpus et de la rigueur des droits.

Qu'est-ce que le RAG ?

Le RAG, pour retrieval-augmented generation ou génération augmentée par récupération, est une technique qui recherche d'abord les passages pertinents dans une base de documents, puis demande à un modèle de langage de répondre à partir de ces passages. Elle permet d'interroger ses propres documents sans réentraîner le modèle et de citer la source de chaque réponse.

Le RAG supprime-t-il les hallucinations ?

Non, il les réduit sans les éliminer. Une étude de Stanford publiée en 2024 a mesuré plus de 17 % de réponses incorrectes sur des outils juridiques commerciaux fondés sur le RAG. Si la recherche ramène un mauvais passage, le modèle rédige une réponse fluide à partir de ce passage, d'où l'importance des citations et de la vérification humaine.

Faut-il entraîner une IA sur ses documents pour qu'elle les connaisse ?

En général, non. Le RAG laisse le modèle tel quel et lui fournit les extraits utiles au moment de chaque question, ce qui permet de mettre la base à jour en ajoutant ou en retirant des documents. Il permet aussi de conserver des droits d'accès par document, ce que l'ANSSI juge impossible une fois les données intégrées à l'entraînement.

Peut-on créer un chatbot sur ses documents sans les envoyer dans le cloud ?

Oui. L'extraction du texte, le modèle d'embedding, la base vectorielle et le modèle de langage peuvent tous fonctionner sur un serveur installé dans les locaux de l'organisation. C'est l'option que la CNIL recommande de privilégier lorsque des données personnelles ou sensibles sont traitées.