KI mit den eigenen Dokumenten nutzen: wie RAG funktioniert

Die meisten KI-Projekte in Unternehmen beruhen auf derselben Technik: die richtigen Passagen in den Dokumenten der Organisation finden und das Modell dann auffordern, auf deren Grundlage zu antworten. So funktioniert sie, wo sie sich irrt und warum sensible Dokumente besser vor Ort bleiben.

Eine gute Quelle, eine falsche Antwort

Ein Fluggast fragt den Chat-Assistenten auf der Website von Air Canada nach den Tarifen für Reisen aufgrund eines Trauerfalls. Der Assistent erklärt ihm, er könne sein Ticket zum normalen Preis bezahlen und die Ermäßigung nachträglich innerhalb von 90 Tagen beantragen. In derselben Nachricht liefert er einen Link zur offiziellen Seite der Fluggesellschaft. Diese Seite sagt das Gegenteil: Der Trauerfalltarif gilt nicht für Anträge, die nach der Reise gestellt werden.

Das Civil Resolution Tribunal von British Columbia entschied im Februar 2024. Air Canada machte geltend, ihr Assistent sei eine eigenständige Einheit, die für ihre eigenen Aussagen verantwortlich sei; das Tribunal bezeichnete das Argument als „bemerkenswert“ und wies es zurück. Die Fluggesellschaft musste die Differenz zwischen dem gezahlten Preis und dem Trauerfalltarif erstatten. Für das Tribunal spielte es keine Rolle, ob die Information von einer festen Seite oder von einem Assistenten stammt: Das Unternehmen haftet für das, was auf seiner Website steht.

Der Vorfall fasst das Problem zusammen, das die retrieval-augmented generation, kurz RAG, lösen will. Das genaue Dokument existierte. Es fehlte ein System, das auf dieser Grundlage antwortet und zeigt, woher jede Aussage stammt.

Das Prinzip: eine Prüfung mit offenem Buch

Der Begriff erscheint 2020 in einem Artikel von Patrick Lewis und elf Koautoren, vorgestellt auf der Konferenz NeurIPS. Die Autoren unterscheiden darin zwei Gedächtnisse. Das parametrische Gedächtnis ist das, was das Modell während des Trainings aufgenommen hat und was in seinen Parametern steckt. Das nicht parametrische Gedächtnis ist ein externer Index, in ihrem Experiment eine Version von Wikipedia, den das System beim Antworten abfragt. Ihr Schluss: Die Kombination beider erzeugt präzisere und faktenreichere Texte als das Modell allein.

Der anschaulichste Vergleich ist die Prüfung. Ein Student, der alles auswendig gelernt hat, antwortet schnell, irrt sich aber bei dem, was er schlecht behalten hat, und weiß nichts von dem, was sich seit seiner Vorbereitung geändert hat. Ein Student, der seinen Ordner aufschlagen darf, sucht zuerst die richtige Seite und formuliert dann auf Grundlage dessen, was er liest. RAG versetzt das Sprachmodell in die Lage des zweiten.

Die CNIL fasst den Nutzen der Methode so zusammen: Sie erzeugt Antworten, die durch externe Daten angereichert sind, spezifischer und leichter aktuell zu halten als das Modell selbst. Das ist der entscheidende Punkt für ein Unternehmen. Ein Modell mit den eigenen Dokumenten neu zu trainieren ist teuer und muss bei jeder Aktualisierung wiederholt werden. Die ANSSI fügt ein Sicherheitsargument hinzu: Sobald Daten in das Training eingeflossen sind, lassen sich keine Zugriffsrechte mehr darauf anwenden, während neben dem Modell gespeicherte Dokumente weiterhin den üblichen Regeln darüber unterliegen können, wer was sieht.

Konkret reiht ein RAG vier Vorgänge aneinander: die Dokumente vorbereiten, sie in Koordinaten umwandeln, die nützlichen Passagen finden und dann eine Antwort formulieren, die sie zitiert.

Schritt 1: Dokumente vorbereiten und zerlegen

Alles beginnt mit der Extraktion des Textes. Eine Textverarbeitungsdatei oder eine Webseite lässt sich leicht lesen; ein gescanntes PDF erfordert Texterkennung, eine Tabelle oder ein Schema verlangen eine besondere Behandlung. Diese undankbare Arbeit bestimmt einen guten Teil der Endqualität: Ein schlecht extrahierter Text liefert falsche Antworten, gleich wie leistungsfähig das Modell ist.

Der Text wird anschließend in Stücke von einigen Absätzen zerlegt, die Praktiker Chunks nennen. Die Zerlegung ist nötig, weil die Suche eine genaue Passage ansteuern muss und nicht einen Bericht von zweihundert Seiten. Sie schafft auch eine Falle, die Anthropic in einer Veröffentlichung vom September 2024 gut beschreibt: Ein isoliertes Stück verliert seinen Kontext. Das gewählte Beispiel ist ein Finanzbericht, aus dem ein Auszug besagt, der Umsatz sei im Quartal um 3 % gestiegen, ohne anzugeben, um welches Unternehmen und welches Quartal es sich handelt.

Die Gegenmittel sind bekannt. Man lässt die Stücke sich leicht überlappen, achtet auf Überschriften und Artikel, statt mitten im Satz zu schneiden, und fügt jedem Stück eine kurze Beschreibung seines Kontextes hinzu: Ursprungsdokument, Abschnitt, Datum. Diese Metadaten dienen später zum Filtern, Zitieren und zur Zugriffskontrolle.

Schritt 2: Bedeutung in Koordinaten übersetzen

Jedes Stück durchläuft dann ein Embedding-Modell, das sich von dem Modell unterscheidet, das die Antwort formulieren wird. Seine Aufgabe ist, einen Text in eine Liste von Zahlen zu verwandeln, einen Vektor, der seine Bedeutung abbildet. Zwei Passagen, die vom selben Gegenstand handeln, auch mit anderen Wörtern, erhalten benachbarte Vektoren.

Das treffendste Bild ist das einer Karte. Jede Passage erhält Koordinaten, nicht auf zwei Achsen wie Breiten- und Längengrad, sondern auf Hunderten oder Tausenden von Dimensionen. Auf dieser Karte liegt „Kündigungsfrist“ nahe bei „Frist, die vor dem Ausscheiden aus dem Unternehmen einzuhalten ist“, obwohl beide Formulierungen fast kein Wort gemeinsam haben. Das unterscheidet die semantische Suche von der Stichwortsuche einer herkömmlichen internen Suchmaschine.

Diese Vektoren wirken abstrakt. Sie sind es weniger, als man glaubt. In einem Artikel, der auf der Konferenz EMNLP 2023 vorgestellt wurde, haben Forscher gezeigt, dass sich 92 % kurzer Texte von 32 Tokens allein aus ihren Embeddings exakt rekonstruieren lassen und dass sich so vollständige Namen in klinischen Notizen wiederfinden. Ein Vektorindex muss daher mit derselben Sorgfalt geschützt werden wie die Dokumente, aus denen er stammt.

Schritt 3: Ablegen, dann wiederfinden

Die Vektoren werden in einer Vektordatenbank gespeichert, zusammen mit dem Originaltext und seinen Metadaten. Stellt ein Nutzer eine Frage, wird sie vom selben Embedding-Modell in einen Vektor umgewandelt, und die Datenbank sucht die Stücke mit den nächstgelegenen Koordinaten. Das Prinzip erinnert an eine Bibliothekarin, die nicht das genaue Wort in den Titeln sucht, sondern direkt zum Regal geht, in dem die Werke zum Thema stehen.

Die rein semantische Suche hat ihre Schwächen. Sie kann einen exakten Verweis, eine Vertragsnummer oder einen Artikelcode übersehen, den eine Stichwortsuche mühelos findet. Seriöse Systeme kombinieren daher beides und fügen oft einen Umordnungsschritt hinzu: Ein zweites Modell liest die ausgewählten Kandidaten erneut und sortiert sie nach ihrer tatsächlichen Relevanz für die gestellte Frage.

Anthropic hat die Wirkung dieser Verbesserungen an eigenen Testdaten beziffert. Mit einer einfachen Vektorsuche fehlte die richtige Information in 5,7 % der Fälle unter den ersten zwanzig Ergebnissen. Mit zusätzlichem Kontext für jedes Stück sank diese Quote auf 3,7 %. In Kombination mit einer Stichwortsuche vom Typ BM25 ging sie auf 2,9 % zurück, mit der Umordnung auf 1,9 %. Das sind die Messungen eines Anbieters an seinen eigenen Daten, doch die Größenordnung zeigt, dass die Suche, mehr als das Formulieren, die Qualität eines RAG ausmacht.

Schritt 4: Die Antwort formulieren und Quellen nennen

Die wenigen ausgewählten Passagen werden in die Anweisung eingefügt, die an das Sprachmodell geht, zusammen mit der Frage und ausdrücklichen Vorgaben: ausschließlich auf Grundlage der gelieferten Auszüge antworten, zu jeder Aussage Dokument und Seite angeben und klar sagen, wenn die Information dort nicht steht. Das Modell formuliert dann eine Antwort in Alltagssprache, und die Oberfläche zeigt die Links zu den zitierten Passagen an.

Die Quellenangabe verändert die Natur des Werkzeugs. Ohne sie muss der Nutzer der Maschine aufs Wort glauben. Mit ihr kann er mit einem Klick prüfen, und die Organisation kann nachträglich den Ursprung einer beanstandeten Antwort nachvollziehen. Im Fall von Air Canada war der Link vorhanden, widersprach aber dem Text; ein gut eingestelltes System muss eine Antwort liefern, die der zitierten Quelle treu bleibt, und der Nutzer sollte den Reflex haben, sie zu öffnen.

Das Modell darf auch nicht unter Auszügen begraben werden. Eine 2023 in den Transactions of the Association for Computational Linguistics veröffentlichte Studie mit dem Titel „Lost in the Middle“ hat gezeigt, dass Modelle Informationen am Anfang oder am Ende des ihnen gelieferten Textes besser verwerten und deutlich schlechter, wenn sie in der Mitte stehen. Besser einige relevante Passagen als ein Stapel ungefährer.

RAG ist im Übrigen nicht immer nötig. Anthropic merkt an, dass es unterhalb von etwa 200.000 Tokens, also ungefähr 500 Seiten, einfacher sein kann, die gesamte Wissensbasis in die Anweisung einzufügen, sofern das Modell ein so langes Kontextfenster akzeptiert. Für eine Hausordnung und einige Verfahren stellt sich die Frage. Für das Archiv einer Kanzlei stellt sie sich nicht.

Warum fast alle Projekte damit beginnen

Ein Sprachmodell, auch ein ausgezeichnetes, kennt weder die internen Verfahren eines Unternehmens noch seine Verträge, Produktblätter oder die Historie seiner Vorgänge. RAG ist der direkteste Weg, ihm Zugang zu diesem Wissen zu geben, ohne es zu verändern. Ein Dokument hinzuzufügen heißt, es zu indexieren; eine veraltete Version zu entfernen heißt, sie aus dem Index zu löschen. Der Vorgang gehört zur Dokumentenverwaltung, nicht zu einem neuen Training.

Die Einsatzfälle ähneln sich von Branche zu Branche. Eine Personalabteilung beantwortet wiederkehrende Fragen der Beschäftigten zum Tarifvertrag oder zum Urlaub. Ein Kundenservice findet das richtige technische Datenblatt. Eine Rechtsabteilung befragt eine Vertragsdatenbank, um Kündigungsklauseln aufzuspüren. Eine Gebietskörperschaft hilft ihren Mitarbeitern, sich in über Jahre angesammelten Beschlüssen und Vorschriften zurechtzufinden. In jedem dieser Fälle liegt der Wert weniger im Formulieren als in der Fähigkeit, die richtige Passage zu finden.

Halluzinationen nehmen ab, verschwinden aber nicht

RAG wird oft als Gegenmittel gegen erfundene Antworten dargestellt. Eine im Mai 2024 veröffentlichte Studie des RegLab und des HAI-Instituts der Stanford University, durchgeführt an mehr als 200 juristischen Fragen, relativiert dieses Versprechen deutlich. Die auf RAG gestützten Rechercheinstrumente von LexisNexis und Thomson Reuters, von denen einige die Abwesenheit von Halluzinationen für sich beanspruchten, lieferten in mehr als 17 % der Fälle falsche Informationen bei Lexis+ AI und Ask Practical Law AI und in mehr als 34 % der Fälle bei Westlaw AI-Assisted Research. GPT-4 allein schnitt deutlich schlechter ab, mit 58 bis 82 % Fehlern bei dieser Art von Fragen.

Die Autoren nennen mehrere Ursachen: eine Suche, die nicht anwendbare Texte liefert, eine dem juristischen Denken eigene Schwierigkeit und die Neigung des Modells, der Richtung der Frage zu folgen, selbst wenn diese auf einer falschen Prämisse beruht. RAG verlagert das Risiko also eher, als es zu beseitigen. Liefert die Suche die falsche Passage, formuliert das Modell eine flüssige Antwort auf Grundlage der falschen Passage.

Die Schutzmaßnahmen sind vor allem organisatorisch. Man stellt einen Satz realer Fragen zusammen, deren richtige Antworten man kennt, und misst das System daran, bevor man es einführt, und danach bei jeder Änderung. Man erlaubt ihm zu antworten, dass es etwas nicht weiß. Man behält eine menschliche Prüfung für Antworten vor, die die Organisation binden. Bei ihrer Begleitung eines Projekts von France Travail bestand die CNIL auf diesem letzten Punkt: die Mitarbeitenden so zu schulen, dass sie Fehler erkennen, und ihnen die Zeit zu lassen, vom Vorschlag des Werkzeugs abzuweichen.

Zugriffsrechte: Der Assistent sieht, was der Index sieht

Das am meisten unterschätzte Risiko ist nicht der Fehler, sondern der interne Abfluss. Sind alle Dokumente einer Organisation in derselben Datenbank indexiert, kann ein Praktikant den Assistenten nach dem Gehalt seines Direktors fragen und einen Auszug aus einer Gehaltsabrechnung erhalten. Das Modell hat nichts erzwungen; es hat gelesen, was ihm die Datenbank übergeben hat.

Die ANSSI macht daraus eine ausdrückliche Anforderung: Ein KI-System muss in seinen Antworten die Zugriffsbeschränkungen jedes einzelnen Nutzers einhalten. Sie präzisiert, dass dies für neben dem Modell gespeicherte Dokumente machbar ist, je nach den Fähigkeiten des Speicherwerkzeugs, und empfiehlt, die konfigurierten Rechte regelmäßig zu überprüfen, etwa monatlich. Microsoft formuliert es in seiner Dokumentation zur Vorbereitung auf Copilot auf seine Weise: Der Assistent respektiert die bestehenden Berechtigungen, was darauf hinausläuft, alle im Lauf der Jahre angesammelten zu weiten Freigaben offenzulegen. Der Anbieter weist im Übrigen darauf hin, dass die Freigabeeinstellungen von SharePoint standardmäßig die freizügigsten sind.

Die OWASP, die maßgebliche Stiftung für Anwendungssicherheit, widmet in der Ausgabe 2025 ihrer Rangliste der zehn wichtigsten Risiken im Zusammenhang mit Sprachmodellen den Schwächen von Vektoren und Embeddings eine eigene Kategorie. Dort finden sich Abflüsse zwischen Nutzern oder Kunden, die sich dieselbe Vektordatenbank teilen, die Vergiftung der Datenbank durch präparierte Dokumente und die oben erwähnte Umkehrung von Embeddings. Das genannte Beispiel spricht für sich: ein Lebenslauf, der in weißer Schrift auf weißem Grund eine Anweisung enthält, die das Sortiersystem dazu bringen soll, den Bewerber zu empfehlen. Jedes indexierte Dokument landet am Ende vor den Augen des Modells; man muss wissen, woher es stammt.

Die praktische Konsequenz ist schnell gesagt und aufwendig umzusetzen. Jedes indexierte Stück muss die Rechte seines Ursprungsdokuments tragen, die Suche muss nach der Identität der fragenden Person filtern, und jede Abfrage muss protokolliert werden.

Veraltete Dokumente, veraltete Antworten

Ein RAG antwortet auf Grundlage dessen, was man ihm anvertraut hat. Enthält der Index die Dienstanweisung von 2019 und die, die sie ersetzt hat, kann er mit gleicher Sicherheit die eine oder die andere zitieren. Der Fall ist in Organisationen häufig, in denen sich Dokumente stapeln, ohne je entfernt zu werden: alte Preislisten, aufgegebene Verfahren, überholte Vertragsvorlagen.

Das Gegenmittel ist zuerst dokumentarisch, dann technisch. Man muss für jeden Bestand eine verantwortliche Person benennen, die Dokumente datieren, Ersetztes archivieren und dafür sorgen, dass der Index Ergänzungen, Änderungen und Löschungen automatisch nachvollzieht. Microsoft empfiehlt selbst, inaktive Websites zu archivieren, damit sein Assistent auf aktuelle Inhalte zurückgreift. Auf der Oberfläche erlaubt es die Anzeige des Datums jeder zitierten Quelle, auf einen Blick eine Antwort zu erkennen, die auf einem alten Text beruht.

Warum sensible Dokumente lokal verarbeiten

Ein RAG verarbeitet naturgemäß die wertvollsten Dokumente der Organisation. Bei einem Online-Dienst durchlaufen diese Dokumente, ihre Vektoren, die Fragen der Nutzer und die Antworten den Anbieter oder verbleiben dort. In ihren Fragen und Antworten vom Juli 2024 zur generativen KI empfiehlt die CNIL, einen Betrieb vor Ort zu bevorzugen, wenn personenbezogene oder sensible Daten verarbeitet werden, um die Risiken einer Extraktion durch Dritte zu begrenzen. Die ANSSI rät in ihrer Empfehlung R34 von Online-Werkzeugen der generativen KI für jede berufliche Nutzung mit sensiblen Daten ab.

Der öffentliche Dienst liefert dafür ein dokumentiertes Beispiel. Im Rahmen ihrer Sandbox zu KI in öffentlichen Diensten hat die CNIL 2024 das Projekt „Conseils Personnalisés“ von France Travail begleitet, ein Werkzeug, das Beratern Weiterbildungen vorschlägt, auf Grundlage eines RAG, das aus dem Weiterbildungskatalog und dem Profil der arbeitsuchenden Person gespeist wird. Das gewählte Modell, Mixtral von Mistral AI, war vor Ort installiert. Die CNIL betont in ihren Empfehlungen, dass ein in der Umgebung des Anbieters genutztes Modell Risiken für den Verlust der Vertraulichkeit personenbezogener Daten birgt.

Für bestimmte Berufe berührt die Frage das Berufsgeheimnis. Artikel 226-13 des französischen Strafgesetzbuchs ahndet die Offenbarung einer geheimen Information durch die Person, der sie aufgrund ihres Berufs anvertraut ist, mit einem Jahr Freiheitsstrafe und 15.000 Euro Geldstrafe. Anwaltskanzleien und Steuerberatungsbüros sind in erster Linie betroffen. Eine Personalabteilung, die Einzelakten indexiert, oder eine Gebietskörperschaft, die Anträge auf Sozialhilfe bearbeitet, gehen ihrerseits mit personenbezogenen Daten um, deren Offenlegung den Betroffenen echten Schaden zufügen würde.

Lokal setzt voraus, dass die gesamte Kette vor Ort bleibt: die Textextraktion, das Embedding-Modell, die Vektordatenbank, das Sprachmodell und die Protokolle. Das Modell im eigenen Haus zu behalten, die Vektoren aber einem externen Dienst anzuvertrauen, schützt kaum etwas, da diese Vektoren die Rekonstruktion eines Teils der Texte erlauben. Im Gegenzug übernimmt die Organisation den Betrieb: Sicherungen, Updates, Überwachung der Zugriffe.

Wo man anfängt

Ein erstes gelungenes Projekt besteht aus wenig: einem begrenzten und gut gepflegten Bestand, etwa den Verfahren einer Abteilung, klaren Zugriffsrechten, einem Satz realer Fragen zur Qualitätsmessung und Nutzern, die wissen, dass sie die zitierten Quellen öffnen müssen. Die Schwierigkeiten kommen selten vom Modell. Sie kommen von den Dokumenten, ihrem Zustand, ihren Versionen und der Frage, wer sie lesen darf.

Diesen Ansatz verfolgt HOMN: Die Dokumente, der Index und das Modell bleiben innerhalb der Mauern der Organisation, und der Rückgriff auf einen externen Dienst bleibt eine ausdrückliche Entscheidung. Welches Werkzeug auch gewählt wird, die Qualität der Antworten hängt zuerst von der des Bestands und von der Sorgfalt bei den Rechten ab.

Was ist RAG?

RAG steht für retrieval-augmented generation, auf Deutsch etwa abrufgestützte Generierung. Die Technik sucht zuerst die relevanten Passagen in einer Dokumentenbasis und bittet dann ein Sprachmodell, auf Grundlage dieser Passagen zu antworten. Sie erlaubt es, die eigenen Dokumente abzufragen, ohne das Modell neu zu trainieren, und die Quelle jeder Antwort zu nennen.

Beseitigt RAG Halluzinationen?

Nein, es verringert sie, ohne sie auszuschließen. Eine Studie aus Stanford, 2024 veröffentlicht, hat bei kommerziellen juristischen Werkzeugen auf RAG-Basis mehr als 17 % falsche Antworten gemessen. Liefert die Suche eine falsche Passage, formuliert das Modell eine flüssige Antwort auf deren Grundlage, daher die Bedeutung von Quellenangaben und menschlicher Prüfung.

Muss man eine KI mit den eigenen Dokumenten trainieren, damit sie sie kennt?

In der Regel nein. RAG lässt das Modell unverändert und liefert ihm bei jeder Frage die nützlichen Auszüge, sodass sich die Wissensbasis durch Hinzufügen oder Entfernen von Dokumenten aktualisieren lässt. Es erlaubt auch, Zugriffsrechte pro Dokument beizubehalten, was die ANSSI für unmöglich hält, sobald die Daten in das Training eingeflossen sind.

Kann man einen Chatbot auf den eigenen Dokumenten aufbauen, ohne sie in die Cloud zu senden?

Ja. Textextraktion, Embedding-Modell, Vektordatenbank und Sprachmodell können alle auf einem Server laufen, der in den Räumen der Organisation steht. Diese Option empfiehlt die CNIL zu bevorzugen, wenn personenbezogene oder sensible Daten verarbeitet werden.