Lokale KI oder Cloud: Wohin gehen die Unternehmensdaten?

Am 2. Mai 2023 untersagte Samsung Electronics seinen Beschäftigten, ChatGPT und andere generative KI-Assistenten auf den Computern, Telefonen und Tablets des Unternehmens sowie im internen Netz zu nutzen. Wenige Wochen zuvor hatten Ingenieure internen Quellcode in ChatGPT eingefügt. Niemand hatte etwas gehackt. Der Code war über den vorgesehenen Weg zu einem Dritten gelangt, den jede Anfrage an einen Online-Assistenten nimmt.

Der Weg einer Anfrage an einen Online-Assistenten

Ein Sprachmodell ist ein Programm, das auf sehr großen Textmengen trainiert wurde und aus dem, was man ihm vorlegt, die wahrscheinlichste Wortfolge berechnet. Es zum Antworten zu bringen, nennt man Inferenz. Sie erfordert Grafikprozessoren, GPUs, Chips, die darauf ausgelegt sind, Milliarden von Multiplikationen aneinanderzureihen, und diese Chips sind teuer.

Ein Unternehmen hat zwei Wege, darauf zuzugreifen. Es kann über das Internet die Kapazität eines Anbieters mieten: Das ist die Cloud. Der Text der Anfrage, die Anhänge und der Gesprächsverlauf verlassen dann sein Netz, werden in einem Rechenzentrum des Anbieters verarbeitet, und die Antwort kommt zurück. Es kann das Modell auch auf einer Maschine installieren, die es besitzt, in den eigenen Räumen. Man spricht dann von lokaler KI oder von einem Betrieb „on-premise“. Die Anfrage verlässt das Gebäude nicht.

Für die Person, die die Frage tippt, ähneln sich beide: ein Fenster, ein Text, eine Antwort nach wenigen Sekunden. Der Unterschied liegt darin, was danach mit dem Text geschieht. In der Cloud hängt sein Schicksal von den Allgemeinen Geschäftsbedingungen des Anbieters ab, von seiner Staatsangehörigkeit, seinen Unterauftragnehmern und den Gerichten, vor denen er geladen werden kann. Lokal hängt es von den Regeln ab, die sich das Unternehmen selbst gegeben hat.

Was Anbieter speichern und wer es anfordern kann

Anbieter bewahren eine Spur der Austausche auf, zumindest eine Zeit lang, um Missbrauch zu erkennen, abzurechnen oder ihren Dienst zu verbessern. Je nach abgeschlossenem Angebot können diese Austausche auch dazu dienen, die nächsten Modelle zu trainieren. Verträge für Unternehmen schließen diese Nutzung in der Regel aus, aber die Aufbewahrungsdauer und die Liste der Unterauftragnehmer stehen in den Anlagen zum Vertrag, nicht auf der Startseite.

Der Prozess der New York Times gegen OpenAI vor dem Bundesgericht des Southern District of New York hat gezeigt, wie weit diese Aufbewahrung gehen kann. Anfang Dezember 2025 lehnte es Richterin Ona Wang ab, ihre Entscheidung zu revidieren, die OpenAI verpflichtete, den Presseverlagen 20 Millionen depersonalisierte ChatGPT-Gespräche zu übergeben. Laut dem Bericht von eWeek wies sie darauf hin, dass diese Stichprobe nur einen kleinen Bruchteil der Dutzenden Milliarden Gespräche von Privatpersonen ausmache, die das Unternehmen aufbewahrt. Die Daten wurden depersonalisiert und unter eine Schutzanordnung gestellt, die ihre Einsicht auf die Anwälte beschränkt.

Die Nutzer, deren Gespräche in dieser Stichprobe enthalten sind, waren nicht Partei des Prozesses. Ihre Austausche wurden zu Beweisstücken in einem Urheberrechtsstreit aus einem einzigen Grund: Sie waren beim Anbieter gespeichert. Für ein Unternehmen lässt sich die praktische Schlussfolgerung in einem Satz fassen. Alles, was ein Dritter aufbewahrt, kann eines Tages von einem Richter oder einer Behörde angefordert werden, in einem Verfahren, das das Unternehmen nicht betrifft.

Der Cloud Act folgt der Staatsangehörigkeit des Anbieters, nicht der Adresse des Servers

Der Cloud Act ist ein US-Gesetz, das im März 2018 verabschiedet wurde. Seine meistkommentierte Bestimmung, kodifiziert in Abschnitt 2713 von Titel 18 des Bundesgesetzbuchs, verpflichtet Anbieter elektronischer Kommunikationsdienste und der Speicherung auf Distanz, die Daten ihrer Kunden, die sich in ihrem Besitz, ihrer Obhut oder unter ihrer Kontrolle befinden, aufzubewahren oder herauszugeben. Der Text stellt klar, dass diese Pflicht unabhängig davon gilt, ob sich die Daten in den Vereinigten Staaten oder im Ausland befinden.

Ein von einem dem US-Recht unterliegenden Unternehmen in Paris installierter Server bleibt also im Anwendungsbereich des Gesetzes. Am 10. Juni 2025 fragte Senator Dany Wattebled vor dem Untersuchungsausschuss des französischen Senats zur öffentlichen Auftragsvergabe den Leiter für öffentliche und rechtliche Angelegenheiten von Microsoft France, Anton Carniaux, ob er unter Eid garantieren könne, dass die Daten französischer Bürger, die Microsoft anvertraut sind, niemals auf Anordnung der US-Regierung ohne Zustimmung der französischen Behörden übermittelt würden. Anton Carniaux antwortete, er könne das nicht garantieren, und fügte hinzu, dass dies nie vorgekommen sei.

Das US-Justizministerium stellt den Text als Ermittlungsinstrument für schwere Straftaten dar, ergänzt durch bilaterale Abkommen mit Partnerländern. Diese Beschreibung ist zutreffend, und nichts deutet darauf hin, dass die Daten eines französischen Mittelständlers ein gängiges Ziel wären. Aber die rechtliche Exposition besteht, sie betrifft alle Kunden eines dem US-Recht unterliegenden Anbieters, und einer der größten von ihnen hat unter Eid erklärt, sie nicht ausschließen zu können. Ein Anbieter, der sich der US-Gerichtsbarkeit entzieht, ist an diese Pflicht nicht gebunden. Ein in den Räumen des Unternehmens installiertes Modell ebenso wenig, da kein Dritter die Daten hält.

Übermittlungen in die Vereinigten Staaten beruhen auf einem umstrittenen Abkommen

Die DSGVO, die europäische Verordnung zum Schutz personenbezogener Daten, erlaubt die Übermittlung dieser Daten aus der Union nur, wenn das Zielland einen als gleichwertig beurteilten Schutz bietet oder vertragliche Garantien vorliegen. Für die Vereinigten Staaten beruht diese Gleichwertigkeit seit Juli 2023 auf dem Datenschutzrahmen zwischen der Europäischen Union und den Vereinigten Staaten, dem Data Privacy Framework.

Seine beiden Vorgänger wurden vom Gerichtshof der Europäischen Union für nichtig erklärt, Safe Harbor im Oktober 2015 und Privacy Shield im Juli 2020, jeweils infolge eines Verfahrens des österreichischen Aktivisten Maximilian Schrems. Der dritte hält vorerst. Am 3. September 2025 wies das Gericht der Europäischen Union die Klage des französischen Abgeordneten Philippe Latombe ab und bestätigte die Gültigkeit des Rahmens. Am 31. Oktober 2025 legte Philippe Latombe Rechtsmittel beim Gerichtshof ein. Nach unserer Kenntnis hat der Gerichtshof zum Veröffentlichungsdatum dieses Artikels noch nicht entschieden.

Ein Unternehmen, das personenbezogene Daten einem bei einem US-Anbieter gehosteten Assistenten anvertraut, stützt sich also auf einen Mechanismus, dessen beide Vorgängerversionen für ungültig erklärt wurden. Fällt der dritte, müssen Verträge überprüft, Übermittlungen neu bewertet und mitunter Nutzungen dringend ausgesetzt werden. Eine Verarbeitung auf einer im Unternehmen installierten Maschine beinhaltet keine Übermittlung und ist davon nicht betroffen.

Was die CNIL für generative KI empfiehlt

Die CNIL hat am 18. Juli 2024 eine Reihe von Fragen und Antworten zur Nutzung generativer KI-Systeme veröffentlicht. Das Dokument schreibt keine Technologie vor, ist aber in einem Punkt klar. Wenn eine Organisation dem System personenbezogene Daten von Kunden oder Beschäftigten oder sensible bzw. strategische Dokumentation zuführen will, erscheint es ihr „im Allgemeinen zweckmäßiger und sicherer“, einen Betrieb vor Ort zu bevorzugen, der die Risiken einer Datenextraktion durch Dritte begrenzt.

Die CNIL erkennt auch die Kosten dieser Option an. Ein System vor Ort zu installieren und zu betreiben, bedeutet eine erhebliche Ausgabe, und der Rückgriff auf eine entfernte Infrastruktur wird oft einfacher sein. Sie fügt hinzu, dass nichts kleine Unternehmen oder Gebietskörperschaften daran hindert, eine gemeinsam genutzte Infrastruktur zu teilen, sofern die Datenübermittlungen geregelt und abgesichert werden.

Bei einem Online-Dienst verlangt sie die Prüfung, ob die Allgemeinen Geschäftsbedingungen des Anbieters ihm erlauben, die eingegebenen Daten weiterzuverwenden. Ist das der Fall, muss die Organisation im Einzelfall entscheiden, ob bestimmte Informationskategorien untersagt werden müssen, etwa solche, die vom Geschäftsgeheimnis erfasst sind. Der Dienstleister muss durch einen Auftragsverarbeitungsvertrag gebunden werden, der seine Verantwortlichkeiten und die zulässigen Zugriffe festlegt. Im Sinne der DSGVO ist ein Auftragsverarbeiter das Unternehmen, das personenbezogene Daten im Auftrag eines anderen verarbeitet.

Das Hosting des Modells vor Ort befreit von keiner Pflicht der DSGVO. Man muss weiterhin einen Zweck festlegen, die Daten auf das Erforderliche beschränken, eine Aufbewahrungsdauer bestimmen und die Maschine absichern. Lokal verringert dagegen die Zahl der zu führenden Verträge und der zu prüfenden Beteiligten.

Der Zeitplan des AI Act nach dem Omnibus vom Juli 2026

Die europäische Verordnung über künstliche Intelligenz, AI Act genannt, ist am 1. August 2024 in Kraft getreten. Sie stuft Systeme nach dem Risiko ein, das sie darstellen, und legt zwei Gruppen von Akteuren Pflichten auf: den Anbietern, die die Systeme entwickeln, und den Betreibern, die sie in ihrer Tätigkeit einsetzen. Ein mittelständisches Unternehmen, das seinen Teams einen Assistenten zur Verfügung stellt, ist Betreiber.

Die verbotenen Praktiken, wie das Social Scoring von Personen, sind seit dem 2. Februar 2025 verboten. Die Pflichten für KI-Modelle mit allgemeinem Verwendungszweck, zu denen die großen Sprachmodelle gehören, gelten seit dem 2. August 2025, und die Europäische Kommission verfügt seit dem 2. August 2026 über ihre Kontrollbefugnisse für diese Modelle. Die Transparenzregeln, die zum Beispiel verlangen, eine Person darüber zu informieren, dass sie mit einer KI kommuniziert, gelten seit demselben Datum.

Die Verordnung (EU) 2026/1744, Digital-Omnibus zur KI genannt, im Juli 2026 im Amtsblatt veröffentlicht, hat zwei Fristen verschoben. Hochrisikosysteme nach Anhang III, der unter anderem Personalauswahl, Kreditbewertung und Bildung abdeckt, müssen zum 2. Dezember 2027 konform sein. Die nach Anhang I, die in bereits regulierte Produkte wie Maschinen oder Medizinprodukte integriert sind, zum 2. August 2028.

Der Text unterscheidet nicht zwischen Cloud und lokal. Er verlangt jedoch vom Unternehmen, zu wissen, welches System es für welchen Zweck und mit welchen Daten nutzt, und dies dokumentieren zu können. Diese Dokumentation lässt sich leichter führen, wenn sich die Version des Modells nicht ohne Wissen der Nutzer ändert, ein Punkt, in dem sich die beiden Optionen deutlich unterscheiden.

Die Kosten: pro Anfrage zahlen oder Kapazität kaufen

Online-Dienste rechnen nach Nutzung ab, in der Regel nach der Zahl verarbeiteter Tokens. Ein Token ist ein Wortfragment, die Einheit, die das Modell liest und erzeugt. Solange einige Beschäftigte ausprobieren, bleibt die Rechnung bescheiden. Wenn das Werkzeug täglich Hunderte Dokumente liest oder jede Kundenanfrage beantwortet, folgt sie dem Volumen, zu einem vom Anbieter festgelegten Tarif, den er ändern kann.

Eine vor Ort installierte Maschine kehrt die Rechnung um. Der größte Teil der Ausgabe fällt beim Kauf an, dann kostet jede weitere Anfrage nur den Strom und die Abnutzung der Hardware. Bei gelegentlicher Nutzung bleibt die Miete günstiger. Bei täglicher und intensiver Nutzung setzt sich der Kauf am Ende durch. Der Kipppunkt hängt von den Volumen jedes Unternehmens ab und wird an dessen eigenen Zahlen berechnet.

Zwei vom AI Index der Stanford University veröffentlichte Messwerte beeinflussen diese Rechnung. Laut der Ausgabe 2025 sanken die Inferenzkosten eines Systems auf dem Niveau von GPT-3.5 zwischen November 2022 und Oktober 2024 auf weniger als ein Zweihundertachtzigstel. Dieselbe Ausgabe zeigte, dass Modelle mit offenen Gewichten, die man herunterladen und auf der eigenen Maschine betreiben kann, ihren Rückstand auf geschlossene Modelle bei bestimmten Tests innerhalb eines Jahres von 8 % auf 1,7 % verringert hatten.

Die Ausgabe 2026 relativiert diesen zweiten Wert. Im März 2026 lag im Arena-Ranking, das aus Nutzerstimmen entsteht, die Antworten blind vergleichen, das beste geschlossene Modell 3,4 % vor dem besten offenen Modell, gegenüber 0,5 % im August 2024. Der Rückstand bleibt gering, schrumpft aber nicht geradlinig: Er wächst mit jeder Veröffentlichung eines neuen geschlossenen Modells und verengt sich dann wieder.

Ausfälle und Latenz: der Preis der Entfernung

In der Nacht vom 19. auf den 20. Oktober 2025 erlitt die Region Northern Virginia von Amazon Web Services einen Kettenausfall. Laut dem von AWS veröffentlichten Bericht erzeugte ein Synchronisationsfehler zwischen zwei automatischen Prozessen des Systems, das die Adressen seiner Datenbank DynamoDB verwaltet, einen leeren DNS-Eintrag. DNS ist das Verzeichnis, das den Namen eines Dienstes in eine Netzwerkadresse übersetzt. Ohne diesen Eintrag fanden die Anwendungen DynamoDB nicht mehr. Diese erste Phase dauerte von 23:48 bis 2:40 Uhr Pazifischer Zeit, also 2 Stunden und 52 Minuten.

Die Folgen dauerten wesentlich länger. Mehrere interne AWS-Dienste, die sich auf DynamoDB stützen, wurden kaskadenartig getroffen, und die Kunden des Rechendienstes EC2 erlitten Fehler, Verlangsamungen und gescheiterte Maschinenstarts bis 13:50 Uhr am 20. Oktober, etwa vierzehn Stunden nach Beginn des Vorfalls. Die auf diesen Diensten aufgebauten Anwendungen wurden ihrerseits unterbrochen.

Auch eine im Unternehmen installierte Infrastruktur fällt aus. Eine Festplatte versagt, ein Netzteil brennt durch, ein Update geht schief. Der Unterschied liegt darin, wer diagnostiziert und wer die Reihenfolge der Wiederinbetriebnahme bestimmt. Er liegt auch an der Internetverbindung, die zu einem zusätzlichen Ausfallpunkt wird, sobald das tägliche Werkzeug der Teams bei einem Dritten liegt.

Die Latenz, also die Zeit zwischen dem Senden einer Anfrage und dem Beginn der Antwort, folgt derselben Logik. In einem Gespräch fällt eine Sekunde mehr nicht auf. Für eine Fachsoftware, die das Modell Hunderte Male pro Stunde abfragt, addieren sich die Hin- und Rückwege, und ihre Dauer schwankt mit der Auslastung des Anbieters. Im internen Netz ist die Verzögerung stabiler, sofern die Maschine für die Zahl der Nutzer dimensioniert ist.

Wenn der Anbieter das Modell wechselt

Am 7. August 2025 startete OpenAI GPT-5 und machte es zum Standardmodell von ChatGPT, wobei die früheren Modelle, darunter GPT-4o, aus der Oberfläche entfernt wurden. Die Proteste kamen sofort, und in den folgenden Tagen kündigte Sam Altman an, dass Plus-Abonnenten GPT-4o wieder auswählen könnten. Die Episode betraf vor allem Privatpersonen, die am Ton des alten Modells hingen. In einem Unternehmen hat derselbe Mechanismus konkretere Folgen.

Ein Prozess, der mit einer bestimmten Modellversion entwickelt wurde, etwa die automatische Extraktion von Beträgen und Daten aus Rechnungen, kann sich mit der nächsten Version anders verhalten. Dann müssen die Tests wiederholt, die dem Modell gegebenen Anweisungen neu geschrieben und manchmal die einem Kunden oder Prüfer übergebene Dokumentation überarbeitet werden. Tarife und Nutzungsbedingungen entwickeln sich auf dieselbe Weise, auf Initiative des Anbieters. Je stärker das Werkzeug integriert ist, desto mehr kostet der Weggang. Ökonomen nennen das Wechselkosten, Informatiker sprechen von Lock-in.

Ein vor Ort installiertes offenes Modell ändert sich nicht, solange das Unternehmen es nicht ersetzt. Dieselben Anweisungen, auf dasselbe Modell mit denselben Einstellungen angewendet, liefern von Monat zu Monat vergleichbare Ergebnisse, was es erlaubt, eine Nutzung zu dokumentieren und zu verteidigen. Der Austausch bleibt möglich, wenn ein besseres Modell erscheint, zum gewählten Zeitpunkt und nach Tests an den Dokumenten des Unternehmens.

Die Fälle, in denen die Cloud vorzuziehen bleibt

Die leistungsstärksten Modelle sind nur über eine API zugänglich, also über eine Schnittstelle, mit der eine Software den Dienst aus der Ferne abfragen kann, und manche würden ohnehin nicht auf eine Büromaschine passen. Bei sehr langem Schlussfolgern, beim Programmieren großer Projekte oder bei Aufgaben, die Dutzende Schritte ohne Aufsicht aneinanderreihen, behalten sie einen messbaren Vorsprung. Verlangt der Bedarf genau dieses Niveau, ist die Cloud oft die einzig vernünftige Option.

Die Cloud eignet sich auch für kurze Projekte wie eine Demonstration oder einen Pilot von einigen Wochen vor einer Investition. Sie eignet sich für sehr unregelmäßige Lasten, wenn eine auf die Spitze dimensionierte Maschine den Rest des Monats ungenutzt bliebe. Und sie eignet sich für Texte ohne Sensibilität: eine bereits veröffentlichte Anzeige umformulieren oder einen Artikeltitel suchen, legt nichts offen.

Die Wahl erfolgt also nach einer Sortierung der Daten. Eine öffentliche Information darf zu einem Anbieter gehen. Personenbezogene Daten, Verträge, unveröffentlichte Zahlen und technisches Know-how rechtfertigen entweder eine Verarbeitung vor Ort oder einen Dienstleister, dessen Vertrag man gelesen, dessen Gerichtsbarkeit man geprüft und dessen Sicherheit man kontrolliert hat.

Standardmäßig vor Ort verarbeiten, nur auf Entscheidung nach außen gehen

Eine einfache Regel erlaubt es, beide Ansätze zu verbinden. Anfragen werden standardmäßig auf einer Maschine des Unternehmens verarbeitet. Das Senden an einen externen Dienst wird zu einer ausdrücklichen Entscheidung, für eine bestimmte Aufgabe getroffen, protokolliert und von einer verantwortlichen Person ablehnbar. Die meisten gängigen Anfragen, etwa eine Akte zusammenfassen, eine Antwort verfassen oder eine Klausel in einem Vertragsbestand finden, sind für Modelle mittlerer Größe erreichbar, die auf Bürohardware laufen. Die anderen gehen nach außen, in Kenntnis der Sachlage.

Für jedes bereits im Einsatz befindliche KI-Werkzeug geben drei Prüfungen ein recht klares Bild der Lage: wo der Text verarbeitet wird, wer ihn aufbewahrt und wie lange und was geschieht, wenn der Dienst einen Tag ausfällt. Die Antworten stehen in den Verträgen, den Anlagen zur Auftragsverarbeitung und auf den Statusseiten der Anbieter.

Nach diesem Prinzip entwickelt HOMN seine Geräte: ein in den Räumen installiertes Modell, das mit den Dokumenten des Unternehmens arbeitet, ohne sie zu übermitteln, und das sich nur dann mit einem externen Dienst verbindet, wenn sein Eigentümer es entschieden hat.

Was ist der Unterschied zwischen einer lokalen KI und einer KI in der Cloud?

Eine KI in der Cloud läuft auf den Servern eines Anbieters: Jede Anfrage verlässt das Unternehmen, wird in einem externen Rechenzentrum verarbeitet, und die Antwort kommt zurück. Eine lokale KI läuft auf einer in den Räumen des Unternehmens installierten Maschine, und die Anfragen verlassen sein Netz nicht.

Gilt der Cloud Act für in Frankreich gespeicherte Daten?

Ja, wenn der Anbieter dem US-Recht unterliegt. Das Gesetz zielt auf Daten in seinem Besitz, seiner Obhut oder unter seiner Kontrolle, gleichgültig, wo sie gespeichert sind. Am 10. Juni 2025 erklärte der Leiter für öffentliche und rechtliche Angelegenheiten von Microsoft France unter Eid vor dem Senat, nicht garantieren zu können, dass diese Daten niemals an die US-Behörden übermittelt würden.

Kann man ChatGPT im Unternehmen DSGVO-konform nutzen?

Das ist möglich mit einem Auftragsverarbeitungsvertrag, Garantien für Übermittlungen außerhalb der Union und einer internen Regel zu den zulässigen Daten. Die CNIL verlangt zu prüfen, ob der Anbieter die eingegebenen Daten weiterverwenden darf, und hält für personenbezogene oder sensible Daten im Allgemeinen einen Betrieb vor Ort für vorzugswürdig.

Wann rechnet sich eine lokale KI mehr als die Cloud?

Wenn die Nutzung täglich und intensiv ist. Die Cloud wird nach der Menge des verarbeiteten Textes abgerechnet, während eine lokale Maschine beim Kauf bezahlt wird und danach nur Strom und Wartung kostet. Bei gelegentlicher oder sehr unregelmäßiger Nutzung bleibt die Miete in der Regel günstiger.