Lokale KI: Definition, Funktionsweise und konkrete Beispiele

Eine lokale KI ist ein Sprachmodell, das seine Antworten auf einer Maschine berechnet, die Sie kontrollieren, ohne Ihre Texte an einen Anbieter zu senden. Dieser Leitfaden erklärt, was dieses Modell enthält, was es bedeutet, es im eigenen Haus zu betreiben, und was man davon vernünftigerweise erwarten kann.

Ein Befehl, ein Download, danach verlässt nichts mehr das Gerät

Die Dokumentation von Ollama, einer freien Software für macOS, Windows und Linux, bringt den Ausgangspunkt in einer Zeile unter: ein im Terminal eingegebener Befehl, der ein Modell herunterlädt und ein Gespräch eröffnet. Für das Beispielmodell Gemma 4 E2B wiegt die Datei etwa 7,2 GB, und die Dokumentation empfiehlt 8 GB Grafikspeicher, bei einem Mac einheitlichen Speicher. Sobald diese Datei auf der Festplatte liegt, wird jede Antwort von den Prozessoren der Maschine berechnet. Man kann das Netzwerkkabel ziehen, das Gespräch läuft weiter.

Das ist die einfachste Definition einer lokalen KI: ein Modell der künstlichen Intelligenz, das auf Hardware ausgeführt wird, die man besitzt oder kontrolliert, sei es ein Laptop, ein Server im Technikschrank oder ein eigenes Gerät. Das Gegenteil ist ein entfernter Dienst. ChatGPT, Gemini oder Le Chat empfangen Ihren Text auf ihren Servern, verarbeiten ihn dort und senden Ihnen das Ergebnis zurück.

Um zu verstehen, was in beiden Fällen geschieht, muss man die Box öffnen: was ein Sprachmodell ist, was die heruntergeladene Datei enthält und was die Maschine genau tut, wenn sie eine Antwort erzeugt.

Ein Sprachmodell sagt die Fortsetzung eines Textes voraus

Ein großes Sprachmodell, oft LLM für large language model abgekürzt, ist ein Programm, das auf eine unscheinbare Aufgabe trainiert wurde: das nächste Textstück zu erraten. Die Tastatur Ihres Telefons, die über den Tasten das nächste Wort vorschlägt, tut im Kleinstmaßstab dasselbe. Das LLM tut es so fein, dass es durch das Aneinanderreihen von Vorhersagen Absätze, Zusammenfassungen, Code oder Übersetzungen erzeugt.

Das Modell verarbeitet keine Wörter, sondern Tokens, Textfragmente, die einem ganzen Wort, einer Silbe oder einem Satzzeichen entsprechen können. Die Dokumentation von OpenAI nennt für das Englische eine Größenordnung: Ein Token entspricht etwa vier Zeichen, also drei Vierteln eines Wortes. Diese Einheit dient dazu, alles zu messen, von der maximalen Länge eines Austauschs, dem Kontextfenster genannt, bis zur Generierungsgeschwindigkeit.

Die Architektur, die diese Modelle möglich gemacht hat, heißt Transformer. Sie wurde 2017 in einem Forschungsartikel mit dem Titel „Attention Is All You Need“ beschrieben. Ihre zentrale Idee, der Aufmerksamkeitsmechanismus, erlaubt es dem Modell, für jedes Token die Bedeutung aller anderen Tokens des Textes zu gewichten. Im Satz „Der Vertrag, den der Kunde gestern unterschrieben hat, läuft im März aus“ verknüpft dieser Mechanismus „läuft aus“ mit „Vertrag“, trotz der dazwischenliegenden Wörter.

Man sollte sich vor Augen halten, was diese Mechanik bedeutet. Das Modell erzeugt die plausibelste Fortsetzung im Licht dessen, was es während des Trainings gesehen hat. Plausibel heißt nicht richtig, und dieser Unterschied erklärt die meisten seiner Grenzen.

Die Gewichte: was die Datei enthält

Was man herunterlädt, wenn man ein Modell installiert, sind seine Gewichte, auch Parameter genannt. Das sind Zahlen, Milliarden von Zahlen, die während des Trainings einzeln angepasst wurden, damit die Vorhersagen gut werden. Man kann sie mit den Reglern eines riesigen Mischpults vergleichen: Kein Regler für sich bedeutet viel, aber ihre Gesamtstellung bestimmt den Klang.

Die Größe eines Modells bemisst sich in Parametern. Mistral 7B, am 27. September 2023 vom französischen Unternehmen Mistral AI veröffentlicht, hat 7,3 Milliarden. Es wurde unter der Lizenz Apache 2.0 verbreitet, die erlaubt, es herunterzuladen, zu nutzen und zu installieren, wo man will, auch für kommerzielle Zwecke. Man spricht von einem Modell mit offenen Gewichten: Das Unternehmen veröffentlicht die Datei selbst und nicht nur einen Fernzugriff.

Im Leben eines Modells folgen zwei Phasen aufeinander. Das Training erzeugt die Gewichte aus riesigen Textmengen; es bindet erhebliche Rechenressourcen und bleibt Sache weniger Labore. Die Inferenz nutzt dann diese eingefrorenen Gewichte, um eine Frage zu beantworten; sie, und nur sie, lässt man lokal laufen. Der Unterschied gleicht dem zwischen dem Verfassen und dem Nachschlagen in einem Wörterbuch: Das erste dauert Jahre, das zweite Sekunden, und niemand muss das Wörterbuch neu schreiben, um ein Wort nachzuschlagen.

Ein Modell ausführen: Engine, Format und Quantisierung

Um diese Gewichte auszuführen, braucht man eine Inferenz-Engine, das Programm, das die Datei in den Speicher lädt und die Berechnungen aneinanderreiht. Die am weitesten verbreitete im lokalen Umfeld heißt llama.cpp. In C und C++ ohne externe Abhängigkeiten geschrieben, zielt sie darauf, Modelle mit minimaler Installation auf einer breiten Palette von Hardware laufen zu lassen: Apple-Chips, herkömmliche x86-Prozessoren, NVIDIA-Grafikkarten über CUDA oder andere Hersteller über Vulkan. Leichter zugängliche Anwendungen wie Ollama oder LM Studio können dasselbe Dateiformat lesen.

Dieses Format heißt GGUF. Laut der Dokumentation von Hugging Face, der wichtigsten Plattform zum Teilen von Modellen, vereint eine GGUF-Datei in einer einzigen Binärdatei die Gewichte und einen normierten Satz von Metadaten: die Architektur, das Token-Vokabular, die zum Laden nötigen Einstellungen. Man kopiert sie, lädt sie, und sie funktioniert, ähnlich wie ein PDF, das seine eigenen Schriften mitbringt.

Der Faktor, der fast alles entscheidet, ist der Speicher. In ihrer ursprünglichen Form wird jeder Parameter mit 16 Bit gespeichert, also zwei Byte. Ein Modell mit 7,3 Milliarden Parametern belegt dann fast 15 GB, mehr als der Speicher der meisten Desktop-Rechner. Die Quantisierung löst dieses Problem, indem sie die Gewichte auf weniger Bit rundet, so wie man die Farbanzahl eines Fotos reduziert, ohne dass das Auge auf den ersten Blick einen Unterschied sieht. llama.cpp unterstützt Quantisierungen von 1,5 bis 8 Bit. Der viel verwendete Typ Q4_K entspricht laut der Dokumentation von Hugging Face 4,5 Bit pro Gewicht: Dasselbe Modell sinkt dann auf etwa 4 GB.

Diese Kompression hat ihren Preis, einen leichten Genauigkeitsverlust, der mit sinkender Bitzahl zunimmt. Und der Speicher dient nicht nur zum Ablegen der Gewichte. Die Dokumentation von Ollama weist darauf hin, dass ein längeres Kontextfenster mehr Speicher verlangt, da die Maschine den gesamten gerade verarbeiteten Text nachhält. Fehlt Grafikspeicher, kann die Software auf den gewöhnlichen Arbeitsspeicher ausweichen, mit langsameren Antworten. Die Wahl der Hardware ergibt sich aus drei Parametern: der Größe des Modells, seiner Quantisierungsstufe und der Länge der zu verarbeitenden Texte.

Warum es in wenigen Jahren realistisch geworden ist

Vor kurzem noch war es eine Laborvorführung, ein kompetentes Modell auf einer einzelnen Maschine laufen zu lassen. Drei Messwerte aus dem AI Index 2025 der Stanford University zeigen, was sich geändert hat.

Der erste betrifft die Größe. 2022 war das kleinste Modell, das im MMLU, einem Multiple-Choice-Test über zahlreiche Fachgebiete, mehr als 60 % richtige Antworten erreichte, PaLM von Google mit 540 Milliarden Parametern. 2024 überschritt Phi-3-mini von Microsoft dieselbe Schwelle mit 3,8 Milliarden Parametern, also einem 142-mal kleineren Modell. Ein Modell dieser Größe passt quantisiert in den Speicher eines Laptops.

Der zweite betrifft den Abstand zwischen geschlossenen Modellen und Modellen mit offenen Gewichten. Anfang Januar 2024 lag im Ranking Chatbot Arena, in dem Internetnutzer die Antworten zweier Modelle blind vergleichen, das beste geschlossene Modell 8,04 % vor dem besten offenen Modell. Im Februar 2025 betrug der Abstand nur noch 1,70 %.

Der dritte betrifft die Kosten. Ebenfalls laut Stanford sanken die Inferenzkosten eines Systems auf dem Niveau von GPT-3.5 zwischen November 2022 und Oktober 2024 auf weniger als ein Zweihundertachtzigstel. Im selben Zeitraum sanken die Hardwarekosten um etwa 30 % pro Jahr, und ihre Energieeffizienz stieg um 40 % pro Jahr.

Diese Zahlen beschreiben einen Trend, keine Gleichheit. Die größten geschlossenen Modelle behalten bei den schwierigsten Aufgaben den Vorteil, und ein auf Präferenzen von Internetnutzern gestütztes Ranking misst nicht alles. Die Grenze dessen, was ohne Rechenzentrum möglich ist, hat sich dennoch deutlich verschoben.

Lokal oder ChatGPT: Die Frage ist, wohin der Text wandert

Aus Sicht des Nutzers ähneln sich beide Erfahrungen: ein Eingabefeld, eine Antwort, die Wort für Wort erscheint. Der Unterschied liegt im Weg. Bei einem Online-Dienst laufen die Frage, die angehängten Dokumente und die Antwort über die Server des Anbieters. Bei einer lokalen KI verlassen sie die Maschine nicht.

Dieser Weg hat konkrete Folgen. OpenAI gibt an, dass die Gespräche kostenloser ChatGPT-Konten und von Plus-Konten zur Verbesserung seiner Modelle genutzt werden können, solange der Nutzer die Option nicht deaktiviert hat, während die Daten seiner professionellen Angebote und seiner API standardmäßig nicht verwendet werden. Die CNIL stellt in ihren im Juli 2024 veröffentlichten Fragen und Antworten zur generativen KI fest, dass bei der Nutzung über eine API die Kontrolle über das System „quasi ausschließlich“ beim Anbieter liegt. Sie empfiehlt einen Betrieb vor Ort, wenn personenbezogene oder sensible Daten verarbeitet werden, um die Risiken einer Extraktion durch Dritte zu begrenzen.

Die ANSSI, die französische Behörde für die Sicherheit von Informationssystemen, geht in ihren am 29. April 2024 veröffentlichten Sicherheitsempfehlungen für Systeme der generativen KI in dieselbe Richtung. Ihre Empfehlung R34 rät von im Internet zugänglichen Werkzeugen der generativen KI für eine berufliche Nutzung mit sensiblen Daten ab: Die Organisation kontrolliert den Dienst nicht und kann daher die Vertraulichkeit dessen, was sie dorthin sendet, nicht garantieren.

Lokal hat weitere Eigenschaften. Es funktioniert ohne Verbindung. Seine Kosten hängen nicht von der Zahl der gestellten Fragen ab, da es sich um gekaufte Hardware statt um einen Zähler handelt. Es ändert sich nicht über Nacht, weil ein Anbieter ein Modell ersetzt oder zurückgezogen hat. Im Gegenzug verwaltet die Organisation Maschine, Updates und Sicherungen selbst und hat keinen Zugang zu den größten geschlossenen Modellen, die nur online angeboten werden. Viele Organisationen kombinieren beides: lokal für Vertrauliches oder Wiederkehrendes, einen entfernten Dienst für gelegentliche Bedürfnisse ohne sensible Daten.

Was man mit einer lokalen KI konkret tun kann

Am besten funktionieren Einsätze, in denen das Modell mit einem gelieferten Text arbeitet, statt aus seinem Gedächtnis zu schöpfen. Ein Sitzungsprotokoll von dreißig Seiten zusammenfassen. Ein Schreiben in einen neutraleren Ton umformulieren. Aus einer Rechnung Lieferant, Datum und Betrag extrahieren, um sie in eine Tabelle einzutragen. Eine technische Anleitung übersetzen. Eingehende E-Mails nach ihrem Betreff sortieren, bevor man sie an die richtige Abteilung weiterleitet.

Der im Unternehmen am häufigsten gewünschte Fall besteht darin, die eigenen Dokumente abzufragen: interne Verfahren, Verträge, Vereinbarungen, die Wissensbasis des Supports. Die dabei eingesetzte Technik, RAG für abrufgestützte Generierung genannt, findet zuerst die relevanten Passagen und bittet dann das Modell, auf deren Grundlage zu antworten und seine Quellen zu nennen. Wir widmen ihr einen ausführlichen Artikel.

Es folgen technischere Einsätze: Hilfe beim Schreiben von Code, Transkription von Besprechungen durch ein ebenfalls vor Ort ausgeführtes Spracherkennungsmodell, Analyse von Fehlerprotokollen. Diese Einsätze verbreiten sich schnell. Laut Eurostat nutzten 2025 20 % der europäischen Unternehmen mit mindestens zehn Beschäftigten eine Technologie der künstlichen Intelligenz, gegenüber 13,5 % ein Jahr zuvor.

In all diesen Fällen liefert die Maschine einen ersten Entwurf oder eine Vorsortierung, und eine Person bestätigt. In dieser Konstellation ist das Verhältnis zwischen gewonnener Zeit und eingegangenem Risiko am günstigsten.

Die Grenzen, ohne sie zu beschönigen

Ein Sprachmodell kann mit Nachdruck etwas Falsches behaupten. Dieses Phänomen, Halluzination genannt, folgt direkt aus seiner Funktionsweise: Es erzeugt einen plausiblen Text, und ein plausibler Text kann ein erfundenes Datum, einen nicht existierenden Rechtsverweis oder eine falsch abgeschriebene Zahl enthalten. Lokaler Betrieb ändert daran nichts. Das Gegenmittel besteht darin, ihm die Quellen zu liefern, statt auf sein Gedächtnis zu setzen, und alles gegenlesen zu lassen, was die Organisation bindet.

Sein Wissen endet mit dem Ende seines Trainings. Ein vor einem Jahr veröffentlichtes Modell kennt die letzte Reform, die letzte Tabelle, die letzte Version einer Software nicht. Es konsultiert das Internet nicht von selbst: Eine vom Netz getrennte lokale KI weiß nur, was sie gelernt hat und was man ihr zu lesen gibt.

Ein kleines Modell bleibt ein kleines Modell. Die von Stanford gemessenen Fortschritte sind real, doch ein Modell mit einigen Milliarden Parametern irrt sich bei mehrstufigem Schlussfolgern, bei einer Berechnung oder einer sehr spezialisierten Frage häufiger als ein Riesenmodell. Die Geschwindigkeit hängt von der Hardware ab: Auf einem Rechner ohne geeigneten Grafikprozessor kann eine lange Antwort auf sich warten lassen.

Schließlich ist eine lokale Installation ein IT-System wie jedes andere. Man muss es administrieren, Korrekturen einspielen, kontrollieren, wer darauf zugreift. Die ANSSI widmet einen Teil ihrer Empfehlungen der Isolierung von KI-Systemen, der Protokollierung der Verarbeitungen und der Rechteverwaltung. Lokal heißt nicht standardmäßig sicher; es heißt, dass die Sicherheit von der Organisation abhängt, die es betreibt.

Wie man beginnt

Am einfachsten probiert man es auf einem aktuellen Rechner mit einer Anwendung wie Ollama oder LM Studio. Wählen Sie ein kleines Modell mit offenen Gewichten, mit einigen Milliarden Parametern, auf 4 Bit quantisiert. Testen Sie es an realen Aufgaben, aber ohne vertrauliche Daten: ein öffentliches Dokument zusammenfassen, einen Text umformulieren, Informationen aus einem leeren Formular extrahieren. Notieren Sie Qualität, Geschwindigkeit und Fehler.

Dieser erste Schritt dient dazu, die Bedürfnisse vor jeder Ausgabe einzugrenzen: die Einsätze, die jede Woche wiederkehren, das Volumen der zu verarbeitenden Dokumente, die Zahl der Personen, die das System gleichzeitig nutzen werden. Diese Elemente bestimmen die Größe des Modells, damit den nötigen Speicher, damit die Hardware.

Für den Teameinsatz genügt der Test-Laptop nicht mehr. Es braucht eine Maschine, die eingeschaltet bleibt, im internen Netz erreichbar ist und über Konten-, Rechte- und Protokollverwaltung verfügt. Das ist die Aufgabe eines Servers oder eines eigenen Geräts.

Bei HOMN bauen wir genau diese letzte Konfiguration: Das Modell, die Dokumente und die Protokolle bleiben auf einer beim Nutzer installierten Maschine, und der Rückgriff auf einen externen Dienst bleibt eine ausdrückliche Entscheidung. Das Vorgehen gilt unabhängig vom gewählten Werkzeug: wissen, wo das Modell läuft, was es enthält und wohin die Daten gehen.

Was ist eine lokale KI?

Eine lokale KI ist ein Modell der künstlichen Intelligenz, meist ein Sprachmodell, das auf Hardware ausgeführt wird, die der Nutzer kontrolliert: Computer, Server oder ein in seinen Räumen installiertes Gerät. Die verarbeiteten Fragen und Dokumente werden nicht an die Server eines Anbieters gesendet. Das Modell ist eine einmal heruntergeladene Datei, die danach ohne Verbindung genutzt wird.

Braucht man für eine lokale KI eine Internetverbindung?

Nein, nicht für den Betrieb. Das Internet dient zum Herunterladen des Modells und der Software-Updates, aber die Berechnung der Antworten geschieht vollständig auf der Maschine. Eine lokale KI kann daher in einem isolierten Netz laufen.

Ist eine lokale KI so leistungsfähig wie ChatGPT?

Nicht bei allem: Die größten geschlossenen Modelle liegen bei den schwierigsten Denkaufgaben weiter vorn. Der Abstand ist jedoch stark geschrumpft, denn laut dem AI Index 2025 von Stanford ging er im Ranking Chatbot Arena zwischen Januar 2024 und Februar 2025 von 8,04 % auf 1,70 % zurück. Zum Zusammenfassen, Umformulieren, Extrahieren oder Abfragen von Dokumenten genügt ein gutes Modell mit offenen Gewichten in den meisten Fällen.

Welche Hardware braucht man, um ein LLM lokal zu betreiben?

Das hängt von der Größe des Modells und seiner Quantisierung ab. Ein auf 4 Bit quantisiertes Modell mit 7 Milliarden Parametern belegt etwa 4 GB, und die Dokumentation von Ollama empfiehlt für ihr Beispielmodell 8 GB Grafik- oder einheitlichen Speicher. Für die gemeinsame Nutzung durch ein Team braucht es eine eigene Maschine mit mehr Speicher.