Open-Source-Modelle 2026: offene Gewichte gegen geschlossene KI
Im Mai 2023 trennten 174 Punkte das beste geschlossene KI-Modell vom besten offenen Modell im Arena-Ranking, in dem Nutzer die Antworten zweier Modelle blind vergleichen. Im August 2024 betrug der Abstand nur noch 7 Punkte. Im März 2026 war er wieder auf 49 gestiegen. Diese Zahlen aus dem AI Index 2026 der Stanford University zeigen, dass Modelle, die man herunterladen und im eigenen Haus betreiben kann, nahe an den besten bleiben, ohne sie zu übertreffen, und dass der Abstand im Takt der Veröffentlichungen weniger Unternehmen schwankt.
Offene Gewichte und Open Source: was die Begriffe umfassen
Ein Sprachmodell ist ein Programm, das Text liest und erzeugt, nachdem es auf riesigen Textbeständen trainiert wurde. Was es gelernt hat, ist in seinen Parametern gespeichert, auch Gewichte genannt: Milliarden von Zahlen, die während des Trainings angepasst wurden. Ein Modell mit offenen Gewichten ist ein Modell, dessen Zahlen veröffentlicht und herunterladbar sind. Jeder kann es dann auf der eigenen Maschine betreiben, anpassen oder untersuchen. Ein geschlossenes Modell dagegen ist nur über die Schnittstelle seines Anbieters zugänglich: Man sendet ihm eine Anfrage, es sendet eine Antwort zurück, und seine Gewichte bleiben auf den Servern des Anbieters.
Der Ausdruck „Open Source“ wird oft für die beiden ersten Fälle verwendet, im strengen Sinn zu Unrecht. Die Open Source Initiative, die maßgebliche Organisation für Lizenzen freier Software, hat Ende Oktober 2024 die Version 1.0 ihrer Definition von Open-Source-KI veröffentlicht. Sie verlangt drei Elemente: hinreichend detaillierte Informationen über die Trainingsdaten, damit eine sachkundige Person ein vergleichbares System nachbauen kann, den vollständigen Code zum Trainieren und Ausführen des Modells und die Parameter selbst.
Die meisten bekannten Modelle veröffentlichen das dritte Element, manchmal einen Teil des zweiten, fast nie das erste. Die Trainingsdaten bleiben aus Wettbewerbs- und urheberrechtlichen Gründen geheim. Einige Forschungsprojekte wie OLMo des Allen Institute for AI veröffentlichen auch ihre Daten, gehören aber nicht zu den leistungsstärksten. Der genaue Begriff für DeepSeek, Qwen, Mistral oder gpt-oss lautet daher „Modelle mit offenen Gewichten“. Dieser Artikel spricht der Einfachheit halber von offenen Modellen.
Was die Lizenzen erlauben
Die Lizenz ist der Vertrag, der festlegt, was der Nutzer mit dem Modell tun darf. Die Lizenzen Apache 2.0 und MIT aus der freien Software sind die freizügigsten: Sie erlauben kommerzielle Nutzung, Änderung und Weiterverbreitung, sofern der Urhebervermerk und der Lizenztext beibehalten werden. Qwen3.5 von Alibaba, gpt-oss von OpenAI und Mistral Large 3 werden unter Apache 2.0 veröffentlicht. DeepSeek V4 erscheint unter der MIT-Lizenz.
Meta hat für Llama 4 eine hauseigene Lizenz gewählt, datiert auf den 5. April 2025. Sie erlaubt die kommerzielle Nutzung, mit drei bemerkenswerten Bedingungen. Ein Unternehmen, dessen Produkte mehr als 700 Millionen monatlich aktive Nutzer haben, muss bei Meta eine Lizenz beantragen, was nur eine Handvoll Konzerne weltweit betrifft. Jedes Unternehmen, das ein auf Llama beruhendes Produkt vertreibt, muss den Vermerk „Built with Llama“ anzeigen. Schließlich muss jedes weitergegebene abgeleitete Modell einen Namen tragen, der mit „Llama“ beginnt.
Diese Bedingungen bleiben für die meisten Unternehmen akzeptabel, verändern aber die Arbeit der Rechtsabteilung. Eine Apache-2.0-Lizenz ist ein Standardtext, den Juristen, die freie Software geprüft haben, bereits kennen. Eine herstellereigene Lizenz muss vollständig gelesen werden, und sie kann sich von einer Modellversion zur nächsten ändern.
Die wichtigsten offenen Modelle im Herbst 2026
Die größten offenen Modelle beruhen fast alle auf einer Architektur mit Expertenmischung. Das Modell ist in zahlreiche Teilnetze zerlegt, und für jedes erzeugte Wort greift eine Weiche nur auf einige wenige zu. Man unterscheidet daher zwei Zahlen: die Gesamtzahl der Parameter, die den nötigen Speicher bestimmt, und die Zahl der aktiven Parameter, die den Rechenaufwand pro Wort bestimmt.
DeepSeek, ein chinesisches Labor, das vom Investmentfonds High-Flyer finanziert wird, hat Ende April 2026 eine Vorabversion seiner V4-Familie unter MIT-Lizenz veröffentlicht. Laut der auf Hugging Face veröffentlichten Beschreibung hat V4-Pro 1.600 Milliarden Parameter, davon 49 Milliarden aktiv, und V4-Flash 284 Milliarden, davon 13 Milliarden aktiv. Beide akzeptieren einen Kontext von einer Million Tokens. Der Kontext ist die Textmenge, die das Modell auf einmal berücksichtigen kann, und ein Token entspricht einem Wortfragment.
Alibaba hat Qwen3.5 am 16. Februar 2026 unter Apache 2.0 veröffentlicht: 397 Milliarden Parameter, davon 17 Milliarden aktiv, und Unterstützung für 201 Sprachen und Dialekte. Laut einer von Summit School veröffentlichten Analyse, die wir bei Alibaba nicht gegenprüfen konnten, umfasst die im April erschienene Serie Qwen3.6 leichter zu hostende Modelle, darunter ein Modell mit 35 Milliarden Parametern, das nur 3 Milliarden aktiviert. Das nachfolgende Flaggschiff Qwen3.7-Max, im Mai 2026 vorgestellt, ist dagegen nur über eine API zugänglich, ohne herunterladbare Gewichte.
In Europa hat das französische Unternehmen Mistral AI am 2. Dezember 2025 Mistral Large 3 veröffentlicht, ein Modell mit 675 Milliarden Parametern, davon 41 Milliarden aktiv, begleitet von drei kleinen Modellen mit 3, 8 und 14 Milliarden Parametern, alle unter Apache 2.0. In den Vereinigten Staaten hat OpenAI im August 2025 gpt-oss veröffentlicht, sein erstes offenes Modell seit GPT-2: Die größte Version hat 117 Milliarden Parameter, davon 5,1 Milliarden aktiv, die kleinste 21 Milliarden, davon 3,6 Milliarden aktiv.
Meta, das auf amerikanischer Seite mit seiner Llama-Familie die Offenheit getragen hatte, hat den Kurs gewechselt. Am 8. April 2026 stellte das Unternehmen Muse Spark vor, das erste Modell seines Labors Meta Superintelligence Labs. Es ist geschlossen: Man nutzt es in den Anwendungen von Meta oder über eine API, die ausgewählten Partnern offensteht. Meta schrieb, es hoffe, künftige Versionen als Open Source zu veröffentlichen, ohne Zeitplan. Die bereits veröffentlichten Llama-Modelle bleiben herunterladbar.
Den Abstand messen: unabhängiges Ranking und Herstellerzahlen
Ein Benchmark ist eine Reihe standardisierter Fragen, mit denen Modelle bewertet werden. Jeder Anbieter hebt die hervor, bei denen er seine besten Ergebnisse erzielt, was Vergleiche fragil macht. Das Arena-Ranking geht anders vor: Nutzer stellen eine Frage, erhalten zwei anonyme Antworten und stimmen für die bessere. Die Stimmen speisen einen Wert vom Typ Elo, dem Wertungssystem der Schachspieler.
Der AI Index 2026, herausgegeben vom Institute for Human-Centered AI der Stanford University, stützt sich auf dieses Ranking. Im März 2026 erreichte das beste geschlossene Modell, Claude Opus 4.6 von Anthropic, 1.503 Punkte. Das beste offene Modell, GLM-5 des chinesischen Unternehmens Zhipu AI, erreichte 1.454, also 49 Punkte oder 3,4 % Abstand. Sechs der zehn ersten Modelle des Rankings waren geschlossen. Der Bericht hält außerdem fest, dass die vier ersten Unternehmen, Anthropic, xAI, Google und OpenAI, innerhalb von 25 Punkten lagen, gefolgt von Alibaba mit 1.449 und DeepSeek mit 1.424.
Der Bericht beschreibt eine Pendelbewegung. Mixtral, WizardLM und dann Llama 3.1 405B hatten den Abstand im August 2024 auf 7 Punkte gedrückt. Das Erscheinen neuer geschlossener Modelle wie o1-preview von OpenAI und Gemini 2.5 Pro von Google hat ihn wieder vergrößert. Der Abstand schrumpft, wenn die offenen Labore veröffentlichen, und öffnet sich wieder, wenn die geschlossenen Labore eine neue Generation herausbringen.
Die Anbieter nennen eigene Schätzungen, die man als solche lesen muss. DeepSeek behauptet, V4-Pro liege beim Schlussfolgern drei bis sechs Monate hinter GPT-5.4 und Gemini 3.1 Pro, eine Schätzung, die die Website WinBuzzer als nicht von unabhängigen Laboren überprüft darstellt. Für Qwen3.5 sehen die von Alibaba veröffentlichten und von The Decoder aufgegriffenen Zahlen das Modell bei Tests zur Befolgung von Anweisungen vorn, etwa IFBench mit 76,5, aber hinter GPT-5.2 bei Wettbewerbsmathematik, mit 91,3 gegenüber 96,7 bei AIME26, und bei der Programmierung, mit 83,6 gegenüber 87,7 bei LiveCodeBench.
Zusammengenommen deuten diese Zahlen darauf hin, dass ein gutes offenes Modell einige Monate hinter den besten geschlossenen Modellen liegt. Bei der Mehrheit der Büroaufgaben sieht der Nutzer keinen Unterschied. Bei den schwierigsten Problemen, etwa langem Schlussfolgern oder Aufgaben, die viele Schritte ohne Aufsicht aneinanderreihen, bleibt er messbar.
Der nötige Speicher und die Rolle der Quantisierung
Um zu funktionieren, muss ein Modell alle seine Parameter in den Speicher laden, auch die der in einem gegebenen Moment inaktiven Experten. Die Expertenmischung verringert die Rechenarbeit, nicht den Speicher. Bei der Standardgenauigkeit von 16 Bit belegt jeder Parameter zwei Byte. Die 117 Milliarden Parameter von gpt-oss würden also etwa 234 Gigabyte erfordern, fast das Dreifache des Speichers einer Nvidia-H100-Karte, die 80 hat.
Die Quantisierung löst einen Teil des Problems. Sie besteht darin, jeden Parameter mit weniger Bit zu speichern, 8 oder 4 statt 16. Die Dokumentation der Transformers-Bibliothek von Hugging Face beschreibt sie als Weg, den nötigen Speicher zu verringern und dabei die Genauigkeit des Modells möglichst zu erhalten. Der treffendste Vergleich ist ein komprimiertes Foto: Die Datei ist viel leichter, und bei guter Kompression sieht man den Unterschied nur aus der Nähe.
Die Anbieter liefern inzwischen bereits quantisierte Modelle. OpenAI verteilt gpt-oss mit den Gewichten seiner Experten im Format MXFP4, auf etwa 4 Bit, sodass die große Version auf eine einzelne Karte mit 80 Gigabyte passt und die kleine mit 16 Gigabyte Speicher läuft. DeepSeek veröffentlicht V4 in einem gemischten Format: 4 Bit für die Experten, 8 Bit für die meisten übrigen Parameter. Auch komprimiert verlangt V4-Pro mehrere hundert Gigabyte und bleibt ein Modell für einen Serververbund.
In der Praxis zeichnen sich drei Stufen ab. Modelle mit 3 bis 20 Milliarden Parametern laufen auf einem Arbeitsplatzrechner mit einer aktuellen Grafikkarte. Modelle mit 30 bis 120 Milliarden verlangen eine eigene Maschine mit einer oder zwei Karten großer Kapazität, was für ein mittelständisches Unternehmen erreichbar bleibt. Darüber, ab einigen hundert Milliarden, braucht es einen vollständigen Rechenserver. Die Kompression hat ihren Preis: Bei Code, Berechnungen oder sehr technischen Texten verschlechtert eine zu starke Quantisierung die Ergebnisse. Die einzige verlässliche Methode besteht darin, sie an den eigenen Dokumenten zu testen.
Die Aufgaben, bei denen sie genügen, und die, bei denen sie Mühe haben
Offene Modelle mittlerer Größe liefern gute Ergebnisse bei begrenzter und wiederkehrender Arbeit: Protokolle zusammenfassen, E-Mails sortieren, Felder aus einer Rechnung extrahieren, Fragen auf Grundlage einer internen Dokumentenbasis beantworten, einen ersten Entwurf schreiben, übersetzen. Für diese Einsätze erzeugt ein gut konfiguriertes Modell mit 20 bis 120 Milliarden Parametern Antworten, die die meisten Nutzer nicht von denen eines geschlossenen Modells unterscheiden. Vor Ort betrieben, bietet es zudem planbare Kosten und ein Verhalten, das sich nicht ohne interne Entscheidung ändert.
Anfälliger sind sie in drei Situationen. Die erste betrifft lange Aufgaben, bei denen das Modell allein handelt und Dutzende Aktionen aneinanderreiht: Eine kleine Fehlerwahrscheinlichkeit pro Schritt summiert sich am Ende. Die zweite betrifft aktuelles Wissen, denn ein Modell weiß nur, was es vor dem Ende seines Trainings gelesen hat, es sei denn, man liefert ihm aktuelle Dokumente. Die dritte betrifft Sprachen und Fachjargons, die in den Trainingsdaten, die vor allem englisch und chinesisch sind, weniger vertreten sind. Juristisches oder technisches Französisch erfordert daher spezifische Tests vor jeder Einführung.
Ein offenes Modell ist eine Datei, kein Dienst. Sicherheitsupdates, Überwachung, Protokollierung der Zugriffe und Rechteverwaltung bleiben Sache dessen, der es betreibt. Das ist die Arbeit, die Anbieter geschlossener Modelle mit ihrer API abrechnen und die man einplanen muss, wenn man sich für Eigenbetrieb entscheidet.
Vereinigte Staaten, China, Europa: drei Arten zu veröffentlichen
Die fortschrittlichsten amerikanischen Labore, Anthropic, Google und OpenAI, halten ihre besten Modelle geschlossen und verkaufen sie über eine API. OpenAI macht mit gpt-oss eine teilweise Ausnahme, das hinter seinen Flaggschiffmodellen zurückbleibt. Meta hat sich mit Muse Spark seinen Wettbewerbern angeglichen.
Die chinesischen Labore wie DeepSeek, Alibaba oder Zhipu AI veröffentlichen viele offene Gewichte unter freizügigen Lizenzen. Der AI Index 2026 stellt fest, dass sich der Abstand zwischen amerikanischen und chinesischen Modellen fast geschlossen hat: Im März 2026 lag das beste amerikanische Modell um 39 Punkte oder 2,7 % vor dem besten chinesischen Modell, Dola-Seed-2.0 Preview von ByteDance. Laut WinBuzzer hat Huawei bestätigt, dass seine auf Ascend-Prozessoren beruhenden Rechencluster DeepSeek V4 ausführen können, das dennoch auf Nvidia-Chips trainiert wurde. Die chinesische Offenheit ist deshalb keine Doktrin: Alibaba hält sein leistungsstärkstes Modell inzwischen hinter einer API zurück, und das beste chinesische Modell des Rankings, das von ByteDance, ist geschlossen.
Europa hat wenige Labore der Spitzenklasse, mit Mistral AI an der Spitze, und wiegt vor allem durch die Regulierung. Die Pflichten des AI Act für KI-Modelle mit allgemeinem Verwendungszweck gelten seit dem 2. August 2025, und die Kommission kann sie seit dem 2. August 2026 durchsetzen. Modelle, die unter einer freien Lizenz veröffentlicht werden, sind, mit Ausnahme der als systemisches Risiko eingestuften, von einem Teil der Pflichten zur technischen Dokumentation befreit, müssen aber weiterhin eine Zusammenfassung ihrer Trainingsdaten und eine Urheberrechtsrichtlinie veröffentlichen. Der Verhaltenskodex, der diese Regeln begleitet und am 10. Juli 2025 veröffentlicht wurde, zählte Mitte August 2025 26 Unterzeichner, darunter OpenAI, Google, Microsoft, Amazon und Anthropic. Meta und die chinesischen Unternehmen standen nicht darauf.
Für einen französischen Käufer ist die Folge praktisch: Bevor man ein Modell einführt, muss man wissen, welches tatsächlich läuft, unter welcher Lizenz, mit welcher Dokumentation und wer sein Anbieter ist.
Das Modell wechseln, ohne die Werkzeuge neu zu bauen
Das Ranking von heute wird nicht das des nächsten Jahres sein. Binnen zwölf Monaten hat DeepSeek eine neue Generation veröffentlicht, Alibaba hat drei vorgestellt und die letzte seiner API vorbehalten, Meta hat sein erstes großes geschlossenes Modell gestartet. Ein Unternehmen, das seine Software direkt an ein bestimmtes Modell anbindet, wettet auf einen Marktstand, der sich vor Jahresende geändert haben wird.
Die Antwort ist technischer Natur. Die Anwendungen wenden sich nicht direkt an das Modell, sondern an eine Zwischenschicht, die das Modell je nach Aufgabe auswählt. Ein internes Testset aus den realen Dokumenten und Fragen des Unternehmens prüft, dass ein neues Modell mindestens so gut abschneidet wie das alte, bevor es ersetzt wird. Ein Modellwechsel wird dann zu einer geplanten und überprüfbaren Wartungsmaßnahme.
Diese Disziplin schützt gleichzeitig vor mehreren Risiken: einem Anbieter, der aufhört, seine Gewichte zu veröffentlichen, einer Lizenz, die sich verschärft, einem steigenden Preis, einem zurückgezogenen Modell. Ein Artikel der deutschen Website Digital Chiefs zur Kehrtwende von Meta empfiehlt den IT-Leitungen dasselbe Vorgehen: mehrere Modellfamilien statt eines einzigen Anbieters, darunter mindestens ein offenes Modell für regulierte oder offline genutzte Einsätze, ein Inventar der Anwendungen und der von ihnen genutzten Modelle und Ausstiegsklauseln in den Verträgen.
Was der Stand der offenen Modelle für ein Unternehmen ändert
Im Herbst 2026 liegen die besten offenen Modelle nach dem am meisten beachteten unabhängigen Maßstab wenige Punkte hinter den besten geschlossenen Modellen. Ihre Lizenzen reichen von Apache 2.0, die fast keine Bedingungen stellt, bis zu hauseigenen Texten, die man prüfen lassen muss. Ihre Verfügbarkeit hängt von der Strategie ihrer Urheber ab, die sich von Version zu Version ändern kann. Für die meisten gängigen Einsätze genügen sie, und sie erlauben es, die Dokumente des Unternehmens zu verarbeiten, ohne sie an Dritte zu senden.
Das Kriterium, das auf Dauer zählt, ist die Fähigkeit, ein Modell durch ein anderes zu ersetzen, ohne den Rest anzutasten. Das ist die Architekturentscheidung von HOMN: Das Modell ist ein austauschbares Teil, vor jedem Austausch an den Dokumenten des Kunden getestet, und die Infrastruktur drumherum bleibt von einer Generation zur nächsten bestehen.
Was ist der Unterschied zwischen einem Open-Source-Modell und einem Modell mit offenen Gewichten?
Ein Modell mit offenen Gewichten veröffentlicht seine Parameter, sodass man es herunterladen und auf der eigenen Maschine betreiben kann. Nach der Definition der Open Source Initiative muss ein Open-Source-Modell zusätzlich den Trainingscode und detaillierte Informationen zu seinen Trainingsdaten veröffentlichen. Die meisten bekannten Modelle wie DeepSeek, Qwen oder Mistral haben offene Gewichte.
Welches ist 2026 das beste Open-Source-KI-Modell?
Laut dem AI Index 2026 von Stanford war das beste offene Modell im Arena-Ranking im März 2026 GLM-5 von Zhipu AI mit 1.454 Punkten. DeepSeek V4, Qwen3.5 und Mistral Large 3 gehören seither zu den größten veröffentlichten offenen Modellen. Die richtige Wahl hängt von der verfügbaren Hardware, der Lizenz und Tests an den eigenen Aufgaben ab.
Sind Open-Source-Modelle so gut wie ChatGPT oder Claude?
Sie kommen nahe heran. Im März 2026 lag das beste offene Modell 49 Punkte oder 3,4 % hinter dem besten geschlossenen Modell des Arena-Rankings. Bei gängigen Büroaufgaben ist der Unterschied kaum sichtbar, aber er bleibt bei langem Schlussfolgern und komplexen autonomen Aufgaben messbar.
Welche Hardware braucht man, um ein Open-Source-LLM lokal zu betreiben?
Ein Modell mit 3 bis 20 Milliarden Parametern läuft auf einem Rechner mit aktueller Grafikkarte, und gpt-oss-20b läuft mit 16 Gigabyte Speicher. Ein auf 4 Bit quantisiertes Modell mit etwa 120 Milliarden Parametern wie gpt-oss-120b passt auf eine Karte mit 80 Gigabyte. Modelle mit mehreren hundert Milliarden Parametern verlangen einen vollständigen Server.