Was KI im Unternehmen kostet: Abo, API oder eigene Maschine

Ein Unternehmen mit fünfzig Beschäftigten, das seine Teams mit einem KI-Assistenten ausstatten will, erhält drei Angebote, die sich nicht vergleichen lassen: einen Preis pro Mitarbeiter und Monat, einen Preis pro Million Tokens, einen Preis für eine Maschine. Dieser Artikel bringt die drei Rechnungen auf dieselbe Einheit, auf Grundlage der am 1. Oktober 2026 gültigen öffentlichen Preislisten.

Drei Arten, dieselbe Antwort zu bezahlen

Das erste Modell ist das Abonnement pro Nutzer, auch Lizenz pro Sitz genannt. Das Unternehmen zahlt einen festen Betrag für jede Person, die das Werkzeug nutzen darf, gleichgültig, ob sie es zehnmal am Tag oder einmal im Monat verwendet. So funktionieren die Team-Angebote der großen Chat-Assistenten und die in Office-Pakete integrierten Copiloten.

Das zweite Modell ist die nutzungsabhängige Bezahlung über eine API. Eine API, also eine Programmierschnittstelle, erlaubt es einer Software, eine Anfrage an das Modell eines Anbieters zu senden und die Antwort zu empfangen. Der Anbieter rechnet dann die verarbeitete Textmenge ab, gemessen in Tokens. Es gibt kein Abonnement pro Person: Die Rechnung folgt dem Volumen.

Das dritte Modell besteht darin, die Maschine zu besitzen. Das Unternehmen kauft einen Computer, der ein Sprachmodell mit offenen Gewichten ausführen kann, also ein Modell, dessen Parameter veröffentlicht sind und sich im eigenen Haus installieren lassen. Die Kosten werden zu einer Investition, die über mehrere Jahre abgeschrieben wird, hinzu kommen Strom und Wartung. Die Zahl der Anfragen verändert die Rechnung nicht mehr; sie verändert nur die Auslastung der Maschine.

Diese drei Modelle beantworten nicht dieselbe Frage. Das Abonnement kauft einen einsatzbereiten Dienst. Die API kauft rohe Rechenkapazität, die in die eigenen Werkzeuge integriert werden muss. Die Maschine kauft eine feste Kapazität, die ohne Mengenbegrenzung verfügbar ist, aber durch ihre Leistung begrenzt bleibt. Um sie zu vergleichen, muss jedes Angebot für einen bestimmten Einsatz auf die Kosten pro Monat umgerechnet werden.

Das Token, die Recheneinheit der Sprachmodelle

Ein Token ist ein Textfragment, oft ein Wortteil, das das Modell nacheinander liest und erzeugt. Die Preisdokumentation von Anthropic nennt eine Größenordnung: Im Englischen entspricht ein Token etwa vier Zeichen, also ungefähr drei Vierteln eines Wortes. Sie weist darauf hin, dass die genaue Zählung je nach Sprache und Inhaltstyp variiert. Ein französischer Text, eine Zahlentabelle oder Quellcode ergeben bei gleicher Länge nicht dieselbe Anzahl an Tokens.

Die Anbieter unterscheiden zwei Kategorien. Eingabe-Tokens entsprechen allem, was das Modell empfängt: die Frage, die Anweisungen, den Gesprächsverlauf, die angehängten Dokumente. Ausgabe-Tokens entsprechen dem, was es schreibt. Letztere sind deutlich teurer. In den am 1. Oktober 2026 erfassten Preislisten kostet das Ausgabe-Token fünfmal so viel wie das Eingabe-Token, sowohl bei den aktuellen Modellen von Anthropic als auch bei der Generation gpt-6 von OpenAI.

Das Token ist weder von einem Anbieter zum anderen noch von einer Modellgeneration zur nächsten eine stabile Einheit. Anthropic gibt an, dass seine Modelle ab Claude 4.7 einen neuen Tokenizer verwenden, der für denselben Text etwa 30 % mehr Tokens erzeugt. Bei gleichem Listenpreis kann dieselbe Aufgabe nach einem Modellwechsel also mehr kosten. Tokenpreise pro Million zwischen zwei Anbietern zu vergleichen, ist, als würde man Kilopreise vergleichen, ohne zu wissen, ob beide Waagen gleich geeicht sind.

Was die Preislisten am 1. Oktober 2026 ausweisen

Bei den Abonnements zeigt die Preisseite von Claude, abgerufen am 1. Oktober 2026, ein Team-Angebot zu 25 Dollar pro Sitz und Monat bei monatlicher Abrechnung oder 20 Dollar bei Jahresbindung für den Standardsitz. Ein sogenannter Premium-Sitz kostet 125 Dollar pro Monat oder 100 Dollar bei jährlicher Bindung. Das Enterprise-Angebot kombiniert eine Basis von 20 Dollar pro Sitz und Monat, jährlich abgerechnet, mit einem Verbrauch, der zu API-Tarifen berechnet wird. Dieser letzte Punkt verdient Beachtung: Auf dieser Stufe deckelt das Abonnement die Ausgaben nicht mehr.

Microsoft hat am 1. Dezember 2025 Microsoft 365 Copilot Business eingeführt, zu 21 Dollar pro Nutzer und Monat, gedacht für Organisationen mit höchstens 300 Nutzern und mit Jahresbindung verkauft. Diese Lizenz kommt zu einem bestehenden Microsoft-365-Business-Abonnement hinzu und ersetzt es nicht. Das Angebot für Großunternehmen wird mit 30 Dollar pro Nutzer und Monat ausgewiesen.

Bei den APIs zeigt die Preisseite von OpenAI, am selben Datum abgerufen, für die neueste Generation Modelle von gpt-6-luna, mit 0,10 Dollar pro Million Eingabe-Tokens und 0,50 Dollar für die Ausgabe, bis gpt-6-astra, mit 10 und 50 Dollar, dazwischen gpt-6.1-sol mit 2 und 10 Dollar. Bei Anthropic kostet Claude Haiku 4.5 1 Dollar für die Eingabe und 5 Dollar für die Ausgabe, Claude Sonnet 5.5 2 und 10 Dollar, Claude Opus 5.5 4 und 20 Dollar. Allein innerhalb der Generation gpt-6 beträgt der Preisunterschied den Faktor hundert.

Zwei Mechanismen senken diese Preise. Die Stapelverarbeitung, die eine verzögerte Antwort akzeptiert, halbiert die Rechnung bei beiden Anbietern. Das Zwischenspeichern wiederholter Anweisungen berechnet erneutes Lesen mit einem Bruchteil des Eingabepreises: 10 % des Basistarifs bei den meisten Modellen von Anthropic. Alle diese Beträge sind in Dollar angegeben, ohne Steuern, und die Anbieter weisen darauf hin, dass sie sie ändern können.

Wie die Rechnung dem Gebrauch folgt

Nehmen wir eine bewusst einfache Annahme. Fünfzig Beschäftigte senden jeweils dreißig Anfragen pro Arbeitstag, an einundzwanzig Tagen im Monat, das ergibt 31.500 Anfragen. Jede Anfrage trägt 3.000 Eingabe-Tokens, was eine Anweisung, etwas Verlauf und ein kurzes Dokument abdeckt, und erzeugt 600 Tokens Antwort. Der Monat summiert sich auf 94,5 Millionen Eingabe-Tokens und 18,9 Millionen Ausgabe-Tokens.

Mit Claude Sonnet 5.5 kostet dieses Volumen 189 Dollar für die Eingabe und 189 Dollar für die Ausgabe, also 378 Dollar pro Monat. Mit Claude Opus 5.5 das Doppelte: 756 Dollar. Mit gpt-6-astra 1.890 Dollar. Mit gpt-6-luna 18,90 Dollar. Dem stehen fünfzig Claude-Team-Sitze bei monatlicher Abrechnung mit 1.250 Dollar gegenüber und fünfzig Copilot-Business-Lizenzen mit 1.050 Dollar, vor der Microsoft-365-Lizenz, die sie voraussetzen.

Diese Rechnung zeigt, dass bei mäßiger und regelmäßiger Nutzung die API eines mittleren Modells günstiger sein kann als die Abonnements. Sie sagt nicht alles. Die API allein liefert weder Oberfläche noch Kontenverwaltung noch Anbindung an die Dokumente des Unternehmens: Diese müssen gebaut oder zugekauft werden. Und die Annahme von 3.000 Tokens pro Anfrage ist fragil.

Die Dokumentation von Anthropic schätzt, dass eine durchschnittliche Webseite etwa 2.500 Tokens entspricht und ein Fachartikel von 500 Kilobyte als PDF etwa 125.000. Liest ein Assistent dieses Dokument bei jedem der zehn Austausche eines Gesprächs erneut, verbraucht er 1,25 Millionen Eingabe-Tokens, das sind 2,50 Dollar bei Claude Sonnet 5.5 für eine einzige Analyse. Mit Zwischenspeicherung sinkt dasselbe Gespräch auf etwa 0,54 Dollar, sofern die Austausche aufeinander folgen, bevor der Cache abläuft. Agenten, also Programme, die mehrere Modellaufrufe aneinanderreihen, um eine Aufgabe zu erledigen, vervielfachen dieses Phänomen: Jeder Schritt sendet den angesammelten Kontext erneut. Bei einer API hängt die Rechnung weniger von der Zahl der Nutzer ab als von der Textmenge, die man das Modell erneut lesen lässt.

Die Kosten, die in der Preisliste nicht erscheinen

Der erste versteckte Posten ist die Integration. Ein Modell mit Mailsystemen, gemeinsamen Ablagen, der Verwaltungssoftware oder der Kundendatenbank zu verbinden, erfordert Entwicklungszeit, Tests und laufende Wartung. Diese Kosten stehen auf keiner Preisseite und hängen vollständig vom Informationssystem des jeweiligen Unternehmens ab.

Der zweite Posten betrifft den Ort der Verarbeitung. OpenAI berechnet einen Aufschlag von 10 % auf seine Endpunkte mit regionaler Verarbeitung, die garantieren, dass die Daten in einer geografischen Zone bleiben, für Modelle, die ab dem 5. März 2026 veröffentlicht wurden. Anthropic wendet einen Faktor von 1,1 an, wenn der Kunde eine Verarbeitung ausschließlich in den Vereinigten Staaten vorschreibt. Zu wählen, wo die eigenen Daten verarbeitet werden, hat einen ausdrücklichen Preis.

Der dritte Posten ist die Erneuerung der Modelle. Die Seite zur Abkündigung von Modellen bei OpenAI zeigt, dass GPT-4.5 preview, dessen Einstellung am 14. April 2025 angekündigt wurde, am 14. Juli 2025, drei Monate später, den Betrieb eingestellt hat. Jeder Ersatz verlangt die Prüfung, ob Anweisungen, Ausgabeformate und Antwortqualität weiterhin tragen. Dieser Requalifizierungsaufwand fällt bei jeder Generation erneut an.

Der vierte Posten ist die Preisinstabilität, in beide Richtungen. Anthropic hatte für Claude Sonnet 5 einen Einführungspreis von 2 und 10 Dollar angekündigt, gültig bis zum 31. August 2026, gefolgt von einer Erhöhung auf 3 und 15 Dollar am 1. September. Die Erhöhung wurde schließlich zurückgenommen, und der Einführungspreis wurde zum Standardpreis. Der Ausgang war für die Kunden günstig, doch die Entscheidung lag nicht bei ihnen. Ein auf einer API-Preisliste aufgebautes Budget bleibt von einer Entscheidung des Anbieters abhängig.

Der fünfte Posten betrifft den Ausstieg. Die eigenen Daten, Gesprächsverläufe und Konfigurationen für einen Anbieterwechsel zu übernehmen, wurde lange berechnet. Die europäische Datenverordnung, seit dem 12. September 2025 anwendbar, erlaubt bis zum 12. Januar 2027 Wechselentgelte, die auf die tatsächlichen Kosten begrenzt sind, und verbietet sie danach, einschließlich der Entgelte für den Datenexport. Sie löst nicht die technische Abhängigkeit: Für ein bestimmtes Modell geschriebene und abgestimmte Anweisungen lassen sich nicht immer ohne Nacharbeit auf ein anderes übertragen.

Die Maschine besitzen: Kaufpreis, Abschreibung und Strom

Für einen realen Fall nehmen wir den NVIDIA DGX Spark, einen kompakten Computer zur Ausführung von Sprachmodellen mit 128 GB einheitlichem Speicher. Er dient als öffentlich nachvollziehbares Beispiel, nicht als Empfehlung. Laut einem europäischen Händler, der seine Preise verfolgt, wurde er im Oktober 2025 zu 3.999 Dollar eingeführt, dann hob NVIDIA den Preis im Februar 2026 um 700 Dollar an und verwies auf die weltweite Speicherknappheit. Im September 2026 begannen die in Europa verkauften Versionen laut den bei einem europäischen Händler (pi3g) erfassten Preisen bei rund 5.038 Euro ohne Steuern. Auch Hardware erlebt Preiserhöhungen, die der Käufer nicht beeinflussen kann, doch er erleidet sie einmal, beim Kauf.

In Frankreich wird IT-Ausstattung üblicherweise über drei Jahre linear abgeschrieben, also ein Drittel ihres Werts pro Jahr. Geräte unter 500 Euro ohne Steuern können direkt als Aufwand verbucht werden. Über sechsunddreißig Monate abgeschrieben, entsprechen 5.038 Euro rund 140 Euro pro Monat.

Der Strom wird aus der Leistung berechnet. Die Dokumentation von NVIDIA nennt für diese Maschine ein externes Netzteil mit 240 Watt. Liefe sie dauerhaft mit diesem Maximum, was die Realität überschätzt, da der Verbrauch im Leerlauf sinkt, würde sie 2.102 Kilowattstunden pro Jahr verbrauchen. Beim gewerblichen Blau-Tarif in der Option Base, seit dem 1. August 2026 auf 0,1624 Euro je Kilowattstunde ohne Mehrwertsteuer, Verbrauchsteuer inbegriffen, festgesetzt infolge des Beschlusses der Energieregulierungsbehörde Commission de régulation de l'énergie vom 15. Juli 2026, liegt die Jahresrechnung höchstens bei etwa 341 Euro, also 28 Euro pro Monat.

Die Obergrenze der monatlichen Besitzkosten dieser Maschine liegt somit bei etwa 168 Euro, vor Wartung, Updates, Datensicherung und der Arbeitszeit der Person, die sich darum kümmert. Dafür verändert die Zahl der Anfragen die Rechnung nicht. Die Grenze liegt woanders: Eine gegebene Maschine bedient nur eine begrenzte Zahl gleichzeitiger Anfragen, umso weniger, je größer das Modell ist, und die Modelle mit offenen Gewichten, die sie ausführen kann, liefern nicht bei allen Aufgaben dieselben Ergebnisse wie die größten kommerziellen Modelle. Nur ein Test mit den realen Aufgaben des Unternehmens schafft Klarheit.

Ein vorsichtiges Vorgehen für den Vergleich

Der Vergleich erfolgt über sechsunddreißig Monate, die Abschreibungsdauer der Hardware, und unter Trennung der Währungen: APIs und Abonnements werden in Dollar abgerechnet, Strom und in Europa gekaufte Hardware in Euro. Eine Umrechnung zum Tageskurs würde über drei Jahre eine trügerische Genauigkeit vortäuschen.

Der erste Schritt besteht im Messen. Ein Pilot von einigen Wochen über eine API, mit einer kleinen Gruppe, liefert die reale Zahl der Tokens pro Anfrage, die die Konsolen der Anbieter anzeigen. Diese Messung ist besser als jede Annahme, auch als die dieses Artikels.

Der zweite Schritt besteht darin, die Einsatzarten zu trennen. Gelegentliche Nutzer kosten über eine API wenig und im Abonnement viel. Intensive Nutzer oder automatische Verarbeitungen, die große Dokumentenmengen erneut lesen, kehren das Verhältnis um. Eine eigene Maschine wird interessant, wenn das Volumen hoch und regelmäßig ist oder wenn ein Teil der Daten das Unternehmen nicht verlassen darf, unabhängig vom Preis der Alternative.

Der dritte Schritt besteht darin, den Ausstieg schon beim Einstieg zu beziffern. Was würde ein Wechsel des Anbieters, des Modells oder der Preisliste in achtzehn Monaten kosten? Mit den Zahlen unseres Beispiels steht eine Maschine, deren Kosten bei etwa 168 Euro pro Monat gedeckelt sind, einer API gegenüber, die mit einem mittleren Modell 378 Dollar oder mit dem kleinsten Modell weniger als 20 Dollar kosten würde. Die Rechnung benennt keinen universellen Sieger. Sie hängt von Volumen, Art der Daten und geforderter Qualität ab, drei Parametern, die nur das Unternehmen kennt.

Was die Preisliste nicht sagt

Die drei Geschäftsmodelle schließen sich nicht aus. Viele Organisationen kombinieren ein Abonnement für Büroanwendungen, eine API für einige gelegentliche Verarbeitungen, die ein sehr großes Modell erfordern, und eine eigene Kapazität für das regelmäßige Volumen und für Daten, die die Räumlichkeiten nicht verlassen dürfen. Wichtig ist, für jeden Datenfluss zu wissen, was er kostet und wer seinen Preis festlegt.

Das ist der Maßstab, den wir bei HOMN anwenden: ein im Voraus bekannter Festpreis für die lokale Verarbeitung und der Rückgriff auf die Cloud, entschieden Datenfluss für Datenfluss, mit gemessenen Kosten. Die Zahlen dieses Artikels sind auf den 1. Oktober 2026 datiert; die als Quellen genannten Preisseiten erlauben es, sie zu aktualisieren.

Was ist ein Token und wie vielen Wörtern entspricht es?

Ein Token ist ein Textfragment, das das Modell liest oder schreibt, oft ein Wortteil. Anthropic schätzt, dass im Englischen ein Token etwa vier Zeichen entspricht, also drei Vierteln eines Wortes. Die Zählung variiert je nach Sprache, Inhalt und Tokenizer des Modells.

Ist die API günstiger als ein Abonnement pro Nutzer?

Bei mäßiger Nutzung oft ja: In unserer Annahme mit 50 Beschäftigten kostet die API eines mittleren Modells 378 Dollar pro Monat gegenüber mehr als 1.000 Dollar für Abonnements. Doch die API liefert weder Oberfläche noch Integration, und ihre Rechnung steigt bei langen Dokumenten und Agenten schnell.

Wie viel Strom verbraucht eine lokale KI-Maschine?

Das hängt von ihrer Leistung ab. Eine Maschine mit einem 240-Watt-Netzteil würde im Dauerbetrieb unter Volllast höchstens 2.102 kWh pro Jahr verbrauchen, das sind etwa 341 Euro beim gewerblichen Blau-Tarif Base, der seit dem 1. August 2026 gilt.

Über wie viele Jahre wird ein KI-Server abgeschrieben?

In Frankreich wird IT-Ausstattung üblicherweise über drei Jahre linear abgeschrieben. Geräte unter 500 Euro ohne Steuern können als Aufwand verbucht werden. Ihr Steuerberater bestätigt die für Ihre Situation passende Dauer.