Geschätzte Lesezeit: 9 Minuten
Kurze Zusammenfassung
- Tokens sind zentrale Elemente, um den Verbrauch von LLM zu messen.
- Jeder Anbieter hat unterschiedliche Tokenisierungsverfahren, was zu variierenden Kosten und Tokenverbrauch führt.
- Bei LLM fallen Tokens nicht nur beim Generieren von Text, sondern auch bei Prompts und interner Verarbeitung an.
- Die Token-Kosten können für Unternehmen schnell erheblich werden, insbesondere bei großen Entwicklerteams und teuren Modellen.
- Eine transparente Abrechnung ist oft nicht gegeben, weshalb alternative Abrechnungsmethoden, wie die von one:ic, attraktiver werden.
Was sind Tokens?
Jeder spricht über KI/LLMs, aber viele wissen nicht, wie die KIs im Einzelnen generieren, was Tokens sind und warum diese relevant für den praktischen Einsatz von LLMs und gleichermaßen ein großer Kostenfaktor sein können.
Um das zu verstehen, lohnt sich ein Blick darauf, wie KI-Modelle Text überhaupt verarbeiten: Sie berechnen nicht direkt Wörter, sondern die wahrscheinlichste Abfolge von Tokens – kleinen Text-Bausteinen, in die jedes Wort vorab zerlegt wird. Ein Token entspricht dabei nicht zwingend einer Silbe: Kurze, häufige Wörter wie „die“ oder „und“ sind meist ein einzelner Token, während lange, seltene Wörter wie „Dokumentenverarbeitung“ in mehrere Tokens aufgeteilt werden.
Wie unterschiedlich das je nach Anbieter ausfällt, zeigt ein einfacher Test mit dem Satz „Dank LLM kann die Dokumentenverarbeitung deutlich stärker automatisiert werden.“ (79 Zeichen): GPT-5 zerlegt ihn in 15 Tokens, Mistral in 25 Tokens, und Claude Opus 4.8 und Fable 5 sogar in 35 Tokens, mehr als doppelt so viele wie GPT-5 für exakt denselben Satz.
Hier eine Grafik für den Vergleich:

Welches Tokenisierungsverfahren ein Anbieter nutzt, hat also einen direkten Einfluss darauf, wie viele Tokens und damit wie viele Kosten ein und derselbe Text am Ende verursacht. Dabei verbraucht nicht nur der reine generierte Text, Code oder Bild Tokens, sondern auch der Prompt und das Nachdenken.
Wo genau fallen Tokens an?
Tokens sind also ein wichtiger Faktor und nicht immer so durchsichtig, wie man denkt. Immer mehr Anbieter rechnen ihre Modelle direkt nach Tokens ab, und dabei fällt oft auf, dass Limits schneller aufgebraucht sind, als man erwarten würde, obwohl gar nicht so viel generiert wurde.
Der Grund dafür sind die Prompts und das Nachdenken der KI. Wenn man einen Prompt in das Modell seiner Wahl eingibt, wird neben dem eigenen Prompt auch ein Masterprompt, RAG-Daten und weitere gespeicherte Informationen, Kontext aus dem Chat sowie Anweisungen von Skills geladen. All das verbraucht ebenfalls Tokens, auch wenn diese meist weniger kostspielig sind als generative Tokens.
Aber auch danach werden noch unzählige davon verbraucht, bevor man ein Ergebnis bekommt. Sobald man den Prompt abschickt, denken die meisten Modelle mittlerweile nach: Sie zerlegen ein Thema, diskutieren potenziell mit Agenten, überdenken ihre Zwischenergebnisse und prüfen mehrmals mögliche Aussagen. All das verbraucht ebenso Tokens. Wenn man also sehr viel Kontext mitschickt oder das Modell anweist, besonders genau zu prüfen, ist man schnell am Limit angelangt oder die Rechnung am Ende des Monats wird sehr teuer.
Hier eine Grafik, welche das visualisiert:

Genau das erleben seit Kurzem Nutzer von Claude Fable 5: Das Modell wurde erst kürzlich von einer Abo-Flatrate auf ein Guthabensystem mit direkter Token-Abrechnung umgestellt. Aus einer Rechengröße wird so plötzlich ein sichtbarer Kostenfaktor für Endnutzer. Interessant dabei: Fable 5 nutzt sogar einen komplett neuen Tokenizer als die Vorgängermodelle. Ein und derselbe Prompt kann dadurch bis zu 35 % mehr Tokens verbrauchen als bei einem älteren Modell – ein weiterer Beleg dafür, wie stark sich die Tokenanzahl je nach Modell und Version unterscheiden kann, wie wir es im vorherigen Abschnitt schon bei GPT-5, Mistral und Claude Opus 5 gesehen haben.
Wie hoch sind die Kosten?
Die direkten Kosten hängen sehr davon ab, welches Modell man verwendet, wie viel Kontext man gibt, wie sehr man dem LLM Vorgaben macht und was genau man generiert und wie das Verhältnis zwischen Input- und Output-Tokens ist.
Hier eine kurze Übersicht über die Kosten von Modellen (Stand 19.08.2026):
- Günstigste Modelle:
- OpenAI GPT-5.6 Luna: 0,20 $ Input / 1,20 $ Output pro Million Tokens
- Google Gemini 3.5 Flash-Lite: 0,30 $ Input / 2,50 $ Output
- Anthropic Claude Haiku 4.5: 1,00 $ Input / 5,00 $ Output
- Mittlere Preisklasse:
- OpenAI GPT-5.6 Terra: 2,00 $ Input / 12,00 $ Output
- Anthropic Claude Sonnet 5: 2,00 $ Input / 10,00 $ Output
- Premium-Modelle:
- OpenAI GPT-5.6 Sol: 5,00 $ Input / 30,00 $ Output
- Anthropic Claude Opus 5: 5,00 $ Input / 25,00 $ Output
- Anthropic Claude Fable 5: 10,00 $ Input / 50,00 $ Output
Input-Tokens stellen dabei den Prompt, Kontext, Skills und weiteres dar, Output sind die generierten Texte, Bilder, Videos und Code. Auffällig: Output-Tokens kosten bei fast allen Anbietern deutlich mehr als Input-Tokens – oft das Fünf- bis Sechsfache. Das liegt daran, dass die Generierung von Text rechenintensiver ist als das reine Verarbeiten von Eingaben.
Diese Preise ändern sich zudem regelmäßig. Prüfen Sie vor einer Kostenkalkulation immer die aktuelle Preisseite des jeweiligen Anbieters.
Realer Kostenfaktor für Unternehmen
Was auf Modellebene nach Centbeträgen aussieht, summiert sich bei Unternehmen zu ganz anderen Größenordnungen. Die durchschnittlichen KI-Budgets in Unternehmen sind von rund 1,2 Millionen US-Dollar im Jahr 2024 auf etwa 7 Millionen US-Dollar im Jahr 2026 gestiegen. Wie schwer sich das kalkulieren lässt, zeigt eine Analyse von J.P. Morgan Private Bank: Ein einzelner Softwareentwickler mit Enterprise-Zugang zu Claude kann monatliche Token-Kosten von bis zu 730 US-Dollar verursachen – hochgerechnet auf ein Fortune-500-Unternehmen mit 5.000 Entwicklern wären das über 3,5 Millionen US-Dollar pro Monat allein für KI-gestütztes Coding.
Selbst Microsoft, das über Milliarden-Investitionen direkten Zugriff auf die günstigsten Konditionen der großen KI-Anbieter hat, kämpft intern mit genau diesem Problem: Im August 2026 stellte der Konzern GPT-5.6 Sol – eines der teuersten verfügbaren Modelle – als neuen Standard in GitHub Copilot ein, mahnte die eigenen Entwickler aber im selben Atemzug per internem Memo zur Zurückhaltung beim Tokenverbrauch. Meta ging noch einen Schritt weiter: Nachdem ein internes Leaderboard zeigte, dass Mitarbeitende 73,7 Billionen (nach Listenpreis hochgerechnet rund 221 Millionen US-Dollar im Monat, wobei Meta die tatsächlichen Kosten nie bestätigt hat) größtenteils sinnlose Tokens produziert hatten, führte der Konzern eigene Token-Budgets und ein zentrales Kontroll-Gateway ein.
Dass Kosten so schnell aus dem Ruder laufen können, liegt auch an der mangelnden Transparenz der Preismodelle selbst: 73 Prozent aller Unternehmen überschreiten inzwischen ihre eigenen KI-Budget-Prognosen. Das Problem ist mittlerweile so verbreitet, dass die Linux Foundation im Juli 2026 eine eigene „Tokenomics Foundation“ gegründet hat, mit dem erklärten Ziel, endlich einheitliche Branchenstandards für Kosten und Preistransparenz zu schaffen.
Wir setzen nicht auf Tokens
Da die Abrechnung von Tokens undurchsichtig ist und schnell zu einem nicht direkt sichtbaren Kostenfaktor wird, haben wir bei one:ic uns dazu entschieden, nicht per Token abzurechnen, sondern per Dokument. Das können wir, da wir unser LLM vollständig selbst hosten und damit nicht abhängig von großen Cloud-Modellen sind.
Für Sie spielt es dabei keine Rolle, wie viel Kontext, RAG-Daten oder internes „Nachdenken“ unser System für ein Dokument benötigt, all das übernehmen wir. Sie zahlen einen festen Preis pro Dokument unabhängig davon, wie aufwendig die Verarbeitung durch SPICE im Hintergrund tatsächlich ist.
Das hat einen konkreten Vorteil: Eine Rechnung kostet bei uns immer gleich viel, unabhängig davon, was gerade auf dem KI-Markt passiert. Wenn Cloud-Modelle ihre Kosten erhöhen, ändert sich bei uns nichts.
FAQ
Ein Token ist die kleinste Texteinheit, mit der KI-Modelle Text verarbeiten und generieren. Ein Token entspricht dabei nicht einer Silbe – kurze, häufige Wörter sind meist ein einzelner Token, lange oder seltene Wörter werden in mehrere Tokens zerlegt.
Jeder Anbieter nutzt ein eigenes Tokenisierungsverfahren. Für denselben Satz kann GPT-5 beispielsweise 15 Tokens benötigen, während Claude Opus 5 31 Tokens verbraucht – mehr als doppelt so viele für exakt denselben Inhalt.
Nein. Neben dem eigentlichen Ergebnis verbrauchen auch Prompts, Masterprompt, RAG-Daten, Chat-Kontext, Skill-Anweisungen sowie das interne „Nachdenken“ des Modells Tokens – oft, bevor überhaupt ein sichtbares Ergebnis entsteht.
Die Preise reichen von 0,20 $ Input / 1,20 $ Output pro Million Tokens bei günstigen Modellen wie GPT-5.6 Luna bis zu 5,00 $ Input / 30,00 $ bzw. 50,00 $ Output bei Premium-Modellen wie GPT-5.6 Sol oder Claude Fable 5.
one:ic rechnet nicht nach Tokens, sondern nach Dokument ab. Da wir unser LLM vollständig selbst hosten, bleibt der Preis unabhängig davon, wie viel Kontext oder internes Nachdenken ein Dokument tatsächlich benötigt – und unabhängig davon, was auf dem KI-Markt gerade passiert.

