GATEWAY · JUL · 2026 · 6 min

LLM-Output-Preise unterscheiden sich um 106×. Ihr KMU zahlt den Höchstpreis.

Im September 2026 kostet der Output des teuersten Modells im öffentlichen Katalog (Claude Fable 5.1, 50 US-Dollar pro 1M Tokens) das 106-Fache des günstigsten, das Produktionsaufgaben noch löst (Qwen3.8-Flash, 0,47 US-Dollar). Kein KMU braucht die Spitze dieser Liste, um ein Ticket zu sortieren oder ein Feld aus einer Rechnung zu ziehen. Wer alles bei einem Anbieter fährt, zahlt den Spitzenpreis bei 100 Prozent der Anfragen.

  • Kategorie
    Gateway
  • Datum
    JUL · 2026
  • Lesezeit
    6min
  • Quellen
    8
§01GATEWAYWeitere Artikel

Was die Zahlen zeigen

Wir haben im September 2026 die offiziellen Preistabellen von sieben Anbietern gezogen und alles auf eine Einheit gebracht: US-Dollar pro 1 Million Output-Tokens. An der Spitze steht Claude Fable 5.1 mit 50 US-Dollar. GPT-6 Astra von OpenAI liegt gleichauf. Weiter nach unten: Claude Opus 5 mit 25, GPT-5.6 Sol mit 20, Gemini 3.1 Pro mit 12, Mistral Medium 3.5 mit 7,50, GLM-5.3 mit 4,40, Gemini 3.8 Flash mit 3,75, Mistral Large 3 mit 1,50, GPT-5.6 Luna mit 1,20 und Qwen3.8-Flash mit 0,47 US-Dollar.

Das untere Ende besteht nicht aus Spielzeugmodellen. Qwen3.8-Flash erreicht 42 im Intelligence Index von Artificial Analysis, die Spitze der Tabelle erreicht 53. Elf Punkte Unterschied bei der Leistung, Faktor 106 beim Preis.

Die Kurve verläuft auch nicht glatt. Zwischen 50 und 4,40 US-Dollar liegen sechs Stufen. Zwischen 4,40 und 0,47 US-Dollar liegen vier weitere. Die entscheidende Frage lautet nicht, welches Modell das beste ist. Sie lautet, welche Stufe diese Aufgabe braucht.

Output pro 1M Tokens (USD, Sep. 2026)vs Claude Fable 5.1 (teuerstes Modell)
anthropic · fable 5.1
$50.00
anthropic · opus 5
$25.00
openai · gpt-5.6 sol
$20.00
google · gemini 3.1 pro
$12.00
mistral · medium 3.5
$7.50
zhipu · glm-5.3
$4.40
google · gemini 3.8 flash
$3.75
mistral · large 3
$1.50
openai · gpt-5.6 luna
$1.20
alibaba · qwen3.8-flash
$0.4799%

Input, Output und Cache sind drei verschiedene Rechnungen

Fast jedes Gespräch über LLM-Kosten beginnt und endet bei der Output-Tabelle. Das ist die falsche Zahl zum Anfangen. Bei echter KMU-Last — RAG, Extraktion, Triage — liegt das Volumen der Eingabe-Tokens meist beim Fünf- bis Zehnfachen der Ausgabe. Der Input-Preis wiegt schwerer, als es aussieht.

Caching verändert die Rechnung erneut. Bei Anthropic kostet das Lesen eines bereits zwischengespeicherten Präfixes 0,1× des normalen Inputs, bei Fable 5.1 sogar nur 0,025×. Das Schreiben in den Cache kostet 1,25× im 5-Minuten-Fenster oder 2× im Ein-Stunden-Fenster. Wenn System-Prompt, Schema und Beispiele stabil sind, zahlen Sie bei jedem Folgeaufruf 10 oder 2,5 Prozent des Inputs. Google und OpenAI bieten Cache-Rabatte in derselben Größenordnung.

Batch ist der dritte Rabatt und der am meisten übersehene: 50 Prozent bei OpenAI, Anthropic und Google für alles, was ein paar Stunden warten kann. Monatsberichte, Nachverarbeitung von Beständen, rückwirkende Klassifikation, CRM-Anreicherung — nichts davon braucht eine Antwort in zwei Sekunden.

Und es gibt Preise, die sich mit der Uhrzeit ändern. DeepSeek berechnet zwischen 01:00 und 04:00 sowie zwischen 06:00 und 10:00 UTC von Montag bis Freitag das Doppelte. Das ist 08:00 bis 12:00 Uhr in Berlin, also mitten im deutschen Arbeitstag. In Brasília ist es 03:00 bis 07:00 Uhr, also tiefe Nacht. Dasselbe Modell bringt je nach Zeitzone Ihres Teams unterschiedliche Ersparnisse.

Die Rabatte, die die Output-Preisliste verbirgtoffizielle Preislisten · Sep 2026
MultiplikatorWann es gilt
Lesen eines gecachten Prefix (Anthropic)0,1× · 0,025× bei Fable 5.1Systemprompt, Schema und stabile Beispiele
Cache-Schreiben1,25× (5 min) · 2× (1 h)Einmal pro Fenster; wird beim ersten Aufruf bezahlt
Batch (OpenAI, Anthropic, Google)−50%Berichte, Nachverarbeitung, rückwirkende Klassifizierung
Off-Peak-Preis (DeepSeek)2× zur UTC-SpitzenzeitFrühmorgens in Brasília; Bürozeiten in Berlin kosten das Doppelte
Input- vs. Output-Volumen im KMU5–10× mehr Input-TokenRAG, Extraktion und Triage: Der Input wiegt schwerer als der Output

Eine echte Rechnung für ein KMU mit 40 Personen

Explizite Annahmen, damit Sie die Rechnung mit Ihren eigenen Zahlen wiederholen können. 120.000 Anfragen pro Monat in drei Anwendungen: Ticket-Triage, Dokumentenextraktion und Fragen an eine interne Wissensbasis. 70 Prozent leicht (3.000 Eingabe-Tokens, 400 Ausgabe), 22 Prozent mittel (6.000 und 900), 8 Prozent schwer (12.000 und 2.500). Das ergibt 525,6 Millionen Eingabe- und 81,4 Millionen Ausgabe-Tokens im Monat.

Szenario A, alles an der Spitze. Alle 120.000 Anfragen auf Fable 5.1 (10 US-Dollar Input, 50 US-Dollar Output): 5.256 US-Dollar Input plus 4.068 US-Dollar Output. 9.324 US-Dollar pro Monat.

Szenario B, nach Aufgabe geroutet. Leichtes auf Qwen3.8-Flash: 56 US-Dollar. Mittleres auf Sonnet 5: 554 US-Dollar. Schweres bleibt auf Fable 5.1: 2.352 US-Dollar. Summe 2.963 US-Dollar — 68 Prozent weniger, und das Frontier-Modell beantwortet weiterhin alles Schwierige.

Szenario C, geroutet plus Caching. Wenn 60 Prozent der Eingabe-Tokens auf dem mittleren und schweren Pfad ein stabiles, aus dem Cache bedientes Präfix sind, sinkt die Rechnung auf 2.118 US-Dollar. Das sind 77 Prozent unter Szenario A, also 86.000 US-Dollar pro Jahr, die im Unternehmen bleiben.

Dieselbe Last von 120.000 Anfragen/Monat, drei Arten zu zahlen
US$ 9.324
Szenario A · alles auf Fable 5.1
US$ 2.963−68%
Szenario B · nach Aufgabe geroutet, Frontier nur für schwere Fälle
US$ 2.118−77%
Szenario C · geroutet + Prefix im Cache · 86.000 US-Dollar/Jahr gespart

Nichts an dieser Rechnung hängt davon ab, Verträge neu zu verhandeln, den Stack zu wechseln oder beim schwierigen Fall eine schlechtere Antwort zu akzeptieren. Es hängt davon ab, pro Aufgabe zu entscheiden statt pro Unternehmen einen Anbieter zu setzen.

Wo das günstige Modell scheitert

An drei Stellen, und zwar zuverlässig.

Erstens, mehrstufiges Reasoning mit Zustand. Günstige Modelle verlieren bei langen Tool-Call-Ketten den Faden, und der Fehler zeigt sich meist in Schritt sieben, nicht in Schritt eins. Das ist die teuerste Stelle, um ihn zu finden.

Zweitens, Geschwätzigkeit. Artificial Analysis hat gemessen, dass DeepSeek V4 Flash in der Testreihe 240 Millionen Ausgabe-Tokens erzeugt, gegenüber einem Median von 130 Millionen. Ein Modell, das pro Token dreimal günstiger ist, aber 1,8-mal mehr schreibt, ist in der Praxis nur 1,7-mal günstiger. Listenpreis ist nicht Kosten pro Aufgabe.

Drittens, Sprache und Fachdomäne. Juristisches Deutsch und Portugiesisch mit Steuerjargon verhalten sich nicht wie generisches Englisch. Und die Verschlechterung ist lautlos: Die Antwort bleibt flüssig, während sie falsch wird. Nur ein bewerteter Testsatz macht das sichtbar.

Dazu kommt ein Kalenderrisiko. Der Aktionspreis von Gemini 3.8 Flash (0,75 US-Dollar Input, 3,75 US-Dollar Output) gilt bis zum 31. Dezember 2026 und verdoppelt sich danach. Ein Jahresbudget auf dieser Zahl bricht im Januar.

Die Bedingungen, unter denen die Ersparnis real wird

Routing ohne vier Dinge ist eine Wette, keine Optimierung.

Automatisches Fallback. Fällt der günstige Anbieter aus, geht die Anfrage ohne menschliches Zutun an den nächsten in der Reihe. Ohne das kostet der erste Ausfall mehr als Monate an Ersparnis.

Ein Bewertungs-Gate. 50 bis 500 repräsentative Fälle, die vor jeder Routing-Änderung laufen. Fällt die Qualität unter die Schwelle, geht die Änderung nicht in Produktion.

Observability pro Aufgabe. Kosten, Latenz und Trefferquote pro Route, nicht eine Monatssumme. Ohne das wissen Sie nicht, welche Route gespart und welche nur die Antwort verschlechtert hat.

Audit. Welches Modell hat welche Anfrage beantwortet, mit welchem Prompt, an welchem Datum, unter welcher Datenrichtlinie. Das verlangt Ihre Compliance, und das erwartet der EU AI Act von jedem, der ein KI-System betreibt — und genau das koppelt Ihre Datenrichtlinie an die des Anbieters, wenn Sie nur einen einsetzen.

Was in den nächsten zwei Wochen zu tun ist

Erstens: Exportieren Sie die Rechnung des letzten Monats und schlüsseln Sie die Ausgaben nach Aufgabentyp auf, nicht nach Modell. Die meisten Teams stellen fest, dass rund 70 Prozent des Volumens leichte Arbeit zu Frontier-Preisen ist.

Zweitens: Nehmen Sie die volumenstärkste und einfachste Aufgabe. Bauen Sie 100 Fälle mit erwarteter Antwort. Lassen Sie sie auf dem aktuellen Modell und auf zwei günstigen Kandidaten laufen. Vergleichen Sie gemessene Treffer, nicht Eindrücke.

Drittens: Klären Sie die Datenrichtlinie vor dem Preis. Inferenz ausschließlich in den USA kostet bei Anthropic 1,1×. Ein europäischer Anbieter wie Mistral liefert Output für 1,50 US-Dollar mit Large 3. Datenresidenz hat einen Preis — und er ist kleiner als der Abstand zwischen zwei Stufen der Tabelle.

Viertens: Setzen Sie das Gateway ein, bevor Sie irgendein Modell tauschen. Ohne eine Schicht, die routet, Fallbacks fährt und protokolliert, wird jeder Wechsel zum Migrationsprojekt. Mit ihr wird er zu einer Zeile Konfiguration.

Zwei-Wochen-Plan
  1. 01
    Rechnung nach Aufgabentyp aufteilen

    Letzten Monat exportieren und nach Triage, Extraktion, Fragen summieren. Meist sind ~70% des Volumens leichte Arbeit zum Frontier-Preis.

  2. 02
    100 Fälle mit Referenzantwort messen

    Die volumenstärkste, einfachste Aufgabe nehmen. Auf dem aktuellen Modell und zwei günstigen Kandidaten laufen lassen. Gemessene Trefferquote vergleichen.

  3. 03
    Datenpolitik vor dem Preis entscheiden

    US-beschränkte Inferenz kostet 1,1× bei Anthropic; Mistral liefert Large-3-Output für 1,50 US-Dollar. Datenresidenz hat einen Preis, kleiner als eine Stufe der Tabelle.

  4. 04
    Gateway vor jedem Modellwechsel

    Ohne eine Schicht, die routet, Fallbacks macht und protokolliert, wird jeder Wechsel zum Migrationsprojekt. Mit ihr ist es eine Konfigurationszeile.

Was Sie morgen tun solltenSchlüsseln Sie die Monatsrechnung nach Aufgabentyp auf, nicht nach Modell: Rund 70 Prozent des Volumens sind meist leichte Arbeit zu Frontier-Preisen. Setzen Sie dann das Gateway davor — damit wird ein Modellwechsel zur Konfiguration statt zur Migration.

Quellen dieser Analyse

Preis pro Output-Token106×

zwischen dem teuersten Modell im Katalog (50 US-Dollar/1M) und dem günstigsten, das Produktionsaufgaben noch löst (0,47 US-Dollar/1M). Das sind 11 Punkte Leistungsunterschied im Intelligence Index.

Kategorie
Gateway
Datum
JUL · 2026
Lesezeit
6 min
Quellen
  • OpenAI · API pricing
  • Anthropic · Claude pricing
  • Google · Gemini API pricing
  • DeepSeek · Models & pricing
§02Weitere ArtikelAlle Insights

Weiterlesen

§03Wie wir schreibencontato@okamiops.com

Keine lose Meinung. Jede Zahl hat eine Quelle, jeder Artikel endet mit was zu tun ist.

Wir schreiben, was wir beim Lösen des Problems für einen Kunden lernen. Wenn Ihr Fall einem davon ähnelt, beginnt das Gespräch hier.