Am 31. Dezember 2026 endet der Einführungspreis für Gemini 3.7 Flash und Gemini 3.8 Flash. Ab dem 1. Januar 2027 verlangt Google für beide Modelle 1,50 statt 0,75 US-Dollar je Million Eingabe-Token und 7,50 statt 3,75 US-Dollar je Million Ausgabe-Token (Stand 21. September 2026, laut Googles Preisseite). Ein Token ist die Abrechnungseinheit, ein Stück Text, oft kürzer als ein Wort. Mein Testdokument mit 1.459 Wörtern ergab samt Arbeitsanweisung 2.251 Token.
Was eine einzelne Aufgabe kostet, lässt sich aus dem Tokenpreis allein nicht ablesen. Ich setze in eigenen Anwendungen Gemini 3.7 Flash ein, der Jahreswechsel betrifft mich also direkt. Deshalb habe ich am 21. September vier Aufgaben durchgemessen, die in kleinen Betrieben jeden Tag anfallen, mit beiden Modellen und zu beiden Preisständen.
Preise und Rabatte im Überblick
Gemini 3.7 Flash ist seit dem 13. August 2026 allgemein verfügbar, Gemini 3.8 Flash seit dem 2. September. Beide kosten pro Token exakt dasselbe und bei beiden endet der Einführungspreis am selben Tag. Wichtig für jede Rechnung ist ein Zusatz auf der Preisseite. Der Ausgabepreis gilt einschließlich der Denk-Token. Das ist der Text, den das Modell vor der eigentlichen Antwort intern erzeugt, um die Aufgabe durchzugehen. Man sieht ihn nicht, bezahlt ihn aber wie Antworttext.
Zwei Rabatte gibt es. Über die Batch-Schnittstelle, bei der Google Anfragen gesammelt innerhalb von bis zu 24 Stunden abarbeitet, kostet alles die Hälfte. Denselben Preis hat die Flex-Stufe, die in Minuten antwortet, aber ohne feste Zusage. Ab 2027 kostet ein Batch-Aufruf damit so viel wie heute ein normaler.
Der zweite Rabatt ist der Zwischenspeicher (Caching). Wiederholte Eingaben rechnet Google dann mit einem Zehntel des Eingabepreises ab. Laut Caching-Dokumentation greift das automatische Caching bei 3.7 und 3.8 aber erst ab 4.096 Token Eingabe. Für ausdrücklich angelegte Zwischenspeicher kommt eine Gebühr pro Stunde dazu. Keine meiner vier Aufgaben kam an die Schwelle heran. Für kurze Büroaufgaben bringt der Rabatt also nichts, er lohnt sich erst, wenn jeder Aufruf mit denselben langen Anweisungen oder Unterlagen beginnt.
Für Audio steht bei 3.7 und 3.8 ein einziger Eingabepreis ohne gesonderten Audiotarif. Bei Gemini 3.1 Flash-Lite kostet Audio dagegen das Doppelte des Textpreises, bei 2.5 Flash-Lite das Dreifache. Die beiden Flash-Lite-Modelle, die ich als Vergleich mitgemessen habe, haben keinen auslaufenden Einführungspreis. Gemini 3.5 Flash-Lite kostet 0,30 und 2,50 US-Dollar je Million Token, 2.5 Flash-Lite 0,10 und 0,40 US-Dollar.
So habe ich gemessen
Die Texte habe ich für eine erfundene Tischlerei selbst geschrieben. Die vier Aufgaben:
- eine Kundenanfrage mit rund 150 Wörtern beantworten, ohne Preise zu nennen und mit Vorschlag für einen Aufmaßtermin
- aus einem Rechnungstext Nummer, Datum, Positionen, Beträge und Fälligkeit als JSON auslesen, also in einem Format, das eine Software direkt weiterverarbeitet, abgesichert über ein Antwortschema mit fest vorgegebenen Feldern
- eine Kundenmail einer von fünf Kategorien zuordnen
- ein internes Konzeptpapier mit knapp 1.500 Wörtern in fünf Sätzen zusammenfassen
Jede Aufgabe lief fünfmal pro Modell über die normale Schnittstelle, ohne Zusatzparameter, also mit dem Denken, das das Modell von sich aus einsetzt. Für 3.7 und 3.8 kamen je fünf Läufe mit der niedrigsten und der höchsten Denkstufe dazu, zusammen 160 Aufrufe. Aus jeder Antwort habe ich die Tokenzahlen für Eingabe, Antwort und Denken übernommen und daraus die Kosten gerechnet. Die ganze Messung hat rund 0,54 US-Dollar gekostet.
Die Qualität habe ich mitgeprüft. Alle 40 JSON-Ausgaben waren gültig und inhaltlich richtig, bis hin zum korrekt berechneten Fälligkeitsdatum. Alle 40 Einordnungen lauteten Reklamation, obwohl die Mail auch die offene Rechnung erwähnt. Keine der Antwortmails nannte einen Preis.
Foto: panumas nikhomkhai / Pexels
Was eine Aufgabe kostet
Die Kosten je 1.000 Aufgaben in US-Dollar, jeweils mit Standardeinstellung:
| Aufgabe | 3.7 Flash bis 31.12.2026 | 3.7 Flash ab 1.1.2027 | 3.8 Flash bis 31.12.2026 | 3.8 Flash ab 1.1.2027 | 3.5 Flash-Lite |
|---|---|---|---|---|---|
| Antwort auf Kundenanfrage | 4,00 | 7,99 | 3,85 | 7,70 | 0,59 |
| Rechnungsdaten als JSON | 3,01 | 6,01 | 4,26 | 8,51 | 1,35 |
| Mail einer Kategorie zuordnen | 1,27 | 2,54 | 1,39 | 2,79 | 0,07 |
| Dokument zusammenfassen | 7,38 | 14,75 | 8,28 | 16,56 | 1,22 |
| Alle vier zusammen | 15,65 | 31,30 | 17,78 | 35,55 | 3,23 |
Pro Aufgabe sind das zum Einführungspreis zwischen 0,13 US-Cent für das Einordnen einer Mail mit 3.7 Flash und 0,83 US-Cent für die Zusammenfassung mit 3.8 Flash. Ab Januar verdoppelt sich jeder Wert, weil Eingabe- und Ausgabepreis im gleichen Verhältnis steigen. Ein Betrieb, der im Monat 2.000 eingehende Mails einordnen und beantworten lässt, zahlt dafür mit 3.7 Flash heute rund 10,50 US-Dollar, ab Januar rund 21 US-Dollar.
Das bleibt ein überschaubarer Betrag. Wer allerdings heute eine Jahreskalkulation aufstellt oder einen Festpreis für eine KI-Anwendung anbietet und dabei den Einführungspreis ansetzt, rechnet mit dem falschen Wert.
Foto: Matheus Bertelli / Pexels
Den größten Teil bezahlst du fürs Denken
Auffällig ist, wofür das Geld ausgegeben wird. Bei Standardeinstellung entfallen je nach Aufgabe 46 bis 89 Prozent der Kosten auf Denk-Token. Am deutlichsten ist es beim Einordnen. Die Antwort besteht aus einem einzigen Wort, drei Token. Davor denkt 3.7 Flash im Schnitt 297 Token lang, 3.8 Flash 329. Bei der Zusammenfassung stehen rund 1.300 bis 1.500 Denk-Token einer Antwort von rund 200 Token gegenüber.
Das Denken kostet auch Zeit. Die Zusammenfassung dauerte mit Standardeinstellung im Median gut sechs Sekunden. In den Läufen, in denen das Modell nicht dachte, waren es unter zwei.
3.8 Flash denkt mehr, der Aufpreis hängt an der Aufgabe
Für 3.8 Flash kursiert in Vergleichsartikeln die Zahl von 45 Prozent Mehrkosten. Sie geht auf Artificial Analysis zurück. Dort kostete eine Aufgabe des hauseigenen Intelligence Index bei hoher Denkstufe 0,58 statt 0,40 US-Dollar, bei rund 48.000 Ausgabe-Token pro Aufgabe. Google schreibt auf der Modellseite selbst, dass 3.8 bei längeren und komplexen Aufgaben bewusst mehr Token verbraucht. Für Alltagsaufgaben empfiehlt Google eine niedrigere Denkstufe.
Meine Aufgaben sind um Größenordnungen kleiner. Bei Standardeinstellung kostete 3.8 über alle vier zusammen knapp 14 Prozent mehr als 3.7. Die Spanne ist groß. Die Antwortmail war mit 3.8 sogar 4 Prozent günstiger, das Einordnen 9 und die Zusammenfassung 12 Prozent teurer. Nur bei der Rechnung kam 3.8 mit 42 Prozent in die Nähe der kursierenden Zahl, weil es dort fast doppelt so lange nachdachte, 675 statt 371 Denk-Token im Schnitt. Auf der hohen Denkstufe lagen beide Modelle näher beieinander, 3.8 war dort insgesamt 9 Prozent teurer.
Einen Qualitätsunterschied zwischen beiden Modellen konnte ich bei diesen Aufgaben nicht feststellen. Beide bestanden in jedem Lauf dieselben Prüfungen und beide machten denselben Fehler bei den Terminvorschlägen, dazu weiter unten mehr.
Die Denkstufe low ist der größte Hebel
Bei den aktuellen Modellen steuert man das Denken über eine Stufe statt über ein Tokenbudget. 3.7 und 3.8 kennen low, medium und high, Standard ist medium, so steht es in der Dokumentation zum Denken. Gesetzt wird die Stufe in der Anfrage:
"generationConfig": {
"thinkingConfig": { "thinkingLevel": "low" }
}
Die Wirkung in Denk-Token im Schnitt, darunter die Kosten für je 1.000 Durchläufe aller vier Aufgaben zum Preis ab 2027:
| 3.7 Standard | 3.7 low | 3.8 Standard | 3.8 low | |
|---|---|---|---|---|
| Antwort auf Kundenanfrage | 829 | 808 | 775 | 157 |
| Rechnungsdaten als JSON | 371 | 218 | 675 | 0 |
| Mail einer Kategorie zuordnen | 297 | 116 | 329 | 143 |
| Dokument zusammenfassen | 1.321 | 0 | 1.541 | 0 |
| Kosten in US-Dollar für 1.000 Durchläufe aller vier Aufgaben ab 2027 | 31,30 | 19,36 | 35,55 | 12,97 |
Bei 3.8 Flash hat low durchgreifend gewirkt. Bei Rechnung und Zusammenfassung dachte das Modell gar nicht mehr, bei der Antwortmail in vier von fünf Läufen nicht. Über alle vier Aufgaben sanken die Kosten um 64 Prozent. 3.7 Flash folgt der Stufe weniger konsequent. Bei der Zusammenfassung fiel das Denken ganz weg, bei Rechnung und Einordnen sank es um 40 bis 60 Prozent, bei der Antwortmail blieb es praktisch unverändert. Insgesamt sparte 3.7 mit low 38 Prozent.
Damit dreht sich die Reihenfolge um. Mit low ist 3.8 Flash ein Drittel günstiger als 3.7 Flash mit low. Ab Januar 2027 kostet es dann sogar weniger als 3.7 Flash heute mit Standardeinstellung, 12,97 gegen 15,65 US-Dollar für je 1.000 Durchläufe aller vier Aufgaben. An der Qualität habe ich nichts verloren gesehen, JSON, Kategorie und Satzzahl stimmten in allen Läufen.
Zwei Stolperstellen gibt es. Die Stufe minimal, die andere Modelle der Reihe kennen, lehnen 3.7 und 3.8 mit einem Fehler ab. Und den älteren Parameter thinkingBudget mit dem Wert 0 nehmen beide ohne Fehlermeldung an, denken aber trotzdem weiter, in meinem Test 103 und 112 Token lang. Wer sich darauf verlässt, bezahlt Denken, das er für abgeschaltet hält.
Flash-Lite kostet einen Bruchteil
Gemini 3.5 Flash-Lite arbeitet von sich aus mit minimalem Denken und hat in keinem Lauf ein einziges Denk-Token abgerechnet. Für alle vier Aufgaben zusammen kamen 3,23 US-Dollar je 1.000 Durchläufe heraus, rund ein Fünftel von 3.7 Flash heute und ein Zehntel ab Januar. Das ältere 2.5 Flash-Lite lag bei 0,53 US-Dollar. Beide antworteten im Median in unter zwei Sekunden. Gemini 3.1 Flash-Lite wäre pro Token noch etwas günstiger als 3.5, wird laut Google aber am 7. Mai 2027 abgeschaltet.
Beim Extrahieren und Einordnen war jedes Ergebnis richtig. Bei der Zusammenfassung zeigte sich der Unterschied. 2.5 Flash-Lite schrieb in drei von fünf Läufen, die Umstellung im Dokument dauere drei Monate, dort sind es sechs. 3.5 Flash-Lite blieb inhaltlich korrekt, leistete sich aber einmal einen Grammatikfehler. Für Aufgaben, bei denen ein Schema die Ausgabe absichert, reicht ein kleines Modell. Für Texte, die ein Mensch liest und denen er vertrauen soll, würde ich beim Flash-Modell bleiben.
Ein Nebenbefund bei den Antwortmails
In 20 von 30 Antwortmails von 3.7 und 3.8 stand ein konkreter Terminvorschlag mit Wochentag, etwa Dienstag, der 22. Oktober. In allen 20 Fällen passte der Wochentag nicht zum Oktober 2026, siebenmal wäre der Termin auf einen Samstag gefallen. Das Modell kennt das heutige Datum nicht, solange es nicht in der Anfrage steht.
Die Gegenprobe war eindeutig. Mit dem Satz „Heute ist Montag, der 21. September 2026.“ am Anfang der Systemanweisung stimmten in zehn weiteren Läufen alle zwölf genannten Wochentage. Der Satz kostet 16 Token pro Aufruf.
Foto: Panos and Marenia Stavrinos / Pexels
Was du jetzt tun kannst
Jede Kalkulation, die über den Jahreswechsel reicht, sollte mit dem Preis ab 2027 rechnen, also mit dem Doppelten dessen, was die Abrechnung heute zeigt. Die Denkstufe gehört je Aufgabe gesetzt und nicht dem Modell überlassen. Für Einordnen, Extrahieren und Zusammenfassen hat low in meinen Läufen gereicht. Genau dort ist der Hebel am größten. Was nicht sofort fertig sein muss, etwa die nächtliche Auswertung eingegangener Rechnungen, läuft über Batch zum halben Preis. Wer große Mengen einordnet oder ausliest, sollte Flash-Lite zumindest testen.
Für mich ist die wichtigste Erkenntnis, dass die Denkstufe mehr bewegt als die Wahl zwischen 3.7 und 3.8. Zwischen den Modellen lagen bei Standardeinstellung 14 Prozent, zwischen Standard und low bis zu 64 Prozent. Wer bis Dezember ohnehin prüft, sollte die Kombination aus 3.8 Flash und der Stufe low gegen die eigenen Aufgaben testen.
Ein Punkt gilt unabhängig vom Modell. Stellst du eine Anwendung mit Gemini dahinter Kundinnen und Kunden im Europäischen Wirtschaftsraum zur Verfügung, verlangt Google laut seinen Zusatzbedingungen zur Gemini API ohnehin einen bezahlten Zugang. Die kostenlose Stufe ist für eigene Tests gedacht. Wie lange Anbieter Anfragen protokollieren, habe ich in einem eigenen Artikel zu Zero Data Retention zusammengetragen. Wer zum Ausprobieren gar nichts bezahlen möchte, findet mit Hetzners kostenloser Inferenz-API eine Spielwiese, allerdings ohne Zusagen für den Produktivbetrieb.
Wenn du wissen willst, was die KI-Aufgaben in deinem Betrieb ab Januar kosten und welche Denkstufe dafür reicht, melde dich gerne bei mir.
Häufige Fragen
Was kostet Gemini 3.7 Flash ab 2027?+
Ab dem 1. Januar 2027 kostet Gemini 3.7 Flash 1,50 US-Dollar je Million Eingabe-Token und 7,50 US-Dollar je Million Ausgabe-Token, Denk-Token eingeschlossen. Bis zum 31. Dezember 2026 gilt ein Einführungspreis von 0,75 und 3,75 US-Dollar. Für Gemini 3.8 Flash gelten dieselben Preise und dasselbe Datum (Stand 21. September 2026).
Ist Gemini 3.8 Flash teurer als 3.7 Flash?+
Pro Token nicht, pro Aufgabe meistens schon, weil 3.8 mehr denkt. In meiner Messung mit vier Büroaufgaben kostete 3.8 bei Standardeinstellung zusammen knapp 14 Prozent mehr, bei der Rechnungsextraktion 42 Prozent mehr und bei der Antwortmail 4 Prozent weniger. Mit der Denkstufe low war 3.8 dagegen ein Drittel günstiger als 3.7 mit low.
Wie schalte ich das Denken bei Gemini 3.7 Flash und 3.8 Flash herunter?+
Über den Parameter thinkingLevel in der thinkingConfig der Anfrage. Beide Modelle kennen die Stufen low, medium und high, Standard ist medium. Die Stufe minimal lehnen beide mit einem Fehler ab. Den älteren Parameter thinkingBudget mit dem Wert 0 nehmen sie ohne Fehlermeldung an, denken aber trotzdem weiter.
Reicht Gemini Flash-Lite für Büroaufgaben?+
Für Einordnen und Extrahieren mit festem Antwortschema war in meiner Messung jedes Ergebnis richtig, bei einem Bruchteil der Kosten. Gemini 3.5 Flash-Lite kostete für alle vier Aufgaben zusammen 3,23 US-Dollar je 1.000 Durchläufe, 3.7 Flash heute 15,65 US-Dollar. Bei Zusammenfassungen machte das ältere 2.5 Flash-Lite in drei von fünf Läufen einen inhaltlichen Fehler, dort ist das größere Modell die sicherere Wahl.
Du willst mehr erfahren?
In einem kostenlosen Erstgespräch besprechen wir, wie du diese Themen für dein Unternehmen nutzen kannst. Kein Verkaufsgespräch, sondern eine ehrliche Einschätzung.
Kostenloses Erstgespräch vereinbaren



