Zum Inhalt springen
StartseiteStart
EN
WhatsAppMailPhone
← Alle Artikel
Gemini 3.7 Flash und 3.8 Flash kosten pro Büroaufgabe 0,13 bis 0,83 Cent
KI

Gemini 3.7 Flash und 3.8 Flash kosten pro Büroaufgabe 0,13 bis 0,83 Cent

Foto: SHVETS production / Pexels

Ich habe gemessen, was vier typische Büroaufgaben mit Gemini 3.7 Flash und 3.8 Flash kosten. Zum Einführungspreis sind es 0,13 bis 0,83 US-Cent pro Aufgabe, ab 1. Januar 2027 das Doppelte. Den größten Teil der Kosten macht das Denken des Modells aus.

Eric MengeAutorEric MengeInhaber & Webentwickler bei EMIT Solution
Veröffentlicht
Lesezeitca. 8 Min.

Kurz gesagt

  • Eine typische Büroaufgabe kostet mit Gemini 3.7 Flash oder 3.8 Flash zum Einführungspreis zwischen 0,13 US-Cent (eine Mail einer Kategorie zuordnen) und 0,83 US-Cent (ein Dokument mit knapp 1.500 Wörtern zusammenfassen), gemessen am 21. September 2026 mit Standardeinstellung.
  • Am 1. Januar 2027 verdoppeln sich bei beiden Modellen Eingabe- und Ausgabepreis auf 1,50 und 7,50 US-Dollar je Million Token. Damit verdoppeln sich auch die Kosten jeder einzelnen Aufgabe.
  • Bei Standardeinstellung entfallen 46 bis 89 Prozent der Kosten auf Denk-Token, die Google zum Ausgabepreis abrechnet. Beim Einordnen einer Mail besteht die Antwort aus drei Token, das Denken davor aus rund 300.
  • Mit der Denkstufe low sanken die Kosten der vier Aufgaben bei Gemini 3.8 Flash um 64 Prozent, ohne erkennbaren Qualitätsverlust. Ab 2027 ist 3.8 Flash mit low damit günstiger als 3.7 Flash heute mit Standardeinstellung.

Am 31. Dezember 2026 endet der Einführungspreis für Gemini 3.7 Flash und Gemini 3.8 Flash. Ab dem 1. Januar 2027 verlangt Google für beide Modelle 1,50 statt 0,75 US-Dollar je Million Eingabe-Token und 7,50 statt 3,75 US-Dollar je Million Ausgabe-Token (Stand 21. September 2026, laut Googles Preisseite). Ein Token ist die Abrechnungseinheit, ein Stück Text, oft kürzer als ein Wort. Mein Testdokument mit 1.459 Wörtern ergab samt Arbeitsanweisung 2.251 Token.

Was eine einzelne Aufgabe kostet, lässt sich aus dem Tokenpreis allein nicht ablesen. Ich setze in eigenen Anwendungen Gemini 3.7 Flash ein, der Jahreswechsel betrifft mich also direkt. Deshalb habe ich am 21. September vier Aufgaben durchgemessen, die in kleinen Betrieben jeden Tag anfallen, mit beiden Modellen und zu beiden Preisständen.

Preise und Rabatte im Überblick

Gemini 3.7 Flash ist seit dem 13. August 2026 allgemein verfügbar, Gemini 3.8 Flash seit dem 2. September. Beide kosten pro Token exakt dasselbe und bei beiden endet der Einführungspreis am selben Tag. Wichtig für jede Rechnung ist ein Zusatz auf der Preisseite. Der Ausgabepreis gilt einschließlich der Denk-Token. Das ist der Text, den das Modell vor der eigentlichen Antwort intern erzeugt, um die Aufgabe durchzugehen. Man sieht ihn nicht, bezahlt ihn aber wie Antworttext.

Zwei Rabatte gibt es. Über die Batch-Schnittstelle, bei der Google Anfragen gesammelt innerhalb von bis zu 24 Stunden abarbeitet, kostet alles die Hälfte. Denselben Preis hat die Flex-Stufe, die in Minuten antwortet, aber ohne feste Zusage. Ab 2027 kostet ein Batch-Aufruf damit so viel wie heute ein normaler.

Der zweite Rabatt ist der Zwischenspeicher (Caching). Wiederholte Eingaben rechnet Google dann mit einem Zehntel des Eingabepreises ab. Laut Caching-Dokumentation greift das automatische Caching bei 3.7 und 3.8 aber erst ab 4.096 Token Eingabe. Für ausdrücklich angelegte Zwischenspeicher kommt eine Gebühr pro Stunde dazu. Keine meiner vier Aufgaben kam an die Schwelle heran. Für kurze Büroaufgaben bringt der Rabatt also nichts, er lohnt sich erst, wenn jeder Aufruf mit denselben langen Anweisungen oder Unterlagen beginnt.

Für Audio steht bei 3.7 und 3.8 ein einziger Eingabepreis ohne gesonderten Audiotarif. Bei Gemini 3.1 Flash-Lite kostet Audio dagegen das Doppelte des Textpreises, bei 2.5 Flash-Lite das Dreifache. Die beiden Flash-Lite-Modelle, die ich als Vergleich mitgemessen habe, haben keinen auslaufenden Einführungspreis. Gemini 3.5 Flash-Lite kostet 0,30 und 2,50 US-Dollar je Million Token, 2.5 Flash-Lite 0,10 und 0,40 US-Dollar.

So habe ich gemessen

Die Texte habe ich für eine erfundene Tischlerei selbst geschrieben. Die vier Aufgaben:

  • eine Kundenanfrage mit rund 150 Wörtern beantworten, ohne Preise zu nennen und mit Vorschlag für einen Aufmaßtermin
  • aus einem Rechnungstext Nummer, Datum, Positionen, Beträge und Fälligkeit als JSON auslesen, also in einem Format, das eine Software direkt weiterverarbeitet, abgesichert über ein Antwortschema mit fest vorgegebenen Feldern
  • eine Kundenmail einer von fünf Kategorien zuordnen
  • ein internes Konzeptpapier mit knapp 1.500 Wörtern in fünf Sätzen zusammenfassen

Jede Aufgabe lief fünfmal pro Modell über die normale Schnittstelle, ohne Zusatzparameter, also mit dem Denken, das das Modell von sich aus einsetzt. Für 3.7 und 3.8 kamen je fünf Läufe mit der niedrigsten und der höchsten Denkstufe dazu, zusammen 160 Aufrufe. Aus jeder Antwort habe ich die Tokenzahlen für Eingabe, Antwort und Denken übernommen und daraus die Kosten gerechnet. Die ganze Messung hat rund 0,54 US-Dollar gekostet.

Die Qualität habe ich mitgeprüft. Alle 40 JSON-Ausgaben waren gültig und inhaltlich richtig, bis hin zum korrekt berechneten Fälligkeitsdatum. Alle 40 Einordnungen lauteten Reklamation, obwohl die Mail auch die offene Rechnung erwähnt. Keine der Antwortmails nannte einen Preis.

Frontplatte eines Servers mit blau leuchtenden Statuslampen Foto: panumas nikhomkhai / Pexels

Was eine Aufgabe kostet

Die Kosten je 1.000 Aufgaben in US-Dollar, jeweils mit Standardeinstellung:

Aufgabe 3.7 Flash bis 31.12.2026 3.7 Flash ab 1.1.2027 3.8 Flash bis 31.12.2026 3.8 Flash ab 1.1.2027 3.5 Flash-Lite
Antwort auf Kundenanfrage 4,00 7,99 3,85 7,70 0,59
Rechnungsdaten als JSON 3,01 6,01 4,26 8,51 1,35
Mail einer Kategorie zuordnen 1,27 2,54 1,39 2,79 0,07
Dokument zusammenfassen 7,38 14,75 8,28 16,56 1,22
Alle vier zusammen 15,65 31,30 17,78 35,55 3,23

Pro Aufgabe sind das zum Einführungspreis zwischen 0,13 US-Cent für das Einordnen einer Mail mit 3.7 Flash und 0,83 US-Cent für die Zusammenfassung mit 3.8 Flash. Ab Januar verdoppelt sich jeder Wert, weil Eingabe- und Ausgabepreis im gleichen Verhältnis steigen. Ein Betrieb, der im Monat 2.000 eingehende Mails einordnen und beantworten lässt, zahlt dafür mit 3.7 Flash heute rund 10,50 US-Dollar, ab Januar rund 21 US-Dollar.

Das bleibt ein überschaubarer Betrag. Wer allerdings heute eine Jahreskalkulation aufstellt oder einen Festpreis für eine KI-Anwendung anbietet und dabei den Einführungspreis ansetzt, rechnet mit dem falschen Wert.

Tischkalender mit dem Monat Dezember bis zum 31. Foto: Matheus Bertelli / Pexels

Den größten Teil bezahlst du fürs Denken

Auffällig ist, wofür das Geld ausgegeben wird. Bei Standardeinstellung entfallen je nach Aufgabe 46 bis 89 Prozent der Kosten auf Denk-Token. Am deutlichsten ist es beim Einordnen. Die Antwort besteht aus einem einzigen Wort, drei Token. Davor denkt 3.7 Flash im Schnitt 297 Token lang, 3.8 Flash 329. Bei der Zusammenfassung stehen rund 1.300 bis 1.500 Denk-Token einer Antwort von rund 200 Token gegenüber.

Das Denken kostet auch Zeit. Die Zusammenfassung dauerte mit Standardeinstellung im Median gut sechs Sekunden. In den Läufen, in denen das Modell nicht dachte, waren es unter zwei.

3.8 Flash denkt mehr, der Aufpreis hängt an der Aufgabe

Für 3.8 Flash kursiert in Vergleichsartikeln die Zahl von 45 Prozent Mehrkosten. Sie geht auf Artificial Analysis zurück. Dort kostete eine Aufgabe des hauseigenen Intelligence Index bei hoher Denkstufe 0,58 statt 0,40 US-Dollar, bei rund 48.000 Ausgabe-Token pro Aufgabe. Google schreibt auf der Modellseite selbst, dass 3.8 bei längeren und komplexen Aufgaben bewusst mehr Token verbraucht. Für Alltagsaufgaben empfiehlt Google eine niedrigere Denkstufe.

Meine Aufgaben sind um Größenordnungen kleiner. Bei Standardeinstellung kostete 3.8 über alle vier zusammen knapp 14 Prozent mehr als 3.7. Die Spanne ist groß. Die Antwortmail war mit 3.8 sogar 4 Prozent günstiger, das Einordnen 9 und die Zusammenfassung 12 Prozent teurer. Nur bei der Rechnung kam 3.8 mit 42 Prozent in die Nähe der kursierenden Zahl, weil es dort fast doppelt so lange nachdachte, 675 statt 371 Denk-Token im Schnitt. Auf der hohen Denkstufe lagen beide Modelle näher beieinander, 3.8 war dort insgesamt 9 Prozent teurer.

Einen Qualitätsunterschied zwischen beiden Modellen konnte ich bei diesen Aufgaben nicht feststellen. Beide bestanden in jedem Lauf dieselben Prüfungen und beide machten denselben Fehler bei den Terminvorschlägen, dazu weiter unten mehr.

Die Denkstufe low ist der größte Hebel

Bei den aktuellen Modellen steuert man das Denken über eine Stufe statt über ein Tokenbudget. 3.7 und 3.8 kennen low, medium und high, Standard ist medium, so steht es in der Dokumentation zum Denken. Gesetzt wird die Stufe in der Anfrage:

"generationConfig": {
  "thinkingConfig": { "thinkingLevel": "low" }
}

Die Wirkung in Denk-Token im Schnitt, darunter die Kosten für je 1.000 Durchläufe aller vier Aufgaben zum Preis ab 2027:

3.7 Standard 3.7 low 3.8 Standard 3.8 low
Antwort auf Kundenanfrage 829 808 775 157
Rechnungsdaten als JSON 371 218 675 0
Mail einer Kategorie zuordnen 297 116 329 143
Dokument zusammenfassen 1.321 0 1.541 0
Kosten in US-Dollar für 1.000 Durchläufe aller vier Aufgaben ab 2027 31,30 19,36 35,55 12,97

Bei 3.8 Flash hat low durchgreifend gewirkt. Bei Rechnung und Zusammenfassung dachte das Modell gar nicht mehr, bei der Antwortmail in vier von fünf Läufen nicht. Über alle vier Aufgaben sanken die Kosten um 64 Prozent. 3.7 Flash folgt der Stufe weniger konsequent. Bei der Zusammenfassung fiel das Denken ganz weg, bei Rechnung und Einordnen sank es um 40 bis 60 Prozent, bei der Antwortmail blieb es praktisch unverändert. Insgesamt sparte 3.7 mit low 38 Prozent.

Damit dreht sich die Reihenfolge um. Mit low ist 3.8 Flash ein Drittel günstiger als 3.7 Flash mit low. Ab Januar 2027 kostet es dann sogar weniger als 3.7 Flash heute mit Standardeinstellung, 12,97 gegen 15,65 US-Dollar für je 1.000 Durchläufe aller vier Aufgaben. An der Qualität habe ich nichts verloren gesehen, JSON, Kategorie und Satzzahl stimmten in allen Läufen.

Zwei Stolperstellen gibt es. Die Stufe minimal, die andere Modelle der Reihe kennen, lehnen 3.7 und 3.8 mit einem Fehler ab. Und den älteren Parameter thinkingBudget mit dem Wert 0 nehmen beide ohne Fehlermeldung an, denken aber trotzdem weiter, in meinem Test 103 und 112 Token lang. Wer sich darauf verlässt, bezahlt Denken, das er für abgeschaltet hält.

Flash-Lite kostet einen Bruchteil

Gemini 3.5 Flash-Lite arbeitet von sich aus mit minimalem Denken und hat in keinem Lauf ein einziges Denk-Token abgerechnet. Für alle vier Aufgaben zusammen kamen 3,23 US-Dollar je 1.000 Durchläufe heraus, rund ein Fünftel von 3.7 Flash heute und ein Zehntel ab Januar. Das ältere 2.5 Flash-Lite lag bei 0,53 US-Dollar. Beide antworteten im Median in unter zwei Sekunden. Gemini 3.1 Flash-Lite wäre pro Token noch etwas günstiger als 3.5, wird laut Google aber am 7. Mai 2027 abgeschaltet.

Beim Extrahieren und Einordnen war jedes Ergebnis richtig. Bei der Zusammenfassung zeigte sich der Unterschied. 2.5 Flash-Lite schrieb in drei von fünf Läufen, die Umstellung im Dokument dauere drei Monate, dort sind es sechs. 3.5 Flash-Lite blieb inhaltlich korrekt, leistete sich aber einmal einen Grammatikfehler. Für Aufgaben, bei denen ein Schema die Ausgabe absichert, reicht ein kleines Modell. Für Texte, die ein Mensch liest und denen er vertrauen soll, würde ich beim Flash-Modell bleiben.

Ein Nebenbefund bei den Antwortmails

In 20 von 30 Antwortmails von 3.7 und 3.8 stand ein konkreter Terminvorschlag mit Wochentag, etwa Dienstag, der 22. Oktober. In allen 20 Fällen passte der Wochentag nicht zum Oktober 2026, siebenmal wäre der Termin auf einen Samstag gefallen. Das Modell kennt das heutige Datum nicht, solange es nicht in der Anfrage steht.

Die Gegenprobe war eindeutig. Mit dem Satz „Heute ist Montag, der 21. September 2026.“ am Anfang der Systemanweisung stimmten in zehn weiteren Läufen alle zwölf genannten Wochentage. Der Satz kostet 16 Token pro Aufruf.

Ein Haufen Euromünzen auf dunklem Untergrund Foto: Panos and Marenia Stavrinos / Pexels

Was du jetzt tun kannst

Jede Kalkulation, die über den Jahreswechsel reicht, sollte mit dem Preis ab 2027 rechnen, also mit dem Doppelten dessen, was die Abrechnung heute zeigt. Die Denkstufe gehört je Aufgabe gesetzt und nicht dem Modell überlassen. Für Einordnen, Extrahieren und Zusammenfassen hat low in meinen Läufen gereicht. Genau dort ist der Hebel am größten. Was nicht sofort fertig sein muss, etwa die nächtliche Auswertung eingegangener Rechnungen, läuft über Batch zum halben Preis. Wer große Mengen einordnet oder ausliest, sollte Flash-Lite zumindest testen.

Für mich ist die wichtigste Erkenntnis, dass die Denkstufe mehr bewegt als die Wahl zwischen 3.7 und 3.8. Zwischen den Modellen lagen bei Standardeinstellung 14 Prozent, zwischen Standard und low bis zu 64 Prozent. Wer bis Dezember ohnehin prüft, sollte die Kombination aus 3.8 Flash und der Stufe low gegen die eigenen Aufgaben testen.

Ein Punkt gilt unabhängig vom Modell. Stellst du eine Anwendung mit Gemini dahinter Kundinnen und Kunden im Europäischen Wirtschaftsraum zur Verfügung, verlangt Google laut seinen Zusatzbedingungen zur Gemini API ohnehin einen bezahlten Zugang. Die kostenlose Stufe ist für eigene Tests gedacht. Wie lange Anbieter Anfragen protokollieren, habe ich in einem eigenen Artikel zu Zero Data Retention zusammengetragen. Wer zum Ausprobieren gar nichts bezahlen möchte, findet mit Hetzners kostenloser Inferenz-API eine Spielwiese, allerdings ohne Zusagen für den Produktivbetrieb.

Wenn du wissen willst, was die KI-Aufgaben in deinem Betrieb ab Januar kosten und welche Denkstufe dafür reicht, melde dich gerne bei mir.

Häufige Fragen

Was kostet Gemini 3.7 Flash ab 2027?+

Ab dem 1. Januar 2027 kostet Gemini 3.7 Flash 1,50 US-Dollar je Million Eingabe-Token und 7,50 US-Dollar je Million Ausgabe-Token, Denk-Token eingeschlossen. Bis zum 31. Dezember 2026 gilt ein Einführungspreis von 0,75 und 3,75 US-Dollar. Für Gemini 3.8 Flash gelten dieselben Preise und dasselbe Datum (Stand 21. September 2026).

Ist Gemini 3.8 Flash teurer als 3.7 Flash?+

Pro Token nicht, pro Aufgabe meistens schon, weil 3.8 mehr denkt. In meiner Messung mit vier Büroaufgaben kostete 3.8 bei Standardeinstellung zusammen knapp 14 Prozent mehr, bei der Rechnungsextraktion 42 Prozent mehr und bei der Antwortmail 4 Prozent weniger. Mit der Denkstufe low war 3.8 dagegen ein Drittel günstiger als 3.7 mit low.

Wie schalte ich das Denken bei Gemini 3.7 Flash und 3.8 Flash herunter?+

Über den Parameter thinkingLevel in der thinkingConfig der Anfrage. Beide Modelle kennen die Stufen low, medium und high, Standard ist medium. Die Stufe minimal lehnen beide mit einem Fehler ab. Den älteren Parameter thinkingBudget mit dem Wert 0 nehmen sie ohne Fehlermeldung an, denken aber trotzdem weiter.

Reicht Gemini Flash-Lite für Büroaufgaben?+

Für Einordnen und Extrahieren mit festem Antwortschema war in meiner Messung jedes Ergebnis richtig, bei einem Bruchteil der Kosten. Gemini 3.5 Flash-Lite kostete für alle vier Aufgaben zusammen 3,23 US-Dollar je 1.000 Durchläufe, 3.7 Flash heute 15,65 US-Dollar. Bei Zusammenfassungen machte das ältere 2.5 Flash-Lite in drei von fünf Läufen einen inhaltlichen Fehler, dort ist das größere Modell die sicherere Wahl.

Du willst mehr erfahren?

In einem kostenlosen Erstgespräch besprechen wir, wie du diese Themen für dein Unternehmen nutzen kannst. Kein Verkaufsgespräch, sondern eine ehrliche Einschätzung.

Kostenloses Erstgespräch vereinbaren