Wer Sprachnachrichten, Anrufbeantworter oder Besprechungen automatisch abschreiben lässt, rechnet bei einer leeren Aufnahme mit einer leeren Abschrift. Am 21. September 2026 habe ich getestet, ob das bei den aktuellen Gemini-Modellen stimmt. Es stimmt nicht. Mit einer kurzen Firmenbeschreibung im Systemtext kam auf reine Stille in 148 von 150 Läufen Text zurück, meist eine komplette Kundennachricht mit Namen, Anliegen und Rückrufnummer.
Für OpenAIs Whisper ist das Phänomen seit 2024 bekannt. Eine Studie um die Informatikerin Allison Koenecke von der Cornell University fand in rund einem Prozent der untersuchten Abschriften ganze Sätze, die in der Aufnahme nicht vorkamen. Besonders betroffen waren Sprecherinnen und Sprecher mit langen Pausen. Für die aktuellen Gemini-Modelle habe ich auf Deutsch keinen vergleichbaren Test gefunden, also habe ich selbst gemessen.
So habe ich getestet
Ich habe sechs Testdateien erzeugt, alle 16 kHz mono im WAV-Format. Fünf davon enthalten digitale Stille, also reine Nullen, mit 0,5, 1, 1,5, 3 und 10 Sekunden Länge. Die sechste enthält drei Sekunden sehr leises, gleichmäßiges Rauschen bei -50 dBFS. Als Gegenprobe kam eine gesprochene Nachricht von 13,5 Sekunden dazu, erzeugt mit der deutschen Sprachausgabe von Windows. Damit sehe ich, ob die Modelle normale Nachrichten weiterhin richtig abschreiben.
Getestet habe ich fünf Modelle über die Gemini API: Gemini 3.8 Flash, 3.7 Flash, 3.5 Flash, 3.5 Flash-Lite und 2.5 Flash. Jede Datei lief pro Modell unter drei Bedingungen, jeweils fünfmal:
- A: nur der Auftrag “Transkribiere die Audioaufnahme wörtlich auf Deutsch.”
- B: derselbe Auftrag plus ein Systemtext, der eine erfundene Tischlerei beschreibt, samt Produkten wie Esstischen und Einbauschränken und typischen Anliegen wie Lieferterminen oder Reklamationen.
- C: wie B, ergänzt um den Satz “Ist nichts Gesprochenes zu hören, antworte ausschließlich mit [keine Sprache].”
Bedingung B ist der realistische Fall. Wer eine Abschrift für den Anrufbeantworter eines Betriebs baut, gibt dem Modell Kontext mit, damit Fachbegriffe und Namen richtig geschrieben werden. Den Denkaufwand der Modelle habe ich niedrig eingestellt. Ein Vorlauf mit den Standardeinstellungen zeigte dasselbe Bild, dort erfanden alle fünf Modelle aus einer Sekunde Stille eine Nachricht. Insgesamt waren es 525 Aufrufe, die zusammen 0,40 US-Dollar gekostet haben.
Foto: Theo Decker / Pexels
Mit Firmenkontext erfindet jedes Modell fast immer
Die Tabelle zählt, wie oft pro Modell erfundener Text zurückkam. Gezählt ist alles, was mindestens ein Wort enthält, das nie gesprochen wurde. Reine Zeitstempel wie “00:00” oder Geräuschmarken wie “(Rauschen)” zähle ich nicht mit. Jede Zelle umfasst 30 Läufe, also sechs stille oder verrauschte Dateien mal fünf Wiederholungen.
| Modell | A: nur Auftrag | B: mit Firmenbeschreibung | C: B plus Platzhalter-Regel |
|---|---|---|---|
| Gemini 3.8 Flash | 28 | 29 | 24 |
| Gemini 3.7 Flash | 27 | 30 | 22 |
| Gemini 3.5 Flash | 4 | 29 | 2 |
| Gemini 3.5 Flash-Lite | 0 | 30 | 0 |
| Gemini 2.5 Flash | 17 | 30 | 0 |
| Summe | 76 von 150 | 148 von 150 | 48 von 150 |
Die mittlere Spalte ist der eigentliche Befund. Kein Modell hat in Bedingung B ein einziges Mal leer geantwortet. 141 der 150 Antworten waren vollständige Sätze mit im Median 51 Wörtern. 130 der 148 erfundenen Abschriften nannten Produkte oder Personen der beschriebenen Tischlerei. Aus einer Sekunde Stille machte Gemini 3.7 Flash zum Beispiel diese Nachricht.
“Guten Tag, hier ist Karin Becker. Ich wollte mich mal erkundigen, wie es mit unserem Nussbaum-Esstisch aussieht. Sie sagten ja, dass er voraussichtlich Mitte des Monats fertig wird. Können Sie mir schon einen konkreten Liefertermin nennen?”
Andere Läufe meldeten eine knarrende vierte Treppenstufe, eine klemmende Schranktür oder eine abgeplatzte Tischkante. 65 der erfundenen Abschriften enthielten eine Telefonnummer, 64 eine ausdrückliche Bitte um Rückruf. Die Länge der Aufnahme spielte dabei keine Rolle. Eine halbe Sekunde Stille erzeugte genauso zuverlässig eine komplette Kundennachricht wie zehn Sekunden.
Foto: Tima Miroshnichenko / Pexels
Ohne Firmenkontext sieht es gemischter aus. Gemini 3.7 Flash und 3.8 Flash erfanden auch dann in 55 von 60 Fällen Text, dann eben ohne Thema, etwa “Wollen wir heute Abend ins Kino gehen?” oder “Guten Tag, herzlich willkommen im Autohaus Huber.” Gemini 3.5 Flash schrieb fast immer nur “00:00” oder “Null Uhr”, Gemini 3.5 Flash-Lite antwortete meist leer. Gemini 2.5 Flash gab in elf Fällen den eigenen Arbeitsauftrag als Abschrift zurück, meist wörtlich “Transkribiere die Audioaufnahme wörtlich auf Deutsch.” Auch das passt ins Bild, denn der Auftrag war der einzige Text, den das Modell hatte.
Die Platzhalter-Regel hilft nur bei einem Teil der Modelle
Die naheliegende Reaktion ist eine Zeile mehr im Prompt, genau das habe ich in Bedingung C geprüft. Bei Gemini 3.5 Flash, 3.5 Flash-Lite und 2.5 Flash wirkt sie fast vollständig, 88 von 90 Antworten waren der korrekte Platzhalter. Gemini 3.7 Flash und 3.8 Flash hielten sich dagegen nur in 13 von 60 Fällen daran und schrieben in den übrigen weiter Nachrichten von erfundenen Kundinnen und Kunden.
Die Gegenprobe mit der gesprochenen Nachricht lief in allen drei Bedingungen sauber. Alle 75 Abschriften waren korrekt. Bei gesprochenem Text schrieb kein Modell ein einziges Mal den Platzhalter. Die Regel schadet also nicht, sie schützt nur nicht bei jedem Modell.
Warum das passiert
Ein Sprachmodell hört nicht zu wie ein Mensch. Es erzeugt die Antwort, die auf die gesamte Eingabe am wahrscheinlichsten folgt. Auf die Bitte “Transkribiere” ist das eine Abschrift, auch wenn es nichts abzuschreiben gibt. Bringt die Aufnahme kein Signal mit, entscheidet der übrige Kontext, wie diese Abschrift aussieht. Beschreibt der Systemtext eine Tischlerei, entsteht eine Tischlerei-Nachricht. Steht nur der Auftrag da, schreibt das Modell im Zweifel den Auftrag ab.
Daraus folgt eine unbequeme Regel. Je besser der Systemtext den Betrieb beschreibt, desto überzeugender wird die Erfindung. Genau der Kontext, der bei echten Nachrichten Namen und Fachbegriffe richtig schreiben lässt, macht eine leere Aufnahme zu einer glaubwürdigen Kundenanfrage.
Foto: Ron Lach / Pexels
Warum das in der Praxis gefährlich ist
Wer selbst diktiert, sieht die Abschrift sofort und merkt, dass sie nicht stimmt. Bei eingehenden Sprachnachrichten ist das anders. Dort ist die Abschrift oft das Einzige, was jemand liest, denn genau dafür wurde sie eingeführt. Kaum jemand hört eine Nachricht nach, deren Text vollständig und plausibel aussieht.
Leere Aufnahmen entstehen auf ganz alltäglichen Wegen. Jemand legt nach dem Signalton wortlos auf, das Handy nimmt in der Jackentasche auf, oder ein in Windows stummgeschaltetes Mikrofon liefert keine Fehlermeldung, sondern schlicht Stille. Landet so eine Aufnahme in einem Ablauf wie in Bedingung B, steht danach ein Ticket im System, das nach einer echten Reklamation aussieht. Im harmlosen Fall ruft das Büro eine Nummer an, die es nicht gibt. Im unangenehmen Fall gehört die Nummer jemandem, der nie angerufen hat.
Wer eingehende Nachrichten ohnehin schon automatisch vorsortiert, etwa wie in meinem Artikel zur E-Mail-Automation mit KI, sollte diese Stelle deshalb besonders absichern. Eine erfundene Sprachnachricht sieht im Posteingang genauso aus wie eine echte.
Was dagegen hilft
Pegel prüfen, bevor das Modell die Datei sieht
Die wirksamste Maßnahme ist, leere Aufnahmen gar nicht erst hinzuschicken. Dafür reicht eine Pegelmessung, also die Frage, wie laut die lauteste Stelle der Aufnahme ist. Diese Python-Funktion misst die mittlere Lautstärke jedes 50-Millisekunden-Abschnitts und gibt den lautesten zurück, in dBFS, wobei 0 das technische Maximum ist:
import wave, numpy as np
def lautester_abschnitt_dbfs(pfad, fenster_ms=50):
with wave.open(pfad, "rb") as w:
rate = w.getframerate()
x = np.frombuffer(w.readframes(w.getnframes()), dtype="<i2") / 32768.0
n = int(rate * fenster_ms / 1000)
rahmen = x[: len(x) // n * n].reshape(-1, n)
rms = np.sqrt((rahmen ** 2).mean(axis=1)).max()
return 20 * np.log10(max(rms, 1e-10))
if lautester_abschnitt_dbfs("nachricht.wav") < -40:
print("Keine Sprache erkannt, Aufnahme wird nicht transkribiert.")
An meinen Testdateien lag die Stille bei minus unendlich, das Rauschen bei -49,5 dBFS und die gesprochene Nachricht bei -13,2 dBFS. Eine Schwelle von -40 dBFS trennt das mit viel Abstand. Den genauen Wert solltest du trotzdem an ein paar echten Aufnahmen deiner Telefonanlage oder deines Mikrofons prüfen, weil jede Leitung ein anderes Grundrauschen hat. Sprachnachrichten aus Messengern kommen meist als Opus-Datei, die wandelst du vorher mit ffmpeg -i nachricht.opus -ar 16000 -ac 1 nachricht.wav in WAV um. Nach genau diesem Umweg über Opus lag die Testnachricht bei -13,8 dBFS, die Stille weiterhin bei minus unendlich.
Foto: Egor Komarov / Pexels
Eine Mindestlänge nur als Vorfilter
Eine Mindestlänge klingt naheliegend, schützt aber allein nicht. In Bedingung B erzeugte eine halbe Sekunde Stille in 25 von 25 Läufen einen vollständigen Satz, zehn Sekunden Stille ebenfalls. Eine Untergrenze von etwa einer Sekunde fängt versehentliches Antippen ab, mehr leistet sie nicht.
Unsichere Abschriften kennzeichnen
Die Platzhalter-Regel gehört trotzdem in den Prompt, weil sie bei drei der fünf Modelle zuverlässig wirkt und echte Sprache nicht beeinträchtigt. Kommt der Platzhalter zurück, sollte die Oberfläche das deutlich zeigen, statt eine leere Nachricht anzulegen. Außerdem lohnt es sich, jede automatische Abschrift als solche zu kennzeichnen und die Originalaufnahme einen Klick daneben anzubieten. Wer Zweifel hat, hört dann kurz rein.
Zweimal abschreiben und vergleichen
Die zuverlässigste Prüfung im Nachhinein ist die Wiederholung. Die gesprochene Testnachricht ergab bei jedem Modell zweimal fast denselben Text, die 150 verglichenen Paare stimmten zu mindestens 98 Prozent überein. Die Unterschiede lagen bei Kleinigkeiten wie “10 Uhr” gegen “10:00 Uhr”. Erfundene Abschriften stimmten im Median nur zu 17 Prozent überein, das ähnlichste Paar kam auf 92 Prozent. Das Modell erzählt bei jedem Durchlauf eine andere Geschichte. Genau daran erkennst du die Erfindung.
Zwei Einschränkungen gehören dazu. Meine Gegenprobe war eine saubere synthetische Stimme. Bei verrauschten Handyaufnahmen weichen auch echte Abschriften stärker voneinander ab, die Schwelle muss dann tiefer liegen. Bei 70 Prozent wären in meinem Test 4 von 399 erfundenen Paaren durchgerutscht. Außerdem erkennt der Vergleich keine Ausgaben, die jedes Mal gleich sind, also etwa den abgeschriebenen Arbeitsauftrag oder “00:00”. Er ergänzt die Pegelprüfung, er ersetzt sie nicht.
Der doppelte Aufruf kostet wenig. Gemini 3.7 Flash rechnete im Test 25 Token pro Sekunde Audio ab, bei 0,75 US-Dollar pro Million Eingabe-Token sind das rund 0,11 US-Cent Eingabekosten pro Minute Aufnahme (Stand 21. September 2026, Einführungspreis laut Google-Preisliste bis Ende 2026). Wie sich die Kosten der Flash-Modelle pro Aufgabe insgesamt zusammensetzen, habe ich in einem eigenen Kostenvergleich aufgeschlüsselt.
Was du mitnehmen solltest
Eine KI-Transkription kennt keinen Zustand “nichts gehört”, solange du ihr keinen gibst. Mit Firmenkontext haben alle fünf getesteten Gemini-Modelle aus Stille glaubwürdige Kundennachrichten gemacht. Die beiden neuesten ließen sich auch durch eine klare Anweisung kaum davon abbringen. Die Lösung liegt deshalb nicht im Modell, sondern davor. Eine Pegelprüfung von gut zehn Zeilen Code, eine sichtbare Kennzeichnung und bei wichtigen Abläufen ein zweiter Durchlauf reichen aus, damit aus einer leeren Aufnahme kein Ticket mehr wird.
Wenn du Sprachnachrichten, Anrufbeantworter oder Besprechungen automatisch abschreiben lassen möchtest und dabei sicher sein willst, dass nur echte Nachrichten im Posteingang landen, melde dich gerne bei mir.
Häufige Fragen
Warum erfindet eine KI-Transkription Text, wenn nichts gesprochen wird?+
Ein Sprachmodell liefert auf einen Auftrag die Antwort, die ihm am wahrscheinlichsten erscheint. Auf die Bitte, eine Aufnahme abzuschreiben, ist eine Abschrift wahrscheinlicher als gar nichts. Enthält die Aufnahme kein Signal, füllt das Modell die Lücke mit dem, was zum übrigen Kontext passt. In meinem Test waren das bei einer beschriebenen Tischlerei fast immer Nachrichten von Kundinnen und Kunden dieser Tischlerei.
Welches Gemini-Modell ist bei leeren Aufnahmen am zuverlässigsten?+
Mit der Anweisung, bei Stille nur [keine Sprache] zu schreiben, lagen Gemini 3.5 Flash-Lite und 2.5 Flash in meinem Test bei 30 von 30 korrekten Platzhaltern, Gemini 3.5 Flash bei 28 von 30. Gemini 3.7 Flash und 3.8 Flash hielten sich nur in 13 von 60 Fällen daran. Ohne diese Anweisung und mit Firmenkontext erfanden alle fünf Modelle fast immer Text. Die Modellwahl allein reicht deshalb nicht, die Prüfung gehört vor das Modell.
Hilft es, der KI im Prompt zu verbieten, etwas zu erfinden?+
Bei einem Teil der Modelle ja, bei den neuesten kaum. Die Platzhalter-Regel senkte die Zahl erfundener Abschriften im Test von 148 auf 48 von 150. 46 der verbliebenen 48 stammten von Gemini 3.7 Flash und 3.8 Flash. Eine Anweisung ist ein Zusatznetz, aber kein Ersatz für eine technische Prüfung der Aufnahme vor dem Aufruf.
Wie erkenne ich eine erfundene Abschrift im Nachhinein?+
Am einfachsten, indem du dieselbe Aufnahme zweimal abschreiben lässt und die Texte vergleichst. Eine gesprochene Testnachricht ergab bei mir zweimal fast denselben Text, mit mindestens 98 Prozent Übereinstimmung. Erfundene Abschriften stimmten im Median nur zu 17 Prozent überein, weil das Modell jedes Mal eine andere Geschichte erzählt. Zusätzlich hilft es, die Originalaufnahme immer einen Klick neben der Abschrift anzubieten.
Du willst mehr erfahren?
In einem kostenlosen Erstgespräch besprechen wir, wie du diese Themen für dein Unternehmen nutzen kannst. Kein Verkaufsgespräch, sondern eine ehrliche Einschätzung.
Kostenloses Erstgespräch vereinbaren



