Gemini 3.8 Live Extended Thinking erreicht 82,6 Punkte auf dem Speech-to-Speech-Quality-Index von Artificial Analysis und damit Platz eins. Google stellte die beiden neuen Sprachmodelle am 15. September 2026 vor, zwei Tage später folgte eine aktualisierte Fassung der Ankündigung. Beide gehören zur selben Modellfamilie, haben aber andere Aufgaben: Gemini 3.8 Live für skalierbare, günstige Dialoge, Gemini 3.8 Live Extended Thinking für komplexe Vorgänge mit mehrstufigem Schlussfolgern. Gebaut sind sie für Voice Agents, also für Anwendungen, in denen ein Sprachmodell ein Gespräch führt und nebenbei Aufgaben erledigt.
Man kennt das aus jeder Telefonkonferenz: Ein Gesprächspartner, der verstummt, weil er etwas nachschlagen muss, reißt den Faden ab. Wer weiterredet und dabei nachsieht, hält das Gespräch am Leben. Hier setzt das neue Modell an. Es soll denken und gleichzeitig sprechen, statt zwischen beiden Zuständen hin und her zu springen. Was daran neu ist, zeigen die Zahlen und die Mechanik.
Zwei Varianten, zwei Aufgaben
Google positioniert die beiden Varianten nicht als Konkurrenten, sondern als Arbeitsteilung. Gemini 3.8 Live ist auf Skalierung und niedrige Kosten ausgelegt. Es verbindet flüssigen Dialog mit visueller Erdung, also dem Verarbeiten von Bildeindrücken während des Gesprächs. In der Speech Agent Arena reicht es für Platz zwei; Google verweist auf hohe Nutzerpräferenz bei niedrigen Kosten pro Stunde Eingabe-Audio. Wer viele Gespräche parallel führen muss und auf den Preis achtet, bekommt hier das Arbeitspferd.
Die Extended-Thinking-Variante ist für Aufgaben gedacht, die sich nicht in einem Satz beantworten lassen. Sie soll mehrstufige Abläufe zu Ende bringen, ohne den Dialogfluss zu unterbrechen. Mehr Rechenzeit als ein reiner Plauderton kostet das; Google nennt den Preis trotzdem wettbewerbsfähig. Die Entscheidungsregel ist einfach: Dialogqualität und Kosten hier, Durchhaltevermögen bei komplizierten Vorgängen dort.
Was die Benchmarks messen
Der Speech-to-Speech-Quality-Index von Artificial Analysis bewertet, wie natürlich ein gesprochenes Hin und Her wirkt. Hier liegt Extended Thinking mit 82,6 Punkten vorn. Die Werte zur Aufgabenerledigung kommen aus anderen Tests: 68,6 Prozent auf τ-Voice, 35,1 Prozent auf Sierra’s τ-Voice-banking, einem auf Bankabläufe zugeschnittenen Test. Beim Schlussfolgern über Audio sind es 97,7 Prozent bei Big Bench Audio. Diese Zahlen lassen sich nicht gegeneinander aufrechnen; sie messen drei verschiedene Fähigkeiten.
Auf ServiceNow’s EVA-Bench, wo Genauigkeit gegen Gesprächsqualität abgewogen wird, verschieben die Modelle laut Google die Pareto-Grenze für komplexe Arbeitsabläufe. Im Ankündigungstext steht, dass dieser Lauf über die Live API auf der Gemini Enterprise Agent Platform erfolgte. Das ist keine Nebensache: Es sagt, unter welchen Bedingungen die Ergebnisse zustande kamen. Wer mit Benchmark-Zahlen arbeitet, sollte mitlesen, auf welcher Infrastruktur und mit welcher Testmethodik sie erhoben wurden.
Denken und Sprechen gleichzeitig
Interessanter als die Punktezahl ist die Architektur. Extended Thinking soll gleichzeitig schlussfolgern und sprechen, statt erst eine Gedankenkette abzuschließen und dann eine Antwort zu verlesen. Während die Arbeit läuft, gibt das Modell frühe Signale wie „Let me check that…“ und begleitet mehrstufige Hintergrundaufgaben mit einer laufenden Fortschrittserzählung. Als Nutzer hört sich das weniger wie eine Abfrage an, mehr wie ein Gespräch mit jemandem, der mitdenkt und das hörbar macht.
Technisch ist das der schwierigere Weg. Ein Sprachmodell, das sequenziell arbeitet, hat eine einfache Kostenstruktur, aber eine hörbare Pause im Gespräch. Wer Reasoning-Schritte und Sprachausgabe überlappen lässt, muss entscheiden, wann eine Zwischenbemerkung ehrlich ist und wann sie nur Wartezeit überbrückt. Die frühen Signale sind der Kompromiss: eine Zusage ohne Ergebnis, die den Faden hält, bis der Befund vorliegt.
Werkzeuge im Hintergrund, 97 Sprachen, visuelle Erdung
Gemini 3.8 Live verarbeitet visuelle Eingaben fast in Echtzeit. Es erkennt während eines laufenden Dialogs 97 Sprachen und wechselt selbstständig zwischen ihnen, ohne dass jemand vorher eine Sprache auswählen muss. Werkzeug- und API-Aufrufe laufen im Hintergrund weiter, während das Gespräch läuft: Das Modell bestätigt eine Anfrage und redet weiter, bis die Aufgabe erledigt ist. Einzeln klingt nichts davon spektakulär. Zusammen entscheidet es, ob aus einer Sprachdemo ein brauchbarer Voice Agent wird.
Für solche Anwendungen zählt vor allem, wie Werkzeugaufruf und Dialog ineinandergreifen. Ein Assistent, der während eines API-Aufrufs stumm bleibt, wirkt defekt. Einer, der den Aufruf im Hintergrund abwickelt und weiterredet, wirkt beschäftigt. Das ist das Verhalten, das die Kosten pro Stunde Eingabe-Audio rechtfertigen soll: nicht die Zahl der gesprochenen Sätze, sondern die Zahl der nebenbei erledigten Aufgaben.
Das Ökosystem für Voice Agents
Über die Gemini Live API lässt sich die Technik in bestehende Entwicklungsplattformen einbinden. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel und Vision Agents gehören laut Google zu den Anbietern, die sprachgesteuerte Schnittstellen ermöglichen, indem sie die Echtzeit-Medienübertragung im Hintergrund übernehmen. Für Entwickler heißt das: Das Streaming baut man nicht selbst, man baut die Nutzererfahrung. Und dort entscheidet sich meist, welches von zwei ansonsten gleich ausgestatteten Produkten gewinnt.
Auf Unternehmensseite nennt Google Zusammenarbeiten und Stimmen von Salesforce, Genspark und Lumeris sowie von 11Sight, Equal AI, Lenskart, Ambr AI und Casuu. Die Zitate kreisen um dieselben drei Eigenschaften: niedrige Latenz, flüssiger Gesprächsverlauf, zuverlässige Werkzeugaufrufe. Das überrascht nicht, denn in der Sprach-KI für Unternehmen entscheidet selten das spektakulärste Beispiel, sondern das Verhalten im hundertsten Gespräch am Tag. Wer Voice Agents mit Live API baut, kann diese Rückmeldungen als Prüfliste lesen.
Verfügbarkeit und das Wasserzeichen in der Tonspur
Der Rollout erfolgt ab sofort in mehreren Stufen. Entwickler finden Gemini 3.8 Live in der Gemini API und in Google AI Studio, Unternehmen in einer privaten Vorschau in Gemini Enterprise, Gemini Enterprise for Customer Experience ist in Aussicht; für alle erscheint es in Search Live. Extended Thinking kommt zusätzlich in Gemini Live, für Abonnenten von Google AI Pro und Ultra in Workspace in Docs, für alle Google-AI-Abonnenten außerdem in Gmail und Keep. Den schnellsten Zugang haben heute Entwickler.
Google markiert jedes erzeugte Audio mit SynthID, einem unhörbaren Muster in der Ausgabe. Es soll für Maschinen erkennbar bleiben und helfen, manipuliertes Material zu identifizieren. Für Unternehmen, die solche Stimmen im Kundenkontakt einsetzen, gehört das zur Compliance-Frage.
Was die Ankündigung verändert
82,6 Punkte sind eine Labormessung, keine Zusage für den eigenen Anwendungsfall. Deutlich wird trotzdem eine Verschiebung: Sprachassistenten, die früher zugehört und geantwortet haben, sollen jetzt während des Gesprächs arbeiten. Der Maßstab ist nicht mehr die beste einzelne Antwort, sondern ob ein Dialog über zehn Minuten trägt, ohne dass jemand auf eine Pause wartet.
Wer mehrsprachige Sprachmodelle für komplexe Aufgaben einsetzt, bekommt ein weiteres Werkzeug – und eine höhere Erwartung an die eigene Anwendung. Latenz, Mehrsprachigkeit und Werkzeugaufrufe sind damit Grundausstattung, nicht Bonus. Die Arbeit verschiebt sich in die Gestaltung des Gesprächs und in die Frage, was das System tun darf und was nicht.
Quelle: blog.google
