Google hat am 15. September 2026 Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking vorgestellt. Die beiden Echtzeit-Audiomodelle sollen Sprachagenten ermöglichen, visuelle Eingaben zu verarbeiten, Tools und API-Aufrufe auszuführen und das Gespräch dabei fortzusetzen. Extended Thinking ist zusätzlich für komplexe, mehrstufige Aufgaben ausgelegt und kann während des Nachdenkens weiter sprechen.

Zwei Modelle, zwei unterschiedliche Aufgaben

MerkmalGemini 3.8 LiveGemini 3.8 Live Extended Thinking
ZielSchnelle, skalierbare EchtzeitdialogeKomplexe Aufgaben mit mehrstufigem Denken
Gespräch während der VerarbeitungTools und API-Aufrufe können im Hintergrund laufenTools und mehrstufige Verarbeitung können laufen, während das Gespräch weitergeht
SprachverhaltenAuf flüssige Dialoge und geringe Verzögerung ausgelegtKann Denkfortschritte während längerer Aufgaben sprachlich begleiten
EntwicklerzugangGemini API und Google AI StudioGemini API und Google AI Studio

Für einen schnellen Sprachassistenten mit vielen parallelen Gesprächen ist Gemini 3.8 Live gedacht. Extended Thinking zielt auf Situationen, in denen der Agent mehrere Schritte koordinieren muss und seine Arbeit nicht einfach mit einer langen Pause unterbrechen soll.

Der wichtige Unterschied passiert während des Gesprächs

Die offizielle Entwicklerdemonstration zeigt asynchrone Tool-Aufrufe, Kontext-Injektion und Hintergrunddenken in der Gemini Live API.

Google beschreibt für beide Modelle Hintergrundverarbeitung: Ein Tool-Aufruf oder eine API-Aktion kann laufen, während der Dialog aktiv bleibt. Die offizielle Entwicklerdemonstration zeigt asynchrone Funktionsaufrufe, proaktives Audio, Echtzeitprotokolle für Tool-Aufrufe und das Einschleusen von Kontext über send_client_content.

Das ist für Sprachagenten der praktischere Fortschritt als eine möglichst menschlich klingende Stimme. Ein Agent kann etwa Informationen aus einem System abrufen, während die Interaktion weiterläuft. Extended Thinking geht noch einen Schritt weiter: Das Modell soll komplexe Aufgaben bearbeiten, sprechen und dabei Fortschritte signalisieren können.

Ein kontrollierter Vergleich mit derselben Aufgabe, demselben Tool und demselben Sitzungscode umfasste sechs Durchläufe. Dabei wurde der Zeichen-Tool-Aufruf bei Gemini 3.8 Live in zwei von drei Sitzungen und bei Extended Thinking in drei von drei Sitzungen ausgelöst. Vor den Aufrufen produzierte Extended Thinking vier bis acht hörbare Fortschrittsabschnitte. Diese Ergebnisse beschreiben die sechs Durchläufe und keine allgemeine Zuverlässigkeitsgarantie.

Visuelle Eingaben und 97 Sprachen

Google sagt, dass Gemini 3.8 Live visuelle Eingaben nahezu in Echtzeit verarbeiten kann. In den gezeigten Abläufen gehören dazu kameraorientierte Interaktionen und die Arbeit mit visuellen Ergebnissen. Beide Live-Modelle sollen außerdem während eines Gesprächs automatisch zwischen 97 unterstützten Sprachen wechseln können.

Für Entwickler ist diese Kombination relevant, weil ein Sprachagent nicht nur Audio verarbeitet: Er kann Kontext aus Bildern aufnehmen, Werkzeuge ansprechen und die Unterhaltung fortsetzen. Welche Qualität ein Agent im Alltag erreicht, hängt dabei nicht allein von der Zahl der Sprachen ab. Unterbrechungen, Hintergrundgeräusche, Akzente, die Bestätigung von Namen und Zahlen sowie die Wiederaufnahme nach einem Verbindungsabbruch bleiben wichtige Praxissituationen.

Googles Leistungsangaben für Extended Thinking

Google nennt für Gemini 3.8 Live Extended Thinking einen Wert von 82,6 im Speech to Speech Quality Index von Artificial Analysis. Außerdem gibt Google 68,6 Prozent bei τ-Voice, 35,1 Prozent beim Sierra-τ-Voice-Banking-Benchmark und 97,7 Prozent bei Big Bench Audio an.

Diese Zahlen beziehen sich auf die von Google genannten Tests und Messgrößen. Sie beschreiben nicht automatisch die Leistung jedes Sprachagenten in jeder Produktionsumgebung. Google sagt außerdem, dass erzeugtes Audio mit SynthID wassergekennzeichnet wird.

Entwicklerzugang und Nutzung in Deutschland

Google nennt die Gemini API und Google AI Studio als Zugangswege für Entwickler. Für Deutschland ist Gemini 3.8 Live außerdem in Search Live verfügbar. Der Zugang zu den einzelnen Modellen und Produkten kann sich nach Modell, Produkt, Konto, Tarif und Markt unterscheiden.

Die beiden Modelle sind damit vor allem für Entwickler interessant, die Sprachagenten mit visueller Verarbeitung, Hintergrundaktionen und mehrstufigem Denken verbinden wollen. Gemini 3.8 Live setzt den Schwerpunkt auf Tempo und Skalierung; Extended Thinking auf anspruchsvollere Abläufe, bei denen der Dialog während der Verarbeitung aktiv bleiben soll.