Google hat am 15. September 2026 Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking vorgestellt. Die beiden Echtzeit-Audiomodelle sollen Sprachagenten ermöglichen, visuelle Eingaben zu verarbeiten, Tools und API-Aufrufe auszuführen und das Gespräch dabei fortzusetzen. Extended Thinking ist zusätzlich für komplexe, mehrstufige Aufgaben ausgelegt und kann während des Nachdenkens weiter sprechen.
Zwei Modelle, zwei unterschiedliche Aufgaben
| Merkmal | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
| Ziel | Schnelle, skalierbare Echtzeitdialoge | Komplexe Aufgaben mit mehrstufigem Denken |
| Gespräch während der Verarbeitung | Tools und API-Aufrufe können im Hintergrund laufen | Tools und mehrstufige Verarbeitung können laufen, während das Gespräch weitergeht |
| Sprachverhalten | Auf flüssige Dialoge und geringe Verzögerung ausgelegt | Kann Denkfortschritte während längerer Aufgaben sprachlich begleiten |
| Entwicklerzugang | Gemini API und Google AI Studio | Gemini API und Google AI Studio |
Für einen schnellen Sprachassistenten mit vielen parallelen Gesprächen ist Gemini 3.8 Live gedacht. Extended Thinking zielt auf Situationen, in denen der Agent mehrere Schritte koordinieren muss und seine Arbeit nicht einfach mit einer langen Pause unterbrechen soll.
Der wichtige Unterschied passiert während des Gesprächs
Google beschreibt für beide Modelle Hintergrundverarbeitung: Ein Tool-Aufruf oder eine API-Aktion kann laufen, während der Dialog aktiv bleibt. Die offizielle Entwicklerdemonstration zeigt asynchrone Funktionsaufrufe, proaktives Audio, Echtzeitprotokolle für Tool-Aufrufe und das Einschleusen von Kontext über send_client_content.
Das ist für Sprachagenten der praktischere Fortschritt als eine möglichst menschlich klingende Stimme. Ein Agent kann etwa Informationen aus einem System abrufen, während die Interaktion weiterläuft. Extended Thinking geht noch einen Schritt weiter: Das Modell soll komplexe Aufgaben bearbeiten, sprechen und dabei Fortschritte signalisieren können.
Ein kontrollierter Vergleich mit derselben Aufgabe, demselben Tool und demselben Sitzungscode umfasste sechs Durchläufe. Dabei wurde der Zeichen-Tool-Aufruf bei Gemini 3.8 Live in zwei von drei Sitzungen und bei Extended Thinking in drei von drei Sitzungen ausgelöst. Vor den Aufrufen produzierte Extended Thinking vier bis acht hörbare Fortschrittsabschnitte. Diese Ergebnisse beschreiben die sechs Durchläufe und keine allgemeine Zuverlässigkeitsgarantie.
Visuelle Eingaben und 97 Sprachen
Google sagt, dass Gemini 3.8 Live visuelle Eingaben nahezu in Echtzeit verarbeiten kann. In den gezeigten Abläufen gehören dazu kameraorientierte Interaktionen und die Arbeit mit visuellen Ergebnissen. Beide Live-Modelle sollen außerdem während eines Gesprächs automatisch zwischen 97 unterstützten Sprachen wechseln können.
Für Entwickler ist diese Kombination relevant, weil ein Sprachagent nicht nur Audio verarbeitet: Er kann Kontext aus Bildern aufnehmen, Werkzeuge ansprechen und die Unterhaltung fortsetzen. Welche Qualität ein Agent im Alltag erreicht, hängt dabei nicht allein von der Zahl der Sprachen ab. Unterbrechungen, Hintergrundgeräusche, Akzente, die Bestätigung von Namen und Zahlen sowie die Wiederaufnahme nach einem Verbindungsabbruch bleiben wichtige Praxissituationen.
Googles Leistungsangaben für Extended Thinking
Google nennt für Gemini 3.8 Live Extended Thinking einen Wert von 82,6 im Speech to Speech Quality Index von Artificial Analysis. Außerdem gibt Google 68,6 Prozent bei τ-Voice, 35,1 Prozent beim Sierra-τ-Voice-Banking-Benchmark und 97,7 Prozent bei Big Bench Audio an.
Diese Zahlen beziehen sich auf die von Google genannten Tests und Messgrößen. Sie beschreiben nicht automatisch die Leistung jedes Sprachagenten in jeder Produktionsumgebung. Google sagt außerdem, dass erzeugtes Audio mit SynthID wassergekennzeichnet wird.
Entwicklerzugang und Nutzung in Deutschland
Google nennt die Gemini API und Google AI Studio als Zugangswege für Entwickler. Für Deutschland ist Gemini 3.8 Live außerdem in Search Live verfügbar. Der Zugang zu den einzelnen Modellen und Produkten kann sich nach Modell, Produkt, Konto, Tarif und Markt unterscheiden.
Die beiden Modelle sind damit vor allem für Entwickler interessant, die Sprachagenten mit visueller Verarbeitung, Hintergrundaktionen und mehrstufigem Denken verbinden wollen. Gemini 3.8 Live setzt den Schwerpunkt auf Tempo und Skalierung; Extended Thinking auf anspruchsvollere Abläufe, bei denen der Dialog während der Verarbeitung aktiv bleiben soll.