Google hat am 15. September 2026 Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking vorgestellt. Die beiden Live-Dialogmodelle sollen Sprachagenten näher an ein laufendes Gespräch bringen: Gemini 3.8 Live setzt auf schnelle, skalierbare Interaktion, während Extended Thinking für komplexe Aufgaben mit mehreren Schritten ausgelegt ist.
Zwei Modelle, zwei Einsatzprofile
Google positioniert Gemini 3.8 Live als Modell für hohe Gesprächsgeschwindigkeit und große Einsatzmengen. Extended Thinking richtet sich an Abläufe, bei denen das System länger planen, Werkzeuge nutzen oder mehrere Zwischenschritte verarbeiten muss.
| Merkmal | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
| Ziel | Schnelle, skalierbare Sprachagenten | Komplexe, mehrstufige Arbeitsabläufe |
| Eingaben | Text, Bild, Video, Audio und PDF | Text, Bild, Video, Audio und PDF |
| Ausgaben | Text und Audio | Text und Audio |
| Kontextfenster | 128.000 Token | 128.000 Token |
| Maximale Ausgabe | 64.000 Token | 64.000 Token |
| Gesprächsverhalten | Flüssiger Live-Dialog und Hintergrund-Tools | Gleichzeitiges Schlussfolgern und Sprechen mit gesprochenen Fortschrittsmeldungen |
Der praktische Unterschied ist schnell erklärt: Für einen Support-Agenten mit vielen parallelen Gesprächen passt Gemini 3.8 Live zum von Google beschriebenen Einsatzprofil. Muss ein Agent dagegen einen mehrstufigen Vorgang bearbeiten, ist Extended Thinking dafür vorgesehen. Beide Modelle können Werkzeuge und API-Aufrufe im Hintergrund ausführen.
Sprechen, sehen und im Hintergrund arbeiten
Gemini 3.8 Live verarbeitet laut Google Text, Bilder, Videos, Audio und PDFs. Das Modell kann visuelle Eingaben nahezu in Echtzeit einbeziehen und während eines Gesprächs automatisch zwischen 97 unterstützten Sprachen wechseln.
Auch die Interaktion ist nicht auf Frage und Antwort in getrennten Blöcken beschränkt. Die Gemini Live API verwendet eine zustandsbehaftete WebSocket-Verbindung für bidirektionales Streaming. So können Audioeingaben und Audioausgaben über eine offene Verbindung laufen, statt den Dialog in eine reine Sprache-zu-Text- und Text-zu-Sprache-Kette aufzuteilen.
Bei Extended Thinking soll der Dialog während längerer Verarbeitung nicht einfach verstummen. Google beschreibt gesprochene Zwischenmeldungen wie „Let me check that...“, während das Modell im Hintergrund weiterarbeitet. Das ist für Aufgaben relevant, bei denen ein Agent etwa Daten abruft, einen API-Aufruf ausführt oder mehrere Arbeitsschritte verbindet.
Die generierte Audioausgabe wird laut Google mit SynthID gekennzeichnet. Dabei handelt es sich um Googles Technologie zur Wasserkennzeichnung KI-generierter Inhalte.
Wo der Zugriff vorgesehen ist
Google DeepMind führt Google AI Studio, die Gemini API und die Gemini Enterprise Agent Platform als Zugänge für Entwickler und Unternehmen auf. Für weitere Produktflächen nennt Google unter anderem Google Search Live, die Gemini App und ausgewählte Google-Workspace-Erfahrungen.
Für Deutschland wurde der Zugang zu Gemini Live in Google Search Live berichtet. Die konkrete Nutzung hängt dabei von der jeweiligen Produktfläche und deren Berechtigung ab. Google Workspace umfasst Gmail Live, Docs Live und Keep Live als Gesprächsfunktionen; für Geschäftskonten wurde die Bereitstellung als bevorstehend beschrieben.
Was die Benchmark-Werte aussagen
Google meldet für Gemini 3.8 Live Extended Thinking einen Wert von 82,6 im Speech to Speech Quality Index von Artificial Analysis. Hinzu kommen 68,6 Prozent bei τ-Voice, 35,1 Prozent im Sierra-τ-Voice-Banking-Benchmark und 97,7 Prozent bei Big Bench Audio. Für das normale Gemini 3.8 Live nennt Google den zweiten Platz in der Speech Agent Arena.
Diese Zahlen stammen aus unterschiedlichen Bewertungen und messen nicht dieselbe Eigenschaft. Ein einzelner Gesamtwert für die allgemeine Qualität der beiden Modelle lässt sich daraus nicht ableiten. Für die Auswahl bleibt deshalb die von Google beschriebene Trennung entscheidend: Gemini 3.8 Live steht für schnelle Gespräche in größerem Maßstab, Extended Thinking für aufwendigere Abläufe mit hörbarem Fortschritt während der Verarbeitung.