Google kondigde op 15 september 2026 Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking aan. De twee live-dialoogmodellen combineren audio met tekst, afbeeldingen, video en pdf's. Gemini 3.8 Live is gericht op snelle spraakagenten die op grote schaal kunnen worden ingezet; Extended Thinking is bedoeld voor complexe workflows met meerdere stappen en kan tijdens het redeneren blijven praten.

Twee modellen, twee verschillende taken

Google positioneert Gemini 3.8 Live als de keuze voor efficiënte, grootschalige spraakinteractie. Het model moet gesprekken vloeiend houden en ondertussen tools of API-aanroepen op de achtergrond uitvoeren.

Gemini 3.8 Live Extended Thinking legt het accent anders. Dit model is ontworpen voor taken waarbij meerdere stappen en uitgebreider redeneren nodig zijn. Tijdens zo'n proces kan het gesproken voortgang geven, bijvoorbeeld met een melding als “Ik ga dat even controleren...”, in plaats van volledig stil te vallen.

EigenschapGemini 3.8 LiveGemini 3.8 Live Extended Thinking
Gericht opEfficiënte, grootschalige spraakagentenComplexe workflows met meerdere stappen
GespreksgedragVloeiende live-dialoog met achtergrondtakenRedeneren en spreken tegelijk, met gesproken voortgang
InvoerTekst, afbeelding, video, audio en pdfTekst, afbeelding, video, audio en pdf
UitvoerTekst en audioTekst en audio
Invoertokenlimiet128.000 tokens128.000 tokens
Uitvoertokenlimiet64.000 tokens64.000 tokens
Gereedschappen en API'sUitvoering op de achtergrond tijdens het gesprekUitvoering op de achtergrond tijdens het gesprek

De praktische vuistregel is helder: Live is de variant voor tempo en schaal, terwijl Extended Thinking meer ruimte maakt voor lastige opdrachten waarbij de assistent meerdere handelingen moet coördineren.

Wat Gemini Live tijdens een gesprek kan doen

Google lanceerde twee Gemini 3.8 Live-modellen voor realtime spraak-AI

De modellen accepteren audio, tekst, afbeeldingen, video en pdf's. Gemini 3.8 Live kan volgens Google visuele input vrijwel in realtime verwerken en tijdens een gesprek automatisch schakelen tussen 97 talen.

Beide modellen kunnen tools en API-aanroepen op de achtergrond uitvoeren terwijl de gesproken interactie doorgaat. Daardoor hoeft een agent niet eerst stil te worden voordat een externe handeling klaar is. Extended Thinking koppelt die achtergrondverwerking aan gesproken voortgang, zodat de gebruiker hoort dat het model nog bezig is met een meerstapstaak.

De Gemini Live API gebruikt een toestandbehoudende WebSocket-verbinding voor tweerichtingscommunicatie. Audio kan daardoor continu heen en weer stromen, in plaats van via een reeks losse stappen van spraak-naar-tekst en tekst-naar-spraak. Voor ontwikkelaars betekent dat een architectuur die dichter bij een telefoongesprek ligt dan bij een walkietalkie.

Google stelt daarnaast dat gegenereerde audio van SynthID-watermerken wordt voorzien.

Waar zijn de modellen toegankelijk?

Google noemt Google AI Studio en de Gemini API als toegangspunten voor ontwikkelaars. Ook het Gemini Enterprise Agent Platform staat op de lijst met ontwikkelaars- en bedrijfsproducten. Voor ontwikkelaars in Nederland wordt toegang via de Gemini API en Google AI Studio gemeld.

Google noemt daarnaast Google Search Live, de Gemini-app en geselecteerde Workspace-ervaringen als toegangspunten voor gebruikers. De beschikbaarheid hangt daarbij af van het specifieke Google-product en de bijbehorende abonnements- of gebruikersvoorwaarden.

Binnen Google Workspace gaat het om livefuncties voor onder meer Gmail, Docs en Keep. De functies zijn bedoeld om zoeken, notities maken en brainstormen via een gesprek uit te voeren.

Wat zeggen de benchmarkcijfers?

Google rapporteert voor Gemini 3.8 Live Extended Thinking een score van 82,6 op Artificial Analysis' Speech to Speech Quality Index. Daarnaast noemt Google 68,6% op τ-Voice, 35,1% op Sierra's τ-Voice-bankingbenchmark en 97,7% op Big Bench Audio. Voor de standaardversie Gemini 3.8 Live rapporteert Google een tweede plaats in de Speech Agent Arena.

Deze cijfers komen uit verschillende evaluaties met verschillende meetopzetten. Ze vormen dus geen enkele algemene prestatiescore. De cijfers beschrijven bovendien door Google gerapporteerde resultaten; de beschikbare informatie bevat geen onafhankelijke reproductie van alle genoemde tests.

Wat dit betekent voor ontwikkelaars

De belangrijkste verandering zit niet alleen in een natuurlijker klinkend gesprek. Gemini 3.8 Live is opgezet als een interface die tijdens het praten externe handelingen kan uitvoeren. Een ontwikkelaar kan audio, visuele context en tools in één live-ervaring combineren.

Extended Thinking past beter bij workflows waarin de agent meerdere stappen moet doorlopen en de gebruiker tijdens het proces op de hoogte moet houden. Denk aan een gesprek waarin informatie wordt opgehaald, een tool wordt aangeroepen en het antwoord daarna verder wordt uitgewerkt. De keuze tussen beide modellen draait daarmee vooral om de verhouding tussen reactiesnelheid, schaal en de complexiteit van de taak.