Google kondigde op 15 september 2026 Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking aan. De twee realtime-audiomodellen zijn ontworpen voor spraakagenten die tijdens een gesprek visuele input verwerken, tools en API's aanroepen en — bij Extended Thinking — complexe taken blijven beredeneren zonder het gesprek stil te leggen.
Twee modellen, twee verschillende taken
| Onderdeel | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
| Hoofddoel | Snelle, schaalbare realtimegesprekken | Complexe taken met meerstapsredenering |
| Gespreksgedrag | Gericht op vloeiende dialoog met visuele input | Kan redeneren en spreken tegelijk, met voortgangssignalen tijdens langer werk |
| Tools en API's | Kunnen op de achtergrond worden aangeroepen terwijl het gesprek doorgaat | Kunnen op de achtergrond worden aangeroepen terwijl het gesprek en de redenering doorgaan |
| Ontwikkelaarstoegang | Gemini API en Google AI Studio | Gemini API en Google AI Studio |
De praktische keuze is daarmee vrij helder: Live is bedoeld voor snelheid en schaal, terwijl Extended Thinking meer ruimte maakt voor workflows met meerdere stappen. Google beschrijft die tweede variant als een model dat tijdens het spreken kan blijven redeneren en de voortgang van dat werk kan melden.
Het belangrijke verschil zit in wat er tijdens het gesprek gebeurt
Een traditionele spraakassistent wacht vaak op een antwoord voordat de volgende actie begint. Gemini 3.8 Live is ontworpen om dat patroon losser te maken. Tools en API-aanroepen kunnen op de achtergrond draaien terwijl de dialoog doorgaat. Het model kan bovendien visuele input bijna realtime verwerken.
De officiële demonstratie van de Gemini Live API laat asynchrone functieaanroepen, proactieve audio, contextinjectie via send_client_content en realtime logboeken voor toolaanroepen zien. In de demonstratie haalt de agent gegevens op uit een database terwijl de interactie actief blijft. Bij Extended Thinking wordt daarnaast getoond hoe het model tijdens complexer werk blijft praten en redeneren.
Voor ontwikkelaars is dat meer dan een nieuwe stemlaag. De kern zit in de combinatie van beurtwisseling, context en acties: een agent kan een gesprek voortzetten, nieuwe context ontvangen en ondertussen een tool laten werken. Dat is precies het soort gedrag dat nodig is voor steminterfaces die meer moeten doen dan een antwoord voorlezen.
97 talen en door Google gemelde benchmarks
Google zegt dat de Live-modellen tijdens één gesprek automatisch kunnen detecteren wanneer iemand van taal wisselt en kunnen overschakelen tussen 97 ondersteunde talen. Taaldekking is daarbij slechts één onderdeel van een bruikbare spraakagent; de modellen moeten ook context, onderbrekingen en acties goed verwerken.
Voor Gemini 3.8 Live Extended Thinking rapporteert Google een score van 82,6 op de Speech to Speech Quality Index van Artificial Analysis. Het bedrijf noemt daarnaast 68,6 procent op τ-Voice, 35,1 procent op Sierra's τ-Voice-benchmark voor banktaken en 97,7 procent op Big Bench Audio. Die cijfers horen bij de door Google aangehaalde evaluaties van Extended Thinking.
De modellen zijn volgens Google bovendien voorzien van SynthID-watermerking in gegenereerde audio. Daarmee koppelt Google de gesproken uitvoer aan zijn eigen systeem voor herkomstmarkering van door AI gegenereerde media.
Toegang voor ontwikkelaars in Nederland
Nederlandse ontwikkelaars konden Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking vanaf de lancering gebruiken via de Gemini Live API en Google AI Studio. Google noemt daarnaast verschillende productkanalen voor consumenten en zakelijke gebruikers, maar toegang verschilt per model, product, account, abonnement en markt.
Voor ontwikkelaars betekent de lancering vooral dat beide modellen rechtstreeks beschikbaar zijn in dezelfde Google-omgeving voor realtime toepassingen. Live past bij een agent die snel moet reageren en op schaal gesprekken voert; Extended Thinking ligt meer voor de hand wanneer een taak meerdere stappen, toolgebruik en voortgang tijdens het redeneren vraagt.