Google ha annunciato il 15 settembre 2026 Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, due modelli audio progettati per agenti vocali capaci di conversare in tempo reale, analizzare input visivi e usare strumenti senza fermare il dialogo. In Italia, l’accesso per gli sviluppatori è indicato attraverso Gemini API e Google AI Studio.

La novità non è soltanto una voce più naturale: è la possibilità di mantenere attiva la conversazione mentre il sistema esegue chiamate a strumenti o API. La variante Extended Thinking aggiunge il ragionamento in più passaggi e può raccontare i propri progressi mentre lavora.

Due modelli, due lavori diversi

Gemini 3.8 Live è orientato a dialoghi vocali fluidi, a bassa latenza e scalabili. È il modello pensato per gestire molte interazioni mantenendo il ritmo della conversazione e usando il contesto visivo quasi in tempo reale.

Gemini 3.8 Live Extended Thinking punta invece su attività più complesse. Google lo descrive come un modello in grado di ragionare e parlare contemporaneamente, fornendo segnali di avanzamento durante le operazioni più lunghe.

CaratteristicaGemini 3.8 LiveGemini 3.8 Live Extended Thinking
Obiettivo principaleDialoghi vocali rapidi, fluidi e scalabiliAttività complesse con ragionamento in più passaggi
Uso di strumenti e API durante il dialogo
Input visivoElaborazione quasi in tempo realeSupportato nell’interazione multimodale dal vivo
Ragionamento durante la conversazioneOttimizzato per velocità e continuitàPuò ragionare e parlare insieme, con aggiornamenti sui progressi
Integrazione per sviluppatoriGemini API e Google AI StudioGemini API e Google AI Studio

Il cambio decisivo avviene mentre la conversazione continua

Dimostrazione ufficiale di Gemini Live API: chiamate asincrone, audio proattivo e inserimento del contesto

Con Gemini Live API, una chiamata a uno strumento può essere eseguita in background senza trasformare ogni richiesta in una sequenza rigida di domanda, attesa e risposta. La dimostrazione ufficiale di Google mostra chiamate asincrone a funzioni, audio proattivo, inserimento di contesto tramite send_client_content e registri in tempo reale per le chiamate agli strumenti.

In pratica, un agente può ricevere nuovo contesto, recuperare dati da un sistema esterno o lavorare su un compito più articolato mentre l’interazione vocale resta aperta. Extended Thinking applica lo stesso principio al ragionamento: invece di interrompere il dialogo, può comunicare i propri progressi mentre porta avanti l’elaborazione.

97 lingue e input visivo

Google afferma che Gemini 3.8 Live può rilevare e gestire il passaggio automatico tra 97 lingue supportate nel corso della stessa conversazione. Il modello può inoltre elaborare input visivi quasi in tempo reale, una funzione utile per agenti che devono interpretare ciò che l’utente inquadra o condivide.

Il conteggio delle lingue, però, descrive la copertura dichiarata da Google: per un agente vocale operativo contano anche la gestione delle interruzioni, la comprensione in ambienti rumorosi, gli accenti, la conferma di nomi e numeri e il recupero dopo una chiamata interrotta. Sono tutti passaggi che incidono sull’esperienza concreta più della semplice quantità di lingue disponibili.

I numeri dichiarati da Google

Per Gemini 3.8 Live Extended Thinking, Google riporta un punteggio di 82,6 nello Speech to Speech Quality Index di Artificial Analysis, 68,6% nel benchmark τ-Voice per il completamento di attività agentiche, 35,1% nel benchmark bancario τ-Voice di Sierra e 97,7% in Big Bench Audio.

Questi valori appartengono alle valutazioni citate da Google e riguardano metriche diverse: non sono un unico punteggio generale. Anche una comparazione di LiveKit su sei esecuzioni ha osservato due chiamate riuscite su tre per Gemini 3.8 Live e tre su tre per Gemini 3.8 Live Extended Thinking, con quattro-otto segmenti vocali di avanzamento prima di ogni chiamata nel secondo caso. Quel campione riguarda soltanto quelle esecuzioni e il compito di disegno usato nella prova.

Accesso per gli sviluppatori in Italia

Per gli sviluppatori italiani, l’accesso ai nuovi modelli è indicato attraverso Gemini API e Google AI Studio. Google elenca inoltre canali come Search Live, Gemini Live, alcune esperienze di Gemini e superfici selezionate di Workspace, ma l’accesso varia in base al modello, al prodotto, al piano, all’account e al mercato.

Il risultato è un aggiornamento rivolto soprattutto a chi costruisce agenti vocali: non soltanto sistemi capaci di rispondere a voce, ma applicazioni che possono ascoltare, vedere, chiamare strumenti e continuare a lavorare senza spezzare ogni volta il filo della conversazione.