Il 15 settembre 2026 Google ha presentato Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, due modelli vocali in tempo reale pensati per trasformare una conversazione in un flusso di lavoro. Il primo privilegia velocità e scalabilità per gli agenti vocali; il secondo affronta attività complesse e ragionamenti a più passaggi continuando a parlare con l’utente.
La differenza non è soltanto nel nome. Google sta proponendo due strumenti per due ritmi di lavoro: un modello per mantenere il dialogo rapido e naturale, l’altro per gestire richieste più impegnative senza lasciare l’interlocutore davanti a un lungo silenzio.
Gemini 3.8 Live e Extended Thinking: quale modello fa cosa
| Dimensione | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
| Obiettivo principale | Agenti vocali efficienti e implementazioni ad alto volume | Flussi di lavoro complessi con ragionamento a più passaggi |
| Conversazione | Dialogo vocale fluido e reattivo | Ragionamento e conversazione simultanei |
| Operazioni in background | Esecuzione di strumenti e chiamate API mentre il dialogo continua | Esecuzione di strumenti e operazioni in background con aggiornamenti vocali sul progresso |
| Input | Testo, immagini, video, audio e PDF | Testo, immagini, video, audio e PDF |
| Output | Testo e audio | Testo e audio |
| Contesto | Fino a 128.000 token in ingresso e 64.000 in uscita | Fino a 128.000 token in ingresso e 64.000 in uscita |
In pratica, Gemini 3.8 Live è la scelta più lineare per un agente che deve sostenere molte conversazioni con tempi di risposta contenuti. Gemini 3.8 Live Extended Thinking è invece pensato per richieste nelle quali servono pianificazione, passaggi intermedi e uso coordinato di più strumenti.
Cosa possono fare mentre stai parlando
I due modelli accettano testo, immagini, video, audio e PDF e producono risposte testuali e vocali. Gemini 3.8 Live può inoltre riconoscere il contesto visivo quasi in tempo reale e passare automaticamente da una lingua all’altra tra 97 lingue supportate durante la conversazione.
La caratteristica più interessante riguarda però il lavoro in parallelo: Google afferma che i modelli possono eseguire strumenti e chiamate API in background mentre il dialogo prosegue. Un agente può quindi occuparsi di un’operazione senza interrompere del tutto lo scambio vocale.
Con Gemini 3.8 Live Extended Thinking, Google descrive anche una modalità in cui il modello ragiona e parla contemporaneamente. Durante un’attività più lunga può fornire aggiornamenti vocali, come «Lasciami controllare…», invece di restare completamente in silenzio fino alla risposta finale.
Il Gemini Live API si basa su una connessione WebSocket persistente e bidirezionale: audio e risposta viaggiano nello stesso scambio continuo, più simile a una telefonata che a una sequenza rigida di registrazione, trascrizione e risposta. Per gli sviluppatori, questo approccio è pensato per mantenere il flusso naturale della conversazione e coordinare le operazioni dell’agente.
Accesso attraverso gli strumenti Google
Google indica Google AI Studio e il Gemini API come punti di accesso per gli sviluppatori. La disponibilità comprende anche Google Enterprise Agent Platform. Per gli utenti, Google elenca superfici come Google Search Live, l’app Gemini e alcune esperienze di Google Workspace.
Le funzioni Gemini Live riguardano inoltre Gmail, Docs e Keep nell’ambito di Google Workspace. La loro presenza concreta dipende dal prodotto e dal tipo di accesso associato all’account: non esiste quindi un unico percorso identico per ogni utilizzo.
Per chi sviluppa un agente vocale, la distinzione è più netta: Google AI Studio e Gemini API sono gli ingressi indicati per costruire e integrare esperienze basate sui modelli. Per chi usa i servizi Google come consumatore, l’esperienza passa invece dalle singole applicazioni che integrano Gemini Live.
Cosa misurano i numeri dei benchmark
Google riporta per Gemini 3.8 Live Extended Thinking un punteggio di 82,6 nello Speech to Speech Quality Index di Artificial Analysis. Nello stesso annuncio attribuisce al modello il 68,6% nel benchmark τ-Voice, il 35,1% nel benchmark τ-Voice dedicato al banking di Sierra e il 97,7% in Big Bench Audio.
Si tratta di risultati appartenenti a valutazioni diverse: non formano un unico punteggio generale e non misurano tutti la stessa cosa. Google riferisce inoltre che Gemini 3.8 Live si è classificato al secondo posto nella Speech Agent Arena.
La lettura utile, per chi deve scegliere un modello, è questa: i numeri descrivono prove specifiche su qualità vocale, completamento di attività e prestazioni in scenari differenti. Non sostituiscono la valutazione del singolo agente, del flusso di lavoro o degli strumenti che dovrà utilizzare.
Un modello vocale che prova a diventare un agente
La novità di Gemini 3.8 Live non è soltanto la possibilità di parlare con un’intelligenza artificiale. Il punto è collegare la conversazione a un’azione: consultare dati, chiamare un’API, lavorare su un documento o proseguire un’attività senza spezzare il dialogo.
Gemini 3.8 Live Extended Thinking spinge questa idea verso incarichi più articolati, nei quali il sistema deve coordinare più passaggi e comunicare verbalmente l’avanzamento. Gemini 3.8 Live, invece, concentra la proposta sulla continuità della conversazione e sulla possibilità di sostenere implementazioni ad alto volume.
L’audio generato dai modelli viene inoltre contrassegnato con SynthID, la tecnologia di Google per l’identificazione dei contenuti generati. La presentazione del 15 settembre 2026 segna così un passaggio dai semplici assistenti vocali a sistemi che conversano, elaborano informazioni e avviano operazioni durante lo stesso scambio.