Em 15 de setembro de 2026, o Google anunciou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, dois modelos de diálogo ao vivo voltados a agentes de voz. A diferença central é simples: o Gemini 3.8 Live prioriza conversas fluidas em implantações eficientes e de alto volume, enquanto o Extended Thinking foi projetado para tarefas complexas, com várias etapas de raciocínio, sem interromper a conversa.

Os modelos recebem texto, imagens, vídeo, áudio e PDFs, além de produzir texto e áudio. Também podem executar ferramentas e chamadas de API em segundo plano enquanto o diálogo prossegue — a mudança que aproxima o assistente de um agente capaz de agir, e não apenas de responder.

Gemini 3.8 Live e Extended Thinking: qual é a diferença?

DimensãoGemini 3.8 LiveGemini 3.8 Live Extended Thinking
Foco principalAgentes de voz eficientes, escaláveis e com diálogo fluidoFluxos de trabalho complexos que exigem raciocínio em várias etapas
Comportamento durante tarefas longasMantém a conversa enquanto executa ferramentas e chamadas de API em segundo planoRaciocina e fala simultaneamente, com indicações de progresso durante operações demoradas
EntradaTexto, imagem, vídeo, áudio e PDFTexto, imagem, vídeo, áudio e PDF
SaídaTexto e áudioTexto e áudio
Limite de entrada128.000 tokens128.000 tokens
Limite de saída64.000 tokens64.000 tokens

A escolha depende do trabalho. Um atendimento com grande volume de chamadas tende a se encaixar na proposta do Gemini 3.8 Live. Já uma tarefa que exige planejamento, consulta a ferramentas e várias decisões intermediárias se aproxima do objetivo do Extended Thinking.

O que os modelos fazem enquanto você fala

Google lança Gemini 3.8 Live para conversas de voz com ferramentas em segundo plano

O Google afirma que os dois modelos conseguem acionar ferramentas e APIs em segundo plano enquanto a conversa continua. Na prática, o diálogo não precisa parar completamente para que uma operação seja concluída. No Extended Thinking, o modelo também pode verbalizar o andamento do trabalho com frases como “Deixe-me verificar isso...” enquanto processa uma tarefa mais longa.

Essa experiência depende de uma conexão de áudio bidirecional. A Gemini Live API usa conexões WebSocket com estado, mantendo o fluxo aberto para que áudio de entrada e de saída circule nos dois sentidos. A documentação técnica do Google descreve uma arquitetura com navegador, backend e Gemini Live, além de uma fila para organizar as solicitações em tempo real.

O Gemini 3.8 Live também processa contexto visual em tempo quase real e, segundo o Google, detecta e alterna automaticamente entre 97 idiomas durante uma conversa. Isso permite combinar voz com imagens, vídeos e outros arquivos no mesmo fluxo, em vez de limitar a interação a uma sequência de áudio convertido em texto.

O áudio gerado pelos modelos recebe marca d’água com o SynthID, tecnologia do Google para identificar conteúdo produzido por IA.

Onde o Google lista acesso aos modelos

Para desenvolvedores, o Google lista o Google AI Studio, a Gemini API e a Google Enterprise Agent Platform como pontos de acesso ao Gemini 3.8 Live e ao Gemini 3.8 Live Extended Thinking.

O Google também lista o Gemini 3.8 Live em experiências como o Search Live e o Extended Thinking no Gemini App e em experiências selecionadas do Google Workspace. No Workspace, os recursos Live abrangem Gmail, Docs e Keep para os públicos e produtos contemplados pelo lançamento.

O que os números de desempenho medem

O Google divulgou quatro resultados para o Gemini 3.8 Live Extended Thinking em avaliações diferentes: 82,6 no Speech to Speech Quality Index da Artificial Analysis, 68,6% no τ-Voice, 35,1% no τ-Voice-banking da Sierra e 97,7% no Big Bench Audio.

Esses valores não formam uma única nota geral. Cada número pertence a uma avaliação própria, com métrica e objetivo específicos. O Google também afirma que o Gemini 3.8 Live ficou em segundo lugar na Speech Agent Arena.

A separação importa porque qualidade de voz, execução de tarefas, desempenho em fluxos bancários e compreensão de áudio medem aspectos diferentes de um agente. Uma pontuação alta em uma dessas avaliações não resume, sozinha, toda a experiência de uso.

A mudança de assistente de voz para agente ao vivo

O lançamento coloca a conversa no centro, mas amplia o que pode acontecer durante ela. O Gemini 3.8 Live foi apresentado como uma opção para interações rápidas e em escala; o Extended Thinking acrescenta uma camada de raciocínio contínuo para trabalhos que não cabem em uma resposta imediata.

Para quem desenvolve produtos, a combinação de áudio, contexto visual e chamadas de ferramentas abre espaço para agentes que consultam dados, executam ações e continuam conversando no mesmo fluxo. Para quem usa o Gemini, a diferença mais perceptível será o tipo de tarefa: respostas ágeis e numerosas de um lado; operações mais elaboradas, com progresso falado, do outro.