Em 15 de setembro de 2026, o Google anunciou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, dois modelos de diálogo ao vivo voltados a agentes de voz. A diferença central é simples: o Gemini 3.8 Live prioriza conversas fluidas em implantações eficientes e de alto volume, enquanto o Extended Thinking foi projetado para tarefas complexas, com várias etapas de raciocínio, sem interromper a conversa.
Os modelos recebem texto, imagens, vídeo, áudio e PDFs, além de produzir texto e áudio. Também podem executar ferramentas e chamadas de API em segundo plano enquanto o diálogo prossegue — a mudança que aproxima o assistente de um agente capaz de agir, e não apenas de responder.
Gemini 3.8 Live e Extended Thinking: qual é a diferença?
| Dimensão | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
| Foco principal | Agentes de voz eficientes, escaláveis e com diálogo fluido | Fluxos de trabalho complexos que exigem raciocínio em várias etapas |
| Comportamento durante tarefas longas | Mantém a conversa enquanto executa ferramentas e chamadas de API em segundo plano | Raciocina e fala simultaneamente, com indicações de progresso durante operações demoradas |
| Entrada | Texto, imagem, vídeo, áudio e PDF | Texto, imagem, vídeo, áudio e PDF |
| Saída | Texto e áudio | Texto e áudio |
| Limite de entrada | 128.000 tokens | 128.000 tokens |
| Limite de saída | 64.000 tokens | 64.000 tokens |
A escolha depende do trabalho. Um atendimento com grande volume de chamadas tende a se encaixar na proposta do Gemini 3.8 Live. Já uma tarefa que exige planejamento, consulta a ferramentas e várias decisões intermediárias se aproxima do objetivo do Extended Thinking.
O que os modelos fazem enquanto você fala
O Google afirma que os dois modelos conseguem acionar ferramentas e APIs em segundo plano enquanto a conversa continua. Na prática, o diálogo não precisa parar completamente para que uma operação seja concluída. No Extended Thinking, o modelo também pode verbalizar o andamento do trabalho com frases como “Deixe-me verificar isso...” enquanto processa uma tarefa mais longa.
Essa experiência depende de uma conexão de áudio bidirecional. A Gemini Live API usa conexões WebSocket com estado, mantendo o fluxo aberto para que áudio de entrada e de saída circule nos dois sentidos. A documentação técnica do Google descreve uma arquitetura com navegador, backend e Gemini Live, além de uma fila para organizar as solicitações em tempo real.
O Gemini 3.8 Live também processa contexto visual em tempo quase real e, segundo o Google, detecta e alterna automaticamente entre 97 idiomas durante uma conversa. Isso permite combinar voz com imagens, vídeos e outros arquivos no mesmo fluxo, em vez de limitar a interação a uma sequência de áudio convertido em texto.
O áudio gerado pelos modelos recebe marca d’água com o SynthID, tecnologia do Google para identificar conteúdo produzido por IA.
Onde o Google lista acesso aos modelos
Para desenvolvedores, o Google lista o Google AI Studio, a Gemini API e a Google Enterprise Agent Platform como pontos de acesso ao Gemini 3.8 Live e ao Gemini 3.8 Live Extended Thinking.
O Google também lista o Gemini 3.8 Live em experiências como o Search Live e o Extended Thinking no Gemini App e em experiências selecionadas do Google Workspace. No Workspace, os recursos Live abrangem Gmail, Docs e Keep para os públicos e produtos contemplados pelo lançamento.
O que os números de desempenho medem
O Google divulgou quatro resultados para o Gemini 3.8 Live Extended Thinking em avaliações diferentes: 82,6 no Speech to Speech Quality Index da Artificial Analysis, 68,6% no τ-Voice, 35,1% no τ-Voice-banking da Sierra e 97,7% no Big Bench Audio.
Esses valores não formam uma única nota geral. Cada número pertence a uma avaliação própria, com métrica e objetivo específicos. O Google também afirma que o Gemini 3.8 Live ficou em segundo lugar na Speech Agent Arena.
A separação importa porque qualidade de voz, execução de tarefas, desempenho em fluxos bancários e compreensão de áudio medem aspectos diferentes de um agente. Uma pontuação alta em uma dessas avaliações não resume, sozinha, toda a experiência de uso.
A mudança de assistente de voz para agente ao vivo
O lançamento coloca a conversa no centro, mas amplia o que pode acontecer durante ela. O Gemini 3.8 Live foi apresentado como uma opção para interações rápidas e em escala; o Extended Thinking acrescenta uma camada de raciocínio contínuo para trabalhos que não cabem em uma resposta imediata.
Para quem desenvolve produtos, a combinação de áudio, contexto visual e chamadas de ferramentas abre espaço para agentes que consultam dados, executam ações e continuam conversando no mesmo fluxo. Para quem usa o Gemini, a diferença mais perceptível será o tipo de tarefa: respostas ágeis e numerosas de um lado; operações mais elaboradas, com progresso falado, do outro.