Em 15 de setembro de 2026, o Google anunciou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, dois modelos de áudio em tempo real projetados para agentes de voz. A proposta central não é apenas falar com uma voz mais natural: é manter o diálogo ativo enquanto o sistema interpreta imagens, executa ferramentas e, no modelo Extended Thinking, trabalha em tarefas complexas.
Dois modelos, duas funções diferentes
O Gemini 3.8 Live foi desenvolvido para conversas ao vivo com baixa latência, escala e eficiência de custo. Ele pode receber entradas visuais, alternar automaticamente entre idiomas durante a conversa e executar chamadas de ferramentas ou de API enquanto o diálogo prossegue.
O Gemini 3.8 Live Extended Thinking mira tarefas mais complexas e com várias etapas. Ele pode raciocinar enquanto fala, dando sinais de progresso durante um processamento mais longo, em vez de encerrar a interação até ter uma resposta pronta.
| Critério | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
| Foco principal | Diálogo ao vivo rápido, escalável e eficiente | Tarefas complexas com raciocínio em várias etapas |
| Conversa durante o processamento | Continua enquanto ferramentas e chamadas de API são executadas | Continua enquanto o modelo raciocina, fala e relata o progresso |
| Entrada visual | Processamento visual quase em tempo real | Interação multimodal ao vivo com entrada visual |
| Uso de ferramentas | Chamadas podem ser executadas em segundo plano | Ferramentas e raciocínio em várias etapas podem ocorrer durante a fala |
| Acesso para desenvolvedores | Gemini API e Google AI Studio | Gemini API e Google AI Studio |
A diferença prática é simples: o Live prioriza o ritmo da conversa; o Extended Thinking aceita uma carga de raciocínio maior sem transformar a interação em um silêncio de espera.
O trabalho acontece enquanto a conversa continua
A demonstração oficial da Gemini Live API apresenta chamadas assíncronas de funções, áudio proativo, injeção de contexto por meio de send_client_content e registros em tempo real das chamadas e dos resultados das ferramentas. Em um fluxo de atendimento, por exemplo, o agente pode consultar dados em segundo plano e continuar a interação por voz.
O áudio proativo também permite que o sistema fale apenas quando o contexto exigir uma resposta. Já a injeção de contexto acrescenta informações à sessão sem depender de uma nova fala do usuário. É uma mudança importante para agentes de voz: a conversa deixa de ser uma sequência rígida de pergunta, espera e resposta.
97 idiomas e resultados de desempenho divulgados pelo Google
O Google afirma que os modelos Live conseguem detectar e alternar automaticamente entre 97 idiomas no meio de uma conversa. Para um agente de voz, essa capacidade combina reconhecimento do idioma com continuidade da sessão — sem exigir que o usuário reinicie o diálogo a cada mudança.
Para o Gemini 3.8 Live Extended Thinking, o Google também divulgou os seguintes resultados:
- 82,6 no Speech to Speech Quality Index da Artificial Analysis;
- 68,6% de conclusão de tarefas no τ-Voice;
- 35,1% no benchmark bancário τ-Voice da Sierra;
- 97,7% no Big Bench Audio.
Esses números são resultados apresentados pelo próprio Google em avaliações específicas. Eles descrevem métricas e condições desses testes, não uma garantia geral de desempenho em qualquer agente, idioma ou ambiente de produção.
O Google também afirma que o áudio gerado pelos modelos recebe marca d’água do SynthID.
Acesso para desenvolvedores no Brasil
No Brasil, o lançamento foi reportado com acesso para desenvolvedores pela Gemini API e pelo Google AI Studio. O anúncio do Google também lista canais como Search Live, Gemini Live, experiências selecionadas do Gemini, Docs, Gmail e Keep, além de uma prévia privada do Gemini Enterprise.
A disponibilidade para consumidores depende do modelo, do produto, do plano, da conta e do mercado. Por isso, a presença de uma opção do Gemini Live em um aplicativo não identifica, por si só, qual modelo está atendendo à sessão.
Para quem desenvolve agentes, a combinação mais relevante está na API: o Gemini 3.8 Live oferece a base de conversação em tempo real, enquanto o Gemini 3.8 Live Extended Thinking acrescenta raciocínio mais profundo e acompanhamento verbal do trabalho em andamento.