Em 15 de setembro de 2026, o Google anunciou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, dois modelos de áudio em tempo real projetados para agentes de voz. A proposta central não é apenas falar com uma voz mais natural: é manter o diálogo ativo enquanto o sistema interpreta imagens, executa ferramentas e, no modelo Extended Thinking, trabalha em tarefas complexas.

Dois modelos, duas funções diferentes

O Gemini 3.8 Live foi desenvolvido para conversas ao vivo com baixa latência, escala e eficiência de custo. Ele pode receber entradas visuais, alternar automaticamente entre idiomas durante a conversa e executar chamadas de ferramentas ou de API enquanto o diálogo prossegue.

O Gemini 3.8 Live Extended Thinking mira tarefas mais complexas e com várias etapas. Ele pode raciocinar enquanto fala, dando sinais de progresso durante um processamento mais longo, em vez de encerrar a interação até ter uma resposta pronta.

CritérioGemini 3.8 LiveGemini 3.8 Live Extended Thinking
Foco principalDiálogo ao vivo rápido, escalável e eficienteTarefas complexas com raciocínio em várias etapas
Conversa durante o processamentoContinua enquanto ferramentas e chamadas de API são executadasContinua enquanto o modelo raciocina, fala e relata o progresso
Entrada visualProcessamento visual quase em tempo realInteração multimodal ao vivo com entrada visual
Uso de ferramentasChamadas podem ser executadas em segundo planoFerramentas e raciocínio em várias etapas podem ocorrer durante a fala
Acesso para desenvolvedoresGemini API e Google AI StudioGemini API e Google AI Studio

A diferença prática é simples: o Live prioriza o ritmo da conversa; o Extended Thinking aceita uma carga de raciocínio maior sem transformar a interação em um silêncio de espera.

O trabalho acontece enquanto a conversa continua

Veja a demonstração da Gemini Live API: chamadas assíncronas, áudio proativo e injeção de contexto

A demonstração oficial da Gemini Live API apresenta chamadas assíncronas de funções, áudio proativo, injeção de contexto por meio de send_client_content e registros em tempo real das chamadas e dos resultados das ferramentas. Em um fluxo de atendimento, por exemplo, o agente pode consultar dados em segundo plano e continuar a interação por voz.

O áudio proativo também permite que o sistema fale apenas quando o contexto exigir uma resposta. Já a injeção de contexto acrescenta informações à sessão sem depender de uma nova fala do usuário. É uma mudança importante para agentes de voz: a conversa deixa de ser uma sequência rígida de pergunta, espera e resposta.

97 idiomas e resultados de desempenho divulgados pelo Google

O Google afirma que os modelos Live conseguem detectar e alternar automaticamente entre 97 idiomas no meio de uma conversa. Para um agente de voz, essa capacidade combina reconhecimento do idioma com continuidade da sessão — sem exigir que o usuário reinicie o diálogo a cada mudança.

Para o Gemini 3.8 Live Extended Thinking, o Google também divulgou os seguintes resultados:

  • 82,6 no Speech to Speech Quality Index da Artificial Analysis;
  • 68,6% de conclusão de tarefas no τ-Voice;
  • 35,1% no benchmark bancário τ-Voice da Sierra;
  • 97,7% no Big Bench Audio.

Esses números são resultados apresentados pelo próprio Google em avaliações específicas. Eles descrevem métricas e condições desses testes, não uma garantia geral de desempenho em qualquer agente, idioma ou ambiente de produção.

O Google também afirma que o áudio gerado pelos modelos recebe marca d’água do SynthID.

Acesso para desenvolvedores no Brasil

No Brasil, o lançamento foi reportado com acesso para desenvolvedores pela Gemini API e pelo Google AI Studio. O anúncio do Google também lista canais como Search Live, Gemini Live, experiências selecionadas do Gemini, Docs, Gmail e Keep, além de uma prévia privada do Gemini Enterprise.

A disponibilidade para consumidores depende do modelo, do produto, do plano, da conta e do mercado. Por isso, a presença de uma opção do Gemini Live em um aplicativo não identifica, por si só, qual modelo está atendendo à sessão.

Para quem desenvolve agentes, a combinação mais relevante está na API: o Gemini 3.8 Live oferece a base de conversação em tempo real, enquanto o Gemini 3.8 Live Extended Thinking acrescenta raciocínio mais profundo e acompanhamento verbal do trabalho em andamento.