Google anunció el 15 de septiembre de 2026 Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de audio en tiempo real diseñados para agentes de voz. La diferencia clave frente a un asistente que simplemente responde consiste en que pueden mantener la conversación mientras procesan imágenes, ejecutan herramientas y, en el caso de Extended Thinking, trabajan en tareas de razonamiento multietapa.

Dos modelos, dos trabajos distintos

Gemini 3.8 Live está pensado para diálogos fluidos, baja latencia y despliegues a escala. Google también le atribuye procesamiento visual casi en tiempo real, de modo que un agente puede combinar voz e imágenes dentro de la misma interacción.

Gemini 3.8 Live Extended Thinking apunta a tareas más complejas. Puede razonar y hablar de forma simultánea, además de ofrecer indicaciones de progreso mientras completa trabajo en segundo plano. En la práctica, la elección depende de la prioridad: conversación rápida y escalable con Live, o razonamiento más profundo para flujos de trabajo con varios pasos mediante Extended Thinking.

AspectoGemini 3.8 LiveGemini 3.8 Live Extended Thinking
EnfoqueDiálogo de voz rápido, fluido y escalableTareas complejas con razonamiento multietapa
Entrada visualProcesamiento casi en tiempo realInteracción multimodal en directo
Herramientas y APIPueden ejecutarse mientras continúa la conversaciónPueden ejecutarse mientras continúan la conversación y el razonamiento
Conversación durante el trabajoMantiene el diálogo mientras se ejecutan accionesMantiene el diálogo y puede narrar el progreso del razonamiento

El cambio importante ocurre mientras la conversación sigue abierta

Demostración del Gemini Live API con llamadas asíncronas, audio proactivo, inyección de contexto y razonamiento en segundo plano

Google presenta Gemini 3.8 Live como un sistema que no tiene que detener el intercambio de voz cada vez que necesita realizar una acción. Las llamadas a herramientas y API pueden ejecutarse en segundo plano mientras el agente sigue conversando.

La demostración del Gemini Live API muestra llamadas de funciones asíncronas, audio proactivo, inyección de contexto mediante send_client_content y registros visibles de las llamadas y sus resultados. El audio proactivo permite que el sistema intervenga cuando el contexto lo requiere, mientras que la inyección de contexto añade información a la sesión sin convertirla necesariamente en un nuevo turno de voz.

En Extended Thinking, esa continuidad se aplica también al razonamiento. El modelo puede seguir hablando mientras trabaja en una tarea más larga y comunicar avances en lugar de desaparecer durante el procesamiento. Es una diferencia de arquitectura con consecuencias prácticas para agentes que consultan datos, llaman a servicios externos o encadenan varias acciones.

La comparación práctica entre Live y Extended Thinking

Una comparación de seis ejecuciones realizada con el mismo aviso, herramienta y código de sesión registró dos llamadas correctas de la herramienta de dibujo en tres sesiones con Gemini 3.8 Live, frente a tres de tres con Gemini 3.8 Live Extended Thinking. En este último caso también se observaron entre cuatro y ocho segmentos audibles de progreso antes de cada llamada.

Ese resultado describe esas seis ejecuciones concretas. Sirve para visualizar cómo cambia el comportamiento de los dos modelos: Live prioriza la interacción directa, mientras que Extended Thinking hace visible parte del trabajo que realiza antes de completar una acción.

97 idiomas y resultados comunicados por Google

Google afirma que los modelos Live pueden detectar el idioma y cambiar automáticamente entre 97 idiomas compatibles durante una conversación. La cifra se refiere a la transición en mitad del diálogo, no solo a una lista de idiomas disponibles para entrada o salida.

Para Gemini 3.8 Live Extended Thinking, Google comunica una puntuación de 82,6 en el Speech to Speech Quality Index de Artificial Analysis, un 68,6 % en τ-Voice, un 35,1 % en la prueba bancaria τ-Voice de Sierra y un 97,7 % en Big Bench Audio. Son resultados presentados por Google para ese modelo y cada métrica corresponde a una evaluación distinta.

Google también afirma que el audio generado incorpora una marca de agua SynthID. La medida está pensada para identificar el origen generado del audio sin alterar el funcionamiento conversacional descrito para los modelos.

Acceso para desarrolladores en España

En España, Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking están disponibles para desarrolladores mediante Gemini API y Google AI Studio. Google también enumera canales de despliegue para usuarios, entre ellos Search Live, Gemini Live y determinadas experiencias de Gemini, Docs, Gmail y Keep; el acceso depende del modelo, el producto, el plan y el mercado.

Para quienes construyen agentes, el punto de entrada es el Gemini Live API: permite combinar conversación de voz, entrada visual, contexto adicional y llamadas a herramientas dentro de una misma sesión. Ahí está el salto que Google intenta vender con esta generación: no solo hablar con una IA, sino mantener el hilo mientras la IA hace algo más.