Google anunció el 15 de septiembre de 2026 Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de diálogo en directo pensados para que los agentes de voz puedan conversar, interpretar contexto multimodal y trabajar con herramientas sin detener necesariamente la interacción. La variante Live prioriza la velocidad y la escala; Extended Thinking está diseñada para tareas complejas de varios pasos y puede verbalizar su progreso mientras razona.

Dos modelos para dos tipos de trabajo

La diferencia principal está en el tipo de carga que Google asigna a cada modelo: Gemini 3.8 Live apunta a agentes de voz eficientes y de alto volumen, mientras Gemini 3.8 Live Extended Thinking se orienta a flujos que requieren más razonamiento y varios pasos encadenados.

DimensiónGemini 3.8 LiveGemini 3.8 Live Extended Thinking
EnfoqueAgentes de voz eficientes y escalablesFlujos complejos con razonamiento de varios pasos
ConversaciónDiálogo fluido con ejecución de herramientas en segundo planoRazonamiento y conversación simultáneos, con indicaciones habladas de progreso
EntradasTexto, imágenes, vídeo, audio y PDFTexto, imágenes, vídeo, audio y PDF
SalidasTexto y audioTexto y audio
Contexto128.000 tokens de entrada y 64.000 de salida128.000 tokens de entrada y 64.000 de salida

La elección, por tanto, no se reduce a cuál es “más potente”. Para un servicio que debe atender muchas conversaciones con rapidez, el modelo Live encaja con la posición de Google. Para una tarea que exige planificar, consultar herramientas y enlazar varios pasos, Extended Thinking está pensado para mantener el intercambio hablado mientras procesa el trabajo.

Qué puede hacer Gemini mientras hablas

Google presenta Gemini 3.8 Live, voz con herramientas en segundo plano

Los dos modelos aceptan audio y generan audio, de modo que Gemini Live funciona como una conversación de voz bidireccional, no como una cadena obligatoria de dictado, transcripción y respuesta. En la práctica descrita para la API, la conexión persistente utiliza WebSocket y mantiene el flujo de audio en ambas direcciones.

Google también afirma que los modelos pueden ejecutar herramientas y llamadas a API en segundo plano mientras la conversación continúa. Eso permite que una aplicación delegue una operación y conserve el turno hablado en lugar de quedarse completamente en silencio. En Extended Thinking, Google plantea además respuestas de progreso como «Déjame comprobarlo…» mientras se completa una tarea más larga.

El diseño también es multimodal. Gemini 3.8 Live puede procesar texto, imágenes, vídeo, audio y PDF, y Google afirma que interpreta entradas visuales en tiempo casi real. Además, puede detectar y cambiar automáticamente entre 97 idiomas durante una conversación.

Eso abre una diferencia importante frente a un asistente de voz limitado a una orden aislada: el agente puede mantener el intercambio, recibir contexto visual y activar una operación externa dentro del mismo flujo. La capacidad concreta de actuar dependerá de las herramientas que la aplicación conecte al modelo; Google describe la ejecución de herramientas y API, no una lista universal de acciones disponibles en cualquier producto.

Dónde se puede acceder a los modelos

Google DeepMind enumera Google AI Studio, la API de Gemini y Gemini Enterprise Agent Platform como superficies para desarrolladores y empresas. También sitúa Gemini 3.8 Live en Google Search Live y experiencias seleccionadas de Google Workspace, mientras que Extended Thinking aparece además asociado a Gemini App y a otras experiencias seleccionadas de Workspace.

Para quien desarrolla un agente, la API es la puerta de entrada más clara: permite construir la conexión de voz y enlazar las herramientas que el producto necesite. Google AI Studio ofrece un punto de acceso desde el navegador, y Enterprise Agent Platform está orientada a despliegues empresariales.

Qué significan los números de rendimiento

Google comunica varios resultados para Gemini 3.8 Live Extended Thinking. Cada cifra pertenece a una evaluación diferente y mide una dimensión concreta; no forman una única nota general del modelo.

EvaluaciónResultado comunicado por GoogleModelo
Speech to Speech Quality Index de Artificial Analysis82,6Gemini 3.8 Live Extended Thinking
τ-Voice68,6 %Gemini 3.8 Live Extended Thinking
Sierra τ-Voice-banking35,1 %Gemini 3.8 Live Extended Thinking
Big Bench Audio97,7 %Gemini 3.8 Live Extended Thinking
Speech Agent ArenaSegundo puestoGemini 3.8 Live

Estos resultados sirven para ubicar el lanzamiento en pruebas de voz, tareas de agentes y audio, pero cada benchmark utiliza sus propias condiciones y métrica. El dato de 82,6 no equivale, por ejemplo, al 97,7 % de Big Bench Audio: son escalas y evaluaciones distintas.

La capa técnica de Gemini Live API

La API Live mantiene una conexión WebSocket con estado para sostener la conversación. En la arquitectura presentada por Google, el navegador, el backend y Gemini Live forman las piezas principales; una cola de solicitudes gestiona el flujo continuo de audio para que la entrada y la salida no tengan que esperar a turnos completamente separados.

Google también afirma que el audio generado incorpora una marca de agua SynthID. Es un detalle relevante para aplicaciones que producen voz sintética a escala: la interacción puede sonar natural y seguir siendo una salida generada por un sistema identificable mediante la tecnología de marcado de Google.