Le 15 septembre 2026, Google a annoncé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles audio conçus pour les agents vocaux en temps réel. Leur particularité ne tient pas seulement à la génération de voix : ils peuvent traiter des entrées visuelles, appeler des outils ou des API et poursuivre le dialogue pendant ces opérations. La version Extended Thinking ajoute un raisonnement en plusieurs étapes tout en continuant à parler.

Deux modèles pour deux usages

Google positionne Gemini 3.8 Live comme le modèle destiné aux conversations rapides, fluides et déployées à grande échelle. Il est conçu pour limiter la latence et traiter des informations visuelles presque en temps réel.

Gemini 3.8 Live Extended Thinking vise plutôt les tâches complexes. Il peut raisonner pendant qu’il parle, fournir des indications de progression et conserver le fil d’un échange lors d’un traitement en plusieurs étapes.

CritèreGemini 3.8 LiveGemini 3.8 Live Extended Thinking
Usage viséDialogues vocaux rapides et déployés à grande échelleTâches complexes nécessitant un raisonnement en plusieurs étapes
Traitement visuelEntrées visuelles traitées presque en temps réelInteraction multimodale en direct, avec raisonnement approfondi
Outils et APIAppels exécutés pendant que la conversation continueAppels exécutés pendant que la conversation continue, avec raisonnement en arrière-plan
Comportement vocalÉchange fluide orienté vers la rapiditéRaisonnement et parole simultanés, avec indications de progression
Intégration développeurGemini API, Google AI Studio et Gemini Live APIGemini API, Google AI Studio et Gemini Live API

La séparation est donc assez claire : Live privilégie la réactivité, tandis qu’Extended Thinking accepte une charge de raisonnement plus importante sans abandonner le dialogue.

Le changement important se produit pendant la conversation

Voir la démonstration officielle du Gemini Live API : appels d’outils asynchrones, audio proactif et injection de contexte

Dans un agent vocal classique, une action externe peut interrompre l’échange : le système reçoit la demande, attend le résultat d’un outil, puis reprend la parole. Google présente Gemini 3.8 Live autour d’un fonctionnement différent, dans lequel l’appel à l’outil ou à l’API s’exécute en arrière-plan pendant que l’échange reste actif.

Le Gemini Live API prend notamment en charge les appels de fonctions asynchrones, l’audio proactif et l’injection de contexte avec send_client_content. Dans la démonstration officielle, les appels d’outils et leurs résultats apparaissent dans les journaux en temps réel. Un exemple montre aussi Extended Thinking générer un fichier SVG tout en poursuivant la conversation.

Cette architecture intéresse surtout les agents capables d’agir : suivi d’une commande, consultation d’une base de données, traitement d’une image ou exécution d’une tâche demandant plusieurs étapes. Le modèle ne se contente plus de répondre à la fin du processus ; il peut maintenir l’interaction pendant que le travail avance.

97 langues et des résultats communiqués par Google

Google indique que les modèles Live peuvent détecter la langue utilisée et passer automatiquement d’une langue à l’autre parmi 97 langues prises en charge, au milieu d’une même conversation. Cette fonction concerne la capacité linguistique annoncée pour les modèles Live ; elle ne constitue pas à elle seule une mesure de la qualité des échanges dans chaque langue.

Pour Gemini 3.8 Live Extended Thinking, Google communique également plusieurs résultats d’évaluation :

  • 82,6 sur le Speech to Speech Quality Index d’Artificial Analysis ;
  • 68,6 % sur le benchmark d’accomplissement de tâches vocales τ-Voice ;
  • 35,1 % sur le benchmark bancaire τ-Voice de Sierra ;
  • 97,7 % sur Big Bench Audio.

Ces chiffres sont les résultats présentés par Google pour Extended Thinking. Ils correspondent à des évaluations différentes et ne mesurent pas toutes la même propriété : qualité de conversion parole-à-parole, accomplissement de tâches, tâches bancaires ou compréhension audio. Impossible, donc, de les réduire à une note unique de « qualité vocale ».

Google indique aussi que l’audio généré reçoit un filigrane SynthID. Cette signature vise à identifier le contenu audio produit par le modèle.

Accès pour les développeurs et déploiement dans les produits Google

Google a annoncé le déploiement de Gemini 3.8 Live et de Gemini 3.8 Live Extended Thinking via la Gemini API et Google AI Studio. L’annonce cite également Search Live, Gemini Live, certaines fonctions de Google Docs, Gmail et Keep, ainsi qu’un aperçu privé de Gemini Enterprise. Les canaux d’accès varient selon le modèle et le produit.

Pour un développeur, le point d’entrée le plus concret est le Gemini Live API : il fournit les fonctions nécessaires à une session vocale en direct, notamment les appels d’outils asynchrones, l’injection de contexte et la gestion d’audio proactive. Pour le grand public, Google a annoncé des intégrations distinctes plutôt qu’un accès uniforme à un seul modèle dans tous ses services.

Ce que Google annonce réellement

Gemini 3.8 Live marque un déplacement de l’IA vocale vers la concurrence des tâches : écouter, parler, analyser une image et déclencher une action peuvent se produire dans une même session. Extended Thinking pousse cette logique plus loin en ajoutant un raisonnement plus profond et une narration de la progression pendant le traitement.

Le lancement concerne des modèles annoncés pour ces usages et des canaux de déploiement associés à l’écosystème Google. Leur intérêt pratique dépendra ensuite du scénario d’agent, des outils connectés et de la manière dont chaque intégration gère les actions externes.