Le 15 septembre 2026, Google a annoncé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles audio conçus pour les agents vocaux en temps réel. Leur particularité ne tient pas seulement à la génération de voix : ils peuvent traiter des entrées visuelles, appeler des outils ou des API et poursuivre le dialogue pendant ces opérations. La version Extended Thinking ajoute un raisonnement en plusieurs étapes tout en continuant à parler.
Deux modèles pour deux usages
Google positionne Gemini 3.8 Live comme le modèle destiné aux conversations rapides, fluides et déployées à grande échelle. Il est conçu pour limiter la latence et traiter des informations visuelles presque en temps réel.
Gemini 3.8 Live Extended Thinking vise plutôt les tâches complexes. Il peut raisonner pendant qu’il parle, fournir des indications de progression et conserver le fil d’un échange lors d’un traitement en plusieurs étapes.
| Critère | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
| Usage visé | Dialogues vocaux rapides et déployés à grande échelle | Tâches complexes nécessitant un raisonnement en plusieurs étapes |
| Traitement visuel | Entrées visuelles traitées presque en temps réel | Interaction multimodale en direct, avec raisonnement approfondi |
| Outils et API | Appels exécutés pendant que la conversation continue | Appels exécutés pendant que la conversation continue, avec raisonnement en arrière-plan |
| Comportement vocal | Échange fluide orienté vers la rapidité | Raisonnement et parole simultanés, avec indications de progression |
| Intégration développeur | Gemini API, Google AI Studio et Gemini Live API | Gemini API, Google AI Studio et Gemini Live API |
La séparation est donc assez claire : Live privilégie la réactivité, tandis qu’Extended Thinking accepte une charge de raisonnement plus importante sans abandonner le dialogue.
Le changement important se produit pendant la conversation
Dans un agent vocal classique, une action externe peut interrompre l’échange : le système reçoit la demande, attend le résultat d’un outil, puis reprend la parole. Google présente Gemini 3.8 Live autour d’un fonctionnement différent, dans lequel l’appel à l’outil ou à l’API s’exécute en arrière-plan pendant que l’échange reste actif.
Le Gemini Live API prend notamment en charge les appels de fonctions asynchrones, l’audio proactif et l’injection de contexte avec send_client_content. Dans la démonstration officielle, les appels d’outils et leurs résultats apparaissent dans les journaux en temps réel. Un exemple montre aussi Extended Thinking générer un fichier SVG tout en poursuivant la conversation.
Cette architecture intéresse surtout les agents capables d’agir : suivi d’une commande, consultation d’une base de données, traitement d’une image ou exécution d’une tâche demandant plusieurs étapes. Le modèle ne se contente plus de répondre à la fin du processus ; il peut maintenir l’interaction pendant que le travail avance.
97 langues et des résultats communiqués par Google
Google indique que les modèles Live peuvent détecter la langue utilisée et passer automatiquement d’une langue à l’autre parmi 97 langues prises en charge, au milieu d’une même conversation. Cette fonction concerne la capacité linguistique annoncée pour les modèles Live ; elle ne constitue pas à elle seule une mesure de la qualité des échanges dans chaque langue.
Pour Gemini 3.8 Live Extended Thinking, Google communique également plusieurs résultats d’évaluation :
- 82,6 sur le Speech to Speech Quality Index d’Artificial Analysis ;
- 68,6 % sur le benchmark d’accomplissement de tâches vocales τ-Voice ;
- 35,1 % sur le benchmark bancaire τ-Voice de Sierra ;
- 97,7 % sur Big Bench Audio.
Ces chiffres sont les résultats présentés par Google pour Extended Thinking. Ils correspondent à des évaluations différentes et ne mesurent pas toutes la même propriété : qualité de conversion parole-à-parole, accomplissement de tâches, tâches bancaires ou compréhension audio. Impossible, donc, de les réduire à une note unique de « qualité vocale ».
Google indique aussi que l’audio généré reçoit un filigrane SynthID. Cette signature vise à identifier le contenu audio produit par le modèle.
Accès pour les développeurs et déploiement dans les produits Google
Google a annoncé le déploiement de Gemini 3.8 Live et de Gemini 3.8 Live Extended Thinking via la Gemini API et Google AI Studio. L’annonce cite également Search Live, Gemini Live, certaines fonctions de Google Docs, Gmail et Keep, ainsi qu’un aperçu privé de Gemini Enterprise. Les canaux d’accès varient selon le modèle et le produit.
Pour un développeur, le point d’entrée le plus concret est le Gemini Live API : il fournit les fonctions nécessaires à une session vocale en direct, notamment les appels d’outils asynchrones, l’injection de contexte et la gestion d’audio proactive. Pour le grand public, Google a annoncé des intégrations distinctes plutôt qu’un accès uniforme à un seul modèle dans tous ses services.
Ce que Google annonce réellement
Gemini 3.8 Live marque un déplacement de l’IA vocale vers la concurrence des tâches : écouter, parler, analyser une image et déclencher une action peuvent se produire dans une même session. Extended Thinking pousse cette logique plus loin en ajoutant un raisonnement plus profond et une narration de la progression pendant le traitement.
Le lancement concerne des modèles annoncés pour ces usages et des canaux de déploiement associés à l’écosystème Google. Leur intérêt pratique dépendra ensuite du scénario d’agent, des outils connectés et de la manière dont chaque intégration gère les actions externes.