Le 15 septembre 2026, Google a annoncé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles de dialogue vocal en temps réel. Le premier privilégie la fluidité et les déploiements à grande échelle ; le second est conçu pour les tâches complexes en plusieurs étapes, tout en continuant à parler pendant son raisonnement.
La différence est importante : Google ne présente pas deux versions interchangeables, mais deux profils pour les agents vocaux. Gemini 3.8 Live doit répondre rapidement à un grand volume de conversations, tandis qu’Extended Thinking vise les scénarios où l’agent doit enchaîner plusieurs opérations avant de répondre.
Gemini 3.8 Live face à Extended Thinking
| Dimension | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
| Usage visé | Agents vocaux rapides et déploiements à grande échelle | Flux de travail complexes nécessitant plusieurs étapes de raisonnement |
| Dialogue | Conversation fluide avec exécution d’outils en arrière-plan | Raisonnement et conversation menés simultanément |
| Progression pendant une tâche longue | L’échange vocal continue pendant les opérations prises en charge | Le modèle peut annoncer sa progression à l’oral pendant les opérations complexes |
| Entrées | Texte, image, vidéo, audio et PDF | Texte, image, vidéo, audio et PDF |
| Sorties | Texte et audio | Texte et audio |
| Fenêtre de contexte en entrée | 128 000 tokens | 128 000 tokens |
| Sortie maximale indiquée | 64 000 tokens | 64 000 tokens |
Pour choisir entre les deux, la règle est assez simple : Gemini 3.8 Live est le profil de la vitesse et de l’échelle ; Extended Thinking est celui de la profondeur. Cette distinction concerne l’usage visé par Google, pas une mesure générale de qualité valable pour toutes les conversations.
Ce que Gemini peut faire pendant que vous parlez
Les deux modèles acceptent plusieurs types de contenu : texte, image, vidéo, audio et PDF. Ils peuvent également produire du texte et de l’audio. Gemini 3.8 Live peut traiter des informations visuelles en quasi-temps réel et passer automatiquement d’une langue à l’autre parmi 97 langues au cours d’une même conversation.
Google indique aussi que les modèles peuvent exécuter des outils et des appels d’API en arrière-plan pendant que le dialogue se poursuit. Dans un agent vocal, cela permet de maintenir l’échange pendant qu’une opération prise en charge est en cours, au lieu de suspendre systématiquement la conversation.
Extended Thinking pousse cette logique plus loin sur les tâches qui demandent plusieurs étapes. Google décrit un modèle capable de raisonner et de parler simultanément, avec des indications vocales de progression comme « Je vais vérifier… ». L’intérêt pratique est évident pour un agent qui doit consulter un outil, attendre un résultat, puis poursuivre son explication sans transformer chaque traitement en long silence.
Le Gemini Live API s’appuie sur une connexion WebSocket persistante et sur un flux audio bidirectionnel. L’architecture est donc plus proche d’un appel téléphonique continu que d’une chaîne où la voix est d’abord transcrite, puis traitée, puis convertie en audio après chaque tour de parole.
Des modèles pensés pour les développeurs
Google liste Google AI Studio, le Gemini API et la Google Enterprise Agent Platform parmi les points d’accès destinés au développement. Gemini 3.8 Live est également listé dans Google Workspace, tandis qu’Extended Thinking apparaît aussi dans Google Search Live, l’application Gemini et certaines expériences Workspace.
Les modèles peuvent ainsi servir de base à des agents vocaux capables de dialoguer, d’interpréter des contenus visuels et de déclencher des outils. Google cite notamment des usages liés au service client, à la productivité et à des assistants capables de traiter des demandes multimodales.
Dans Google Workspace, les fonctions Gemini Live concernent Gmail, Docs et Keep. Le déploiement dépend toutefois de la surface Google utilisée et des conditions d’accès associées au produit ou à l’abonnement.
Ce que mesurent les résultats annoncés par Google
Google rapporte pour Gemini 3.8 Live Extended Thinking un score de 82,6 à l’Artificial Analysis Speech to Speech Quality Index, 68,6 % à τ-Voice, 35,1 % au benchmark bancaire τ-Voice de Sierra et 97,7 % à Big Bench Audio. Gemini 3.8 Live est par ailleurs présenté par Google comme arrivé en deuxième position dans la Speech Agent Arena.
Ces chiffres correspondent à des évaluations différentes. Ils ne constituent donc pas une note globale unique et ne permettent pas de transformer mécaniquement 82,6, 68,6 % ou 97,7 % en un classement général des modèles vocaux.
Les résultats donnent surtout une indication sur les axes mis en avant par Google : qualité du dialogue vocal, réussite de tâches agentiques, scénarios bancaires et compréhension audio. Pour un projet réel, le choix entre les deux modèles dépendra du type de conversation, du nombre d’étapes nécessaires et de la place accordée à la latence.
Le lancement ajoute aussi un élément de traçabilité : Google indique que l’audio généré est marqué par SynthID, sa technologie de marquage des contenus générés.
L’accès dépend de la surface utilisée
Pour les développeurs, Google présente Google AI Studio et le Gemini API comme des portes d’entrée directes vers les modèles, avec la Google Enterprise Agent Platform pour les usages d’entreprise. Les fonctions destinées au grand public et à Google Workspace sont, elles, liées aux produits et aux conditions d’éligibilité propres à chaque surface.
Autrement dit, Gemini 3.8 Live n’est pas simplement un bouton universel ajouté à toutes les conversations Gemini. Le modèle choisi et les fonctions accessibles dépendent de l’environnement dans lequel l’utilisateur ou le développeur l’emploie.