BLOG
Suivi des actualités 007 | Google lance Gemini 3.8 Live et Extended Thinking : l'agent vocal qui « réfléchit à voix haute », et une copie d'examen dont le surveillant est la maison elle-même
Suivi des actualités : annonces à chaud × jugement technique × conseils pratiques. Auteur : Yongliang
Le 15 septembre, le blog officiel de Google (signé Tom Ouyang et Malini Jaganathan de la Gemini Audio Team) a publié d’un coup deux modèles vocaux : Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking. Le premier mise sur l’échelle et l’efficacité des coûts, en insistant sur l’intelligence conversationnelle et la compréhension visuelle ; le second vise les tâches de haute complexité, avec pour argument de vente « raisonner et parler en même temps » — le modèle pense tout en parlant, et lorsqu’il doit vérifier une information, il annonce d’abord « Let me check that… », puis rend compte de sa progression en temps réel. Le même jour, les développeurs pouvaient y accéder via la Gemini API et AI Studio ; les particuliers ont vu arriver les nouvelles fonctionnalités par vagues dans Search Live, l’application Gemini Live et Workspace ; la version entreprise reste en préversion privée. Le domaine des agents vocaux est très en vogue cette année, et chacun met en avant la capacité « à faire le travail » et pas seulement « à discuter ». Google a joué à fond cette fois : selon la communication officielle, Extended Thinking a décroché la première place (82.6) au Speech to Speech Quality Index d’Artificial Analysis, un classement tiers. Mais ce bulletin mérite une lecture ligne par ligne — car le surveillant, le candidat et celui qui sort de la salle d’examen sont, pour une bonne part, la même entité.
Ce qui a été annoncé
Posons d’abord les informations dures de la communication officielle, toutes issues du blog officiel du 15 septembre :
Les deux modèles se répartissent clairement les rôles. Gemini 3.8 Live suit la voie de l’échelle : priorité à l’efficacité des coûts, prise en charge de 97 langues avec bascule automatique en cours de conversation, et capacité à accepter des entrées visuelles quasi en temps réel — la démo de lancement incluait l’observation d’une position d’échecs et la génération directe d’un composant React à partir d’un simple croquis. Il peut aussi exécuter des appels d’outils et des requêtes API en arrière-plan, sans interrompre la conversation en cours. Gemini 3.8 Live Extended Thinking suit la voie de la haute complexité : il gère des tâches de raisonnement en plusieurs étapes, avec comme particularité « le processus de réflexion énoncé à voix haute » — l’utilisateur entend quand le modèle consulte des sources et quand il calcule, au lieu de rester devant un silence en attendant le résultat.
La disponibilité se décline sur trois niveaux. Niveau développeurs : disponible dès le jour J, avec l’ouverture simultanée de la Gemini API et d’AI Studio. Niveau particuliers : un découpage par abonnement — Search Live, l’application Gemini Live, et dans Workspace Docs Live / Gmail Live / Keep Live ; les fonctionnalités suivent les deux paliers d’abonnement Google AI Pro et Ultra, et tout le monde n’a pas reçu l’intégralité des fonctions le même jour. Niveau entreprises : toujours en préversion privée ; les clients Gemini Enterprise doivent faire une demande.
L’écosystème d’accompagnement est complet : la sortie audio embarque le filigrane SynthID, et une model card officielle a été publiée. La liste des partenaires est longue — Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents ; côté témoignages clients : Salesforce, Genspark, Lumeris.
Comment lire le bulletin officiel
Cette partie doit se lire lentement, car les chiffres ne proviennent pas des mêmes sources et n’ont pas la même valeur.
Deux proviennent de classements tiers : Extended Thinking se classe premier au Speech to Speech Quality Index d’Artificial Analysis avec un score de 82.6, et deuxième au classement des préférences utilisateurs du Speech Agent Arena. Ce sont des tests menés par des organismes externes, que l’on peut considérer comme des évaluations indépendantes.
Les chiffres issus de la communication officielle interne : taux de complétion des tâches d’agents τ-Voice de 68.6%, scénario Sierra τ-Voice-banking à 35.1%, Big Bench Audio à 97.7%. Ces chiffres n’ont, à ce jour, été répliqués par aucun tiers indépendant ; dans le corps du texte, on ne peut donc les appeler que « communication officielle ».
Le plus intéressant est la ligne concernant le ServiceNow EVA-Bench. Le blog officiel indique qu’Extended Thinking « repousse la frontière de Pareto de la précision et de la qualité conversationnelle », mais juste après figure une note de l’auteur : les tests ont été exécutés sur la Live API de la Gemini Enterprise Agent Platform. En clair, cela signifie : ce benchmark du service client en entreprise tourne sur la plateforme d’agents maison de Google. EVA-Bench est bien, en lui-même, le cadre d’évaluation de ServiceNow ; ça, c’est exact. Mais l’environnement d’exécution est la pile interne — cette réserve, l’officiel l’a écrite lui-même, et au lecteur de la retenir aussi.
La bonne façon de lire ce bulletin est donc : la partie tierce peut être citée, la partie « communication officielle » doit être étiquetée comme telle, et la ligne EVA-Bench doit être mémorisée avec ses deux moitiés — « cadre tiers » et « piste maison ».
L’autre moitié, à froid
C’est la partie que ce numéro veut vraiment aborder sérieusement. Cinq points, classés par poids.
Premier point : un lancement maison avec des benchmarks maison — honnête, mais pas complètement honnête. Qu’un fabricant d’IA publie ses propres résultats sur sa propre plateforme est un usage du secteur, rien d’étonnant. Mais la matière à franchise était toute trouvée cette fois : la note de EVA-Bench « exécuté sur la Live API de la Gemini Enterprise Agent Platform » revient à ce que l’officiel signale lui-même son conflit d’intérêts. Ce n’est pas de la triche — la réserve est écrite au grand jour ; mais ce n’est pas non plus une validation indépendante. Le vrai manque, c’est que ces jolis chiffres — τ-Voice, Big Bench Audio — n’ont été répliqués par aucune organisation externe dans l’ensemble des supports de lancement. L’engouement de la conférence passera ; la question de savoir si un tiers retestera ces chiffres est ce qui déterminera s’ils tiennent debout.
Deuxième point : la nomenclature de « Extended Thinking » — penser à voix haute, transparence du raisonnement ou mise en scène anthropomorphique. Avec les modèles textuels, la chaîne de raisonnement peut être auditée mot à mot, capturée d’écran, contestée. En vocal, c’est différent : vous entendez un « Let me check that… » bien fluide, mais le modèle est-il réellement en train de chercher, de calculer, ou se contente-t-il de vous apaiser avec un discours convenu appris par entraînement ? La « réflexion » de l’interaction vocale ne peut pas être auditée comme le texte — l’auditeur n’a ni le droit d’accéder au processus de raisonnement, ni le moyen de distinguer « un vrai raisonnement en plusieurs étapes » d’« un raisonnement en plusieurs étapes joué ». Emballer la latence en « réflexion » est, côté ingénierie, une décision produit élégante ; côté récit, cela s’approprie la confiance accumulée par le terme « extended thinking » à l’ère du texte. Entre transparence et représentation s’intercale une couche de voix — et cette couche de voix, pour l’instant, c’est le fournisseur qui la définit.
Troisième point : entre la promesse et la concrétisation s’intercalent le tableau des abonnements et la liste des préversions. Le jour du lancement, les développeurs pouvaient utiliser l’API, c’est vrai. Mais côté particulier, la panoplie Workspace — Docs Live, Gmail Live, Keep Live — est répartie selon les abonnements Pro / Ultra, et entre « c’est lancé » et « vous pouvez vous en servir » s’intercale un mur payant ; côté entreprise, l’argument central, Gemini Enterprise, reste en préversion privée : sur candidature, opaque, sans calendrier. Ce n’est pas le problème de Google seul, c’est la norme d’un secteur entier : « annonce intégrale, livraison par paliers ». Mais pour le lecteur, distinguer les trois niveaux du « déjà lancé » importe bien plus que de retenir les vidéos de démo de la conférence.
Quatrième point : les trois fondamentaux de l’agent vocal n’ont toujours pas de réponse indépendante. Pour évaluer la capacité d’un agent vocal à faire le travail, trois indicateurs sont incontournables : la gestion des interruptions (combien de temps le modèle met-il à s’arrêter quand l’utilisateur coupe la parole), la latence de bout en bout (combien de temps attendre avant qu’il ne commence à parler) et la fiabilité des appels d’outils (il dit avoir appelé l’API, mais l’appel a-t-il vraiment réussi ?). Dans les supports de cette annonce, l’officiel n’a fourni aucune donnée de réplication tierce pour ces trois indicateurs. La démo d’échecs et la génération de composants React sont impressionnantes, mais une démo est un succès unique, alors que les trois fondamentaux sont des taux de réussite sur dix mille essais. Jusqu’à ce que des évaluations indépendantes paraissent, « faire le travail » s’écoute avec une décote.
Cinquième point : SynthID est un filigrane de détection, pas un dispositif de responsabilité. Filigraner l’audio IA est une bonne chose, cela facilite l’identification a posteriori. Mais la question à laquelle répond un filigrane est « ce contenu audio est-il généré par IA », pas « qui est responsable si cet audio IA dit des bêtises ». Quand un agent vocal a cherché les informations pour l’utilisateur, lu la conclusion à voix haute et exécuté les outils en arrière-plan, la chaîne de responsabilité en cas d’erreur — modèle, plateforme, intégrateur, client — n’est couverte par aucun filigrane existant. Présenter un outil de détection comme un cadre de responsabilité est un glissement rhétorique habituel des annonces.
Si vous êtes développeur
En trois lignes : « utilisable maintenant / attendre avant de s’engager / quoi regarder pour choisir » :
Utilisable dès maintenant : la Gemini API et AI Studio sont disponibles dès le jour J, on peut se lancer directement dans le prototypage d’agents vocaux. La bascule automatique entre 97 langues, si elle tient la promesse officielle, est un argument de vente concret pour le support client multilingue et les produits tournés vers l’international — mais testez d’abord une passe sur vos propres corpus, et ne prenez pas la démo de la conférence pour critère de recette. La conception des appels d’outils en arrière-plan sans interrompre la conversation mérite d’être particulièrement éprouvée dans un prototype : c’est elle qui fait la différence entre un « assistant » et un « employé ».
À surveiller avant de s’engager : les capacités d’Agent Platform en préversion privée de Gemini Enterprise, à réévaluer quand elles seront publiquement disponibles et auront des évaluations indépendantes ; la panoplie Workspace est répartie par abonnement, vérifiez avant tout achat à quel palier votre équipe tombe réellement ; pour la narration de progression « à voix haute », concevez votre produit en la traitant comme un indicateur d’interface UI, pas comme une preuve de raisonnement — vos utilisateurs ne peuvent pas davantage auditer une piste audio.
Les indicateurs à regarder pour choisir : quel que soit le choix final, la sélection d’un agent vocal se fait sur cinq chiffres — le temps de réponse aux interruptions, la latence de bout en bout, le taux de réussite des appels d’outils (statistiques par scénario, pas agrégées), le taux de disponibilité réel de la bascule multilingue (testez vos langues cibles, pas les langues des démos officielles) et le coût par tâche (les modes de raisonnement en plusieurs étapes comme Extended Thinking coûtent plusieurs fois le prix d’un modèle standard, exigez la précision). De ces cinq chiffres, la conférence ne vous en donnera aucun : faites vos propres benchmarks, ou attendez les tests d’organismes tiers.
Conclusion
La substance technique de cette annonce de Google est réelle : raisonner et parler en même temps, des appels d’outils en arrière-plan sans interrompre la conversation, la bascule entre 97 langues — pris isolément, chacun de ces points mérite que la concurrence s’inquiète. Mais l’eau du récit de la conférence est réelle aussi : une copie dont l’auteur surveille lui-même l’examen, une « réflexion » inauditable, une « annonce intégrale » découpée par paliers d’abonnement, des fondamentaux sans réplication tierce, et un filigrane de détection maquillé en cadre de responsabilité. La concurrence des agents vocaux entre dans sa seconde mi-temps : on ne compare plus qui a la démo la plus éblouissante, mais dont les chiffres résistent à un contre-test externe. La copie de Gemini 3.8 Live est rendue, le droit de la corriger appartient aux tiers — ce numéro se contente de recopier l’énoncé ; quant à savoir si les réponses sont justes, on en reparlera quand quelqu’un d’autre aura fini de corriger.
Sources
- Blog officiel de Google : l’annonce de Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking (2026-09-15, signée Tom Ouyang et Malini Jaganathan, Gemini Audio Team)
- Model card jointe au blog officiel (2026-09-15)
- Classements tiers cités par le blog officiel : Artificial Analysis Speech to Speech Quality Index, Speech Agent Arena (chiffres de classement au 2026-09-15)