Produit · 19 septembre 2026
Google lance Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking
Google a lancé deux nouveaux modèles vocaux, Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking. Techsauce a rapporté que ces modèles visent à réduire le temps de réflexion pour permettre des interactions en temps réel sans interruptions.
Le modèle Gemini 3.8 Live est conçu pour gérer un volume important de tâches tout en maîtrisant les coûts. Il se classe deuxième sur la Speech Agent Arena selon les préférences des utilisateurs. Ce modèle peut traiter des images presque en temps réel pour baser ses réponses sur le flux visuel de la caméra et prend en charge 97 langues, avec la capacité de basculer automatiquement entre elles durant une conversation.
Gemini 3.8 Live Extended Thinking se concentre sur les tâches complexes nécessitant plusieurs étapes de réflexion. Il a obtenu la première place de l'indice de qualité de conversation voix à voix d'Artificial Analysis avec un score de 82,6. Ce modèle a également atteint 68,6 % sur le test τ-Voice, 35,1 % sur le test τ-Voice-banking de Sierra et 97,7 % sur Big Bench Audio. Pour éviter les silences, il émet des signaux sonores et communique sa progression pendant qu'il traite les raisonnements complexes en arrière-plan.
Les deux modèles ont été évalués via EVA-Bench de ServiceNow sur la plateforme Gemini Enterprise Agent Platform, démontrant une précision accrue pour les tâches complexes sans dégrader la qualité de la conversation. Ils sont accessibles aux développeurs via l'API Gemini et Google AI Studio, ainsi que via des plateformes comme Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents. Google collabore également avec Salesforce, Genspark et Lumeris.
Pour les utilisateurs, Gemini 3.8 Live sera intégré à Search Live, tandis que Extended Thinking sera disponible dans Gemini Live, Docs pour les abonnés Google AI Pro et Ultra, ainsi que dans Gmail et Keep pour tous les abonnés Google AI. Les fonctionnalités seront également présentes dans l'application Gemini et Google Workspace.
L'entreprise a précisé que tous les fichiers audio générés intègrent un filigrane numérique SynthID, inaudible pour l'humain mais détectable par les systèmes, afin de lutter contre la désinformation. Les détails de sécurité sont disponibles dans la fiche du modèle publiée par Google.