Продукт · 19 сентября 2026 г.
Также опубликовано на Français, עברית, Português (Brasil)
Google представила голосовые модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking
Компания Google выпустила две новые голосовые модели: Gemini 3.8 Live, предназначенную для выполнения большого объема задач при контролируемых затратах, и Gemini 3.8 Live Extended Thinking, ориентированную на сложные многоэтапные вычисления. Обе модели сокращают время обработки данных до уровня реального времени, что позволяет вести непрерывный диалог без пауз.
Издание Techsauce сообщило, что основной целью разработки стало устранение задержек между окончанием речи пользователя и ответом системы. Модели способны обрабатывать визуальный контекст через камеру в реальном времени, выполнять фоновые задачи во время разговора и использовать звуковые сигналы подтверждения до того, как окончательный ответ будет сформирован.
Модель Gemini 3.8 Live Extended Thinking заняла первое место в индексе качества голосового взаимодействия Speech to Speech Quality Index от Artificial Analysis с результатом 82.6. Она также показала высокие результаты в тестах τ-Voice (68.6%) и τ-Voice-banking от Sierra (35.1%), имитирующем банковское обслуживание, а также в тесте Big Bench Audio (97.7%). В свою очередь, Gemini 3.8 Live заняла второе место в Speech Agent Arena благодаря предпочтениям пользователей и низким эксплуатационным расходам.
Согласно данным EVA-Bench от ServiceNow, обе модели повысили точность выполнения сложных задач без потери качества беседы. Gemini 3.8 Live поддерживает 97 языков и способна автоматически переключаться между ними в рамках одного предложения. Модель также может вызывать инструменты и интерфейсы прикладного программирования в фоновом режиме, продолжая общение с пользователем до завершения технической операции.
Для обеспечения безопасности все аудиофайлы, созданные искусственным интеллектом Google, помечаются цифровым водяным знаком SynthID, который не слышен человеку, но позволяет идентифицировать синтезированный голос. Подробности по безопасности изложены в опубликованной карте модели.
Инструменты доступны разработчикам через Gemini API и Google AI Studio, а также поддерживаются платформами Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Google сотрудничает с компаниями Salesforce, Genspark и Lumeris. Обычные пользователи получат доступ к Gemini 3.8 Live в Search Live, а к Extended Thinking — в Gemini Live, Docs, Gmail и Keep в зависимости от уровня подписки Google AI.
Сообщает Techsauce.