Produto · 26 de setembro de 2026
Também publicado em Norsk
Google lança modelo de síntese de voz Gemini 3.8 Flash TTS com suporte a mais de 100 idiomas
O Google anunciou nesta quarta‑feira, 23, dois novos modelos de síntese de voz a partir de texto: Gemini 3.8 Flash TTS e Gemini 3.8 Flash‑Lite TTS. O Flash TTS foca na criação de vozes com design e encenação detalhados, enquanto o Flash‑Lite TTS foi pensado para uso em grande escala, como dublagem e agentes de voz, com custos reduzidos. Ambas as versões suportam mais de 100 idiomas e dialetos, incluindo variantes regionais como o espanhol do México e o francês do Québec. A biblioteca de vozes pronta para uso já conta com mais de 2.000 opções, e é possível reproduzir a voz de uma pessoa a partir de apenas 30 segundos de amostra, desde que o autor forneça consentimento e a amostra corresponda ao falante original. As vozes geradas podem ser salvas e reutilizadas em projetos contínuos.
O sistema permite que diretores de leitura especifiquem entonação linha a linha, usando tags como "laughs", "sigh", "mhm" ou "yeah" para inserir risos, suspiros ou interjeições, além de gerar diálogos com múltiplos interlocutores a partir de um único script. A velocidade e a qualidade da voz permanecem estáveis mesmo em gravações longas, e recursos adicionais de ajuste de timbre, altura e sotaque estão previstos para o futuro. A geração de voz requer que o proprietário da voz autorize o uso de sua amostra, e todas as produções são marcadas com a assinatura eletrônica SynthID. O acesso ao Flash TTS já está disponível para desenvolvedores por meio da Gemini API e do Google AI Studio, enquanto o Flash‑Lite TTS será oferecido gradualmente no Google Vids.
O Gemini API tem preços diferenciados: até 31 de dezembro de 2023 a entrada custa 0,50 dólar por milhão de tokens e a saída 9,00 dólares; a partir de 1º de janeiro de 2024 esses valores dobram, chegando a 1,00 e 18,00 dólares respectivamente. O Flash‑Lite TTS tem tarifa de 6,00 dólares por milhão de tokens até o final de 2023 e 12,00 dólares a partir de 2024. Cada segundo de áudio corresponde a 25 tokens. Também há um plano gratuito com limites definidos na tabela de preços. O modelo não está disponível em AI Studio nas regiões de Illinois e Texas nos Estados Unidos, na zona econômica europeia, no Reino Unido, na Suíça, na Índia e em alguns outros mercados.
Informado por BRIDGE.