Produkt · 26. september 2026
Google lanserer nye modeller for tekst-til-tale
Google har presentert de nye modellene Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS for generering av tale fra tekst.
BRIDGE rapporterte at Flash TTS er utviklet med fokus på detaljerte instruksjoner for stemmedesign og fremføring, mens Flash-Lite TTS er rettet mot oppgaver som krever lavkostnadshåndtering av store mengder data, slik som dubbing og taleagenter.
Flash TTS gjør det mulig å skape nye stemmer fra bunnen av ved å spesifisere rolle, aksent og stemmekvalitet med naturlig språk. Modellen støtter over 100 språk og dialekter, inkludert regionale variasjoner som spansk fra Mexico og fransk fra Quebec, og tilbyr et bibliotek med over 2 000 klare stemmer. Det er mulig å gjenskape en stemmekvalitet basert på et lydopptak på 30 sekunder, forutsatt at man har rettighetene til stemmen, og disse stemmene kan lagres for bruk i fremtidige prosjekter.
Systemet tillater instruksjoner for fremføring på hver linje, inkludert merker for latter, sukk og bekreftende lyder. Det kan genereres dialog mellom to talere fra ett enkelt manus, og stemmekvalitet og hastighet opprettholdes selv i lydfiler som varer i flere timer. Funksjoner for å justere klang, tonehøyde og aksent basert på en grunnstemme skal legges til snart.
For å gjenskape stemmer kreves det opptak der eieren har gitt sitt samtykke, og stemmen kan ikke opprettes hvis den ikke samsvarer med referanselyden. All lyd generert av Gemini-modellene får et digitalt vannmerke kalt SynthID. Funksjonen for stemmegjenskaping er ikke tilgjengelig i Google AI Studio i Storbritannia, Sveits, India, Det europeiske økonomiske samarbeidsområdet, eller i statene Illinois og Texas i USA.
Flash TTS er rullet ut til utviklere via Gemini API og Google AI Studio, og til allmennheten via Gemini Notebook. Gemini Enterprise vil snart få tilgang via API, mens Flash-Lite TTS rulles ut til allmennheten gjennom Google Vids.
For betalte planer i Gemini API er prisen for tekst-input 0,50 dollar per million tokens frem til 31. desember i år, og 1,00 dollar fra 1. januar 2027. For lyd-output koster Flash TTS 9,00 dollar i samme periode og 18,00 dollar fra 2027, mens Flash-Lite TTS koster 6,00 dollar og øker til 12,00 dollar fra 2027. Ett sekund med lyd telles som 25 tokens. Det finnes også et gratisnivå med egne vilkår.