Google julkisti Gemini 3.8 Flash TTS -puhemallit

0

Googlen uudet Gemini 3.8 Flash TTS ja Flash-Lite TTS tuottavat puhetta yli sadalla kielellä ja mahdollistavat äänen suunnittelun pelkillä tekstiohjeilla.

aiuutiset.fi — Tekoälyuutiset suomeksi

Google julkisti 23. syyskuuta kaksi uutta puhetta tuottavaa tekoälymallia: Gemini 3.8 Flash TTS ja Gemini 3.8 Flash-Lite TTS. Molemmat muuttavat tekstin puhutuksi ääneksi, mutta uutta on se, että käyttäjä voi suunnitella äänen itse pelkällä tekstiohjeella. Mallit tukevat yli sataa kieltä ja niiden mukana tulee yli 2 000 valmista ääntä.

Mitä Google julkisti?

Kyse on puhesynteesistä eli tekstistä puheeksi -tekniikasta, jossa ohjelma tuottaa luonnollisen kuuloisen puhutun äänen kirjoitetusta tekstistä. Google kuvaa uusia malleja kaikkien aikojen ilmeikkäimmiksi äänentuotantomalleikseen. Ne tulevat saataville Googlen kehittäjille tarkoitettuun ohjelmointirajapintaan, Google AI Studio -työkaluun sekä kuluttajatuotteisiin Gemini Notebook ja Google Vids.

Kaksi mallia on tarkoitettu eri käyttöön. Gemini 3.8 Flash TTS on suunnattu luovaan työhön: sillä voi rakentaa kokonaan uusia ääniä hahmoille esimerkiksi peleihin, äänikirjoihin ja podcasteihin. Gemini 3.8 Flash-Lite TTS on tarkoitettu suuriin määriin ja edulliseen hintaan, kuten automaattiseen jälkiäänitykseen ja puhetta käyttäviin asiakaspalvelusovelluksiin. Googlen kehittäjädokumentaation mukaan Flash-Lite TTS korvaa aiemman 3.1 Flash TTS -esiversion tuotantokäytössä.

Ääniä voi nyt suunnitella itse

Aiemmin puhettatuottavat mallit tarjosivat valmiin valikoiman ääniä — Googlella niitä oli 30. Uudet mallit kasvattavat valikoiman yli 2 000 ääneen, ja mukana on alueellisia muunnoksia, kuten meksikonespanja, Quebecin ranska ja skotlanninenglanti.

Flash TTS -mallissa äänen voi myös suunnitella kokonaan itse. Käyttäjä kirjoittaa tavallisella kielellä kehotteen, jossa kuvailee hahmon, aksentin ja äänen ominaisuudet, ja malli rakentaa äänen sen pohjalta. Malli osaa jäljitellä myös olemassa olevaa ääntä 30 sekunnin näytteestä, jos käyttäjällä on siihen oikeus. Google kertoo tarkistavansa suostumuksen erillisellä äänitallenteella ennen kuin äänen kopiointi onnistuu. Myöhemmin yhtiö lupaa vielä työkalun, jolla valmista ääntä voi hienosäätää sävelkorkeuden, nopeuden ja aksentin osalta.

Näyttelijän ohjausta rivi riviltä

Molemmat mallit antavat ohjata jokaista repliikkiä erikseen. Malli osaa esimerkiksi kuiskata jännityskohtauksessa tai puhua rauhallisesti asiakaspalvelijan roolissa, ja ohjeet voi kirjoittaa suoraan käsikirjoituksen sekaan. Malli myös säilyttää äänen laadun ja hahmon soinnin useiden tuntien mittaisessa yhtämittaisessa äänitteessä, mikä on tärkeää äänikirjoissa ja podcasteissa.

Uutta on myös kahden puhujan kohtausten ohjaaminen yhdestä käsikirjoituksesta sekä se, että tekstiin voi lisätä merkintöjä esimerkiksi naurahduksesta, huokauksesta ja äännähdyksistä, joilla on tarkoitus viestiä kuuntelijalle. Näin puheeseen saa mukaan taukoja ja reaktioita, joita luonnollisessa keskustelussa syntyy itsestään.

Turvatoimet ja vesileima

Äänen kopiointi on herkkä aihe, koska sillä voi tehdä syväärennöksiä eli väärennettyjä äänitallenteita, joissa esiintyy oikea henkilö. Google kertoo siksi rakentaneensa suostumuksen varmistuksen osaksi äänen luontia: kopioitavaa ääntä ei synny ilman äänen omistajan antamaa suullista suostumusta.

Lisäksi jokainen Googlen äänimallien tuottama äänitiedosto merkitään näkymättömällä SynthID-vesileimalla, jonka on tarkoitus auttaa tunnistamaan tekoälyn tuottama synteettinen sisältö ja estää väärän tiedon leviämistä. Tiedostoon lisätään myös C2PA-alkuperämerkintä, joka kertoo sisällön alkuperän ja muokkaushistorian allekirjoituksin.

Vertailutestit ja saatavuus

Google perustelee malliensa tasoa riippumattomilla vertailutesteillä. Hume AI:n Voice Design -testissä Gemini 3.8 Flash TTS sijoittui ensimmäiseksi 71,4 pisteen tuloksella ja sai aksenttien mallintamisesta 60,8 pistettä. Hume AI:n laatuluokituksessa Flash TTS oli ensimmäinen ja Flash-Lite TTS toinen. Voice Arenan sokkotestissä mallit menestyivät Googlen mukaan hyvin muun muassa japanissa, brasilianportugalissa, vietnamissa, arabiassa, meksikonespanjassa ja hindissä. Yksittäinen testitulos kannattaa silti lukea varoen, sillä ne mittaavat vain sitä, mitä kyseisessä testissä mitataan.

Kehittäjät voivat ottaa mallit käyttöön heti Googlen ohjelmointirajapinnassa ja AI Studio -työkalussa. Flash TTS tulee kuluttajille Gemini Notebook -sovellukseen ja Flash-Lite TTS Google Vids -videosovellukseen, ja yrityskäyttöön tarkoitettu Gemini Enterprise saa mallin myöhemmin. Google kertoo useiden työkaluvalmistajien, kuten Figman, HeyGenin ja Wondercraftin, ottavan uudet mallit käyttöön jälkiäänityksessä ja puheavustajissa.

Lähteet

Google: Gemini 3.8 text-to-speech says hello, 23.9.2026. https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/

Google AI for Developers: Gemini 3.8 Flash-Lite TTS, 23.9.2026. https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts

MarkTechPost: Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTS With Prompt-Based Voice Design, 23.9.2026. https://www.marktechpost.com/2026/09/23/google-releases-gemini-3-8-flash-tts-and-flash-lite-tts-with-prompt-based-voice-design/

AI News: Google launches Gemini 3.8 Flash TTS voice models, 24.9.2026. https://www.artificialintelligence-news.com/news/google-gemini-3-8-flash-tts-voice-models/

FoneArena: Google rolls out Gemini 3.8 Flash TTS and Flash-Lite TTS with custom voice creation, 2000+ voices, 100+ language support, 24.9.2026. https://www.fonearena.com/blog/493358/google-gemini-3-8-flash-tts-flash-lite-tts.html

LatestLY: Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS Introduced by Google With Custom Voice Design and SynthID Watermarking, 23.9.2026. https://www.latestly.com/technology/gemini-3-8-flash-tts-gemini-3-8-flash-lite-tts-introduced-by-google-with-custom-voice-design-and-synthid-watermarking-7617618.html

Leave a Reply

Pakolliset kentät on merkitty *

Share with