Google on laajentanut Gemini 3.8 -malliperhettä uusilla Gemini 3.8 Flash TTS- ja Flash-Lite TTS -puhemalleilla. Uusien mallien tavoitteena on tehdä tekoälyn tuottamasta puheesta aiempaa vivahteikkaampaa ja paremmin ohjattavaa esimerkiksi podcasteihin, äänikirjoihin, dubbaamiseen ja videoiden kerrontaan.
Mallit tulevat käyttöön sekä kuluttajapalveluissa että kehittäjille Google AI Studion ja Gemini API:n kautta.
Gemini 3.8 Flash TTS pystyy luomaan kokonaan uuden äänen tekstimuotoisen kuvauksen perusteella. Googlen mukaan tuki kattaa yli 100 kieltä ja murretta, ja lisäksi käytettävissä on yli 2 000 valmista tuotantokäyttöön tarkoitettua ääntä.
MAINOS (ARTIKKELI JATKUU ALLA)
Mallissa on myös äänen replikointiominaisuus, joka voi luoda johdonmukaisen version käyttäjän luvallisesti toimittamasta äänestä noin 30 sekunnin näytteen perusteella.
Google korostaa, että ominaisuuden käyttö edellyttää lupaa kyseisen äänen käyttämiseen.
Uudet mallit osaavat Googlen mukaan seurata yksityiskohtaisia ohjeita esimerkiksi sävyyn, puhenopeuteen, murteeseen, tauotukseen ja tunnetilaan liittyen. Mukaan voidaan lisätä myös puheenomaisia elementtejä, kuten kuiskauksia, naurua ja huokauksia.
MAINOS (ARTIKKELI JATKUU ALLA)
Lisäksi mallit voivat tuottaa kahden puhujan keskusteluja yhdestä käsikirjoituksesta ja pitää äänet johdonmukaisina myös tuntien mittaisissa tuotannoissa.
Tämä avaa uusia käyttömahdollisuuksia esimerkiksi podcasteihin, äänikirjoihin, videoiden selostuksiin, dubbaamiseen ja puheagentteihin.
Googlen mukaan Gemini 3.8 Flash TTS sijoittui Hume AI:n Voice Design Benchmarkissa kokonaisuutena ensimmäiseksi ja sai esimerkiksi aksenttien hallinnasta pisteet 60,8.
Flash- ja Flash-Lite-mallit sijoittuivat yhtiön mukaan myös Humen kokonaislaatuindeksissä kärkeen, ja Voice Arena -testeissä ne olivat useilla kielillä aivan parhaiden joukossa. Kaikissa osa-alueissa Google ei kuitenkaan ollut paras. ElevenLabs sai Humen testeissä edelleen korkeammat pisteet yksittäisten äänten laadussa ja ihmismäisessä vaihtelussa.
MAINOS (ARTIKKELI JATKUU ALLA)
Gemini 3.8 Flash TTS tulee käyttöön Gemini Notebookissa, kun taas kevyempi Flash-Lite TTS saapuu Google Vids -apveluun.
Kehittäjät voivat käyttää molempia malleja Gemini API:n ja Google AI Studion kautta.
Google asemoi Flash-mallin laadukkaampaan ja monipuolisempaan tuotantoon, kun taas Flash-Lite on suunnattu kevyempiin ja kustannustehokkaampiin käyttötapauksiin.
Google on lisännyt äänen replikointiin useita rajoituksia ja tunnistusmekanismeja. Yhtiö kertoo edellyttävänsä suostumuksen varmistamista, lisäävänsä tuotettuun sisältöön SynthID-vesileiman sekä C2PA-tunnistetiedot.
MAINOS (ARTIKKELI JATKUU ALLA)
Lisäksi AI Studion äänen replikointitoiminto ei ole käytettävissä kaikilla alueilla. Google estää sen muun muassa Britanniassa, Euroopan talousalueella, Intiassa, Texasissa ja Illinoisissa.
Mainos: Noin 1 600 000 tuotteen hintavertailu ja hintaseuranta - katso Hinta.fistä mistä saat halvimmalla






Salasana hukassa?
Etkö ole vielä rekisteröitynyt? Rekisteröidy tästä »