Google laajentaa Gemini 3.5 -malliperhettään kolmella puheeseen keskittyvällä tekoälymallilla.
Gemini Audio -nimellä kulkeva kokonaisuus sisältää Gemini 3.5 Transcriben, Gemini 3.5 Liven ja Gemini 3.5 Live Experimentalin. Googlen mukaan tavoitteena ovat aiempaa luonnollisemmat reaaliaikaiset keskustelut ja tarkempi puheentunnistus. Uudet mallit ovat tulossa laajasti muun muassa Geminiin, Google-hakuun, Gmailiin, Docsiin, Keepiin ja Gboardiin.
Gemini-perusmallien osalta Google on ehtinyt julkaista jo myös Gemini 3.6 Flashin ja Gemini 3.7 Flashin, mutta uudet äänimallit kuuluvat edelleen Gemini 3.5 -sukupolveen.
MAINOS (ARTIKKELI JATKUU ALLA)
Uusista malleista Gemini 3.5 Transcribe keskittyy puheen muuttamiseen tekstiksi, kun taas Live-mallit on rakennettu reaaliaikaista puhekeskustelua varten.
Google lupaa Gemini 3.5 Transcribelle aiempaa parempaa tarkkuutta, syvempää kontekstin ymmärtämistä sekä automaattista kielentunnistusta. Malli tukee yli 85 kieltä, minkä lisäksi sen kerrotaan selviytyvän alueellisista aksenteista ja erilaisista murteista. Uutuus korvaa Googlen aiemman Chirp 3 -transkriptiomallin.
Gemini 3.5 Transcribe osaa käsitellä puhetta jo litteroinnin aikana, joten kyse ei ole pelkästä puheen mahdollisimman sanatarkasta muuttamisesta tekstiksi.
MAINOS (ARTIKKELI JATKUU ALLA)
Esimerkiksi täytesanat, kuten englannin “um” ja “ah”, voidaan poistaa automaattisesti. Malli osaa lisäksi muotoilla tuotettua tekstiä ja tehdä siihen käyttäjän sanelemia muutoksia.
Google esitti uudelle mallille myös konkreettisia tarkkuuslukuja. Gemini 3.5 Transcriben WER eli Word Error Rate on suoratoistettavan äänen kohdalla noin neljä prosenttia. Valmiiksi tallennetuissa äänitiedostoissa Google ilmoittaa sanavirhetasoksi vain 2,6 prosenttia.
Lukujen kerrotaan perustuvan erilaisiin todellisiin käyttöolosuhteisiin, joissa mukana on esimerkiksi taustamelua sekä tekoälyn kanssa käytäviä keskusteluja.
Google nostaa esille myös mahdollisuuden antaa mallille omaa sanastoa. Gemini 3.5 Transcribe voidaan näin auttaa tunnistamaan esimerkiksi erikoisalojen termejä, harvinaisia sanoja ja poikkeuksellisia kirjoitusasuja.
MAINOS (ARTIKKELI JATKUU ALLA)
Gemini 3.5 Transcribe osaa lisäksi erotella toisistaan useita puhujia. Valmiiksi tallennetussa äänessä malli voi määrittää puheen eri henkilöille ja tuottaa sanatason aikaleimoja enintään kolmelle puhujalle. Myös yli kolmen puhujan tunnistamista tuetaan, mutta Google luokittelee tämän ominaisuuden toistaiseksi kokeelliseksi.
Mallin pitäisi pystyä automaattisesti tunnistamaan käytetty kieli yli 85 tuetun kielen joukosta. Käyttäjän ei siten välttämättä tarvitse kertoa etukäteen, millä kielellä tallenne tai keskustelu käydään.
Yksi Gemini 3.5 Transcriben kiinnostavammista ominaisuuksista on niin kutsuttu function callin, jonka avulla puhetta käsittelevä tekoälymalli voi siirtää monimutkaisempia tehtäviä muiden Gemini-mallien suoritettavaksi. Esimerkkinä Google mainitsee kuvien luomisen. Jos käyttäjä pyytää puheella Geminiä tekemään jotakin, mitä Transcribe ei itse suorita, tehtävä voidaan välittää tarkoitukseen paremmin soveltuvalle mallille.
Gemini 3.5 Transcribesta on jo saatu esimakua Pixel 11 -puhelimissa Gboardin uuden Rambler-ominaisuuden kautta. Se on tällä hetkellä saatavilla vain valituissa maissa ja valituilla kielillä. Mallia käytetään lisäksi Google Antigravityssä sekä Geminin macOS-sovelluksessa. Myöhemmin Transcribe on tarkoitus tuoda myös Chromeen. Tällöin käyttäjän pitäisi pystyä sanelemaan tekstiä käytännössä mihin tahansa verkkosivulla olevaan tekstikenttään mallia hyödyntäen.
MAINOS (ARTIKKELI JATKUU ALLA)
Gemini Audio -kokonaisuuden toinen keskeinen osa on Gemini 3.5 Live, joka on uusi tekoälyn kanssa käytävässä keskustelussa käytettävä malli.
Google on pyrkinyt ratkaisemaan erityisesti ongelmia, joiden vuoksi puheella käytettävät tekoälyavustajat voivat tuntua tavallista ihmisten välistä keskustelua kömpelömmiltä.
Gemini 3.5 Live pystyy esimerkiksi käsittelemään käyttäjän tekemät keskeytykset kesken lauseen. Lisäksi malli pystyy käsittelemään reaaliaikaista visuaalista tietoa. Tämä mahdollistaa tilanteet, joissa käyttäjä näyttää Gemini-avustajalle jotakin kameralla ja keskustelee samalla näkemästään asiasta.
Gemini 3.5 Live pystyy myös yhdistelemään useita kieliä saman keskustelun aikana eli tilanteita, joissa käyttäjä vaihtaa kielestä toiseen tai käyttää samassa keskustelussa useita kieliä.
Samalla Gemini 3.5 Live voi käynnistää taustalla muita työkaluja keskeyttämättä keskustelua.
Kolmas julkistettu malli on Gemini 3.5 Live Experimental. Nimensä mukaisesti kyseessä on kokeellisempi versio Live-mallista. Se on tarkoitettu erityisesti tilanteisiin, joissa pelkkä nopea keskusteluvastaus ei riitä, vaan tekoälyn täytyy suorittaa monimutkaisempaa päättelyä.
Live Experimental pystyy Googlen mukaan tekemään päättelyä samalla, kun se puhuu käyttäjän kanssa ja malli voi myös selostaa tehtävän etenemistä vaiheittain.
Googlen mukaan uusi Gemini Audio -malliperhe on tulossa kaikkien käyttäjien saataville muun muassa Search Liveen, Gemini Liveen, Google Docsiin, Google Keepiin, Gmailiin, Gemini-sovellukseen ja Gboardiin.
Myös kehittäjät saavat uudet mallit käyttöönsä. Gemini Audio -mallit ovat tulossa tarjolle Gemini API -rajapinnnan, Google AI Studion ja Google Antigravityn kautta. Yritysasiakkaille Google puolestaan tuo mallit Gemini Enterprise Agent Platformiin sekä Gemini Enterprise for Customer Experienceen.
Mainos: Noin 1 600 000 tuotteen hintavertailu ja hintaseuranta - katso Hinta.fistä mistä saat halvimmalla






Salasana hukassa?
Etkö ole vielä rekisteröitynyt? Rekisteröidy tästä »