Tekoäly-yhtiö Anthropic on kertonut sisäisen selvityksensä paljastaneen kolme tapausta, joissa sen Claude-tekoälymallit pääsivät luvatta kolmen eri organisaation tuotantojärjestelmiin kyberturvallisuustestien aikana.
Ensimmäinen tapauksista ajoittuu jo huhtikuulle.
Anthropicin mukaan tapaukset havaittiin sen jälkeen, kun toinen tekoäly-yhtiö OpenAI kertoi aiemmin oman tekoälynsä murtautuneen Hugging Facen järjestelmiin sisäisessä testissä. OpenAI-tapauksen jälkeen Anthropic käynnisti oman tarkastuksensa selvittääkseen, olivatko sen tekoälymallit päässeet internetiin testausympäristöistä, joiden olisi pitänyt toimia eristettyinä hiekkalaatikoina.
MAINOS (ARTIKKELI JATKUU ALLA)
Anthropic kertoo tarkastaneensa 141 006 arviointiajoa. Näistä löytyi kolme tapausta, joissa Claude pääsi internetiin ollessaan vuorovaikutuksessa kolmannen osapuolen kumppanin, Irregularin, kanssa.
Anthropicin mukaan pääsy johtui Irregularin kanssa ajetun arviointiympäristön virheellisestä konfiguraatiosta. Anthropicin mukaan kyse oli yhtiöiden välisestä väärinkäsityksestä siitä, oliko testiasetelmalla internet-yhteys. Todellisuudessa yhteys oli auki.
Anthropic sanoo, ettei se pyri siirtämään syytä Irregularille, vaan käsittelee korjaukset kuin vastuu olisi yksin sillä. Irregular tekee lisäksi omaa erillistä selvitystään.
MAINOS (ARTIKKELI JATKUU ALLA)
Avoimen yhteyden vuoksi Claude-mallit päätyivät kolmen eri organisaation tuotantoinfrastruktuuriin ja saivat luvattoman pääsyn käytössä oleviin järjestelmiin.
Tapauksissa oli mukana kolme eri mallia: Claude Opus 4.7, Mythos 5 ja julkaisematon sisäisessä tutkimustestissä ollut malli.
Anthropic korostaa, että jokaisessa tapauksessa Claudelle oli nimenomaisesti kerrottu kehotteessa, ettei sillä ollut internet-yhteyttä. Malli näyttää kuitenkin olettaneen, että vastaan tulleet oikeat järjestelmät olivat osa sille annettua harjoitusta.
Anthropicin mukaan yksi selvityksen kiinnostavimmista löydöksistä oli se, että eri mallit reagoivat eri tavoin, kun ne kohtasivat merkkejä siitä, että kohteet olivat todellisia eivätkä testijärjestelmiä.
MAINOS (ARTIKKELI JATKUU ALLA)
Opus 4.7, kolmesta mallista vanhin, tunnisti kaikissa neljässä kyseisen tapauksen ajossa päätyneensä oikeaan tuotantojärjestelmään. Kahdessa ajossa se järkeili, että todellinen yritys oli ehkä sittenkin osa harjoitusta. Kaikissa neljässä ajossa se kuitenkin jatkoi hyökkäystä, mukaan lukien tunnistetietojen keräämistä ja tuotantodataa sisältävän tietokannan käsittelyä.
Mythos 5 havaitsi myös merkkejä siitä, että se oli oikeassa internetissä. Se kuitenkin päätteli itsensä takaisin uskomaan, että kyse oli yhä simulaatiosta. Tämän jälkeen se julkaisi haitallisen ohjelmistopaketin julkiseen Pythonin PyPI-pakettirekisteriin. Paketti ehdittiin ladata ja suorittaa ulkopuolisissa järjestelmissä ennen kuin se havaittiin.
Vain Anthropicin uusin sisäinen tutkimusmalli pysähtyi omatoimisesti, kun se päätteli kohteen olevan todellinen.
Anthropic sanoo tapausten osoittavan, että tehokkaiden tekoälymallien kyberturvatesteihin tarvitaan merkittäviä lisäsuojauksia. Anthropic huomauttaa myös, että Claudea ajettiin näissä testeissä ilman niitä lisärajoituksia ja turvatoimia, joita se käyttää yleisesti saatavilla olevissa malleissa. Anthropicin mukaan nämä suojaukset olisivat estäneet toiminnan. Ne oli jätetty pois, koska arviointien tarkoituksena oli mitata mallien raakoja kyvykkyyksiä.
MAINOS (ARTIKKELI JATKUU ALLA)
Anthropicin mukaan se ei löytänyt mitään todisteita siitä, että mikään malli olisi “tavoitellut omaa päämääräänsä”. Sen mukaan mallit yrittivät suorittaa niille annettua tehtävää, mutta tekivät sen vaarallisella tavalla tilanteessa, jossa testieristys epäonnistui.
Anthropic vertaa tapausta myös OpenAI:n aiemmin paljastamaan Hugging Face -murtoon, mutta korostaa eroa. OpenAI:n tapauksessa malli hyödynsi tuntematonta ohjelmistohaavoittuvuutta päästäkseen ulos testiympäristöstä. Anthropicin mukaan sen omat mallit eivät murtautuneet hiekkalaatikosta samalla tavalla, vaan pääsivät internetiin virheellisesti auki jätettyä reittiä pitkin.
Yhtiö myös huomauttaa löytäneensä tapaukset itse ennakoivan tarkastuksen kautta. Kahdesta tavoitetusta organisaatiosta kumpikaan ei ollut aiemmin havainnut toimintaa tai ilmoittanut siitä Anthropicille.
Anthropic kertoo tekevänsä nyt yhteistyötä riippumattoman METR-arviointiryhmän kanssa, joka tarkastelee tapauksia kolmannen osapuolen näkökulmasta.
Mainos: Noin 1 600 000 tuotteen hintavertailu ja hintaseuranta - katso Hinta.fistä mistä saat halvimmalla






Salasana hukassa?
Etkö ole vielä rekisteröitynyt? Rekisteröidy tästä »