Et voi pitää sitä laatikossa. Viime viikko osoitti sen kahdesti.
Yhdysvallat julisti tehokkaimman hakkeroivan tekoälyn liian vaaralliseksi vietäväksi. Päivää myöhemmin kiinalainen laboratorio julkaisi vastaavan avoimena. Kykyä ei voi pitää laatikossa, joten lopettakaa salaisuuksienne pitäminen siellä.
Trumpin hallinto päätti, että koskaan rakennetun tehokkaimman hakkeroivan tekoälyn on liian vaarallista päästää maasta ulos. Kiinalaiselta laboratoriolta kesti neljä päivää antaa maailmalle vastaava ilmainen, kannettavalla pyörivä.
9. kesäkuuta Anthropic julkaisi Mythos-mallin, joka lukee koodikannan ja löytää siitä hyväksikäytettävät heikkoudet nopeammin kuin yksikään ihmisjoukko. Kolmea päivää myöhemmin Washington kielsi Anthropicia luovuttamasta Mythosta tai sisarusmallia Fablea kenellekään ulkomaalaiselle, mukaan lukien omat ulkomaalaiset työntekijänsä, ja Anthropic sammutti molemmat kaikilta. Noin vuorokauden ajan maailman kyvykkäin virheidenlöytötekoäli istui laatikossa. Samaan viikkoon kiinalainen laboratorio Zhipu julkaisi GLM-5.2:n: avoimet painot, luvallinen lisenssi, ilmainen lataus joka pyörii kannettavalla, turvallisuusrajapinnat suunniteltu irrotettaviksi. Semgrep vertasi sitä juuri lukittuun malliin, nimesi tuloksen "We have Mythos at Home" ja totesi GLM-5.2:n voittavan Claude Coden yhdessä luokassa pääsynhallintavirheitä noin seitsemäntoista sentillä löydettyä haavoittuvuutta kohti.
Siis yhden viikon sisällä vakava hallinto teki vakavan yrityksen pitää rintamatasoinen kyberkyky laatikossa, ja avoimella painoparilla varustettu vastaava teki laatikosta merkityksettömän ennen kuin uutiskierto ehti vaihtua. Ei siksi, että valvonta olisi ollut laiskaa. Siksi, että kykyä ei voi vientikiellyttää, jos toinen laboratorio voi rakentaa sen uudelleen ja antaa sen ilmaiseksi. Washington päättää, mitä omat yrityksensä julkaisevat. Se ei päätä, mitä muu maailma julkaisee avoimena. Toinen puoli laittoi sen laatikkoon, toinen päästi vastaavan vapaaksi, sama viikko, vastakkaisiin suuntiin, yksi johtopäätös.
Hallinto käsitteli tätä aseena syystä, jonka jokaisen puolustajan kannattaa harkita. Malli, joka itsenäisesti löytää hyväksikäytettäviä heikkouksia, on sellainen, jonka osoitat jokaiseen rakentamaanne muuriin, ja viime viikkoon asti sen vahvin versio eli tarkastetun sadan luona. Nyt vastaava on vapaa, väsymätön, halpa ja pyörii samoilla koneilla, joilla koodinne ja agenttinne jo pyörivät. Hyödyllinen oletus ei enää ole, että pidätte sen ulkopuolella. Se on, että se on jo sisällä, lukee, jahtaa yhtä salaisuutta, joka muuttaa tukikohdan tietomurroksi.
Tämä on kysymys, jonka ympärille rakennimme Clavitorin, vuosia ennen kuin tämä viikko sen puolestamme esitti: ei se, kuinka pitää tiirikka ulkopuolella, vaan se, mitä se löytää, kun se on sisällä.
Jokainen muu holvi on muuri salaisuuden ympärillä. Pääsette muurin ohi varastetulla tokenilla, vuotaneella avaimella, ajossa olevan koodin virheellä, ja salaisuus on siinä heti luettavana. Muuri on koko puolustus, joten muurin murtuminen on koko tietomurto. Muurien ohi pääseminen on juuri sitä, mihin rintamatasoinen haavoittuvuuksienlöytäjä on tarkoitettu.
Teimme vastakkaisen vedon, ainoan, joka selviää tiirikan päästessä irti: muurin päässä ei ole luettavaa salaisuutta. Herkimmät kenttänne salataan avaimella, joka johdetaan omasta laitteistanne, sormenjäljestänne, kasvoistanne, turvaavaimestanne sillä hetkellä kun napautatte sitä, omassa selaimessanne. Avainta ei koskaan lähetetä meille eikä sitä koskaan tallenneta palvelimillemme. Tarkistimme tämän omasta lähdekoodistamme ennen kuin kirjoitimme sen ylös: ottakaa koko backend, jokainen palvelin, koko tietokanta, ja kädessänne on salaustekstiä ja 256-bittinen avain, jota teille ei koskaan annettu ja jota ette löydä, koska se ei koskaan ollut sillä koneella, jonka otitte.
Syy, miksi tämä kestää GLM-5.2:n, on tylsä, ja tylsyys on juuri pointti. Ohjelmistovirheen löytäminen ja 256-bittisen avaimen arvaaminen ovat eri ongelmia. Rintamatasoinen malli on poikkeuksellinen ensimmäisessä eikä parempi kolikonheitosta toisessa, eikä skaalaus muuta tätä. Se hyökkää toteutuksiin. Se ei hyökkää entropiaan. Kaikki muu, mitä pyöritämme, on olemassa vain kaventaakseen sitä, mihin se ulottuu, kunnes ainoa jäljellä oleva hyökkäyskohde on matematiikka, eikä matematiikka avaudu.
Mikään tästä ei tee teistä koskemattomia, ja kuka tahansa, joka myy teille sen lupauksen, valehtelee. Riittävän hyvä hyökkääjä, joka nyt pitää hallussaan ilmaisen rintamatasoisen virheidenlöytäjän, löytää lopulta virheen ajossa olevasta koodista. Olettakaa, että se pääsee sisään. Me olemme vieneet pois hyödyn. Päästyänne sisään salaisuudet ovat salaustekstiä, jonka avainta ei ollut koskaan löydettävissä, koska se elää laitteistanne ja on olemassa vain sillä hetkellä kun käytätte sitä. Me emme lupaa, etteikö teihin voi kohdistua. Me lupaamme, ettei käden ulottuvuuden päässä ole mitään purettavaa.
Tämän viikon otsikko on geopoliittinen, ja se katoaa uutiskierrosta. Kestävä osa on hiljaisempi: kykyä ei voi pitää laatikossa, ja viime viikko osoitti sen kahdesti, vastakkaisiin suuntiin, samaan aikaan. Vastaus ei koskaan ollut parempi laatikko. Se on lopettaa mihinkään laatikkoon paneminen, jonka avaaminen kannattaa vaivaa. Emme rakentaneet holvia, johon kukaan ei pääse sisään. Rakennimme sellaisen, johon pääsee sisään ja lähtee silti tyhjin käsin.
Säännöt, joita noudatamme sen talonpuolen kohdalla, jossa tämä vaara oikeasti asuu, ovat täällä.
Tässä on kysymys, josta kannattaa väitellä, koska vastaus muuttaa tavan, jolla rakennette kaiken muun: uskotteko, että voimme pitää näiden mallien seuraavan sukupolven kokonaan pois järjestelmistämme? Vai onko ainoa rehellinen suunnitelma olettaa, että ne ovat jo sisällä?
Clavitor (@clavitorai) on tekoälyagenteille – ja niitä vastaan – rakennettu tunnistetietojen holvi. clavitor.ai
Lähteet
Fortune (@FortuneMagazine): "Anthropic disables Fable and Mythos AI models following U.S. government export ban." 9.6. julkaisu, 12.6. kauppaministeriön direktiivi, joka kielsi jaon kenelle tahansa ulkomaalaiselle, ja Anthropicin molempien mallien sammuttaminen kaikilta käyttäjiltä. [1]
Semgrep (@semgrep): "We have Mythos at Home: GLM-5.2 beats Claude in our cyber benchmarks." Avoimilla painoilla toimiva GLM-5.2 testattiin haavoittuvuuksien tunnistuksessa, ja se voitti Claude Coden pääsynhallinta- (IDOR-)virheissä noin 0,17 dollarilla löydöstä kohti. [2]
CNBC (@CNBC): "Trump admin allows Anthropic to release Mythos AI model to some companies, government agencies." Mythoksen myöhempi rajoitettu julkaisu noin 100 tarkastetulle yritykselle ja liittovaltion virastolle. [3]
Cybersecurity Dive (@CyberSecDive): "Cybersecurity experts blast U.S. government for restricting Anthropic's AI models." Alan reaktio, jonka mukaan kyky on niin yleinen, ettei rajoitus voinut pitää. [4]