Du kan ikke holde den i en boks. Forrige uke beviste det to ganger.
USA mente det kraftigste hacke-AI-et var for farlig til å eksportere. Dager senere ga et kinesisk laboratorium verden en tilsvarende modell, åpen. Du kan ikke holde en kapabilitet i en boks, så slutt å holde hemmelighetene dine i en.
Trump-administrasjonen besluttet at det kraftigste hacke-AI-et som noensinne er bygget, var for farlig til å forlate landet. Det tok et kinesisk laboratorium fire dager å gi verden en tilsvarende modell, gratis, på en laptop.
9. juni lanserte Anthropic Mythos, en modell som leser en kodebase og finner de utnyttbare svakhetene i den raskere enn noe menneskelig team. Tre dager senere forbød Washington Anthropic å gi Mythos, eller søskenmodellen Fable, til utenlandske statsborgere, inkludert selskapets egne ansatte som ikke er borgere, og Anthropic slo av begge for alle. I omtrent et døgn satt den mest kapable feilfunnende AI-en på jorden i en boks. Så, samme uke, lanserte det kinesiske laboratoriet Zhipu GLM-5.2: åpne vekter, en lisens med få begrensninger, en gratis nedlasting som kjører på en laptop, med sikkerhetskontroller som kan fjernes med vilje. Semgrep målte den mot modellen Washington nettopp hadde låst inne, kalte resultatet «We have Mythos at Home», og fant at GLM-5.2 slo Claude Code på en klasse av tilgangskontrollfeil til omtrent sytten cent per sårbarhet funnet.
Så i løpet av én uke gjorde en seriøs regjering et seriøst forsøk på å holde en frontier-kapabilitet for nettkrigføring i en boks, og en åpen tilsvarende modell gjorde boksen irrelevant før nyhetssyklusen rullet videre. Ikke fordi kontrollen var slurvete. Fordi du ikke kan eksportkontrollere en kapabilitet som et annet laboratorium kan bygge på nytt og gi bort. Washington bestemmer hva selskapene deres sender ut. Det bestemmer ikke hva resten av verden publiserer åpent. Den ene siden la den i en boks, den andre satte den tilsvarende fri, samme uke, motsatt retning, én konklusjon.
En regjering behandlet dette som et våpen, av en grunn hver forsvarer bør sitte med. En modell som selvstendig finner utnyttbare svakheter, er en du retter mot hver vegg du har bygget, og fram til forrige uke levde den sterkeste versjonen av det hos hundre gjennomgåtte selskaper. Nå er den tilsvarende gratis, utrettelig, billig, og kjører på de samme maskinene koden og agentene dine allerede kjører på. Den nyttige antakelsen er ikke lenger at du kan holde den ute. Det er at den allerede er inne, leser, jakter på den ene hemmeligheten som gjør et fotfeste om til et brudd.
Det er spørsmålet vi bygde Clavitor rundt, år før denne uken stilte det for oss: ikke hvordan du holder dirkeboksen ute, men hva den finner når den er inne.
Alle andre hvelv er en vegg rundt en hemmelighet. Kom forbi veggen, via en stjålet token, en lekket nøkkel, en feil i kjørende kode, og hemmeligheten ligger der rett foran deg. Veggen er hele forsvaret, så når veggen svikter, er det hele bruddet. Å komme forbi vegger er nøyaktig hva en frontier-modell for å finne sårbarheter er laget for.
Vi tok det motsatte veddemålet, det eneste som overlever at dirkeboksen kommer løs: det er ingen lesbar hemmelighet på andre siden av veggen. De mest sensitive feltene dine er kryptert med en nøkkel avledet fra din egen hardware, fingeravtrykket ditt, ansiktet ditt, sikkerhetsnøkkelen din, i det øyeblikket du tapper den, inne i din egen nettleser. Den nøkkelen sendes aldri til oss og lagres aldri på serverne våre. Vi sjekket dette mot vår egen kildekode før vi skrev det ned: ta hele backenden, hver server, hele databasen, og det du sitter igjen med er kryptert tekst og en 256-bit-nøkkel du aldri fikk og ikke kan finne, fordi den aldri var på maskinen du tok.
Grunnen til at det overlever GLM-5.2 er kjedelig, og kjedelig er poenget. Å finne en programvarefeil og å gjette en 256-bit-nøkkel er ulike problemer. En frontier-modell er enestående på det første og ikke bedre enn et myntkast på det andre, og ingen mengde skala endrer det. Den angriper implementasjoner. Den angriper ikke entropi. Så alt det andre vi kjører finnes bare for å krympe det den kan nå, til det eneste som er igjen å angripe er matematikken, og matematikken åpner seg ikke.
Ingenting av dette gjør deg urørlig, og den som selger deg det, lyver. En god nok angriper, som nå har en gratis frontier-modell for å finne feil, vil til slutt finne en svakhet i kjørende kode. Anta at den kommer inn. Det vi tok fra den er utbyttet. Kom inn, og hemmelighetene er kryptert tekst hvis nøkkel aldri var der å finne, fordi den lever på hardwaren din og bare finnes i det øyeblikket du bruker den. Vi lover ikke at du ikke kan nås. Vi lover at det ikke er noe dekrypterbart på andre siden av rekkevidden.
Overskriften denne uken er geopolitisk, og den vil sykle ut. Den delen som varer, er roligere: en kapabilitet kan ikke holdes i en boks, og forrige uke beviste det to ganger, i motsatt retning, samtidig. Svaret var aldri en bedre boks. Det er å slutte å legge noe i en som er verdt bryet med å åpne. Vi bygde ikke et hvelv ingen kan bryte seg inn i. Vi bygde det du kan bryte deg inn i og fortsatt gå tomhendt ut av.
Reglene vi holder oss selv til, for den siden av huset der denne faren faktisk lever, er her.
Så her er spørsmålet verdt å diskutere, fordi svaret endrer hvordan du bygger alt annet: tror du vi i det hele tatt kan holde neste generasjon av disse modellene ute av systemene våre? Eller er den eneste ærlige planen å anta at de allerede er inne?
Clavitor (@clavitorai) er hvelvet for påloggingsinformasjon bygget for AI-agenter, og mot dem. clavitor.ai
Kilder
Fortune (@FortuneMagazine): "Anthropic disables Fable and Mythos AI models following U.S. government export ban." Lanseringen 9. juni, direktivet fra Handelsdepartementet 12. juni som forbød distribusjon til utenlandske statsborgere, og at Anthropic slo av begge modellene for alle brukere. [1]
Semgrep (@semgrep): "We have Mythos at Home: GLM-5.2 beats Claude in our cyber benchmarks." Åpen GLM-5.2 målt på sårbarhetsdeteksjon, som slår Claude Code på tilgangskontrollfeil (IDOR) til omtrent $0,17 per funn. [2]
CNBC (@CNBC): "Trump admin allows Anthropic to release Mythos AI model to some companies, government agencies." Den senere begrensede utgivelsen av Mythos til omtrent 100 gjennomgåtte selskaper og føderale etater. [3]
Cybersecurity Dive (@CyberSecDive): "Cybersecurity experts blast U.S. government for restricting Anthropic's AI models." Reaksjonen fra bransjen på at kapabiliteten er vanlig nok til at kontrollen ikke kunne holde. [4]