Du kan ikke holde den i en boks. Sidste uge beviste det to gange.
USA erklærede det mest kraftfulde hacking-AI for farligt til at blive eksporteret. Dage senere open-source'ede et kinesisk laboratorium en tilsvarende model. Du kan ikke holde en kapabilitet i en boks, så hold op med at holde dine hemmeligheder i en.
Trump-administrationen besluttede, at det mest kraftfulde hacking-AI nogensinde bygget var for farligt til at forlade landet. Det tog et kinesisk laboratorium fire dage at give verden en tilsvarende model, gratis, på en bærbar.
Den 9. juni sendte Anthropic Mythos, en model, der læser en kodebase og finder de udnyttelige fejl i den hurtigere end noget menneskeligt team. Tre dage senere forbød Washington Anthropic at give Mythos, eller dens søster Fable, til udenlandske statsborgere, inklusive deres egne ikke-borgere blandt medarbejderne, og Anthropic slukkede begge for alle. I cirka en dag sad den mest kapable fejlfindende AI på jorden i en boks. Så, samme uge, frigav det kinesiske laboratorium Zhipu GLM-5.2: åbne vægte, en permissiv licens, et gratis download, der kører på en bærbar, med sikkerhedskontroller der kan fjernes med vilje. Semgrep benchmarkede den mod den model, Washington lige havde låst inde, kaldte resultatet "We have Mythos at Home," og fandt GLM-5.2 slå Claude Code på en klasse af adgangskontrolfejl til cirka sytten øre per funden sårbarhed.
Så inden for én uge gjorde en seriøs regering et seriøst forsøg på at holde en frontier-kapabilitet inden for cyber i en boks, og en open-weight-tilsvarende gjorde boksen irrelevant, før nyhedscyklussen vendte. Ikke fordi kontrollen var doven. Fordi du ikke kan eksportkontrollere en kapabilitet, som et andet laboratorium kan genopbygge og give væk. Washington bestemmer, hvad deres egne virksomheder sender. De bestemmer ikke, hvad resten af verden open-sourcer. Den ene side satte den i en boks, den anden satte den tilsvarende fri, samme uge, modsatte retninger, én konklusion.
En regering behandlede dette som et våben af en grund, som enhver forsvarer bør sidde med. En model, der autonomt finder udnyttelige fejl, er en, du peger mod hver mur, du har bygget, og indtil sidste uge levede den stærkeste version af den hos et udvalgt hundrede. Nu er den tilsvarende fri, udholdelig, billig, og kører på de samme maskiner, din kode og dine agenter allerede kører på. Den brugbare antagelse er ikke længere, at du kan holde den ude. Det er, at den allerede er inde, læser, jagter den ene hemmelighed, der gør et fodfæste til et brud.
Det er det spørgsmål, vi byggede Clavitor omkring, år før denne uge stillede det for os: ikke hvordan man holder dirkejeren ude, men hvad han finder, når han er inde.
Alle andre hvælve er en mur rundt om en hemmelighed. Kom forbi muren, via et stjålet token, en lækket nøgle, en fejl i den kørende kode, og hemmeligheden ligger lige der til at læse. Muren er hele forsvaret, så når muren fejler, er det hele bruddet. At komme forbi mure er præcis, hvad en frontier-sårbarhedsfinder er til.
Vi tog det modsatte væddemål, det eneste, der overlever, at dirkejeren slipper løs: der er ingen læsbar hemmelighed for enden af muren. Dine mest følsomme felter er krypteret med en nøgle udledt af dit eget hardware, dit fingeraftryk, dit ansigt, din sikkerhedsnøgle, i det øjeblik du trykker på den, inde i din egen browser. Den nøgle sendes aldrig til os og gemmes aldrig på vores servere. Vi tjekkede dette mod vores egen kildekode, før vi skrev det ned: tag hele backenden, hver server, hele databasen, og det, du sidder med, er kryptotekst og en 256-bit-nøgle, du aldrig fik og ikke kan finde, fordi den aldrig var på den maskine, du tog.
Grunden til, at det overlever GLM-5.2, er kedelig, og kedelig er pointen. At finde en softwarefejl og at gætte en 256-bit-nøgle er forskellige problemer. En frontier-model er ekstraordinær til det første og ikke bedre end et møntkast til det andet, og ingen mængde skala ændrer det. Den angriber implementeringer. Den angriber ikke entropi. Så alt det andet, vi kører, findes kun for at formindske, hvad den kan nå, indtil det eneste tilbage at angribe er matematikken, og matematikken åbner ikke.
Intet af det gør dig urørlig, og enhver, der sælger dig det, lyver. En god nok angriber, der nu har en gratis frontier-fejlfinder, vil til sidst finde en fejl i kørende kode. Antag, at den kommer ind. Det, vi tog væk, er udbyttet. Kom ind, og hemmelighederne er kryptotekst, hvis nøgle aldrig var der at finde, fordi den lever på dit hardware og kun findes i det øjeblik, du bruger den. Vi lover ikke, at du ikke kan nås. Vi lover, at der ikke er noget dekrypterbart for enden af rækkevidden.
Overskriften i denne uge er geopolitisk, og den vil cykle ud. Den del, der varer, er mere stille: en kapabilitet kan ikke holdes i en boks, og sidste uge beviste det to gange, i modsatte retninger, på én gang. Svaret var aldrig en bedre boks. Det er at holde op med at lægge noget i en, der er værd at bruge tid på at åbne. Vi byggede ikke et hvælv, ingen kan bryde ind i. Vi byggede det, du kan bryde ind i og stadig gå tomhændet ud af.
De regler, vi holder os selv til, for den side af huset, hvor denne fare faktisk lever, er her.
Så her er spørgsmålet, der er værd at diskutere, fordi svaret ændrer, hvordan du bygger alt det andet: tror du, vi overhovedet kan holde næste generation af disse modeller ude af vores systemer? Eller er den eneste ærlige plan at antage, at de allerede er inde?
Clavitor (@clavitorai) er adgangskodehvælvet bygget til AI-agenter, og imod dem. clavitor.ai
Kilder
Fortune (@FortuneMagazine): "Anthropic disables Fable and Mythos AI models following U.S. government export ban." Lanceringen den 9. juni, handelsdirektivet den 12. juni, der forbød distribution til udenlandske statsborgere, og Anthropic, der deaktiverede begge modeller for alle brugere. [1]
Semgrep (@semgrep): "We have Mythos at Home: GLM-5.2 beats Claude in our cyber benchmarks." Open-weight GLM-5.2 benchmarket på sårbarhedsdetektion, slår Claude Code på adgangskontrolfejl (IDOR) til cirka $0,17 per fund. [2]
CNBC (@CNBC): "Trump admin allows Anthropic to release Mythos AI model to some companies, government agencies." Den senere begrænsede frigivelse af Mythos til cirka 100 udvalgte virksomheder og føderale agenturer. [3]
Cybersecurity Dive (@CyberSecDive): "Cybersecurity experts blast U.S. government for restricting Anthropic's AI models." Branchereaktionen på, at kapabiliteten er almindelig nok til, at kontrollen ikke kunne holde. [4]