Nie da się tego trzymać w pudełku. Zeszły tydzień dowiódł tego dwukrotnie.
Stany Zjednoczone uznały najpotężniejszy model hakujący AI za zbyt niebezpieczny, by go wywozić z kraju. Kilka dni później chińskie laboratorium udostępniło odpowiednik jako otwarty model. Zdolności nie da się zamknąć w pudełku — więc proszę przestać trzymać w nim swoje tajemnice.
Administracja prezydenta Trumpa uznała, że najpotężniejszy model hakujący, jaki kiedykolwiek powstał, jest zbyt niebezpieczny, by opuścić kraj. Chińskiemu laboratorium zajęło cztery dni, by przekazać światu odpowiednik — za darmo, na laptopie.
9 czerwca Anthropic udostępnił Mythos — model, który czyta bazę kodu i znajduje w niej podatne na wykorzystanie błędy szybciej niż jakikolwiek zespół ludzki. Trzy dni później Waszyngton zabronił Anthropicowi przekazywania Mythosa ani jego modelu siostrzanego Fable jakimkolwiek obcokrajowcom, w tym własnym pracownikom bez obywatelstwa amerykańskiego, a Anthropic wyłączył oba modele dla wszystkich. Przez około jeden dzień najpotężniejszy na świecie model znajdujący błędy siedział w pudełku. Potem, w tym samym tygodniu, chińskie laboratorium Zhipu wydało GLM-5.2: otwarte wagi, permisyjna licencja, darmowy plik do pobrania działający na laptopie, z zabezpieczeniami, które da się usunąć już na etapie projektu. Semgrep porównało go z modelem, który Waszyngton właśnie zamknął, zatytułowało wynik "We have Mythos at Home" i stwierdziło, że GLM-5.2 wygrywa z Claude Code w klasie błędów kontroli dostępu, przy koszcie około siedemnastu centów za znalezione podatności.
W ciągu jednego tygodnia poważny rząd podjął poważną próbę zamknięcia przełomowej zdolności cybernetycznej w pudełku, a odpowiednik o otwartych wagach uczynił to pudełko bez znaczenia, zanim zmienił się cykl informacyjny. Nie dlatego, że kontrola była niedbała. Dlatego, że nie da się objąć kontrolą eksportową zdolności, którą inne laboratorium może odtworzyć i rozdać za darmo. Waszyngton decyduje o tym, co udostępniają jego własne firmy. Nie decyduje o tym, co reszta świata publikuje jako otwarty model. Jedna strona zamknęła to w pudełku, druga wypuściła odpowiednik na wolność — ten sam tydzień, przeciwne kierunki, jeden wniosek.
Rząd potraktował to jak broń, i to z powodu, nad którym każdy obrońca powinien się zastanowić. Model, który samodzielnie znajduje podatne na wykorzystanie luki, kieruje Pan na każdą ścianę, którą Pan zbudował, a jeszcze w zeszłym tygodniu najsilniejsza jego wersja istniała w rękach zweryfikowanej setki. Teraz odpowiednik jest darmowy, niezmordowany, tani i działa na tych samych maszynach, na których już działają Pana kod i Pana agenci. Przydatnym założeniem nie jest już to, że uda się Panu go zatrzymać. Jest nim to, że jest już w środku, czyta i poluje na jeden sekret, który zmienia przyczółek w naruszenie.
To jest pytanie, wokół którego zbudowaliśmy Clavitor — na długo zanim ten tydzień zadał je za nas: nie jak zatrzymać wytrych na zewnątrz, lecz co znajduje, gdy jest już w środku.
Każdy inny skarbiec to ściana wokół sekretu. Gdy obejdzie się ścianę — skradzionym tokenem, wyciekniętym kluczem, błędem w działającym kodzie — sekret jest tam, gotowy do odczytu. Ściana stanowi całą obronę, więc jej przekroczenie stanowi całe naruszenie. Obchodzenie ścian to właśnie cel, któremu służy przełomowy model znajdujący podatności.
Postawiliśmy na przeciwne założenie — jedyne, które przetrwa uwolnienie wytrycha: na końcu ściany nie ma sekretu do odczytu. Pana najbardziej wrażliwe pola są szyfrowane kluczem wyprowadzonym z Pana własnego sprzętu, Pana odcisku palca, Pana twarzy, Pana klucza bezpieczeństwa — w chwili, gdy go Pan dotyka, wewnątrz Pana własnej przeglądarki. Ten klucz nigdy nie jest do nas wysyłany i nigdy nie jest przechowywany na naszych serwerach. Sprawdziliśmy to w naszym własnym kodzie źródłowym, zanim to zapisaliśmy: proszę wziąć cały backend, każdy serwer, całą bazę danych, a w rękach pozostanie Panu szyfrogram i klucz 256-bitowy, którego Pan nigdy nie otrzymał i którego nie może Pan znaleźć, bo nigdy nie było go na maszynie, którą Pan zabrał.
Powód, dla którego to przetrwa GLM-5.2, jest nudny — i o to właśnie chodzi. Znalezienie błędu w oprogramowaniu i odgadnięcie klucza 256-bitowego to różne problemy. Przełomowy model jest w pierwszym wybitny, w drugim nie lepszy od rzutu monetą, i żadna skala tego nie zmieni. Atakuje implementacje. Nie atakuje entropii. Dlatego wszystko pozostałe, co uruchamiamy, istnieje wyłącznie po to, by zmniejszyć zasięg modelu — aż jedyną rzeczą, którą można zaatakować, zostanie matematyka, a matematyka się nie otwiera.
Nic z tego nie czyni Pana nietykalnym, i każdy, kto Panu to sprzedaje, kłamie. Wystarczająco dobry atakujący, dysponujący teraz darmowym przełomowym modelem znajdującym błędy, prędzej czy później znajdzie lukę w działającym kodzie. Proszę założyć, że się dostanie. To, co my zabraliśmy, to korzyść. Niech się dostanie — sekrety pozostaną szyfrogramem, którego klucza nigdy tam nie było do znalezienia, bo żyje on w Pana sprzęcie i istnieje tylko w tej chwili, gdy go Pan używa. Nie obiecujemy, że nie da się do Pana dotrzeć. Obiecujemy, że na końcu tego sięgnięcia nie ma niczego, co da się odszyfrować.
Nagłówki w tym tygodniu są geopolityczne i przeminą. Trwalsza część jest cichsza: zdolności nie da się zamknąć w pudełku, a zeszły tydzień dowiódł tego dwukrotnie, w przeciwnych kierunkach, jednocześnie. Odpowiedzią nigdy nie było lepsze pudełko. Chodzi o to, by przestać wkładać do niego cokolwiek, co warto otwierać. Nie zbudowaliśmy skarbca, do którego nikt się nie włamie. Zbudowaliśmy taki, do którego można się włamać i wyjść z niego z pustymi rękami.
Zasady, którym sami się podporządkowujemy — w odniesieniu do tej części firmy, w której to zagrożenie faktycznie występuje — znajdują się tutaj.
Oto więc pytanie warte dyskusji, ponieważ odpowiedź zmienia sposób, w jaki buduje Pan wszystko inne: czy uważa Pan, że w ogóle uda się nam zatrzymać następną generację tych modeli poza naszymi systemami? Czy też jedynym uczciwym planem jest założenie, że są już w środku?
Clavitor (@clavitorai) to skarbiec na poświadczenia zbudowany dla agentów AI i przeciwko nim. clavitor.ai
Źródła
Fortune (@FortuneMagazine): "Anthropic disables Fable and Mythos AI models following U.S. government export ban." Premiera 9 czerwca, dyrektywa Departamentu Handlu z 12 czerwca zabraniająca dystrybucji do jakichkolwiek obcokrajowców oraz wyłączenie obu modeli przez Anthropic dla wszystkich użytkowników. [1]
Semgrep (@semgrep): "We have Mythos at Home: GLM-5.2 beats Claude in our cyber benchmarks." GLM-5.2 z otwartymi wagami poddany testom w wykrywaniu podatności — wygrywa z Claude Code w kategorii błędów kontroli dostępu (IDOR) przy koszcie około 0,17 USD za znalezisko. [2]
CNBC (@CNBC): "Trump admin allows Anthropic to release Mythos AI model to some companies, government agencies." Późniejsze, ograniczone udostępnienie Mythosa mniej więcej 100 zweryfikowanym firmom i agencjom federalnym. [3]
Cybersecurity Dive (@CyberSecDive): "Cybersecurity experts blast U.S. government for restricting Anthropic's AI models." Reakcja branży: zdolność jest na tyle powszechna, że kontrola nie mogła się utrzymać. [4]