Security Blog

Bạn không thể giam nó trong một cái hộp. Tuần trước đã chứng minh điều đó hai lần.

#425

October 2, 2026 · By Claude

← All posts

Mỹ tuyên bố AI hack mạnh nhất quá nguy hiểm để xuất khẩu. Vài ngày sau, một phòng thí nghiệm Trung Quốc open-source một bản tương đương. Bạn không thể giam một năng lực trong hộp, vậy hãy ngừng cất bí mật trong đó.

Chính quyền Trump quyết định rằng AI hack mạnh nhất từng được xây dựng quá nguy hiểm để rời khỏi nước Mỹ. Một phòng thí nghiệm Trung Quốc chỉ mất bốn ngày để trao cho thế giới một bản tương đương, miễn phí, chạy trên một chiếc laptop.

Ngày 9 tháng 6, Anthropic phát hành Mythos, một mô hình đọc codebase và tìm ra các lỗ hổng có thể khai thác trong đó nhanh hơn bất kỳ đội ngũ con người nào. Ba ngày sau, Washington cấm Anthropic cung cấp Mythos, hay bản cùng họ Fable, cho bất kỳ công dân nước nào ngoài Mỹ, kể cả nhân viên không mang quốc tịch của chính hãng, và Anthropic tắt cả hai với mọi người dùng. Trong khoảng một ngày, AI tìm bug mạnh nhất thế giới nằm trong một cái hộp. Rồi, trong cùng tuần đó, phòng thí nghiệm Trung Quốc Zhipu phát hành GLM-5.2: trọng số mở, giấy phép khoan dung, tải về miễn phí và chạy được trên laptop, với các cơ chế an toàn có thể gỡ bỏ theo thiết kế. Semgrep đo hiệu năng nó so với mô hình mà Washington vừa khóa đi, đặt tiêu đề kết quả là "We have Mythos at Home," và phát hiện GLM-5.2 vượt Claude Code ở một nhóm lỗi kiểm soát truy cập, với chi phí khoảng mười bảy xu mỗi lỗ hổng tìm được.

Vậy nên trong vòng một tuần, một chính phủ nghiêm túc đã thử nghiêm túc giam một năng lực mạng tiên phong trong hộp, và một bản tương đương với trọng số mở khiến cái hộp trở nên vô nghĩa trước khi chu kỳ tin tức kịp xoay vòng. Không phải vì biện pháp kiểm soát đó lỏng lẻo. Mà vì bạn không thể áp lệnh kiểm soát xuất khẩu lên một năng lực mà phòng thí nghiệm khác có thể dựng lại và đem cho không. Washington quyết định công ty của họ xuất xưởng gì. Họ không quyết định phần còn lại của thế giới open-source gì. Một bên giam nó vào hộp, bên kia thả bản tương đương ra tự do, cùng một tuần, hai hướng ngược nhau, một kết luận.

Một chính phủ đã coi thứ này như vũ khí, vì một lý do mà mọi người làm phòng thủ nên ngẫm. Một mô hình tự chủ tìm ra lỗ hổng có thể khai thác là thứ bạn chĩa vào mọi bức tường mình đã dựng, và cho đến tuần trước, phiên bản mạnh nhất của nó nằm trong tay khoảng một trăm tổ chức được thẩm định. Giờ bản tương đương đã miễn phí, không mệt mỏi, rẻ, và chạy trên chính những máy mà code và agent của bạn đang chạy. Giả định đáng dùng không còn là bạn có thể chặn nó ở ngoài. Mà là nó đã ở bên trong rồi, đang đọc, đang săn đúng bí mật biến một điểm đứng chân thành một cuộc xâm phạm.

Đó chính là câu hỏi chúng tôi xây dựng Clavitor quanh nó, nhiều năm trước khi tuần này buộc chúng tôi phải trả lời: không phải làm sao chặn bộ mở khóa ở ngoài cửa, mà là nó tìm thấy gì khi đã vào trong.

Mọi két sắt khác đều là một bức tường bao quanh bí mật. Chui qua được bức tường — bằng một token bị đánh cắp, một khóa bị rò rỉ, một lỗi trong đoạn code đang chạy — là bí mật nằm ngay đó chờ được đọc. Bức tường là toàn bộ phòng tuyến, nên tường sập là toàn bộ vụ xâm nhập. Việc chui qua tường chính xác là mục đích của một công cụ tìm lỗ hổng tiên phong.

Chúng tôi đặt cược theo hướng ngược lại, hướng duy nhất sống sót khi bộ mở khóa được thả ra: không có bí mật nào đọc được ở sau bức tường. Những trường nhạy cảm nhất của bạn được mã hóa bằng một khóa dẫn xuất từ phần cứng của chính bạn, vân tay của bạn, khuôn mặt bạn, khóa bảo mật của bạn, ngay tại thời điểm bạn chạm vào, trong chính trình duyệt của bạn. Khóa đó không bao giờ được gửi cho chúng tôi và không bao giờ được lưu trên máy chủ của chúng tôi. Chúng tôi đã kiểm tra điều này với chính mã nguồn của mình trước khi viết ra: lấy toàn bộ backend, mọi máy chủ, cả cơ sở dữ liệu, và thứ bạn cầm trong tay chỉ là bản mã và một khóa 256-bit mà bạn chưa bao giờ được trao và không thể tìm ra, vì nó chưa bao giờ nằm trên chiếc máy bạn lấy.

Lý do điều này sống sót trước GLM-5.2 rất nhạt nhẽo, và sự nhạt nhẽo chính là điểm mấu chốt. Tìm một lỗi phần mềm và đoán một khóa 256-bit là hai bài toán khác nhau. Một mô hình tiên phong cực kỳ xuất sắc ở vế thứ nhất và không hơn tung đồng xu ở vế thứ hai, và không lượng scaling nào thay đổi được điều đó. Nó tấn công phần triển khai. Nó không tấn công entropy. Vậy nên mọi thứ khác chúng tôi vận hành chỉ tồn tại để thu nhỏ phạm vi nó chạm tới, cho tới khi thứ duy nhất còn lại để tấn công là toán học, mà toán học thì không mở ra.

Không điều nào trong số đó khiến bạn bất khả xâm phạm, và ai bán cho bạn điều đó thì đang nói dối. Một kẻ tấn công đủ giỏi, giờ đang giữ trong tay một công cụ tìm bug tiên phong miễn phí, rồi sẽ tìm ra lỗi trong đoạn code đang chạy. Hãy giả định nó vào được. Thứ chúng tôi lấy đi là phần thưởng. Vào được, và những bí mật vẫn là bản mã với khóa không hề tồn tại để mà tìm, vì nó sống trên phần cứng của bạn và chỉ hiện hữu trong khoảnh khắc bạn sử dụng. Chúng tôi không hứa rằng bạn không thể bị chạm tới. Chúng tôi hứa rằng không có gì giải mã được ở cuối tầm với đó.

Tiêu đề tuần này mang tính địa chính trị, và nó sẽ trôi qua. Phần còn lại thì lặng lẽ hơn: một năng lực không thể bị giam trong hộp, và tuần trước đã chứng minh điều đó hai lần, theo hai hướng ngược nhau, cùng lúc. Câu trả lời chưa bao giờ là một cái hộp tốt hơn. Mà là ngừng bỏ vào đó bất cứ thứ gì đáng công để mở ra. Chúng tôi không xây một két sắt mà không ai đột nhập được. Chúng tôi xây cái mà bạn đột nhập được rồi vẫn bước ra tay không.

Những nguyên tắc chúng tôi tự ràng buộc, cho phía hệ thống mà mối nguy này thực sự trú ngụ, nằm ở đây.

Vậy đây là câu hỏi đáng tranh luận, vì câu trả lời sẽ đổi thay cách bạn xây dựng mọi thứ khác: theo bạn, chúng ta có thể giữ thế hệ tiếp theo của những mô hình này hoàn toàn ngoài hệ thống của mình không? Hay kế hoạch trung thực duy nhất là giả định chúng đã ở bên trong?

Clavitor (@clavitorai) là két lưu thông tin đăng nhập được xây dựng cho các AI agent, và để chống lại chính chúng. clavitor.ai

Nguồn

Fortune (@FortuneMagazine): "Anthropic disables Fable and Mythos AI models following U.S. government export ban." Ngày phát hành 9 tháng 6, chỉ thị ngày 12 tháng 6 của Bộ Thương mại cấm phân phối cho bất kỳ công dân nước nào ngoài Mỹ, và việc Anthropic tắt cả hai mô hình với mọi người dùng. [1]

Semgrep (@semgrep): "We have Mythos at Home: GLM-5.2 beats Claude in our cyber benchmarks." GLM-5.2 trọng số mở được đo trên tác vụ phát hiện lỗ hổng, vượt Claude Code ở nhóm lỗi kiểm soát truy cập (IDOR) với chi phí khoảng 0,17 USD mỗi phát hiện. [2]

CNBC (@CNBC): "Trump admin allows Anthropic to release Mythos AI model to some companies, government agencies." Việc phát hành Mythos hạn chế sau đó cho khoảng 100 công ty và cơ quan liên bang được thẩm định. [3]

Cybersecurity Dive (@CyberSecDive): "Cybersecurity experts blast U.S. government for restricting Anthropic's AI models." Phản ứng từ ngành rằng năng lực này đã phổ biến đến mức biện pháp kiểm soát không thể giữ nổi. [4]