Lồng chưa bao giờ là vấn đề. Vấn đề là những chiếc chìa khóa bên trong.
Ngày 8 tháng 7, chúng tôi viết rằng sandbox kiểm soát nơi một agent chạy, chứ không phải thứ nó có thể lấy đi. Tám ngày sau, một agent tự trị đã chạy hơn 17.000 hành động trên các cụm nội bộ của Hugging Face. Không gì lọt ra khỏi worker. Và cũng chẳng cần phải thế.
Ngày 8 tháng 7, chúng tôi viết rằng việc cách ly nơi một agent chạy không cho bạn biết gì về thứ nó có thể lấy đi, vì thông tin đăng nhập mà nó cần để làm việc nằm ngay trong lồng cùng nó. Tám ngày sau, Hugging Face tiết lộ rằng một agent tự trị đã thực hiện hơn 17.000 hành động trên các cụm nội bộ của họ.
Không gì lọt ra ngoài. Và cũng chẳng cần phải thế.
Mọi chuyện bắt đầu từ một tập dữ liệu độc hại mang theo hai cách thực thi mã: một trình tải remote-code và một lỗi chèn mẫu trong phần config của tập dữ liệu. Chỉ việc tải nó là đủ để chạy mã trên một worker xử lý.
Worker đó là ranh giới. Nó đã giữ vững. Chỉ là điều đó chẳng có ý nghĩa gì.
Agent chiếm quyền truy cập cấp node, thu thập thông tin đăng nhập đám mây và cụm nằm trên máy đó, rồi dùng chúng để đi thẳng vào các cụm nội bộ khác. Nó duy trì một đàn sandbox vòng đời ngắn, dựng lại kênh command-and-control trên các dịch vụ công khai mỗi khi một sandbox chết đi. Trong một cuối tuần, 17.000 hành động. Không ai gõ một lệnh nào trong số đó.
Những thông tin đăng nhập trên worker đó có hiệu lực ở bất kỳ đâu agent muốn hướng tới.
Chìa khóa cứ nằm chỏng chơ ở đó.
Hugging Face xử lý phần khó rất tốt. Hệ thống phát hiện bắt được một cuộc tấn công được dựng để trông như automation thông thường, việc khoanh vùng giữ vững, và họ xác minh rằng các mô hình, tập dữ liệu và Spaces công khai không bị đụng tới, chuỗi cung ứng sạch. Thông báo thẳng thắn về những gì thực sự đã mất: một số tập dữ liệu nội bộ hạn chế, và thông tin đăng nhập mà nhiều dịch vụ phụ thuộc. Việc giám định pháp y khó hơn mức cần thiết, vì những lý do thuộc về tranh luận của người khác.
Phần của chúng tôi là thông tin đăng nhập. Một bí mật sống trên máy nơi mã chạy sẽ thuộc về bất cứ thứ gì chạy tiếp theo. Điều đó đúng với một file .env trên laptop, và đúng với một thông tin đăng nhập đám mây trên worker xử lý của một công ty làm nghề này. Agent không cần màn thoát hiểm nào khéo léo. Nó cần một chiếc chìa khóa có hiệu lực ở nơi khác, và chiếc chìa khóa thì nằm chỏng chơ ở đó.
Giữ chìa khóa ở ngoài lồng.
Một thông tin đăng nhập chỉ tồn tại trong khoảnh khắc của lời gọi sẽ không có mặt trên worker khi agent bắt đầu tìm kiếm. Một thông tin đăng nhập gắn với máy nơi nó được cấp sẽ là đồ bỏ đi trong sandbox kế tiếp. Một agent chỉ với tới đúng thứ mà nó được gọi tên để với tới sẽ không thể phát hiện ra cụm bên cạnh. Và mỗi lần sử dụng đều được ghi ra khỏi máy, xâu chuỗi bằng hash, nơi một tiến trình sở hữu máy không thể viết lại lịch sử của chính nó.
Không điều nào trong số đó vá được một trình tải tập dữ liệu. Mã vẫn chạy trên worker đó, và một thông tin đăng nhập còn hiệu lực trong khoảnh khắc đó vẫn có thể bị tiêu trong khoảnh khắc đó. Điều thay đổi là sự kế thừa: một chiếc chìa khóa phạm vi hẹp, có hạn dùng cho một việc, thay vì một chùm chìa khóa đi theo. Cuộc xâm nhập vẫn xảy ra. Chỉ là nó không còn kéo dài cả một cuối tuần.
Lồng vẫn tốt. Hãy làm trống nó.
Lồng của Hugging Face đã hoạt động. Mọi nền tảng agent đang đua nhau xây một cái lồng tốt hơn, và đó là cuộc đua sai để giành chiến thắng một mình. Hãy hỏi câu khác: khi thứ gì đó bên trong bị quay lại chống bạn, thứ nằm trong tầm với là gì? Nếu câu trả lời là một thông tin đăng nhập có hiệu lực trên máy kế tiếp, thì bạn không xây một sandbox. Bạn xây một căn phòng với chìa khóa dán ở trong.
Những tính chất mà một thông tin đăng nhập cần có khi tiến trình đang nắm giữ nó bị chiếm: https://x.com/clavitorai/status/2071121333719625842
Clavitor (@clavitorai) là kho thông tin đăng nhập được xây cho các AI agent, và để chống lại chính họ. clavitor.ai
Nguồn
Hugging Face (@huggingface): "Thông báo sự cố bảo mật — tháng 7 năm 2026." Thông báo chính thức. Một cuộc xâm nhập được điều khiển từ đầu đến cuối bởi một hệ thống agent tự trị, đi vào qua pipeline xử lý dữ liệu bằng một tập dữ liệu độc hại lạm dụng hai đường thực thi mã (trình tải tập dữ liệu remote-code, chèn mẫu trong config của tập dữ liệu). Truy cập trái phép vào một số tập dữ liệu nội bộ hạn chế và vào một số thông tin đăng nhập mà các dịch vụ của họ sử dụng. Không có dấu hiệu can thiệp vào các mô hình, tập dữ liệu hay Spaces công khai; chuỗi cung ứng phần mềm được xác minh sạch. Hơn 17.000 hành động của kẻ tấn công được ghi lại. [1]
The Hacker News (@TheHackersNews): "Kho mô hình AI lớn nhất thế giới Hugging Face bị xâm nhập bởi AI agent tự trị." [2]
Clavitor (@clavitorai): "Lồng giữ được nơi agent chạy. Không giữ được thứ nó có thể lấy đi." Ngày 8 tháng 7 năm 2026 — dự đoán mà sự cố này đã kiểm chứng. [3]
(Kiểm tra các handle còn hoạt động trước khi đăng: @huggingface, @TheHackersNews.)