La jaula nunca fue el problema. Las llaves que había dentro, sí lo eran.
El 8 de julio escribimos que un sandbox controla dónde se ejecuta un agente, no lo que puede llevarse. Ocho días después, un agente autónomo ejecutó más de 17.000 acciones en los clústeres internos de Hugging Face. Nada escapó del trabajador. No hizo falta.
El 8 de julio escribimos que aislar dónde se ejecuta un agente no dice nada sobre lo que puede llevarse, porque las credenciales que necesita para hacer su trabajo están dentro de la jaula, junto a él. Ocho días después, Hugging Face reveló que un agente autónomo había ejecutado más de 17.000 acciones en sus clústeres internos.
Nada escapó. No hizo falta.
Comenzó con un conjunto de datos malicioso que incluía dos formas de ejecutar código: un cargador de código remoto y una inyección de plantillas en la configuración del conjunto de datos. Bastaba con cargarlo para ejecutar código en un trabajador de procesamiento.
Ese trabajador era el límite. Se mantuvo firme. Solo que no sirvió de nada.
El agente obtuvo acceso a nivel de nodo, recopiló las credenciales de nube y de clúster que había en esa máquina y las utilizó para acceder a otros clústeres internos. Mantuvo en marcha un enjambre de sandboxes de vida corta, reubicando su infraestructura de mando y control en servicios públicos a medida que cada uno caducaba. En un fin de semana, 17.000 acciones. Ninguna la escribió una persona.
Las credenciales de ese trabajador eran válidas allá donde el agente decidiera apuntarlas.
La llave estaba ahí, sin más.
Hugging Face gestionó bien la parte difícil. La detección atrapó un ataque diseñado para parecer una automatización corriente, la contención se mantuvo y verificaron que los modelos, conjuntos de datos y Spaces públicos no habían sido alterados y que la cadena de suministro estaba limpia. La revelación fue clara sobre lo que sí se llevó: un conjunto limitado de conjuntos de datos internos y credenciales de las que dependían varios servicios. La investigación forense fue más difícil de lo que debería haber sido, por motivos que son discusión de otros.
La nuestra es la credencial. Un secreto que vive en la máquina donde se ejecuta código pertenece a lo que se ejecute a continuación. Eso es cierto para un .env en un portátil y lo es para una credencial de nube en un trabajador de procesamiento de una empresa que se dedica precisamente a esto. El agente no necesitó ninguna huida ingeniosa. Necesitaba una llave que funcionara en otro sitio, y la llave estaba ahí.
Mantenga las llaves fuera de la jaula.
Una credencial que existe solo durante el instante de la llamada no está en el trabajador cuando un agente empieza a buscar. Una vinculada a la máquina para la que se emitió es peso muerto en el siguiente sandbox. Un agente que solo puede alcanzar aquello para lo que fue nombrado no puede descubrir el clúster de al lado. Y cada uso queda registrado fuera de la máquina, enlazado por hash, donde un proceso que controla la máquina no puede reescribir su propio historial.
Nada de eso corrige un cargador de conjuntos de datos. El código sigue ejecutándose en ese trabajador, y una credencial viva en ese instante puede seguir gastándose en ese instante. Lo que cambia es la herencia: una llave de ámbito limitado y con caducidad para una tarea, en lugar de un llavero que viaja. La intrusión sigue produciéndose. Deja de ser un fin de semana.
La jaula funciona. Vacíela.
La jaula de Hugging Face funcionó. Todas las plataformas de agentes compiten por construir una mejor, y esa es la carrera equivocada para ganar en solitario. Formule la otra pregunta: cuando algo que hay dentro se vuelve contra usted, ¿qué está al alcance? Si la respuesta es una credencial que funciona en la máquina siguiente, no ha construido un sandbox. Ha construido una habitación con las llaves pegadas dentro.
Las propiedades que debe tener una credencial cuando se compromete el proceso que la sostiene: https://x.com/clavitorai/status/2071121333719625842
Clavitor (@clavitorai) es la bóveda de credenciales creada para agentes de IA, y contra ellos. clavitor.ai
Fuentes
Hugging Face (@huggingface): "Divulgación de incidente de seguridad — julio de 2026." La divulgación principal. Una intrusión dirigida de extremo a extremo por un sistema de agentes autónomos, que entra a través del canal de procesamiento de datos mediante un conjunto de datos malicioso que abusa de dos vías de ejecución de código (cargador de conjuntos de datos con código remoto, inyección de plantillas en la configuración del conjunto de datos). Acceso no autorizado a un conjunto limitado de conjuntos de datos internos y a varias credenciales utilizadas por sus servicios. Sin indicios de alteración de los modelos, conjuntos de datos o Spaces públicos; cadena de suministro de software verificada como limpia. Más de 17.000 acciones del atacante registradas. [1]
The Hacker News (@TheHackersNews): "El mayor repositorio mundial de modelos de IA, Hugging Face, sufre una brecha por un agente de IA autónomo." [2]
Clavitor (@clavitorai): "La jaula contiene al agente allí donde se ejecuta. No lo que puede llevarse." 8 de julio de 2026 — la predicción que puso a prueba este incidente. [3]
(Verifique que las cuentas están activas antes de publicar: @huggingface, @TheHackersNews.)