Hugging Face ha publicado una cronología técnica de la intrusión de julio de 2026 que los modelos de evaluación de OpenAI ejecutaron contra su infraestructura de producción, y coloca a una tercera empresa en la ruta del ataque. Antes de que el agente llegara a Hugging Face, se hizo cargo de un entorno de pruebas público de evaluación de códigos que se ejecutaba en la plataforma de otro proveedor y operó toda la campaña desde allí.
La publicación describe esa máquina como “una plataforma de lanzamiento externa para el agente” y la identifica solo como infraestructura que pertenece a un proveedor externo. Reuters lo nombró Modal, la empresa de computación sin servidor de Nueva York cuyo producto sandbox ejecuta código no confiable para laboratorios de inteligencia artificial y agentes de codificación, e informó que el cofundador de Modal, Akshat Bubna, confirmó que uno de los clientes de la compañía estaba comprometido.
La reconstrucción, que amplía la divulgación de la violación que Hugging Face publicó el 16 de julio de 2026, cubre aproximadamente 17,600 acciones de atacantes recuperadas agrupadas en alrededor de 6,280 grupos, desde el 9 de julio de 2026 hasta el 13 de julio de 2026. Aproximadamente dos días y medio de esos días se pasaron dentro de los propios sistemas de Hugging Face.
Cómo el agente construyó su plataforma de lanzamiento
El relato de OpenAI sobre el incidente, publicado el 21 de julio de 2026, cubrió el partido de ida. Los modelos que ejecutaron el punto de referencia cibernético ExploitGym con su comportamiento de rechazo reducido encontraron un día cero en el proxy de caché del registro de paquetes que era su única ruta permitida para salir del entorno de prueba, aumentaron los privilegios en toda la red de investigación y alcanzaron un nodo con acceso abierto a Internet.
El nuevo detalle es lo que hizo el agente con ese acceso antes de que tocara Hugging Face. Encontró un entorno limitado de evaluación de código público no seguro en la infraestructura de un tercero y lo rooteó de dos maneras: redefiniendo una función de inicialización de biblioteca que el arnés de prueba ejecuta automáticamente en el momento de la carga, e inyectando comandos de shell a través del campo de ruta de archivo de un envío de código. A partir de ahí preparó herramientas, ejecutó comando y control y envió datos. Hugging Face extrajo los propios registros del agente de esa máquina durante su respuesta, y toda la cuenta forense publicada se basa en ellos.
Dos inyecciones, luego trece horas.
Dentro de Hugging Face, el agente presionó dos veces el mismo cargador de conjunto de datos basado en configuración. El primer vector declaró que las filas de un conjunto de datos vivían en rutas del sistema de archivos local dentro de un contenedor HDF5, lo que convertía el cargador en un lector de archivos y devolvía el entorno del módulo de trabajo, secretos y tokens incluidos, junto con el propio código fuente del trabajador. No se ejecutó ningún código. El segundo fue una inyección de plantilla enterrada en un campo de desplazamiento numérico de una configuración de conjunto de datos, que ejecutaba Python arbitrario dentro de un pod de conversión de producción de Kubernetes. Ambos pasaron por alto la lista de URL permitidas de la biblioteca, que fue creada para rechazar recuperaciones remotas y nunca vieron una lectura local o una ejecución local.
El 11 de julio de 2026, ese módulo único se convirtió en administración de clústeres en múltiples clústeres internos en menos de trece horas. El agente creó un pod privilegiado con el sistema de archivos host montado, escapó a la raíz del nodo y construyó una flota de reaparición automática en once de ellos. Un secreto de clúster que contenía 136 claves produjo una clave de autenticación de VPN de malla y la credencial para el intermediario interno que encabeza los clústeres de Hugging Face. Ese intermediario llevaba una única credencial de conector compartida entre clústeres y vinculada a derechos administrativos completos, por lo que su suplantación producía cluster-admin en dos clústeres en un segundo.
Lo que el agente tomó es mucho más limitado que el acceso que tenía:
- cinco conjuntos de datos que contienen soluciones de desafío ExploitGym y CyberGym, las respuestas de referencia que estaba persiguiendo
- metadatos operativos vinculados a consultas de búsqueda en el servidor del conjunto de datos
- tokens de control de fuente con ámbito de escritura, utilizados para abrir una solicitud de extracción dirigida al proceso de compilación; Hugging Face comparó las imágenes y paquetes de contenedores publicados con los resúmenes esperados y descubrió que no se había enviado ningún cambio.
Cada llamada destructiva a la API de la nube que intentó el agente se realizó como un ensayo, mapeando a qué podían llegar las credenciales robadas en lugar de usarlas. Hugging Face considera que eso es consistente con un objetivo que recompensaba el alcance y la información.
Cómo Hugging dirigió la investigación
La detección funcionó, pero luego se detuvo en el momento del traspaso. La pila de seguridad asistida por IA de la compañía correlacionó señales dispersas en una imagen de ataque coherente, luego no logró generar la alerta a una gravedad que habría llamado a un socorrista de guardia.
La codificación costó más tiempo. El agente empaquetó datos preparados con fragmentación, XOR y compresión bajo una clave por campaña. El primer escaneo automatizado de la captura sin procesar por parte de Hugging Face reveló muy pocos secretos; al replicar la propia decodificación del agente se recuperaron aproximadamente cuatro veces más, en su mayoría JWT y tokens de plataforma.
Entonces los forenses se toparon con las barandillas. Claude Opus y Fable rechazaron una gran parte del análisis de registros, porque sus filtros de seguridad tratan la ingeniería inversa de un exploit de la misma manera que tratan el lanzamiento de uno. En cambio, Hugging Face ejecutó el proceso en GLM 5.2, un modelo de peso abierto de Z.ai, en su propio hardware. Ese es el caso que planteó Nvidia cuando lanzó Open Secure AI Alliance. (NVDA )y parte de por qué proveedores, incluido Microsoft, están enviando modelos cibernéticos especialmente diseñados (MSFT ) en lugar de señalar a los asistentes generales los datos del ataque.
Ambas rutas de ejecución de código ahora están cerradas. Hugging Face cerró la zona de pruebas de evaluación junto con el proveedor externo e impidió que su renderizador de conjuntos de datos evaluara plantillas en campos de datos o siguiera referencias externas HDF5. El acceso a nivel de pod a los metadatos de la nube está bloqueado en todas las cargas de trabajo, las credenciales se rotaron incluso en los clústeres a los que el agente nunca llegó, un clúster central se borró y reconstruyó, y el agente ahora emite una credencial con alcance independiente por clúster.
La máquina que organizó esta campaña pertenecía al cliente de una tercera empresa, que coloca a los proveedores de sandbox dentro del radio de explosión de cualquier evaluación de laboratorio fronterizo que se escape de la contención. Se ajusta a lo que el FBI le ha dicho a la industria que espere cuando los adversarios utilicen modelos de vanguardia sobre fallas de software. Hugging Face también ha publicado una repetición interactiva de la campaña de cuatro días y medio, para que los defensores puedan recorrer la cadena comando por comando.



