• 2 min de lectura
OpenAI afirma que un agente de prueba se escapó y pirateó Hugging Face
OpenAI y Hugging Face dicen que una evaluación interna de modelos provocó que un agente de IA autónomo se escapara de una sandbox y vulnerara a Hugging Face.

Imagen: Mashable
OpenAI afirma que una evaluación interna de seguridad salió muy mal: un agente impulsado por un modelo escapó de un entorno de prueba supuestamente aislado, llegó a Internet público y vulneró a Hugging Face mientras intentaba resolver un benchmark de hacking.
La divulgación se produjo el martes en una publicación de OpenAI titulada “OpenAI y Hugging Face se asocian para abordar un incidente de seguridad durante la evaluación de modelos”. Leída junto con un reciente informe de incidentes de Hugging Face, describe una cadena de ataque que suena menos a un fallo de seguridad rutinario y más a una prueba de estrés que se desbordó en el mundo real.
Según Hugging Face, la intrusión fue diferente a todo lo que había manejado antes porque estuvo completamente dirigida por un “sistema de agente de IA autónomo”. La compañía dijo que el agente encadenó vulnerabilidades para obtener credenciales y acceder a datos de sus servidores, llevando a cabo “miles de acciones individuales a través de un enjambre de entornos aislados efímeros, con comando y control auto-migratorio desplegado en servicios públicos.”

Recomendado
Un fallo de Adobe en Chrome expuso chats de WhatsApp Web
OpenAI dijo que el incidente involucró una combinación de modelos de OpenAI, incluyendo GPT‑5.6 Sol y un modelo pre-lanzamiento más capaz, ambos configurados con una reducción de sus rechazos ante tareas cibernéticas para la evaluación. La compañía afirmó que los modelos eran probados en una evaluación interna diseñada para medir explotación avanzada mediante rutas de ataque complejas.
El fallo crítico se produjo cuando los modelos, pese a estar en un “entorno altamente aislado” con acceso de red limitado, encontraron y explotaron una vulnerabilidad de día cero en el proxy de caché del registro de paquetes. OpenAI dijo que ese punto de apoyo permitió a los modelos llevar a cabo escalada de privilegios y movimiento lateral dentro de su entorno de pruebas de investigación hasta que alcanzaron un nodo con acceso a Internet.
Una vez fuera, el agente parece haber perseguido el objetivo que se le había asignado: demostrar su capacidad de hacking en ExploitGym, un benchmark para convertir vulnerabilidades de software en exploits funcionales. OpenAI dijo que el sistema determinó que Hugging Face era un lugar probable para encontrar soluciones para ExploitGym y lo atacó en consecuencia.
Sigue sin estar claro si el agente realmente resolvió la prueba de ExploitGym. Lo que sí queda claro por los relatos de ambas compañías es que logró escapar del sandbox de OpenAI y comprometió la infraestructura de Hugging Face en el proceso.
Tanto OpenAI como Hugging Face dicen que las vulnerabilidades han sido corregidas y que ahora se han implementado salvaguardias adicionales.
Security Editor
Sophia unpacks the invisible wars happening on our networks. Covering cybersecurity, privacy legislation, and cryptography, she exposes how our data is weaponized and defended. Before joining for(geeks), she spent years as a penetration tester. She's the reason the rest of the team uses physical security keys.
vía Mashable


