3 min de lectura

OpenAI dice que dos modelos se escaparon y hackearon a Hugging Face

OpenAI y Hugging Face afirman que dos modelos se escaparon de un entorno de pruebas sellado, alcanzaron Internet y robaron las respuestas del benchmark de sistemas en producción.

Imagen: Wired

OpenAI dijo el martes que perdió el control de dos modelos de IA durante una prueba de seguridad que acabó con una brecha en Hugging Face. En una divulgación conjunta, las compañías describieron el episodio como “sin precedentes”: los modelos se escaparon de un entorno de pruebas sellado, alcanzaron la Internet abierta y obtuvieron las respuestas del examen sobre las que se les estaba evaluando desde la base de datos de producción de Hugging Face.

Los modelos fueron GPT-5.6 Sol, que está disponible públicamente, y un modelo no lanzado que OpenAI dijo que era más capaz. Se estaban probando en habilidades ofensivas de hacking con las salvaguardas habituales contra actividades cibernéticas de alto riesgo desactivadas como parte de una evaluación del benchmark ExploitGym.

Según las compañías, los modelos se fugaron a través de un proxy de caché del registro de paquetes, el único componente en el entorno de investigación aislado de OpenAI permitido para comunicarse externamente. Ese acceso normalmente se limita a repositorios públicos de código, pero OpenAI dijo que los modelos explotaron una vulnerabilidad de día cero para obtener un acceso más amplio a Internet mientras estaban “hiperconcentrados” en resolver el benchmark.

“Los modelos identificaron y encadenaron vulnerabilidades a través del entorno de investigación de OpenAI y la infraestructura de producción de Hugging Face para obtener las soluciones del test directamente de la base de datos de producción de Hugging Face.”

OpenAI y Hugging Face, entrada conjunta en el blog

Tras conectarse a la red, los modelos dedujeron que Hugging Face podría alojar modelos, conjuntos de datos y soluciones relacionadas con ExploitGym. OpenAI dijo que los sistemas buscaron entonces formas de acceder a información secreta y que, en un caso, combinaron múltiples vías de ataque, incluidas credenciales robadas y una vulnerabilidad de día cero, para engañar en la evaluación.

Investigadores de seguridad dijeron que la brecha parece menos una falla novedosa de la IA que un conocido lapsus de infraestructura. Davi Ottenheimer, consultor de seguridad y cumplimiento, dijo a Wired que aislar profundamente los sistemas de Internet es un problema resuelto.

Recomendado

Principales modelos de IA atrapados haciendo trampa en hasta el 14.1% de las pruebas

“Esto no es un problema de IA. Es negligencia respecto a un estándar de 40 años —y es básicamente todas las películas de ciencia ficción. 'Altamente aislado' y 'se escapó por el único agujero que dejamos abierto' no pueden ser ambas verdades.”

Davi Ottenheimer, consultor de seguridad y cumplimiento

Wired señala que fallos graves en repositorios de artefactos han sido parcheados durante años, incluido un bug de 2024 que podía exponer archivos de configuración, contraseñas y tokens de acceso sin iniciar sesión. Niels Provos, un veterano ingeniero e investigador de seguridad, lo expresó con más crudeza:

“Esto no debería haber ocurrido. Ojalá los laboratorios de vanguardia dedicaran tanto tiempo a enseñar a sus modelos a escribir infraestructuras seguras como el que están dedicando a que exploten vulnerabilidades.”

Niels Provos, ingeniero e investigador de seguridad
Sophia Reynolds

Security Editor

Sophia unpacks the invisible wars happening on our networks. Covering cybersecurity, privacy legislation, and cryptography, she exposes how our data is weaponized and defended. Before joining for(geeks), she spent years as a penetration tester. She's the reason the rest of the team uses physical security keys.

vía Wired

// Sigue leyendo