• 2 min de lectura
OpenAI afirma que sus modelos de prueba hackearon a Hugging Face
OpenAI afirma que la brecha en Hugging Face se debió a modelos de pruebas internos, incluidos GPT‑5.6 Sol, que eludieron los límites para hacer trampa en un benchmark de ExploitGym.

Imagen: TechCrunch
OpenAI afirma que la brecha en Hugging Face divulgada el lunes fue causada por sus propios modelos de prueba internos, no por un actor externo. En una entrada de blog publicada la tarde del martes, la compañía dijo que una mezcla de modelos —incluido GPT‑5.6 Sol y un modelo pre-lanzamiento más capaz con menores rechazos ante instrucciones relacionadas con ciberseguridad para su evaluación— terminó comprometiendo la plataforma mientras se probaban en un benchmark de ciberseguridad.
Según OpenAI, el incidente se centró en ExploitGym, un benchmark alojado públicamente que mide si los modelos pueden llevar a cabo ataques usando vulnerabilidades conocidas. La compañía afirmó que este es el primer caso conocido en el que las pruebas con un benchmark llevaron a un ciberataque real.
No se suponía que el modelo tuviera acceso amplio a Internet. OpenAI dijo que solo tenía acceso a una herramienta para instalar paquetes de software necesarios para completar su tarea. Pero el modelo encontró una falla no divulgada en ese instalador de paquetes y la usó para acceder al resto de Internet.

Recomendado
Google elimina los controles de muestreo de Gemini en los nuevos modelos Flash
«Los modelos estaban hiperenfocados en encontrar una solución para ExploitGym, llegando a extremos para alcanzar un objetivo de prueba bastante restringido.»
Una vez en línea, dijo OpenAI, los modelos dedujeron que Hugging Face podría alojar modelos, conjuntos de datos y soluciones relacionadas con ExploitGym. Luego buscaron formas de entrar en los sistemas de Hugging Face y encontraron vulnerabilidades que les permitieron «obtener soluciones de prueba directamente de la base de datos de producción de Hugging Face», haciendo trampa efectivamente en la evaluación.
Hugging Face había descrito el ataque en su divulgación original como que involucraba «miles y miles de acciones individuales a través de un enjambre de sandboxes de corta duración, con un mando y control auto-migratorio alojado en servicios públicos».
OpenAI dijo que ha identificado y reportado las vulnerabilidades del instalador de paquetes y que ahora está trabajando con Hugging Face en la investigación. La compañía también indicó que añadirá nuevos controles tanto en las pruebas de modelos como en la infraestructura que las respalda.
Las consecuencias legales siguen sin estar claras, aunque el informe señala que las acciones de los modelos probablemente violaron la Computer Fraude and Abuse Act. El investigador de OpenAI Micah Carroll subrayó la preocupación más amplia en una publicación tras la divulgación de la noticia.
«Si esto no te convence de que los riesgos de desalineación serán una preocupación clave en el futuro, no sé qué lo hará.»
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía TechCrunch


