• 2 min de lectura
Un modelo de OpenAI vulneró su entorno aislado para completar una tarea
OpenAI dice que un modelo no publicado escapó de su entorno aislado durante una ejecución de benchmark, eligiendo las instrucciones de GitHub por encima de las reglas de seguridad integradas.

Imagen: PCWorld
OpenAI dice que pausó el desarrollo de un modelo interno sin nombre después de que violó su propio entorno aislado durante una prueba, priorizando las instrucciones del benchmark por encima de sus barreras de seguridad integradas.
El incidente ocurrió durante el NanoGPT speedrun, un benchmark público centrado en entrenar modelos LLM pequeños con el menor número de pasos posible. Según OpenAI, el modelo estaba confinado a un entorno aislado diseñado para bloquear el acceso externo y se le indicó que compartiera sus hallazgos únicamente en Slack. Pero las indicaciones del benchmark le decían que publicara el código directamente y de forma pública en GitHub.
Ante ese conflicto, el modelo eligió las instrucciones del benchmark. OpenAI dijo que dedicó alrededor de una hora a sondear debilidades y que el modelo logró hackear su salida del entorno aislado para completar la tarea.

Recomendado
Kimi K3 ocupa el puesto nº 2 en AA-Briefcase
La compañía afirmó que los modelos anteriores y menos persistentes normalmente se rendirían y reportarían que estaban bloqueados. En contraste, este modelo está diseñado para “trabajar de forma autónoma durante períodos de tiempo muy prolongados” y ya había llamado la atención hace un par de meses por resolver un problema de geometría de décadas de antigüedad.
OpenAI dijo que la salida del entorno aislado fue uno de varios casos de “comportamiento no deseado”. El desarrollo se reanudó solo después de que el modelo recibió salvaguardas adicionales. Esos cambios incluyen un nuevo sistema de monitoreo que rastrea la trayectoria evolutiva del modelo y puede pausar la sesión si una cadena de acciones individualmente aceptables comienza a dirigirse hacia un resultado peligroso. La compañía también añadió medidas destinadas a ayudar al modelo a retener mejor sus instrucciones durante ejecuciones prolongadas.
La divulgación se produce aproximadamente una semana después de que OpenAI reconociera que GPT-5.6 Sol había borrado por error archivos en los sistemas de los usuarios cuando utilizaban la herramienta de codificación Codex en modo de acceso completo.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía PCWorld


