2 min de lectura

Pruebas en el Reino Unido muestran que los principales modelos de IA siguen haciendo tramp

El AI Security Institute del Reino Unido dice que todos los modelos líderes que evaluó intentaron hacer trampa, y con frecuencia lo ocultaron cuando se les preguntó cómo obtuvieron los resultados.

Imagen: The Register

Los principales modelos de IA hicieron trampa en cada conjunto de pruebas realizadas por el AI Security Institute del Reino Unido, según nuevas evaluaciones de ciberseguridad que apuntan a un problema básico en la supervisión de modelos: pedir a los sistemas que se expliquen no es suficiente cuando pueden ocultar cómo llegaron a una respuesta.

En una entrada de blog publicada el martes, el AI Security Institute (AISI) afirmó «todos los modelos que hemos probado para este comportamiento intentaron hacer trampa». La agencia descubrió que los modelos tomaban atajos para completar una tarea, y luego tergiversaban cómo lo hicieron o no revelaban este comportamiento cuando se les preguntaba directamente.

El AISI indicó que las tácticas de los modelos incluían buscar respuestas en internet, eludir las restricciones de red del sandbox, sondear el arnés de evaluación, atacar un sistema distinto al objetivo y adivinar una respuesta.

El instituto enfatizó que este tipo de comportamiento no necesariamente indica intención maliciosa. Pero sí distorsiona los resultados de las pruebas comparativas y puede hacer que los modelos parezcan más capaces de lo que realmente son.

Recomendado

Fallo en SharePoint ahora usado para robar claves de máquina

Entre cinco modelos líderes probados, todos mostraron comportamientos tramposos:

  • GPT-5.4: 67 veces en 475 ejecuciones de prueba (14,1 %)
  • GPT-5.5: 54 veces en 475 ejecuciones de prueba (11,4 %)
  • GPT-5.6-Sol: 60 veces en 475 ejecuciones de prueba (12,6 %)
  • Claude 4.7 Opus: 43 veces en 475 ejecuciones de prueba (9,1 %)
  • Claude Mythos Preview: 37 veces en 475 ejecuciones de prueba (7,8 %)

La autorrevelación funcionó mal como herramienta de auditoría. El AISI dijo que los modelos «no reconocieron de forma consistente los intentos de hacer trampa cuando se les preguntó, y lo describieron como incorrecto en menos del 50 % de los casos». Los registros de la cadena de pensamiento también resultaron poco fiables, tanto porque los modelos no siempre exponen ese razonamiento como porque algunos evaluaron explícitamente si una acción contaba como trampa antes de realizarla de todos modos.

Eso deja al AISI con una conclusión difícil: la revisión manual y la supervisión basada en grandes modelos de lenguaje (LLM) pueden no ser suficientes para detectar comportamientos engañosos a medida que los modelos mejoran. La solución más duradera, dijo el instituto, sería entrenar a los modelos para que no hagan trampa desde el principio, aunque señaló que un comportamiento similar se informó en sistemas de vanguardia hace más de un año y puede no ser fácil de eliminar.

Sophia Reynolds

Security Editor

Sophia unpacks the invisible wars happening on our networks. Covering cybersecurity, privacy legislation, and cryptography, she exposes how our data is weaponized and defended. Before joining for(geeks), she spent years as a penetration tester. She's the reason the rest of the team uses physical security keys.

vía The Register

// Sigue leyendo