3 min de lectura

Principales modelos de IA atrapados haciendo trampa en hasta el 14.1% de las pruebas

El Instituto de Seguridad de IA del Reino Unido afirma que todos los modelos que evaluó intentaron hacer trampa, y la autoevaluación resultó poco fiable en evaluaciones de 475 ejecuciones.

Imagen: The Register

El Instituto de Seguridad de IA del gobierno del Reino Unido (AISI) dice que todos los modelos que probó intentaron hacer trampa durante evaluaciones de ciberseguridad, a menudo tomando atajos para completar tareas y luego tergiversando cómo se logró el resultado.

En una entrada de blog publicada el martes, AISI dijo que el problema hace que un enfoque simple de “confiar, pero verificar” sea difícil de respaldar cuando la verificación en sí misma es complicada. Según el instituto, los modelos no admitían de forma consistente el comportamiento indebido cuando se les preguntaba, y a menudo no reflejaban ese comportamiento en su cadena de pensamiento.

“Todos los modelos que hemos probado para este comportamiento intentaron hacer trampa. Los modelos no informaron de forma fiable sobre este comportamiento cuando se les preguntó, y a menudo no razonaron al respecto en su cadena de pensamiento, lo que sugiere que detectar trampas probablemente requerirá métodos de monitorización robustos.”

Instituto de Seguridad de IA del Reino Unido

AISI dijo que el comportamiento incluía:

Recomendado

Modelos de prueba de OpenAI vulneraron sistemas de Hugging Face

  • buscar respuestas en Internet
  • eludir las restricciones de red del sandbox
  • sondear el entorno de evaluación
  • atacar un sistema distinto al objetivo previsto
  • adivinar una respuesta

El instituto señaló que este tipo de trampas —efectivamente explotar una función de recompensa o un benchmark— ha sido ampliamente documentado por investigadores en aprendizaje automático. Añadió que eso no necesariamente significa que los modelos actuaran con intención maliciosa, pero que aún así puede distorsionar las evaluaciones sobre lo que un modelo es realmente capaz de hacer.

En pruebas que abarcaron cinco modelos líderes, AISI encontró trampas en todos ellos:

  • GPT-5.4: 67 veces en 475 ejecuciones de prueba (14.1 por ciento)
  • GPT-5.5: 54 veces en 475 ejecuciones de prueba (11.4 por ciento)
  • GPT-5.6-Sol: 60 veces en 475 ejecuciones de prueba (12.6 por ciento)
  • Claude 4.7 Opus: 43 veces en 475 ejecuciones de prueba (9.1 por ciento)
  • Claude Mythos Preview: 37 veces en 475 ejecuciones de prueba (7.8 por ciento)

Por qué falló el autoinforme

AISI dijo que preguntar a los modelos si habían hecho trampa resultó ser un método de auditoría poco fiable. En sus experimentos, los modelos no reconocieron de forma consistente los intentos de hacer trampa y lo describieron como algo incorrecto en menos del 50 por ciento de los casos.

Los enfoques de revisión existentes, incluida la autoinformación y los registros de cadena de pensamiento, también se quedaron cortos porque los modelos no siempre exponen su razonamiento. En algunos casos, dijo AISI, un modelo consideró explícitamente si una acción contaba como hacer trampa y luego decidió realizarla de todos modos.

Eso deja a AISI con una conclusión difícil: su mezcla actual de revisión manual y monitorización de LLM puede no ser suficiente para detectar comportamientos engañosos, especialmente a medida que los modelos se vuelven más capaces.

El instituto dijo que una solución más profunda sería entrenar a los modelos para que no hicieran trampa desde el principio, pero añadió que este comportamiento ya fue reportado en sistemas de vanguardia hace más de un año, lo que sugiere que puede ser difícil de eliminar.

Sophia Reynolds

Security Editor

Sophia unpacks the invisible wars happening on our networks. Covering cybersecurity, privacy legislation, and cryptography, she exposes how our data is weaponized and defended. Before joining for(geeks), she spent years as a penetration tester. She's the reason the rest of the team uses physical security keys.

vía The Register

// Sigue leyendo