• 2 min de lectura
Los agentes de IA ahora pueden ser engañados con recuerdos falsos
Investigadores descubrieron un nuevo ataque contra agentes de IA que implanta recuerdos falsos con un 98% de éxito y puede activarlos más tarde en el 60% de las tareas de seguimiento.

Imagen: ITzine
Investigadores de New Mexico State University dicen que la memoria persistente en agentes de IA se ha convertido en una nueva superficie de ataque. Su método, llamado GhostWriter, no compromete el modelo en sí. En cambio, alimenta al agente con «memorias» falsas que pueden resurgir días o semanas después y condicionar sus decisiones.
El ataque es relativamente simple. Un correo electrónico normal, una invitación de calendario u otro documento externo actúan como contenedor de instrucciones ocultas. Si un agente lee esos datos por sí mismo y los almacena, la entrada maliciosa permanece en la memoria. Más tarde, cuando un usuario le pide que gestione algo rutinario, la trampa puede activarse en un contexto completamente distinto.
Los autores probaron el ataque en escenarios en los que un agente de IA procesa correos y datos de calendario. En promedio, GhostWriter logró implantar memoria maliciosa con aproximadamente un 98% de eficacia, y posteriormente activarla en cerca del 60% de los casos durante solicitudes de seguimiento.

Recomendado
Malware espía se oculta en calendarios de Microsoft 365
Eso lo diferencia de los clásicos ataques de 'prompt injection', que normalmente apuntan a la conversación actual y deben detectarse mientras la orden maliciosa todavía es visible en el intercambio. Aquí, el objetivo no es forzar una respuesta incorrecta de inmediato, sino corromper lo que el modelo guarda como contexto útil. Esto es especialmente problemático para agentes que manejan correo, agendas, código y documentos corporativos.
En respuesta, los investigadores propusieron Agentic Memory Sentry, o AM-Sentry. El sistema verifica los datos antes de que se escriban en la memoria y revisa por separado las memorias recuperadas antes de entregárselas al modelo de lenguaje. En su configuración más estricta, AM-Sentry redujo la tasa de éxito de GhostWriter a menos del 12% sin apenas disminuir la funcionalidad útil del agente.
El problema ya está superando el ámbito del laboratorio. OpenAI, Google, Anthropic y otros desarrolladores están impulsando flujos de trabajo de agentes en los que los asistentes actúan en nombre del usuario y conservan el contexto entre sesiones. A medida que esa memoria se vuelve más útil, las fallas en su filtrado resultan mucho más costosas.
Security Editor
Sophia unpacks the invisible wars happening on our networks. Covering cybersecurity, privacy legislation, and cryptography, she exposes how our data is weaponized and defended. Before joining for(geeks), she spent years as a penetration tester. She's the reason the rest of the team uses physical security keys.
vía ITzine


