• 3 min de lectura
Las indicaciones ocultas pueden envenenar la memoria de los agentes de IA
Investigadores afirman que un ataque en dos fases puede plantar falsos recuerdos en agentes de IA con memoria a largo plazo, con tasas de inyección de aproximadamente 98% y de activación de alrededor

Imagen: TechXplore
La memoria está haciendo que los agentes de IA sean más útiles y, potencialmente, mucho más fáciles de manipular. Investigadores de la Universidad Estatal de Nuevo México afirman que los atacantes pueden plantar en secreto instrucciones maliciosas en la memoria a largo plazo de un agente, creando lo que describen como falsos recuerdos que luego pueden influir en su comportamiento.
El equipo — George Torres, Sharad Shrestha y Satyajayant Misra — llama al ataque GhostWriter. En un artículo publicado en el servidor de preprints arXiv, describen cómo apunta a agentes tipo asistente personal que combinan conversación, planificación de tareas y memoria persistente.
“Actualmente, los agentes con memoria a largo plazo tienden a caer en dos dominios distintos: agentes conversacionales y agentes de planificación de acciones. Los agentes asistentes personales se sitúan en la convergencia de estos dos dominios y manejan información sensible mientras interactúan con fuentes de información no confiables, creando vulnerabilidades de seguridad no contempladas previamente. Presentamos el novedoso vector de ataque, GhostWriter, que explota los subsistemas de memoria actuales en agentes personales que usan herramientas para envenenar su almacén de memoria.”
Cómo funciona el ataque GhostWriter
Según los investigadores, el ataque tiene dos fases: inyección y activación. Primero, un atacante oculta una carga útil en el contenido que procesa el agente. Más tarde, cuando el agente recupera esa memoria envenenada durante una tarea legítima, la instrucción maliciosa puede ser ejecutada.
Un ejemplo en el artículo es un asistente de correo electrónico que es engañado para resumir siempre los mensajes de un remitente específico y reenviarlos en secreto a un atacante. Eso podría exponer mensajes sensibles de un banco, una entidad financiera u otra fuente oficial.

Recomendado
Errores en extensiones de Joomla entran en la lista de vulnerabilidades explotadas de CISA
Los autores informan tasas de inyección casi universales de aproximadamente el 98% y una tasa de activación promedio de alrededor del 60% frente a agentes de modelos de última generación.
AM-Sentry busca bloquear el envenenamiento de memoria
Los investigadores argumentan que el problema se debe a una débil gobernanza de la memoria en los agentes actuales. Para abordarlo, proponen Agentic Memory Sentry (AM-Sentry), que combina:
- una política de guardado de memoria
- un filtro de recuperación de memoria
“Este ataque es posible debido a la falta de gobernanza de la memoria centrada en la seguridad. En respuesta, proponemos Agentic Memory Sentry (AM-Sentry), que aprovecha dos técnicas de mitigación: una política de guardado de memoria y un filtro de recuperación de memoria. Nuestros experimentos muestran que AM-Sentry reduce drásticamente la tasa de éxito de GhostWriter manteniendo la utilidad del agente.”
El artículo se titula «Cuando los agentes recuerdan demasiado: ataques de envenenamiento de memoria a agentes de modelos de lenguaje a gran escala» y tiene el DOI 10.48550/arxiv.2607.06595. A medida que la memoria se convierte en una característica estándar en los asistentes de IA, el trabajo señala un problema de seguridad creciente: el mismo contexto almacenado que hace a los agentes más personalizados también puede convertirse en una superficie de ataque.
Security Editor
Sophia unpacks the invisible wars happening on our networks. Covering cybersecurity, privacy legislation, and cryptography, she exposes how our data is weaponized and defended. Before joining for(geeks), she spent years as a penetration tester. She's the reason the rest of the team uses physical security keys.
vía TechXplore


