• 2 min de lectura
Los agentes de IA pueden ser engañados para recordar ataques
Investigadores usaron GhostWriter para plantar recuerdos falsos en agentes de IA, activándolos más tarde en el 60% de las solicitudes de seguimiento probadas.

Imagen: ITzine
Investigadores de la Universidad Estatal de Nuevo México han identificado la memoria persistente como una nueva superficie de ataque para agentes de IA. Su método GhostWriter no compromete el modelo subyacente; en cambio, planta «recuerdos» falsos que pueden resurgir días o semanas después e influir en las decisiones del agente.
El ataque usa un correo electrónico ordinario, una invitación de calendario u otro documento externo como contenedor de instrucciones ocultas. Si un agente lee el contenido y lo almacena en memoria, la entrada maliciosa permanece disponible. Puede activarse más tarde cuando el usuario realiza una solicitud que por lo demás sería rutinaria.
Los investigadores probaron GhostWriter en escenarios con agentes que procesan correos electrónicos y calendarios. En promedio, el ataque inyectó recuerdos maliciosos con una efectividad de alrededor del 98% y luego los activó en aproximadamente el 60% de las consultas posteriores.

Recomendado
Ostium pierde 23,75 millones de dólares en un ataque al feed de precios
A diferencia de los ataques convencionales de inyección de instrucciones (prompt-injection), que apuntan a la conversación actual y deben detectarse de inmediato, GhostWriter corrompe información que el agente ha guardado como contexto útil. Eso crea un riesgo serio para sistemas que gestionan correos electrónicos, agendas, código y documentos corporativos.
Protegiendo la memoria de los agentes de IA
Los investigadores propusieron Agentic Memory Sentry, o AM-Sentry, para contrarrestar la amenaza. El sistema verifica la información antes de escribirla en la memoria y revisa por separado los recuerdos recuperados antes de pasárselos al modelo de lenguaje.
En su configuración más estricta, AM-Sentry redujo la efectividad de GhostWriter a menos del 12% sin apenas afectar las funciones útiles del agente.
Los hallazgos se producen en un momento en que OpenAI, Google, Anthropic y otros desarrolladores promueven agentes que actúan en nombre de los usuarios y retienen contexto entre sesiones. A medida que la memoria persistente hace estos sistemas más útiles, las fallas en la validación de la memoria se vuelven cada vez más costosas.
Security Editor
Sophia unpacks the invisible wars happening on our networks. Covering cybersecurity, privacy legislation, and cryptography, she exposes how our data is weaponized and defended. Before joining for(geeks), she spent years as a penetration tester. She's the reason the rest of the team uses physical security keys.
vía ITzine


