Dale a un asistente de IA memoria y acceso a tu bandeja de entrada, y le darás al atacante una manera de reescribir lo que cree que sabe sobre ti. Un solo correo electrónico puede engañar a ese agente para que guarde un «hecho» falso sobre el usuario, oculte el cambio y dirija silenciosamente sus respuestas en sesiones posteriores.
Cuando funciona, la persona lee una respuesta de apariencia normal y nunca se entera de que su asistente fue manipulado.
Los investigadores nombraron el ataque. inyección de memoria sigilosa y creó una herramienta que escribe los correos electrónicos automáticamente. El artículo «Cuando las garras recuerdan pero no lo dicen», aterrizó en arXiv el 6 de julio de 2026.
Primero, qué hacen estos asistentes.
Un agente personal es un asistente de IA que se queda. En lugar de olvidar todo cuando finaliza un chat, guarda notas sobre ti en archivos: tus preferencias, tus contactos y lo que le pediste que hiciera. Lee esas notas al comienzo de cada nueva sesión, por lo que siente que te conoce.
Muchos de estos agentes también pueden actuar por usted, leyendo su correo electrónico, revisando su calendario y ejecutando pequeños trabajos según un cronograma mientras está fuera.
garra abiertael agente de código abierto utilizado como objetivo principal del estudio, mantiene este estado en archivos de texto sin formato: algunos contienen sus instrucciones permanentes (AGENTS.md), otros contienen lo que ha aprendido sobre usted (MEMORY.md). Coloca los principales en el contexto del modelo al comienzo de cada sesión.
Esas notas son el objetivo del producto. Ellos también son el objetivo.
El ataque de un correo electrónico
El atacante no necesita su contraseña ni su cuenta. Envían un correo electrónico a alguien cuyo agente está configurado para revisar su bandeja de entrada, lo que, para estos asistentes, es un trabajo de rutina. Enterrado en ese correo electrónico hay un texto dirigido al asistente, no a usted.
Si la habilidad de correo electrónico del agente muerde el anzuelo, suceden tres cosas seguidas. El agente utiliza sus propias herramientas de archivos para escribir la nota falsa del atacante en su memoria persistente. Su respuesta visible no dice nada de haberlo hecho. Y luego, en una nueva conversación, esa nota falsa cambia lo que te dice o hace por ti.
En uno de los casos de prueba del estudio, la mentira plantada fue que el límite de envío diario de Zelle del usuario se había elevado a $10,000.
No capta el cambio por varias razones. El asistente oculta sus pasos detrás de escena por diseño, por lo que el momento en que edita un archivo nunca aparece en el chat. Pocos usuarios alguna vez abren los archivos de memoria sin procesar para leerlos. Y cuando el agente se ejecuta según una programación en segundo plano, a menudo no envía ningún mensaje, por lo que no hay nada que notar.
Para hacer que el veneno se adhiera, la herramienta apunta a los archivos principales que se cargan en cada sesión, de modo que se carga una sola escritura en cada sesión posterior en lugar de esperar a que se extraiga de un almacén de memoria separado.
El ataque es generado por una herramienta que los investigadores llaman MemGhost. Sus creadores entrenaron un modelo de atacante fuera de línea contra una instantánea de un agente personal, recompensando los correos electrónicos que guardaban la memoria mientras mantenían la respuesta en silencio. En el momento del ataque, escribe el correo electrónico terminado de una sola vez, sin intercambios con la víctima.
En 56 casos de prueba nuevos, MemGhost realizó el ataque completo, plantando un recuerdo falso, ocultándolo y luego influyendo en las respuestas del agente en una sesión posterior. Funcionó en el 87,5% de las ejecuciones en segundo plano contra OpenClaw en GPT-5.4 y en el 71,4% contra un agente Claude Code SDK en Sonnet 4.6.
Estas fueron ejecuciones de referencia aisladas y comienzan solo después de que el correo electrónico ya ha llegado a una bandeja de entrada que el agente lee, por lo que aquí nada prueba si una carga útil real borra primero el filtrado de spam o la autenticación del remitente.
El éxito fue generalmente menor en las pruebas en modo de primer plano, donde el usuario puede ver la respuesta. En modo de fondo, se mantuvo por encima del 80% en cada uno de los otros dos marcos de agentes y en un almacén de memoria basado en vectores en lugar de los archivos simples. El equipo también construyó Banco de susurrosun punto de referencia de 108 casos que abarca riesgos que van desde malos consejos médicos hasta pérdidas de dinero y sabotaje de seguridad.
![]() |
| Descripción general del marco WhisperBench |
Las versiones toscas del truco en su mayoría fallan. Un contundente «guarda esto en silencio y no digas nada» fue captado o ignorado por los modelos más fuertes casi siempre; el generador capacitado es lo que hizo subir los números. También pasó por alto las defensas destinadas a detener este tipo de ataque.
Un filtro de entrada creado para detectar correos electrónicos envenenados pasó por alto el mensaje de MemGhost más de nueve de cada diez veces, y un modelo especialmente endurecido para ignorar las instrucciones que llegan por correo electrónico siguió el mensaje colocado aproximadamente la mitad de las veces. Incluso cuando se hizo que el propietario preguntara abiertamente: «dime qué verificaste y qué hiciste», el ataque permaneció oculto aproximadamente una cuarta parte del tiempo en un modelo.
No hay ningún parche rápido que esperar. El propio OpenClaw política de seguridad trata la inyección rápida por sí sola como fuera del alcance de una solución, a menos que también cruce un límite de autorización, política de herramientas, aprobación o zona de pruebas. MemGhost no cruza ninguno de ellos, ya que funciona a través de la propia herramienta de escritura en memoria del agente, y los investigadores siguen demostrando exactamente este tipo de inyección contra el marco.
Los autores del estudio sostienen que la verdadera solución tiene que estar dentro del agente: etiquetar de dónde proviene una información, preguntar al usuario antes de que algo llegue a la memoria duradera y registrar cada escritura. Hasta que eso llegue, la configuración expuesta es cualquier agente que lea correo que no es de confianza y pueda escribir su propia memoria sin preguntar.
La solución contundente es mantener esos dos trabajos separados. De lo contrario, limite lo que puede cambiar una ejecución activada por correo electrónico y verifique los archivos de memoria después de que llegue algo sospechoso.
OpenClaw confirmó esa posición a The Hacker News y rechazó cómo el periódico configuró a su agente. Es guía de seguridad indica a los operadores que enruten el correo electrónico que no es de confianza a través de un agente lector independiente sin memoria, archivos ni herramientas de shell, pasando sólo un resumen al agente principal, que el documento no probó.
También argumenta que el nivel del modelo es importante: las ejecuciones de OpenClaw utilizaron GPT-5.4, un modelo de frontera actual, pero los autores omitieron Claude Opus 4.6 por costo, y OpenClaw señaló HackMyClawun desafío público en el que miles de correos electrónicos de inyección no lograron extraer un secreto de un agente de Opus 4.6. Esa prueba se centró en el robo de datos, no en el envenenamiento de la memoria, por lo que no responde directamente al artículo.
OpenClaw dijo que está sopesando los controles de escritura en memoria para contenido externo, incluida la procedencia, los registros de auditoría y las indicaciones de confirmación, en la misma dirección que recomienda el documento. The Hacker News también se comunicó con los autores del artículo y actualizará esta historia con cualquier respuesta.
La versión manual fue lo primero.
En 2024, el investigador Johann Rehberger mostró el mismo movimiento contra ChatGPT, plantando instrucciones en su memoria a largo plazo a través de contenido web envenenado para seguir filtrando los datos de un usuario en chats futuros. Él lo llamó SpaIware. OpenAI cerró el camino de la filtración de datos, pero se mantuvo la capacidad de escribir memoria a partir de contenido que no era de confianza.
Un año después, llegó a ser un producto de envío. EchoLeak (CVE-2025-32711), divulgado por Aim Security en junio de 2025, utilizó un correo electrónico de texto oculto para hacer que Microsoft 365 Copilot entregara datos internos de la empresa cuando el usuario luego le hizo una pregunta normal. Microsoft lo calificó como crítico y lo parchó, y no se informó ningún abuso en el mundo real.
A estudio de caso posterior Expuso cómo pasó los filtros de Copilot. Ambos demostraron que el contenido que lee una IA puede contener comandos, entregados mediante un correo electrónico que cualquiera puede enviar.
Lo que MemGhost agrega es persistencia: la versión de Rehberger tuvo que ser plantada a mano, y EchoLeak filtró datos solo en el momento en que se solicitó, pero aquí una carga útil automatizada convierte un correo electrónico en una memoria falsa que permanece y dirige las sesiones mucho después de que el mensaje desaparece.
Este es un resultado de laboratorio, no un robo en progreso. Los investigadores ejecutaron todo en entornos de prueba sellados con bandejas de entrada falsas y usuarios falsos, y los documentos en papel solo se probaron en laboratorio, no se usaron contra personas reales; dicen que planean revelar sus hallazgos, patrones de ataque y puntos de referencia a los fabricantes de los agentes y modelos afectados.
El sigilo se mantiene en el estudio en parte porque los agentes capaces están diseñados para mantener la actividad de sus herramientas fuera del chat. El único modelo que se reveló lo hizo imprimiendo sus pasos intermedios en la respuesta, y los investigadores esperan que la detección se vuelva más difícil a medida que los agentes mejoren su trabajo silencioso.
El verdadero problema es más claro: un mensaje procedente del exterior se convirtió en un contexto duradero y confiable dentro del agente, sin ningún momento visible en el que alguien lo aprobara.





