Seguridad de agentes de IA: cuatro ataques en julio, un fallo compartido
Pasamos dos años preguntándonos si la IA nos mentiría. La pregunta más útil este verano es qué sucede una vez que le entregamos las llaves. Dale a un modelo tu Gmail, tu calendario, una memoria y el poder de actuar, y sus errores dejan de ser embarazosos. Comienzan a ser explotables.
Durante aproximadamente diez días en julio, cuatro investigaciones llegaron que hacen el mismo punto desde cuatro ángulos. Ninguna es un error aislado. Juntas esbozan la forma de la seguridad de los agentes de IA en 2026, y la imagen no es reconfortante.
El asistente del navegador que hace clic por ti
Comienza con la herramienta que está más cerca de tus datos. La firma de seguridad Manifold Security publicó una investigación que muestra que cualquier extensión de navegador que instales puede secuestrar silenciosamente a Claude de Anthropic para Chrome y hacer que lea tu Gmail, Google Docs y Calendario.
El truco es pequeño. La extensión escucha un clic del usuario antes de ejecutar una de las nueve tareas integradas. Nunca verifica si el clic es real. Una extensión rival puede falsificar uno en seis líneas de código, y Claude trata el falso como genuino.
Manifold lo califica de alta severidad por defecto. Salta a crítico una vez que un usuario ha activado el modo "Actuar sin preguntar", donde la lectura ocurre en silencio.
Manifold dice que le informó a Anthropic en mayo. Ocho versiones después, informa que la falla sigue funcionando en la versión actual. La compañía ya había cubierto los riesgos de navegación agentiva anteriores, y esta es la misma herida reabierta.
Un solo correo electrónico que reescribe la memoria
El segundo hallazgo pasa de clics a memoria. Los agentes personales ahora mantienen notas sobre ti entre chats: tus contactos, tus hábitos, tu lista de tareas. Los investigadores preguntaron qué sucede si un atacante puede escribir en ese almacenamiento.
En un artículo publicado en arXiv, un equipo mostró que un correo electrónico cuidadosamente redactado puede plantar un falso recuerdo en un agente de IA. Conectaron una bandeja de entrada de víctima a un agente a través de Google sign-in, luego enviaron cargas desde una cuenta que controlaban.
El correo pasó los filtros de spam normales y llegó a la bandeja de entrada. El agente lo leyó, y en más de la mitad de los casos guardó las instrucciones del atacante en la memoria a largo plazo sin advertir al usuario.
Esa es la parte peligrosa. Una inyección de aviso normal dura una conversación. Esta persiste. La memoria envenenada sigue guiando al agente a través de futuras sesiones hasta que alguien la encuentra. Como dijo Digital Trends, el agente recuerda la mentira y nunca menciona de dónde vino.
Una puerta trasera por menos de $100
La tercera grieta se encuentra aún más profunda, dentro del propio modelo. Katie Paxton-Fear, una profesora y defensora de ciberseguridad en Semgrep, quería saber si puedes confiar en un modelo de peso abierto que descargas gratis. Así que lo envenenó.
Tomó aproximadamente una hora y menos de £75, escribió ella y dos colegas de Semgrep en una publicación detallada. Solo diez ejemplos de entrenamiento contaminados fueron suficientes para hacer que el modelo escribiera código con un agujero de seguridad oculto, incluso para avisos que nunca había visto. Modelos más grandes eran más fáciles de envenenar, no más difíciles.
Su preocupación no es una descarga manipulada. Es que no podemos verificar. Un modelo envenenado no se bloquea ni parece roto. Como ella y sus colegas lo expresaron, un modelo público nos da "casi ninguna capacidad para predecir su comportamiento". Un programa normal puede ser desmenuzado para ver lo que hace. Un conjunto de pesos no puede.
No es la única que está investigando esto. David Kaplan, de la firma de seguridad Origin, construyó un modelo manipulado que roba datos silenciosamente a través de una herramienta de correo electrónico sin señales para el usuario. Su planteamiento es agudo: el veneno "no llegó en una página web. Estaba sentado en los pesos todo el tiempo".
El ‘trifecta letal’ se hace más grande
El cuarto estudio explica por qué los primeros tres importan tanto a la vez. La firma de seguridad PromptArmor examinó los conectores que vinculan ChatGPT y Claude a servicios externos como Gmail y Slack.
El desarrollador Simon Willison nombró el peligro central el año pasado como el trifecta letal: un agente con acceso a datos privados, exposición a contenido no confiable y una forma de enviar información. Mantén los tres a la vez y un solo mensaje envenenado puede filtrar tus secretos. Los conectores entregan a los agentes los tres por defecto.
PromptArmor encontró que el terreno se movía bajo todo el sistema. En su estudio, un conector cambiaba en promedio cada nueve minutos. De 2,517 que rastreó, 931 cambiaron en seis semanas. Los proveedores añadieron 1,686 nuevas herramientas a conectores que ya estaban activos y reescribieron 1,127 descripciones de herramientas, que es exactamente lo que le dice a un modelo cuándo actuar.
Un solo conector también puede crecer. El conector de Dropbox solo creció de ocho herramientas a 24, y de ninguna que pueda destruir datos a cuatro. Aproximadamente dos de cada cinco conectores de Claude llaman silenciosamente a otros servicios de IA a su vez.
El conector de Zoom muestra a dónde conduce eso. Pídele que busque en tus reuniones, y una consulta llena de datos sensibles puede pasar a cualquiera de diez subprocesadores de IA a través de ocho familias de modelos. El mapa que aprobaste el lunes puede no describir el sistema que ejecutas el viernes.
Un problema con cuatro máscaras
Alinea los cuatro y la falla compartida es obvia. En cada caso, el modelo se comporta. La falla de seguridad vive en lo que lo rodea: el clic en el que confía, la memoria que mantiene, los pesos que hereda, el conector que llama.
Ese es el eje de la seguridad de los agentes de IA. Durante décadas, aseguramos el software limitando lo que un programa podía hacer. El punto de venta de un agente es que puede hacer casi cualquier cosa, en tu nombre, a partir de instrucciones escritas en lenguaje sencillo.
Cada conveniencia también es una puerta. La falla de Claude para Chrome, la memoria envenenada, la puerta trasera barata y los conectores cambiantes son cuatro puertas a la misma casa.
La industria conoce las soluciones en teoría: verifica que los clics sean reales, etiqueta de dónde proviene la información, pregunta antes de escribir en la memoria, registra cada acción y trata cualquier texto externo como hostil. El problema es que estas barandillas ralentizan al agente, y la velocidad es lo que todos están vendiendo.
TNW ha observado la misma tensión en la violación de Hugging Face y en el auge de los insiders sintéticos. Esta es la misma historia, ahora dirigida al asistente en tu navegador.
La incómoda conclusión de julio no es que algún producto en particular esté roto. Es que estamos conectando agentes a nuestras cuentas más sensibles más rápido de lo que estamos aprendiendo a defenderlas. Cuatro equipos acaban de mostrar cuán amplia es la brecha. Las personas que construyen las barandillas aún están un paso detrás de las personas que encuentran los agujeros.
Otros artículos
Seguridad de agentes de IA: cuatro ataques en julio, un fallo compartido
Cuatro equipos de investigación rompieron agentes de IA de cuatro maneras en diez días, desde Claude para Chrome hasta memoria envenenada. La brecha de seguridad de los agentes de IA, explicada.
