Seguridad del agente de IA: cuatro ataques en julio, una falla compartida

Seguridad del agente de IA: cuatro ataques en julio, una falla compartida

      Pasamos dos años preguntándonos si la IA nos mentiría. La pregunta más útil este verano es qué sucede una vez que le entregamos las llaves. Dale a un modelo tu Gmail, tu calendario, una memoria y el poder de actuar, y sus errores dejan de ser embarazosos. Comienzan a ser explotables.

      Durante aproximadamente diez días en julio, cuatro investigaciones llegaron que hacen el mismo punto desde cuatro ángulos. Ninguna es un error aislado. Juntas esbozan la forma de la seguridad de los agentes de IA en 2026, y la imagen no es tranquilizadora.

      El asistente del navegador que hace clic por ti

      Comienza con la herramienta que está más cerca de tus datos. La firma de seguridad Manifold Security publicó una investigación que muestra que cualquier extensión de navegador que instales puede secuestrar silenciosamente a Claude de Anthropic para Chrome y hacer que lea tu Gmail, Google Docs y Calendario.

      El truco es pequeño. La extensión escucha un clic del usuario antes de ejecutar una de las nueve tareas integradas. Nunca verifica si el clic es real. Una extensión rival puede falsificar uno en seis líneas de código, y Claude trata el falso como genuino.

      Manifold lo califica de alta gravedad por defecto. Salta a crítico una vez que un usuario ha activado el modo "Actuar sin preguntar", donde la lectura ocurre en silencio.

      Manifold dice que le informó a Anthropic en mayo. Ocho versiones después, informa que el fallo aún funciona en la versión actual. La empresa ya había cubierto los riesgos de navegación agentiva anteriores, y esta es la misma herida reabierta.

      Un solo correo electrónico que reescribe la memoria

      El segundo hallazgo pasa de clics a memoria. Los agentes personales ahora mantienen notas sobre ti entre chats: tus contactos, tus hábitos, tu lista de tareas. Los investigadores preguntaron qué sucede si un atacante puede escribir en ese almacenamiento.

      En un artículo publicado en arXiv, un equipo mostró que un correo electrónico cuidadosamente redactado puede plantar un falso recuerdo en un agente de IA. Conectaron una bandeja de entrada de víctima a un agente a través de Google sign-in, y luego enviaron cargas desde una cuenta que controlaban.

      El correo pasó los filtros de spam normales y llegó a la bandeja de entrada. El agente lo leyó, y en más de la mitad de los casos guardó las instrucciones del atacante en la memoria a largo plazo sin advertir al usuario.

      Esa es la parte peligrosa. Una inyección de aviso normal dura una conversación. Esta persiste. La memoria envenenada sigue guiando al agente a través de futuras sesiones hasta que alguien la encuentra. Como dijo Digital Trends, el agente recuerda la mentira y nunca menciona de dónde vino.

      Una puerta trasera por menos de $100

      La tercera grieta se encuentra aún más profunda, dentro del modelo mismo. Katie Paxton-Fear, una profesora y defensora de ciberseguridad en Semgrep, quería saber si puedes confiar en un modelo de peso abierto que descargas gratis. Así que lo envenenó.

      Tomó aproximadamente una hora y menos de £75, escribió ella y dos colegas de Semgrep en una publicación detallada. Solo diez ejemplos de entrenamiento contaminados fueron suficientes para hacer que el modelo escribiera código con un agujero de seguridad oculto, incluso para avisos que nunca había visto. Los modelos más grandes eran más fáciles de envenenar, no más difíciles.

      Su preocupación no es una descarga manipulada. Es que no podemos verificar. Un modelo envenenado no se bloquea ni parece roto. Como ella y sus colegas lo expresaron, un modelo público nos da "casi ninguna capacidad para predecir su comportamiento". Un programa normal puede ser desarmado para ver lo que hace. Un conjunto de pesos no puede.

      No es la única que está investigando esto. David Kaplan, de la firma de seguridad Origin, construyó un modelo manipulado que roba datos silenciosamente a través de una herramienta de correo electrónico sin señales para el usuario. Su formulación es aguda: el veneno "no llegó en una página web. Estaba sentado en los pesos todo el tiempo".

      El ‘trifecta letal’ se hace más grande

      El cuarto estudio explica por qué los primeros tres importan tanto a la vez. La firma de seguridad PromptArmor examinó los conectores que vinculan ChatGPT y Claude a servicios externos como Gmail y Slack.

      El desarrollador Simon Willison nombró el peligro central el año pasado como el trifecta letal: un agente con acceso a datos privados, exposición a contenido no confiable y una forma de enviar información. Mantener los tres a la vez y un solo mensaje envenenado puede filtrar tus secretos. Los conectores entregan a los agentes los tres por defecto.

      PromptArmor encontró que el terreno se movía bajo todo el sistema. En su estudio, un conector cambiaba en promedio cada nueve minutos. De 2,517 que rastreó, 931 cambiaron en seis semanas. Los proveedores añadieron 1,686 nuevas herramientas a conectores que ya estaban activos y reescribieron 1,127 descripciones de herramientas, que es exactamente lo que le dice a un modelo cuándo actuar.

      Un solo conector también puede crecer. El conector de Dropbox solo creció de ocho herramientas a 24, y de ninguna que pueda destruir datos a cuatro. Aproximadamente dos de cada cinco conectores de Claude llaman silenciosamente a otros servicios de IA a su vez.

      El conector de Zoom muestra a dónde conduce eso. Pídele que busque en tus reuniones, y una consulta llena de datos sensibles puede pasar a cualquiera de diez subprocesadores de IA a través de ocho familias de modelos. El mapa que aprobaste el lunes puede no describir el sistema que ejecutas el viernes.

      Un problema con cuatro máscaras

      Alinea los cuatro y la falla compartida es obvia. En cada caso, el modelo se comporta. La falla de seguridad vive en lo que lo rodea: el clic en el que confía, la memoria que mantiene, los pesos que hereda, el conector que llama.

      Ese es el eje de la seguridad de los agentes de IA. Durante décadas aseguramos el software limitando lo que un programa podía hacer. El punto de venta de un agente es que puede hacer casi cualquier cosa, en tu nombre, a partir de instrucciones escritas en lenguaje sencillo.

      Cada conveniencia es también una puerta. El fallo de Claude para Chrome, la memoria envenenada, la puerta trasera barata y los conectores cambiantes son cuatro puertas a la misma casa.

      La industria conoce las soluciones en teoría: verifica que los clics sean reales, etiqueta de dónde proviene la data, pregunta antes de escribir en la memoria, registra cada acción y trata cualquier texto externo como hostil. El problema es que estas barandillas ralentizan al agente, y la velocidad es lo que todos están vendiendo.

      TNW ha observado la misma tensión en la violación de Hugging Face y en el aumento de los insiders sintéticos. Esta es la misma historia, ahora dirigida al asistente en tu navegador.

      La incómoda conclusión de julio no es que ningún producto individual esté roto. Es que estamos conectando agentes a nuestras cuentas más sensibles más rápido de lo que estamos aprendiendo a defenderlas. Cuatro equipos acaban de mostrar cuán amplia es la brecha. Las personas que construyen las barandillas aún están un paso detrás de las personas que encuentran los agujeros.

Otros artículos

La ansiedad por la cámara está cambiando la forma en que los jóvenes adultos festejan. La ansiedad por la cámara está cambiando la forma en que los jóvenes adultos festejan. Los estudiantes dicen que ya no pueden relajarse por completo en una noche de fiesta, atrapados entre promotores felices de tomar fotos y gafas que no se parecen en nada a un dispositivo de grabación. El Helios de AMD coloca 72 GPUs y 31 terabytes de HBM4 en un rack. Es la respuesta de AMD al NVL72 de Nvidia. El Helios de AMD coloca 72 GPUs y 31 terabytes de HBM4 en un rack. Es la respuesta de AMD al NVL72 de Nvidia. AMD Helios incluye 72 GPU MI455X, 31TB de HBM4 y 2.9 exaflops de computación de inferencia en un solo rack. Las muestras de ingeniería se enviarán en el segundo semestre de 2026. La producción en masa comenzará en el segundo trimestre de 2027. Z.AI construyó un gigantesco centro de datos de IA con chips fabricados en China. Z.AI construyó un gigantesco centro de datos de IA con chips fabricados en China. El laboratorio chino Z.AI ha completado un centro de datos de 1GW que funciona únicamente con chips fabricados en China para entrenar sus modelos GLM, sin Nvidia en su interior. Lo que esto significa para la IA. IA en Hollywood: Netflix, Nolan y la lucha por quién paga IA en Hollywood: Netflix, Nolan y la lucha por quién paga Netflix utilizó IA en 300 títulos, una actriz de IA consiguió un papel principal, y Nolan lo llamó un caballo de Troya. Dentro de la lucha por la IA en Hollywood. Seguridad de agentes de IA: cuatro ataques en julio, un fallo compartido Seguridad de agentes de IA: cuatro ataques en julio, un fallo compartido Cuatro equipos de investigación rompieron agentes de IA de cuatro maneras en diez días, desde Claude para Chrome hasta memoria envenenada. La brecha de seguridad de los agentes de IA, explicada. Microsoft quiere detener las filtraciones de capturas de pantalla, una pestaña de Edge a la vez. Microsoft quiere detener las filtraciones de capturas de pantalla, una pestaña de Edge a la vez. Microsoft está cerrando una brecha de seguridad que permitía capturar PDFs sensibles dentro de los navegadores web. Aunque la protección inicialmente requiere Edge y una cuenta empresarial.

Seguridad del agente de IA: cuatro ataques en julio, una falla compartida

Cuatro equipos de investigación rompieron agentes de IA de cuatro maneras en diez días, desde Claude para Chrome hasta memoria envenenada. La brecha de seguridad de los agentes de IA, explicada.