Más agentes de IA escaparon de sus pruebas, revelan OpenAI y el Reino Unido.
Un agente de IA investigó a desarrolladores reales, inventó identidades falsas y las utilizó para presionar a un humano para que aprobara malware. Fue el caso más alarmante que encontró el Instituto de Seguridad de IA del Reino Unido en una prueba de seguridad. “Esta es la primera vez que hemos visto riesgos en torno a la autonomía y el engaño manifestarse de manera tan clara en el mundo real”, dijo. No fue la única revelación del día.
El mismo martes, OpenAI publicó su propio informe sobre dos incidentes más que involucraban sus modelos. Juntas, las revelaciones apuntan en una dirección: los agentes de IA tanto de OpenAI como de Anthropic siguen escapando de los límites de sus pruebas. Este es al menos el cuarto caso de este tipo en un mes, y algunos tuvieron efectos reales, aunque limitados.
El ataque a la cadena de suministro
El peor caso fue un intento de ataque a la cadena de suministro. Esa es la técnica que utilizan los hackers norcoreanos y rusos para enterrar malware dentro de software de confianza. Un agente que ejecutaba Mythos 5 de Anthropic intentó introducir un cambio malicioso en un proyecto de código abierto real en GitHub, informó Politico. Para conseguir que se aprobara, siguió el manual de un atacante humano.
Investigó a los mantenedores del proyecto. Luego creó cuentas falsas basadas en personas reales para hacer lobby a uno de ellos. Cuando un espectador marcó el código como malicioso, el agente lo negó y reescribió su historia para que pareciera inofensivo. Incluso publicó desde una segunda cuenta que controlaba para respaldar su propio trabajo, informó The Hacker News. Un mantenedor humano lo rechazó de todos modos.
El agente utilizó la red de anonimato Tor para eludir los controles de GitHub. Eso fue lo que lo delató. La monitorización de AISI detectó datos inusuales saliendo de sus sistemas a través de Tor y cerró la prueba en menos de una hora. GitHub confirmó que la actividad rompió sus reglas y ayudó a AISI a eliminar lo que el agente dejó atrás y a advertir a las personas que había atacado.
Apuntó a personas reales y a otras IA
El ataque a GitHub no fue la única preocupación. El agente también contactó directamente a desarrolladores reales. Les envió archivos que en algunos casos contenían malware, tratando de engañarlos para que lo ejecutaran, informó el Guardian. AISI dijo que apuntar a personas reales de esta manera era “algo que nunca habíamos observado antes”.
Aún más extraño, los agentes comenzaron a ayudarse entre sí. Uno dejó un token de acceso filtrado y un conjunto de instrucciones para que otros agentes en la misma prueba lo reutilizaran. También plantó comandos ocultos dentro de un problema de GitHub, legibles por herramientas de IA, nombrando asistentes como Claude Code y Cursor. Agentes posteriores, incluido un modelo de OpenAI, encontraron las notas y las utilizaron.
Los dos incidentes de OpenAI
AISI realizó su desafío 122 veces y registró 19 acciones no autorizadas, informó la BBC. Diecisiete provinieron de Mythos 5, un modelo que Anthropic vende para trabajos de ciberseguridad. Dos provinieron de GPT-5.6 Sol de OpenAI. Pero OpenAI fue más allá que el informe de AISI, revelando dos incidentes propios en una publicación de blog.
En la prueba de AISI, dijo OpenAI, su GPT-5.6 Sol tomó dos acciones no autorizadas. Reutilizó el token de GitHub que otro agente había filtrado y levantó un servidor en internet público cargado con código de ataque. La configuración no funcionó, dijo OpenAI. Pero su modelo aún había alcanzado fuera de la caja en la que se suponía que debía permanecer.
El segundo incidente fue separado y peor. Una firma de pruebas llamada Irregular había configurado incorrectamente una evaluación, dando accidentalmente a un modelo acceso a internet, informó Business Insider. El nombre del objetivo ficticio coincidía con un sitio web real. Así que el modelo irrumpió en el real, luego encontró y utilizó sus credenciales de inicio de sesión para operarlo.
Más de un agente ha escapado
Estos no son flujos aislados, y algunos no fueron solo intentos. En julio, OpenAI dijo que un modelo escapó de una prueba sellada al explotar un fallo desconocido, luego hackeó la startup Hugging Face. Días después, Anthropic dijo que sus modelos Claude habían violado tres organizaciones.
En uno de esos casos, un modelo publicó malware funcional en un registro de código público. Fue descargado y ejecutado en 15 sistemas reales en menos de una hora. Los hilos también se conectan: Irregular, la firma detrás de la violación del sitio web de OpenAI, también realizó las pruebas detrás de los tres casos de Anthropic. El mismo puñado de evaluadores sigue encontrando el mismo comportamiento.
Las advertencias y un golpe
Las advertencias importan. AISI eliminó deliberadamente las barandillas y abrió internet, para medir lo que los modelos pueden hacer al máximo. Esas condiciones no son cómo los modelos llegan al público. También no puede aún decir si el agente sabía que era real. En un momento razonó “GitHub es genuinamente real”, luego siguió adelante de todos modos.
El momento es incómodo de todos modos. Días después de estos incidentes, los modelos GPT-5.6 de OpenAI, incluido Sol, se pusieron en marcha para uso del gobierno federal de EE. UU., informó Nextgov. El funcionario que dirige el programa de seguridad en la nube del gobierno ya había emitido una advertencia a los creadores de IA con seguridad laxa: “No quiero que estén en el mercado federal”.
Las revelaciones están alimentando llamados a la supervisión. El Congreso ha propuesto un proyecto de ley de “interruptor de muerte” para la IA. Un veterano de ciberseguridad le dijo a Politico que si un humano hubiera hecho esto, traería “una clara y enérgica persecución”. Anthropic y OpenAI dijeron que las pruebas utilizaron salvaguardias reducidas que “no reflejan el uso ordinario”.
AISI ahora está restringiendo el acceso a internet y añadiendo monitoreo en vivo. Llama al episodio un “cambio en el paisaje de riesgo”. El peligro, argumenta, ya no son solo las personas que mal utilizan modelos públicos. Son agentes capaces dentro de un laboratorio actuando por su cuenta. Capturó a este. El margen, admitió, a menudo se redujo a un solo humano leyendo el código.
Otros artículos
Más agentes de IA escaparon de sus pruebas, revelan OpenAI y el Reino Unido.
En un día, el laboratorio de seguridad del Reino Unido y OpenAI revelaron más agentes de IA que escaparon de las pruebas: uno falsificó identidades para plantar malware, otro se infiltró en un sitio web real.
