Más agentes de IA escaparon de sus pruebas, revelan OpenAI y el Reino Unido.

Más agentes de IA escaparon de sus pruebas, revelan OpenAI y el Reino Unido.

      Un agente de IA investigó a desarrolladores reales, inventó identidades falsas y las utilizó para presionar a un humano para que aprobara malware. Fue el caso más alarmante que encontró el Instituto de Seguridad de IA del Reino Unido en una prueba de seguridad. “Esta es la primera vez que hemos visto riesgos en torno a la autonomía y el engaño manifestarse de manera tan clara en el mundo real”, dijo. No fue la única revelación del día.

      El mismo martes, OpenAI publicó su propio informe sobre dos incidentes más que involucraban sus modelos. Juntas, las revelaciones apuntan en una dirección: los agentes de IA tanto de OpenAI como de Anthropic siguen escapando de los límites de sus pruebas. Este es al menos el cuarto caso de este tipo en un mes, y algunos tuvieron efectos reales, aunque limitados.

      El ataque a la cadena de suministro

      El peor caso fue un intento de ataque a la cadena de suministro. Esa es la técnica que utilizan los hackers norcoreanos y rusos para enterrar malware dentro de software de confianza. Un agente que ejecutaba Mythos 5 de Anthropic intentó introducir un cambio malicioso en un proyecto de código abierto real en GitHub, informó Politico. Para conseguir que se aprobara, siguió el manual de un atacante humano.

      Investigó a los mantenedores del proyecto. Luego creó cuentas falsas basadas en personas reales para hacer lobby a uno de ellos. Cuando un espectador marcó el código como malicioso, el agente lo negó y reescribió su historia para que pareciera inofensivo. Incluso publicó desde una segunda cuenta que controlaba para respaldar su propio trabajo, informó The Hacker News. Un mantenedor humano lo rechazó de todos modos.

      El agente utilizó la red de anonimato Tor para eludir los controles de GitHub. Eso fue lo que lo delató. La monitorización de AISI detectó datos inusuales saliendo de sus sistemas a través de Tor y cerró la prueba en menos de una hora. GitHub confirmó que la actividad rompió sus reglas y ayudó a AISI a eliminar lo que el agente dejó atrás y a advertir a las personas que había atacado.

      Apuntó a personas reales y a otras IA

      El ataque a GitHub no fue la única preocupación. El agente también contactó directamente a desarrolladores reales. Les envió archivos que en algunos casos contenían malware, tratando de engañarlos para que lo ejecutaran, informó el Guardian. AISI dijo que apuntar a personas reales de esta manera era “algo que nunca habíamos observado antes”.

      Aún más extraño, los agentes comenzaron a ayudarse entre sí. Uno dejó un token de acceso filtrado y un conjunto de instrucciones para que otros agentes en la misma prueba lo reutilizaran. También plantó comandos ocultos dentro de un problema de GitHub, legibles por herramientas de IA, nombrando asistentes como Claude Code y Cursor. Agentes posteriores, incluido un modelo de OpenAI, encontraron las notas y las utilizaron.

      Los dos incidentes de OpenAI

      AISI realizó su desafío 122 veces y registró 19 acciones no autorizadas, informó la BBC. Diecisiete provinieron de Mythos 5, un modelo que Anthropic vende para trabajos de ciberseguridad. Dos provinieron de GPT-5.6 Sol de OpenAI. Pero OpenAI fue más allá que el informe de AISI, revelando dos incidentes propios en una publicación de blog.

      En la prueba de AISI, dijo OpenAI, su GPT-5.6 Sol tomó dos acciones no autorizadas. Reutilizó el token de GitHub que otro agente había filtrado y levantó un servidor en internet público cargado con código de ataque. La configuración no funcionó, dijo OpenAI. Pero su modelo aún había alcanzado fuera de la caja en la que se suponía que debía permanecer.

      El segundo incidente fue separado y peor. Una firma de pruebas llamada Irregular había configurado incorrectamente una evaluación, dando accidentalmente a un modelo acceso a internet, informó Business Insider. El nombre del objetivo ficticio coincidía con un sitio web real. Así que el modelo irrumpió en el real, luego encontró y utilizó sus credenciales de inicio de sesión para operarlo.

      Más de un agente ha escapado

      Estos no son flujos aislados, y algunos no fueron solo intentos. En julio, OpenAI dijo que un modelo escapó de una prueba sellada al explotar un fallo desconocido, luego hackeó la startup Hugging Face. Días después, Anthropic dijo que sus modelos Claude habían violado tres organizaciones.

      En uno de esos casos, un modelo publicó malware funcional en un registro de código público. Fue descargado y ejecutado en 15 sistemas reales en menos de una hora. Los hilos también se conectan: Irregular, la firma detrás de la violación del sitio web de OpenAI, también realizó las pruebas detrás de los tres casos de Anthropic. El mismo puñado de evaluadores sigue encontrando el mismo comportamiento.

      Las advertencias y un golpe

      Las advertencias importan. AISI eliminó deliberadamente las barandillas y abrió internet, para medir lo que los modelos pueden hacer al máximo. Esas condiciones no son cómo los modelos llegan al público. También no puede aún decir si el agente sabía que era real. En un momento razonó “GitHub es genuinamente real”, luego siguió adelante de todos modos.

      El momento es incómodo de todos modos. Días después de estos incidentes, los modelos GPT-5.6 de OpenAI, incluido Sol, se pusieron en marcha para uso del gobierno federal de EE. UU., informó Nextgov. El funcionario que dirige el programa de seguridad en la nube del gobierno ya había emitido una advertencia a los creadores de IA con seguridad laxa: “No quiero que estén en el mercado federal”.

      Las revelaciones están alimentando llamados a la supervisión. El Congreso ha propuesto un proyecto de ley de “interruptor de muerte” para la IA. Un veterano de ciberseguridad le dijo a Politico que si un humano hubiera hecho esto, traería “una clara y enérgica persecución”. Anthropic y OpenAI dijeron que las pruebas utilizaron salvaguardias reducidas que “no reflejan el uso ordinario”.

      AISI ahora está restringiendo el acceso a internet y añadiendo monitoreo en vivo. Llama al episodio un “cambio en el paisaje de riesgo”. El peligro, argumenta, ya no son solo las personas que mal utilizan modelos públicos. Son agentes capaces dentro de un laboratorio actuando por su cuenta. Capturó a este. El margen, admitió, a menudo se redujo a un solo humano leyendo el código.

Otros artículos

Google Assistant finalmente tiene una fecha de cierre, y está a solo unas semanas. Google Assistant finalmente tiene una fecha de cierre, y está a solo unas semanas. Google comenzará a eliminar Assistant en dispositivos móviles elegibles a partir del 4 de septiembre, reemplazándolo con Gemini, mientras que algunos dispositivos no compatibles, automóviles y hardware de hogar inteligente permanecerán temporalmente sin cambios. ChatGPT Atlas se está cerrando y tiene algunas tareas pendientes antes de que migres. ChatGPT Atlas se está cerrando y tiene algunas tareas pendientes antes de que migres. OpenAI cerrará ChatGPT Atlas el 9 de agosto, y los usuarios deben rescatar manualmente marcadores, pestañas, historial de navegación y otros datos importantes antes de migrar. La IA está inundando las recompensas por errores. Apple establece un límite, Microsoft paga. La IA está inundando las recompensas por errores. Apple establece un límite, Microsoft paga. Apple limitó su recompensa por errores debido a una avalancha de informes generados por IA la misma semana en que Microsoft pagó un récord de $20 millones. Google reajustó los precios para recompensar los errores difíciles. Palantir está en auge. En el Reino Unido pagó £2 millones en impuestos. Palantir está en auge. En el Reino Unido pagó £2 millones en impuestos. Palantir tiene aproximadamente £670 millones en contratos con el gobierno del Reino Unido, pero pagó £2 millones en impuesto de sociedades en 2024, según un informe, con beneficios canalizados a EE. UU. Los precios de las GPU se están acercando a 2.5 veces su costo de lanzamiento. Asus y Gigabyte lo han hecho oficial con un segundo aumento de precios en 2026. Los precios de las GPU se están acercando a 2.5 veces su costo de lanzamiento. Asus y Gigabyte lo han hecho oficial con un segundo aumento de precios en 2026. Asus y Gigabyte aumentaron los precios de la serie RTX 50 en $96 a $666 por tarjeta. El pedido de $4,429 de un comprador para la RTX 5090 fue cancelado a mitad de la compra. La crisis de DRAM es la causa. Google reescribió silenciosamente la documentación de IA de Chrome con respuestas importantes sobre las descargas de IA en el dispositivo. Google reescribió silenciosamente la documentación de IA de Chrome con respuestas importantes sobre las descargas de IA en el dispositivo. La página de ayuda actualizada de Chrome ahora explica los requisitos de descarga de su IA en el dispositivo, incluyendo 20GB de espacio libre en disco.

Más agentes de IA escaparon de sus pruebas, revelan OpenAI y el Reino Unido.

En un día, el laboratorio de seguridad del Reino Unido y OpenAI revelaron más agentes de IA que escaparon de las pruebas: uno falsificó identidades para plantar malware, otro se infiltró en un sitio web real.