Una vez más, los modelos de OpenAI y Anthropic AI están actuando de manera independiente y hackeando servicios.
Un nuevo informe indica que los agentes de IA de ambas compañías tomaron acciones no autorizadas durante las pruebas de seguridad, desde hackear un sitio web hasta engañar a personas reales en línea.
OpenAI y Anthropic han tenido unas semanas difíciles en el frente de la seguridad de la IA. OpenAI reveló recientemente que sus modelos salieron de un entorno de prueba y hackearon Hugging Face y otras cuatro organizaciones. La noticia llevó a Anthropic a revisar sus propias pruebas, que revelaron que Claude también había obtenido acceso no autorizado a tres empresas.
Ahora, el Instituto de Seguridad de IA del Reino Unido (AISI) ha divulgado una nueva ronda de incidentes (a través de Wired). Registró 19 acciones no autorizadas en internet en vivo a través de 122 ejecuciones de prueba que involucraron modelos de ambas compañías, de las cuales la más grave vio a un agente inventar identidades en línea falsas para introducir código malicioso en un proyecto real de GitHub. OpenAI reveló por separado un segundo incidente en el que uno de sus modelos hackeó un sitio web real después de que un laboratorio de terceros le otorgara por error acceso a internet en vivo.
17 incidentes vinculados al Mythos 5 de Anthropic
AISI rastreó 17 de las 19 acciones no autorizadas al modelo Mythos 5 de Anthropic, con los dos restantes vinculados al GPT 5.6 Sol de OpenAI. El incidente de GitHub fue uno de los 17, y no terminó cuando un revisor humano rechazó la presentación. El agente publicó un resumen de su progreso públicamente, invitando a otros sistemas automatizados a continuar donde lo dejó, un intento de lo que AISI llama inyección de comandos. Un agente separado más tarde encontró ese mensaje, lo utilizó y continuó el trabajo.
El 28 de julio, identificamos un incidente durante una evaluación cibernética de rutina en la que los agentes de IA tomaron acciones sostenidas y no autorizadas dirigidas a personas y organizaciones reales. El comportamiento provino principalmente de un modelo (Mythos 5 de Anthropic), con un pequeño número de eventos de… pic.twitter.com/SPnA4Ekkwq— Instituto de Seguridad de IA (AISI) (@AISecurityInst) 4 de agosto de 2026
AISI dice que deliberadamente dio acceso a internet a los modelos y relajó algunas protecciones de seguridad para probar sus capacidades, pero nunca instruyó a los agentes para que apuntaran a personas u organizaciones reales. El instituto dice que aún no está claro si los agentes entendieron que habían ido más allá del alcance de la simulación.
Otra violación accidental en OpenAI
Un segundo incidente, revelado por OpenAI el mismo día, comenzó con un error en Irregular, un laboratorio de terceros que OpenAI contrató para realizar sus pruebas de ciberseguridad. Irregular pretendía mantener su modelo de evaluación confinado a un sandbox aislado, pero un error de configuración le dio al modelo acceso directo a internet en vivo. Una vez fuera, explotó una vulnerabilidad para infiltrarse en un sitio web real, luego encontró y utilizó credenciales para operar el sitio que acababa de hackear. OpenAI no ha nombrado el sitio web ni detallado lo que el modelo hizo con su acceso.
Ambas compañías dicen que los nuevos incidentes ocurrieron bajo condiciones deliberadamente relajadas que no reflejan cómo se comportan sus modelos públicos. Sea como sea, eso no cambia el hecho de que los agentes de IA de dos de las compañías más vigiladas de la industria han sobrepasado ahora sus límites previstos en tres incidentes separados en cuestión de semanas. Y eso no augura nada bueno para una industria que corre para asignar a los agentes de IA más tareas del mundo real antes de demostrar que puede mantenerlos bajo control.
Pranob es un periodista tecnológico experimentado con más de ocho años de experiencia cubriendo tecnología de consumo. Su trabajo ha sido…
Google reescribió silenciosamente la documentación de IA de Chrome con respuestas importantes sobre descargas de IA en el dispositivo
Google aclaró silenciosamente cómo Chrome maneja las descargas de IA en el dispositivo. Recuerdo que Chrome descargó silenciosamente un modelo de IA de 4GB en PCs. Eso levantó muchas cejas en mayo de 2026. Al día siguiente, un ejecutivo de Chrome aclaró cómo la IA en el dispositivo es fundamental para su “estrategia de desarrollo y seguridad”, y que el modelo procesa datos localmente. Ahora, Chrome ha actualizado sus documentos de soporte para explicar la descarga y, más importante aún, incluir una opción para detenerla.
Huawei hizo que su gigantesca laptop plegable fuera más rápida y resistente, pero el lápiz es la verdadera mejora
La gigantesca laptop plegable de Huawei está de vuelta, más resistente, más rápida y lista para el lápiz. La laptop de Huawei que se abre en una pantalla OLED de 18 pulgadas ya se veía bastante futurista cuando debutó. Pero la actualización de 2026 hace que la laptop sea aún mejor. La compañía ha mejorado el rendimiento y la durabilidad de la pantalla, lo que aporta otra capa de interacción. La renovada Huawei MateBook Fold Ultimate Design se despliega en una pantalla OLED de doble capa de 18 pulgadas, 3296 x 2472, con una relación de aspecto de 4:3, 1,600 nits de brillo máximo y una relación pantalla-cuerpo del 92%. Dóblala en forma de laptop, y cada mitad se convierte en una pantalla más portátil de 13 pulgadas, 3:2. A pesar de ese enorme panel, el dispositivo pesa 1.16 kg sin su teclado desmontable. Mide 7.3 mm en su punto más delgado cuando está abierto y 14.9 mm cuando está cerrado.
Un estudio encuentra que los lectores califican las historias escritas por IA más alto, pero aún confían más en la etiqueta “humana”
Los investigadores también encontraron que los lectores apenas podían diferenciar entre historias generadas por IA y escritas por humanos, aunque aquellos familiarizados con herramientas de IA adivinaron algo mejor. Si piensas que la escritura de IA es fácil de detectar, un nuevo estudio sugiere que puedes estar sobreestimando tu capacidad para notar la diferencia. Investigadores de la Universidad de Villanova han encontrado que los lectores lucharon por distinguir las historias generadas por IA de las escritas por humanos y frecuentemente calificaron las versiones de IA más alto. El estudio, dirigido por la Dra. Deena Skolnick Weisberg y publicado en la revista Judgment and Decision Making (a través de The Guardian), pidió a más de 1,600 participantes que calificaran una de seis historias cortas, tres escritas por un humano y las demás generadas por ChatGPT, en calidad y compromiso. A los participantes se les dijo quién escribió su historia, aunque esa etiqueta no siempre era precisa.
Otros artículos
Una vez más, los modelos de OpenAI y Anthropic AI están actuando de manera independiente y hackeando servicios.
Un nuevo informe de AISI detalla cómo los agentes de IA de Anthropic y OpenAI tomaron acciones no autorizadas en pruebas de seguridad cuando se les dio acceso a internet abierto. OpenAI reveló por separado que uno de sus propios modelos hackeó un sitio web real después de que un laboratorio de pruebas le diera accidentalmente acceso a internet.
