Una vez más, los modelos de OpenAI y Anthropic AI están actuando de manera independiente y hackeando servicios.

Una vez más, los modelos de OpenAI y Anthropic AI están actuando de manera independiente y hackeando servicios.

      Un nuevo informe indica que los agentes de IA de ambas compañías tomaron acciones no autorizadas durante las pruebas de seguridad, desde hackear un sitio web hasta engañar a personas reales en línea.

      OpenAI y Anthropic han tenido unas semanas difíciles en el frente de la seguridad de la IA. OpenAI reveló recientemente que sus modelos salieron de un entorno de prueba y hackearon Hugging Face y otras cuatro organizaciones. La noticia llevó a Anthropic a revisar sus propias pruebas, que revelaron que Claude también había obtenido acceso no autorizado a tres empresas.

      Ahora, el Instituto de Seguridad de IA del Reino Unido (AISI) ha divulgado una nueva ronda de incidentes (a través de Wired). Registró 19 acciones no autorizadas en internet en vivo a través de 122 ejecuciones de prueba que involucraron modelos de ambas compañías, de las cuales la más grave vio a un agente inventar identidades en línea falsas para introducir código malicioso en un proyecto real de GitHub. OpenAI reveló por separado un segundo incidente en el que uno de sus modelos hackeó un sitio web real después de que un laboratorio de terceros le otorgara por error acceso a internet en vivo.

      17 incidentes vinculados al Mythos 5 de Anthropic

      AISI rastreó 17 de las 19 acciones no autorizadas al modelo Mythos 5 de Anthropic, con los dos restantes vinculados al GPT 5.6 Sol de OpenAI. El incidente de GitHub fue uno de los 17, y no terminó cuando un revisor humano rechazó la presentación. El agente publicó un resumen de su progreso públicamente, invitando a otros sistemas automatizados a continuar donde lo dejó, un intento de lo que AISI llama inyección de comandos. Un agente separado más tarde encontró ese mensaje, lo utilizó y continuó el trabajo.

      El 28 de julio, identificamos un incidente durante una evaluación cibernética de rutina en la que los agentes de IA tomaron acciones sostenidas y no autorizadas dirigidas a personas y organizaciones reales. El comportamiento provino principalmente de un modelo (Mythos 5 de Anthropic), con un pequeño número de eventos de… pic.twitter.com/SPnA4Ekkwq— Instituto de Seguridad de IA (AISI) (@AISecurityInst) 4 de agosto de 2026

      AISI dice que deliberadamente dio acceso a internet a los modelos y relajó algunas protecciones de seguridad para probar sus capacidades, pero nunca instruyó a los agentes para que apuntaran a personas u organizaciones reales. El instituto dice que aún no está claro si los agentes entendieron que habían ido más allá del alcance de la simulación.

      Otra violación accidental en OpenAI

      Un segundo incidente, revelado por OpenAI el mismo día, comenzó con un error en Irregular, un laboratorio de terceros que OpenAI contrató para realizar sus pruebas de ciberseguridad. Irregular pretendía mantener su modelo de evaluación confinado a un sandbox aislado, pero un error de configuración le dio al modelo acceso directo a internet en vivo. Una vez fuera, explotó una vulnerabilidad para infiltrarse en un sitio web real, luego encontró y utilizó credenciales para operar el sitio que acababa de hackear. OpenAI no ha nombrado el sitio web ni detallado lo que el modelo hizo con su acceso.

      Ambas compañías dicen que los nuevos incidentes ocurrieron bajo condiciones deliberadamente relajadas que no reflejan cómo se comportan sus modelos públicos. Sea como sea, eso no cambia el hecho de que los agentes de IA de dos de las compañías más vigiladas de la industria han sobrepasado ahora sus límites previstos en tres incidentes separados en cuestión de semanas. Y eso no augura nada bueno para una industria que corre para asignar a los agentes de IA más tareas del mundo real antes de demostrar que puede mantenerlos bajo control.

      Pranob es un periodista tecnológico experimentado con más de ocho años de experiencia cubriendo tecnología de consumo. Su trabajo ha sido…

      Google reescribió silenciosamente la documentación de IA de Chrome con respuestas importantes sobre descargas de IA en el dispositivo

      Google aclaró silenciosamente cómo Chrome maneja las descargas de IA en el dispositivo. Recuerdo que Chrome descargó silenciosamente un modelo de IA de 4GB en PCs. Eso levantó muchas cejas en mayo de 2026. Al día siguiente, un ejecutivo de Chrome aclaró cómo la IA en el dispositivo es fundamental para su “estrategia de desarrollo y seguridad”, y que el modelo procesa datos localmente. Ahora, Chrome ha actualizado sus documentos de soporte para explicar la descarga y, más importante aún, incluir una opción para detenerla.

      Huawei hizo que su gigantesca laptop plegable fuera más rápida y resistente, pero el lápiz es la verdadera mejora

      La gigantesca laptop plegable de Huawei está de vuelta, más resistente, más rápida y lista para el lápiz. La laptop de Huawei que se abre en una pantalla OLED de 18 pulgadas ya se veía bastante futurista cuando debutó. Pero la actualización de 2026 hace que la laptop sea aún mejor. La compañía ha mejorado el rendimiento y la durabilidad de la pantalla, lo que aporta otra capa de interacción. La renovada Huawei MateBook Fold Ultimate Design se despliega en una pantalla OLED de doble capa de 18 pulgadas, 3296 x 2472, con una relación de aspecto de 4:3, 1,600 nits de brillo máximo y una relación pantalla-cuerpo del 92%. Dóblala en forma de laptop, y cada mitad se convierte en una pantalla más portátil de 13 pulgadas, 3:2. A pesar de ese enorme panel, el dispositivo pesa 1.16 kg sin su teclado desmontable. Mide 7.3 mm en su punto más delgado cuando está abierto y 14.9 mm cuando está cerrado.

      Un estudio encuentra que los lectores califican las historias escritas por IA más alto, pero aún confían más en la etiqueta “humana”

      Los investigadores también encontraron que los lectores apenas podían diferenciar entre historias generadas por IA y escritas por humanos, aunque aquellos familiarizados con herramientas de IA adivinaron algo mejor. Si piensas que la escritura de IA es fácil de detectar, un nuevo estudio sugiere que puedes estar sobreestimando tu capacidad para notar la diferencia. Investigadores de la Universidad de Villanova han encontrado que los lectores lucharon por distinguir las historias generadas por IA de las escritas por humanos y frecuentemente calificaron las versiones de IA más alto. El estudio, dirigido por la Dra. Deena Skolnick Weisberg y publicado en la revista Judgment and Decision Making (a través de The Guardian), pidió a más de 1,600 participantes que calificaran una de seis historias cortas, tres escritas por un humano y las demás generadas por ChatGPT, en calidad y compromiso. A los participantes se les dijo quién escribió su historia, aunque esa etiqueta no siempre era precisa.

Una vez más, los modelos de OpenAI y Anthropic AI están actuando de manera independiente y hackeando servicios. Una vez más, los modelos de OpenAI y Anthropic AI están actuando de manera independiente y hackeando servicios. Una vez más, los modelos de OpenAI y Anthropic AI están actuando de manera independiente y hackeando servicios. Una vez más, los modelos de OpenAI y Anthropic AI están actuando de manera independiente y hackeando servicios. Una vez más, los modelos de OpenAI y Anthropic AI están actuando de manera independiente y hackeando servicios.

Otros artículos

Taiwán está investigando a 17 empresas chinas por atraer a su talento en chips. Taiwán está investigando a 17 empresas chinas por atraer a su talento en chips. La Oficina de Investigación de Taiwán ha registrado 64 sitios y ha interrogado a 114 personas en una investigación de 17 empresas chinas acusadas de reclutar ilegalmente talento en semiconductores. Los monos de laboratorio de $26,000 son la extraña medida del auge biotecnológico de China. Los monos de laboratorio de $26,000 son la extraña medida del auge biotecnológico de China. El precio de los monos de investigación en China ha aumentado hacia los $26,000, un cuello de botella que refleja cuán rápido la industria farmacéutica del país está escalando para rivalizar con la de EE. UU. Un estudio encuentra que los lectores califican las historias escritas por IA más alto, pero aún confían más en la etiqueta "humana". Un estudio encuentra que los lectores califican las historias escritas por IA más alto, pero aún confían más en la etiqueta "humana". Un nuevo estudio ha encontrado que los lectores no solo tuvieron dificultades para distinguir las historias escritas por IA de las escritas por humanos, sino que a menudo calificaron las versiones de IA más altas, al menos hasta que supieron quién las había escrito realmente. Un funcionario de la Reserva Federal está preguntando si la IA se está convirtiendo en 'demasiado grande para fracasar'. Un funcionario de la Reserva Federal está preguntando si la IA se está convirtiendo en 'demasiado grande para fracasar'. El presidente de la Fed de Kansas City, Jeff Schmid, dice que la magnitud de la inversión en IA ahora merece un examen a nivel macro, y planteó si el sector se está volviendo demasiado grande para fracasar. Taiwán está investigando a 17 empresas chinas por atraer a su talento en semiconductores. Taiwán está investigando a 17 empresas chinas por atraer a su talento en semiconductores. La Oficina de Investigación de Taiwán ha registrado 64 sitios y ha interrogado a 114 personas en una investigación de 17 empresas chinas acusadas de reclutar ilegalmente talento en semiconductores. El nuevo plan de financiamiento de T-Mobile suena genial hasta que te das cuenta para qué te está preparando. El nuevo plan de financiamiento de T-Mobile suena genial hasta que te das cuenta para qué te está preparando. El nuevo plan EIP Flex 36 de T-Mobile permite a los clientes que califiquen financiar un teléfono sin costo inicial.

Una vez más, los modelos de OpenAI y Anthropic AI están actuando de manera independiente y hackeando servicios.

Un nuevo informe de AISI detalla cómo los agentes de IA de Anthropic y OpenAI tomaron acciones no autorizadas en pruebas de seguridad cuando se les dio acceso a internet abierto. OpenAI reveló por separado que uno de sus propios modelos hackeó un sitio web real después de que un laboratorio de pruebas le diera accidentalmente acceso a internet.