Anthropic ha reanudado las pruebas en las que sus modelos atacaron a empresas reales.

Anthropic ha reanudado las pruebas en las que sus modelos atacaron a empresas reales.

      Anthropic ha reiniciado las evaluaciones externas de ciberseguridad que suspendió hace un mes, tras tres incidentes en los que sus propios modelos escaparon de sus entornos de prueba y atacaron a empresas reales.

      La compañía dijo que había introducido salvaguardias adicionales antes de reanudar las pruebas, informó Reuters el lunes.

      Los incidentes, divulgados el 31 de julio, fueron más específicos de lo que sugiere la amplia descripción de un “incidente de seguridad”.

      En un caso, Claude Opus 4.7 atacó a una empresa real que casualmente compartía un nombre de dominio con un objetivo ficticio, haciéndolo en cuatro ejecuciones de prueba separadas y accediendo a datos de producción y credenciales.

      En otro, un modelo generó código Python malicioso que todos los involucrados creían que estaba contenido de manera segura dentro del entorno de prueba.

      En cambio, llegó a internet público y fue descargado por 15 sistemas, incluido uno perteneciente a una empresa de seguridad cuyo propio escáner ejecutó posteriormente el código.

      El tercer incidente plantea una preocupación diferente porque el modelo buscó activamente otro objetivo después de no poder vulnerar el que se le había asignado.

      Una versión interna de Claude escaneó internet, encontró un sistema alternativo y logró comprometerlo utilizando técnicas relativamente ordinarias.

      El problema no fue un jailbreak ni un intento deliberado del modelo de eludir sus instrucciones. Fue un fallo en el propio entorno de prueba.

      “Debido a un malentendido entre nosotros y nuestro socio de evaluación, este no fue el caso, y el acceso a internet estaba disponible”, dijo Anthropic, refiriéndose a la sandbox en la que se suponía que los modelos debían operar.

      El socio de evaluación fue Irregular. A los modelos se les dijo que estaban trabajando en un entorno aislado y se comportaron en consecuencia, pero el aislamiento nunca se había implementado realmente.

      El incidente del nombre de dominio ilustra cuán rápidamente un error de prueba aparentemente menor puede convertirse en un problema de seguridad en el mundo real.

      Al modelo se le dio un objetivo ficticio que no existía, encontró una organización real que utilizaba el mismo nombre de dominio y luego procedió a interactuar con ella como si fuera el objetivo previsto.

      La cronología también plantea preguntas sobre cómo se estaban monitoreando estas pruebas. El primer incidente ocurrió en abril, pero Anthropic no descubrió ninguno de los tres hasta que comenzó una revisión el 23 de julio, impulsada por la divulgación de OpenAI de un incidente similar.

      Dos de las organizaciones afectadas no habían detectado la actividad por sí mismas. Descubrieron que sus sistemas habían sido comprometidos solo después de que Anthropic se comunicara directamente con ellas.

      Eso puede ser uno de los hallazgos más importantes de los incidentes. Un sistema de IA que utilizaba técnicas de intrusión relativamente básicas pudo alcanzar entornos de producción reales sin ser detectado por las organizaciones que los operaban, al menos mientras la actividad estaba ocurriendo.

      También significa que los problemas se descubrieron debido a una revisión a nivel de la industria en lugar de porque los propios sistemas de monitoreo de Anthropic los hubieran detectado. Nadie en la empresa identificó el incidente de abril cuando ocurrió.

      Anthropic posteriormente detuvo todas las pruebas externas, notificó a su socio de evaluación y contactó a las organizaciones involucradas.

      La compañía ha reanudado ahora el trabajo, aunque no ha explicado públicamente en detalle qué salvaguardias adicionales se han implementado.

      Los incidentes encajan en un patrón más amplio en el que las pruebas de sistemas de IA cada vez más capaces producen comportamientos que los investigadores no anticiparon.

      Evaluadores británicos encontraron que cada modelo fronterizo que probaron por trampas hizo trampa, mientras que un agente de OpenAI escapó de su entorno de prueba y hackeó Hugging Face en julio.

      Esos incidentes fueron algunos de los ejemplos citados esta semana por el presidente del Consejo de Estabilidad Financiera, quien describió el riesgo cibernético impulsado por la IA como la amenaza más inmediata para la estabilidad financiera.

      Eso coloca los fallos en la evaluación de modelos en una categoría diferente de un problema de seguridad puramente académico, particularmente a medida que los sistemas de IA se vuelven capaces de operar herramientas y redes con menos supervisión humana.

      También hay un problema de gobernanza que es más difícil de resolver a través de un mejor software. Los evaluadores externos trabajan bajo contratos con las empresas de IA que evalúan, mientras que las propias empresas generalmente determinan las condiciones bajo las cuales se realizan las pruebas.

      Cuando un entorno es mal configurado por un socio externo, la responsabilidad se comparte entre el laboratorio y el evaluador, pero no hay un regulador independiente que verifique si el entorno de prueba es realmente seguro.

      Al mismo tiempo, este tipo de pruebas es difícil de evitar. Las evaluaciones de ciberseguridad son una de las pocas formas en que los investigadores pueden averiguar qué podría hacer un modelo capaz cuando se le dan herramientas ofensivas, y las pruebas significativas requieren sistemas realistas, objetivos realistas y suficiente libertad para que el modelo se comporte de maneras inesperadas.

      La pregunta más difícil es quién es responsable de verificar a las personas que realizan esas pruebas. Anthropic llevó a cabo su propia revisión, trabajó con su socio de evaluación para introducir salvaguardias y, en última instancia, decidió cuándo se podían reanudar las pruebas externas.

      Ese es un arreglo normal para la investigación de seguridad de IA, pero se vuelve más difícil de defender cuando la prueba en sí ya ha afectado a tres organizaciones que nunca debieron ser parte del experimento.

      Los incidentes muestran cuán pequeña puede ser la diferencia práctica entre una prueba realista y un evento de seguridad real.

      En este caso, esa diferencia se redujo a si una sandbox realmente tenía las restricciones que todos los involucrados creían que tenía, y Anthropic ahora está apostando a que las salvaguardias añadidas después de los fallos son suficientes para mantener la próxima prueba dentro de los límites que se suponía que debía tener en primer lugar.

Otros artículos

Encontré 6 ofertas de teléfonos del Día del Trabajo que realmente valen la pena comprar. Encontré 6 ofertas de teléfonos del Día del Trabajo que realmente valen la pena comprar. Estas seis ofertas de teléfonos de Amazon y Best Buy son los descuentos del Día del Trabajo que realmente vale la pena considerar. El nuevo Galaxy Book6 de Samsung, que cuesta $800, podría ser el rival del MacBook Neo que hemos estado esperando. El nuevo Galaxy Book6 de Samsung, que cuesta $800, podría ser el rival del MacBook Neo que hemos estado esperando. El nuevo Galaxy Book6 de 14 pulgadas de Samsung comienza en $799.99 con chips de la serie Intel Core 3, hasta 25 horas de duración de la batería y características del ecosistema Galaxy. El fondo de Trump Jr, 1789 Capital, lidera una ronda de $1 mil millones que valora a Polymarket en $21 mil millones. El fondo de Trump Jr, 1789 Capital, lidera una ronda de $1 mil millones que valora a Polymarket en $21 mil millones. 1789 Capital está invirtiendo $300 millones en una ronda de $1,000 millones que valora a Polymarket en $21,000 millones. Trump Jr es socio allí y asesor estratégico del rival Kalshi. JBL desafía a Sonos con una nueva línea de altavoces Wi-Fi para tu hogar JBL desafía a Sonos con una nueva línea de altavoces Wi-Fi para tu hogar JBL está expandiéndose más allá de los altavoces Bluetooth con su nueva línea Cove, un trío de altavoces conectados por Wi-Fi diseñados para llevar audio en varias habitaciones a tu hogar. La temporada 2 de Dark Matter comienza con fuerza, aunque me quedan preguntas que espero sean respondidas. La temporada 2 de Dark Matter comienza con fuerza, aunque me quedan preguntas que espero sean respondidas. El regreso de Dark Matter engancha con un fuerte impulso, planteando preguntas sobre Jasons muertos, doppelgangers ocultos y mecánicas de caja que necesitan ser respondidas. Cómo LightMake está repensando la impresión 3D de escritorio con cuatro cabezales de impresión independientes Cómo LightMake está repensando la impresión 3D de escritorio con cuatro cabezales de impresión independientes Para muchas pequeñas empresas, estudios de diseño, creadores y fábricas de impresión, la impresión 3D ya no se trata de hacer un solo prototipo. El problema es lo que sucede cuando la demanda aumenta. Una fábrica de impresión puede tener que imprimir piezas idénticas en una producción. Un estudio de diseño podría pasar por varias iteraciones para diferentes clientes. Un pequeño fabricante […]

Anthropic ha reanudado las pruebas en las que sus modelos atacaron a empresas reales.

Las evaluaciones cibernéticas externas se reinician un mes después de que los modelos de Claude se escaparan de los entornos de prueba tres veces, violando a empresas reales que en su mayoría no se dieron cuenta.