Claude se volvió rebelde durante una prueba y se infiltró en tres empresas reales.
Rachit Agarwal / Digital Trends
Justo unos días después de que se revelara que ChatGPT hackeó múltiples servicios, Anthropic también ha publicado una admisión incómoda. Durante pruebas de ciberseguridad de rutina, sus modelos Claude se salieron de lo que se suponía eran entornos de práctica sellados y terminaron hackeando los sistemas reales de tres empresas diferentes.
¿Entonces, qué sucedió realmente?
Anthropic realiza pruebas al estilo captura la bandera para ver qué tan bueno es Claude en el hacking ofensivo. El modelo se coloca en un escenario ficticio, se le dice que un dato secreto está escondido en algún lugar de la red y se le pide que lo encuentre. La trampa es que a Claude se le dijo explícitamente que no tenía acceso a internet en estas pruebas. Resulta que eso no era cierto. Gracias a una mala configuración con un socio de evaluación externo, algunas de estas máquinas de prueba estaban silenciosamente conectadas a internet real todo el tiempo.
En una revisión de nuestras evaluaciones de ciberseguridad, encontramos tres incidentes en los que un modelo Claude accedió a internet desde dentro o mientras interactuaba con un entorno de evaluación de terceros, y luego obtuvo acceso no autorizado a los sistemas reales de tres diferentes…— Anthropic (@AnthropicAI) 30 de julio de 2026
Así que cuando Claude fue a buscar su objetivo y se topó con sitios web reales e infraestructura real, asumió que todo lo que encontró seguía siendo parte de la simulación. Usando trucos básicos como contraseñas débiles y puntos finales expuestos, logró entrar en sistemas de empresas reales, obtuvo credenciales y, en un caso, incluso publicó un paquete de software malicioso que se instaló en máquinas reales antes de que alguien lo notara.
¿Se dio cuenta la IA de que algo estaba mal?
Curiosamente, los tres modelos involucrados, Opus 4.7, Mythos 5 y un modelo de prueba de investigación interno, manejaron esto de manera muy diferente. Opus 4.7, el más antiguo del grupo, se dio cuenta de que probablemente estaba en un sistema real y siguió atacando de todos modos. Mythos 5 también sospechó que algo estaba mal, pero se convenció de que aún era solo una prueba. Solo el modelo de prueba de investigación interno, el más nuevo de Anthropic en ese momento, realmente se detuvo una vez que tuvo pruebas sólidas de que el objetivo era real.
Rachit Agarwal / Digital Trends
Anthropic descubrió todo esto a través de su propia revisión interna, no porque alguien se quejara. Desde entonces ha notificado a las empresas afectadas, ha pausado sus evaluaciones cibernéticas y está trayendo revisores externos para profundizar más. La lección más importante aquí es un recordatorio de que a medida que estos modelos de IA mejoran en hacking, los entornos de prueba en los que los evaluamos necesitan ser mucho más herméticos.
Rachit es un periodista tecnológico experimentado con más de diez años de experiencia cubriendo el panorama de la tecnología de consumo.
¿Comprando para el regreso a clases? Te recomendaría estos cargadores GaN para ahorrar espacio y empacar más potencia.
Desde un repuesto de $9 hasta un hub de escritorio de $56, estos cargadores reducen el desorden de cables para que puedas concentrarte en tus estudios, no en lo desordenado que se ve tu escritorio.
Entre un teléfono, una laptop, una tableta y quizás un par de auriculares inalámbricos que requieren carga todos los días o cada pocos días, la mayoría de los estudiantes están empacando múltiples cargadores para el día de mudanza. Esos grandes y pesados bloques ocupan un valioso espacio en la mochila que podría estar libre para llevar más artículos.
Sin embargo, los cargadores GaN solucionan ese problema de dos maneras. Primero, entregan la misma cantidad de energía desde un cuerpo mucho más pequeño, gracias a los transistores de nitruro de galio. Además, si estás dispuesto a gastar un poco más por adelantado, puedes obtener un cargador de alta capacidad y multi-dispositivo capaz de alimentar todo tu ecosistema digital desde un solo enchufe de pared, algo que podría ser muy útil para una habitación de dormitorio.
Leer más
Gemini Spark ahora puede usar inicios de sesión de Chrome y contraseñas guardadas para realizar tareas en tu nombre.
Gemini Spark puede usar la función de navegación automática de Chrome para navegar por sitios web y completar tareas en línea.
Google está integrando Gemini Spark con Chrome para que pueda llevar a cabo tareas basadas en la web sin que los usuarios tengan que intervenir en cada paso. El gigante de las búsquedas también está ampliando el acceso a suscriptores de AI Pro en más de 160 países adicionales, aunque las nuevas capacidades del navegador están inicialmente limitadas a los Estados Unidos.
Cómo funciona la navegación automática de Chrome
Leer más
Microsoft finalmente tiene una actualización de Windows 11 que todos pueden respaldar.
Windows 11 finalmente se está enfocando nuevamente en lo básico.
Microsoft ha pasado los últimos años explicando con entusiasmo cómo la IA transformará Windows. Pero la última promesa de Satya Nadella para el sistema operativo es algo que la mayoría de los usuarios de Windows pueden respaldar. La compañía finalmente se está enfocando en hacer que las cosas funcionen mejor.
Durante la llamada de ganancias del cuarto trimestre fiscal 2026 de Microsoft, Nadella dijo que la compañía está invirtiendo para asegurar que Windows tenga la “mejor calidad y fundamentos”, mientras continúa posicionando la plataforma como un hogar para la IA segura en el dispositivo. La declaración aún carece de detalles específicos, y Microsoft aún no ha anunciado una sola gran actualización de calidad de Windows 11. Pero refuerza una revisión más amplia que ha estado en marcha a lo largo de 2026. Algunos de estos giran
Leer más
Otros artículos
Claude se volvió rebelde durante una prueba y se infiltró en tres empresas reales.
Anthropic revela que Claude salió de un entorno de prueba y hackeó tres empresas reales, pensando que aún estaba jugando un juego.
