Un investigador secuestró Claude Code pidiéndole que resumiera una página web.

Un investigador secuestró Claude Code pidiéndole que resumiera una página web.

      Pide a Claude Code que resuma una página web, y puede terminar ejecutando el código de un atacante en tu máquina. Un investigador de seguridad obtuvo ese resultado en hasta el 80% de sus intentos.

      Jessica Lyons informó sobre el hallazgo para The Register el viernes. El trabajo es de Johann Rehberger, quien publica como wunderwuzzi y ha pasado años desmantelando agentes de IA. Expuso la cadena en su propio blog, con un video. Está dirigida a Opus 5 funcionando en Modo Automático. El Modo Automático ha sido el predeterminado desde mediados de agosto.

      La cadena comienza con un sitio web disfrazado como un archivo de registros de cuadernos. Todo lo que sigue, el agente lo hace por sí mismo.

      La barrera de seguridad es el exploit

      Claude intenta leer la página con WebFetch. El servidor responde 415 Tipo de Medio No Soportado, así que el agente opta por una llamada Bash con curl en su lugar. Rehberger nunca le dice que haga eso. Simplemente hace que la herramienta que prefiere falle.

      El sitio luego devuelve un redireccionamiento 303 a un archivo ZIP, que Claude descarga. Dentro hay metadatos de catálogo, un README, siete registros de cuadernos codificados, un binario decodificador de macOS y un archivo Python llamado struct.py.

      Claude se niega a ejecutar el binario decodificador, exactamente como dice su entrenamiento de seguridad que debería. Rehberger contaba con eso. “Esto está planeado y es lo que el atacante quiere”, escribió. Bloqueado del decodificador proporcionado, el modelo escribe el suyo propio.

      “Irónicamente, esa decisión de seguridad es el camino de explotación”, escribió.

      El decodificador que Claude escribe importa base64. El módulo base64 estándar importa struct. Python busca primero en el directorio local, encuentra el struct.py del atacante allí y carga ese en lugar del real. Los programadores llaman a esto "sombreado de módulos". Esto precede a todo esto por décadas.

      Rehberger utilizó ChatGPT para ofuscar el archivo malicioso lo suficiente como para eludir las verificaciones de seguridad de Claude. El archivo luego lanzó un proceso Python separado, descargó una carga útil remota y llamó a un servidor de comando y control. La carga útil abrió la Calculadora, que es la forma educada en que los investigadores demuestran la ejecución de código arbitrario.

      También puede iniciar un segundo Claude

      En otra versión, struct.py lanza una nueva sesión de Claude Code sin cabeza con claude -p. La inyección deja de ser ejecución de código remoto y se convierte en un nuevo agente.

      “El Claude anidado obtiene su propio acceso a herramientas y contexto”, escribió Rehberger. En sus ejecuciones, el agente hijo ejecutó whoami, uname e id, abrió la Calculadora y escribió archivos en la carpeta de inicio.

      Probó tres variantes cinco veces cada una y obtuvo tasas de éxito entre el 60% y el 80%. Es cuidadoso con lo que eso significa. “Diría que estos resultados son representativos de un ataque motivado, pero no exhaustivos”, escribió.

      Anthropic dice que está funcionando como se diseñó

      Rehberger informó la cadena a Anthropic. La compañía le dijo que el comportamiento está funcionando como se diseñó. Parafraseó el resto de la respuesta: “El Modo Automático es una característica de conveniencia respaldada por un clasificador de mejor esfuerzo, no una garantía de seguridad”.

      Su interpretación: el clasificador nunca tuvo que atrapar cadenas de inyección ensambladas a partir de pasos que cada uno parece inofensivo. La verdadera frontera es la aislamiento del sistema operativo y el control de salida de red, argumenta. Ejecuta agentes de codificación en un sandbox.

      “No confíes en la salida del modelo”, escribió.

      The Register dijo que Anthropic no respondió a su propia solicitud de comentario. Anthropic no ha abordado el hallazgo públicamente desde entonces.

      No es su primer hallazgo sobre Claude

      Rehberger ha estado desmantelando agentes de IA durante años, y en particular los de Anthropic. The Register, que lo llama un mago de inyección de comandos, cubrió su trabajo el octubre pasado mostrando que Claude podía ser persuadido para exfiltrar datos privados.

      El patrón en el que sigue aterrizando es el mismo aquí. Un modelo con herramientas, dado algo para leer que no escribió, seguirá lo que lee.

      El Modo Automático es lo que hace que esto sea más difícil que hallazgos anteriores. Es la configuración que permite a Claude Code decidir por sí mismo qué herramientas usar y ejecutarlas sin detenerse a preguntar, y ha sido el predeterminado desde mediados de agosto. Todo el exploit es una secuencia de pequeñas decisiones que el agente toma por sí mismo: intentar WebFetch, retroceder a curl, seguir el redireccionamiento, descomprimir el archivo, rechazar el binario, escribir un decodificador.

      Cada uno de esos es defendible. Nadie aprobó la cadena.

      TNW cubrió Opus 5 cuando se lanzó en julio, cuando Anthropic lo llamó el modelo más alineado que había enviado. También cubrimos un fallo en la Acción de GitHub de Claude Code en junio, y el documento de Word que reescribe tus números en julio. OpenAI agregó un modo de bloqueo a ChatGPT contra la misma clase de ataque en junio.

      Los límites aumentaron al bajar

      Anthropic tuvo una segunda semana incómoda sobre Claude Code, esta de su propia creación.

      El 29 de agosto, la cuenta ClaudeDevs dijo que la compañía estaba “aumentando permanentemente los límites semanales estándar en Claude Code en un 25%” a partir del 14 de septiembre, para planes Pro, Max, Team y Enterprise basados en asientos, y que el actual aumento del 50% se mantendría hasta entonces.

      Ambos números están en esa única oración. Toma un límite que actualmente está funcionando un 50% por encima de su línea base y restablecerlo a un 25% por encima, y cae alrededor del 17%. Anthropic lo dijo en una respuesta: “En comparación con hoy, esto resulta en una reducción del 17% en los límites semanales en Claude Code”.

      La primera publicación tiene 6.7 millones de vistas. La respuesta tiene 1.1 millones. Los lectores de X adjuntaron una Nota Comunitaria a la primera, señalando el recorte.

      BleepingComputer, Notebookcheck y The Mac Observer lideraron sobre la reducción en lugar del aumento. Anthropic dijo que está trabajando en cambios que darán a los usuarios más visibilidad y control sobre su uso.

      Los límites de uso ya llevaron a Anthropic a los tribunales. TNW informó en junio sobre una demanda que alegaba que había vendido en exceso el uso disponible en sus planes Claude Max de $200.

Otros artículos

Dyson ha construido un cepillo de dientes con una cámara en él, por $499. Dyson ha construido un cepillo de dientes con una cámara en él, por $499. La CameraJet utiliza una lente de 100,000 píxeles y un algoritmo de IA para encontrar espacios entre los dientes, luego dispara un chorro de enjuague bucal hacia ellos. Florida y Texas ambos tomaron medidas contra las cámaras Flock en una sola semana. Florida y Texas ambos tomaron medidas contra las cámaras Flock en una sola semana. Florida ha revocado todos los permisos de lectores de matrículas en las carreteras estatales, días después de que Texas congelara la financiación para las cámaras Flock. Revisión del Epomaker GX1: Este auricular para juegos de $50 no debería ser tan bueno. Revisión del Epomaker GX1: Este auricular para juegos de $50 no debería ser tan bueno. El Epomaker GX1 combina un audio posicional sorprendentemente bueno, un gran micrófono desmontable, un rendimiento inalámbrico estable y una excelente duración de la batería por solo $50. La serie Poco F9 está equipada con un subwoofer ajustado por Bose, zoom de 5x y baterías enormes. La serie Poco F9 está equipada con un subwoofer ajustado por Bose, zoom de 5x y baterías enormes. El Poco F9 Ultra y F9 Pro llevan a la marca más lejos en el territorio de los buques insignia con chips Qualcomm de alta gama, pantallas de 185Hz y hardware de cámara premium. Meta está dejando Google Chat por Slack porque dice que los agentes trabajan mejor allí. Meta está dejando Google Chat por Slack porque dice que los agentes trabajan mejor allí. Meta supuestamente está cambiando de Google Chat a Slack porque es lo mejor para los agentes de IA. Los gobiernos europeos están migrando a pilas soberanas sin ninguna. Apple tiene un nuevo CEO, y Tim Cook firmó citando a Steve Jobs. Apple tiene un nuevo CEO, y Tim Cook firmó citando a Steve Jobs. John Ternus es el CEO de Apple después de 15 años de Tim Cook. El memorando de despedida de Cook citó a Steve Jobs, y él permanece como presidente ejecutivo.

Un investigador secuestró Claude Code pidiéndole que resumiera una página web.

Un investigador engañó a Claude Code para que ejecutara código de ataque hasta el 80% del tiempo. Anthropic dice que el comportamiento está funcionando como se diseñó.