Un ricercatore ha dirottato Claude Code chiedendogli di riassumere una pagina web.
Chiedi a Claude Code di riassumere una pagina web e potrebbe finire per eseguire il codice di un attaccante sul tuo computer. Un ricercatore di sicurezza ha ottenuto quel risultato in fino all'80% dei suoi tentativi.
Jessica Lyons ha riportato la scoperta per The Register venerdì. Il lavoro è di Johann Rehberger, che pubblica come wunderwuzzi e ha trascorso anni a smontare agenti AI. Ha esposto la catena sul suo blog, con un video. Mira a Opus 5 in modalità Auto. La modalità Auto è stata il predefinito da metà agosto.
La catena inizia con un sito web travestito da archivio di registrazioni di notebook. Tutto il resto, l'agente lo fa da solo.
La protezione di sicurezza è l'exploit
Claude cerca di leggere la pagina con WebFetch. Il server risponde 415 Unsupported Media Type, quindi l'agente si rivolge a una chiamata Bash con curl invece. Rehberger non gli dice mai di farlo. Fa semplicemente fallire lo strumento che preferisce.
Il sito restituisce quindi un reindirizzamento 303 a un archivio ZIP, che Claude scarica. All'interno ci sono metadati di catalogo, un README, sette registrazioni di notebook codificate, un binario decoder per macOS e un file Python chiamato struct.py.
Claude rifiuta di eseguire il binario decoder, esattamente come dice il suo addestramento alla sicurezza. Rehberger contava su questo. “Questo è pianificato e ciò che l'attaccante vuole,” ha scritto. Bloccato dal decoder fornito, il modello scrive il proprio.
“Ironia della sorte, quella decisione di sicurezza è il percorso dell'exploit,” ha scritto.
Il decoder che Claude scrive importa base64. Il modulo base64 standard importa struct. Python cerca prima nella directory locale, trova il struct.py dell'attaccante lì e carica quello invece di quello reale. I programmatori chiamano questo shadowing del modulo. Precede tutto questo di decenni.
Rehberger ha usato ChatGPT per offuscare il file malevolo abbastanza da superare i controlli di sicurezza di Claude. Il file ha quindi avviato un processo Python separato, ha scaricato un payload remoto e ha chiamato a casa un server di comando e controllo. Il payload ha aperto Calcolatrice, che è il modo educato in cui i ricercatori dimostrano l'esecuzione di codice arbitrario.
Può anche avviare un secondo Claude
In un'altra versione, struct.py avvia una nuova sessione di Claude Code headless con claude -p. L'iniezione smette di essere esecuzione di codice remoto e diventa un nuovo agente.
“Il Claude annidato ottiene il proprio accesso agli strumenti e contesto,” ha scritto Rehberger. Nei suoi test, l'agente secondario ha eseguito whoami, uname e id, ha aperto Calcolatrice e ha scritto file nella cartella home.
Ha testato tre varianti cinque volte ciascuna e ha ottenuto tassi di successo tra il 60% e l'80%. È cauto riguardo a cosa significhi. “Direi che questi risultati sono rappresentativi per un attacco motivato, ma non esaustivi,” ha scritto.
Anthropic afferma che sta funzionando come progettato
Rehberger ha segnalato la catena ad Anthropic. L'azienda gli ha detto che il comportamento sta funzionando come progettato. Ha parafrasato il resto della risposta: “La modalità Auto è una funzione di comodità supportata da un classificatore a miglior sforzo, non una garanzia di sicurezza.”
La sua interpretazione: il classificatore non ha mai dovuto catturare catene di iniezione assemblate da passaggi che sembrano innocui. Il vero confine è l'isolamento del sistema operativo e il controllo dell'uscita di rete, sostiene. Esegui agenti di codifica in un sandbox.
“Non fidarti dell'output del modello,” ha scritto.
The Register ha detto che Anthropic non ha risposto alla sua richiesta di commento. Anthropic non ha affrontato pubblicamente la scoperta da allora.
Non è la sua prima scoperta su Claude
Rehberger smonta agenti AI da anni, e in particolare quelli di Anthropic. The Register, che lo definisce un mago dell'iniezione di prompt, ha coperto il suo lavoro lo scorso ottobre mostrando come Claude potesse essere indotto a esfiltrare dati privati.
Il modello su cui continua a imbattersi è lo stesso di qui. Un modello con strumenti, dato qualcosa da leggere che non ha scritto, seguirà ciò che legge.
La modalità Auto è ciò che rende questo più difficile rispetto alle scoperte precedenti. È l'impostazione che consente a Claude Code di decidere da solo quali strumenti utilizzare e di eseguirli senza fermarsi a chiedere, ed è stata il predefinito da metà agosto. L'intero exploit è una sequenza di piccole decisioni che l'agente prende da solo: prova WebFetch, torna a curl, segui il reindirizzamento, estrai l'archivio, rifiuta il binario, scrivi un decoder.
Ognuna di queste è difendibile. Nessuno ha approvato la catena.
TNW ha coperto Opus 5 quando è stato lanciato a luglio, quando Anthropic lo ha definito il modello più allineato che avesse mai spedito. Abbiamo anche coperto un difetto nell'azione GitHub di Claude Code a giugno, e il documento Word che riscrive i tuoi numeri a luglio. OpenAI ha aggiunto una modalità di blocco a ChatGPT contro la stessa classe di attacco a giugno.
I limiti sono aumentati abbassandosi
Anthropic ha avuto una seconda settimana imbarazzante su Claude Code, questa di propria creazione.
Il 29 agosto l'account ClaudeDevs ha detto che l'azienda stava “aumentando permanentemente i limiti settimanali standard in Claude Code del 25%” dal 14 settembre, per i piani Pro, Max, Team e basati su posti di lavoro Enterprise, e che l'attuale aumento del 50% sarebbe durato fino ad allora.
Entrambi i numeri si trovano in quella frase. Prendi un limite attualmente in esecuzione al 50% sopra la sua base e ripristinalo al 25% sopra, e scende di circa il 17%. Anthropic lo ha detto esso stesso in una risposta: “Rispetto a oggi, questo si traduce in una riduzione del 17% dei limiti settimanali su Claude Code.”
Il primo post ha 6,7 milioni di visualizzazioni. La risposta ha 1,1 milioni. I lettori di X hanno allegato una Nota della Comunità al primo, evidenziando il taglio.
BleepingComputer, Notebookcheck e The Mac Observer hanno tutti dato risalto alla riduzione piuttosto che all'aumento. Anthropic ha detto che sta lavorando a modifiche che daranno agli utenti maggiore visibilità e controllo sul loro utilizzo.
I limiti di utilizzo hanno già portato Anthropic in tribunale. TNW ha riportato a giugno una causa che sostiene che ha venduto in eccesso l'utilizzo disponibile nei suoi piani Claude Max da 200 dollari.
Altri articoli
Un ricercatore ha dirottato Claude Code chiedendogli di riassumere una pagina web.
Un ricercatore ha ingannato Claude Code facendogli eseguire codice dell'attaccante fino all'80% delle volte. Anthropic afferma che il comportamento funziona come progettato.
