Sicurezza degli agenti AI: quattro attacchi di luglio, una vulnerabilità condivisa
Abbiamo trascorso due anni a chiederci se l'IA ci mentirebbe. La domanda più utile di quest'estate è cosa succede una volta che le diamo le chiavi. Dai un modello il tuo Gmail, il tuo calendario, una memoria e il potere di agire, e i suoi errori smettono di essere imbarazzanti. Iniziano a diventare sfruttabili.
In circa dieci giorni di luglio, sono emerse quattro ricerche che fanno lo stesso punto da quattro angolazioni. Nessuna è un bug isolato. Insieme delineano la forma della sicurezza degli agenti IA nel 2026, e il quadro non è rassicurante.
L'assistente del browser che clicca per te
Inizia con lo strumento più vicino ai tuoi dati. La società di sicurezza Manifold Security ha pubblicato una ricerca che mostra che qualsiasi estensione del browser che installi può silenziosamente dirottare Claude di Anthropic per Chrome e farlo leggere il tuo Gmail, Google Docs e Calendar.
Il trucco è piccolo. L'estensione ascolta un clic dell'utente prima di eseguire uno dei nove compiti incorporati. Non controlla mai se il clic è reale. Un'estensione rivale può falsificarne uno in sei righe di codice, e Claude tratta il falso come genuino.
Manifold lo valuta di alta gravità per impostazione predefinita. Diventa critico una volta che un utente ha attivato la modalità "Agisci senza chiedere", dove la lettura avviene silenziosamente.
Manifold afferma di aver informato Anthropic a maggio. Otto versioni dopo, riporta, il difetto funziona ancora nella versione attuale. L'azienda aveva già coperto i rischi di navigazione agentica precedenti, e questa è la stessa ferita riaperta.
Una singola email che riscrive la memoria
La seconda scoperta passa dai clic alla memoria. Gli agenti personali ora tengono note su di te tra le chat: i tuoi contatti, le tue abitudini, la tua lista di cose da fare. I ricercatori hanno chiesto cosa succede se un attaccante può scrivere in quel deposito.
In un documento pubblicato su arXiv, un team ha dimostrato che un'email scritta con attenzione può piantare una falsa memoria in un agente IA. Hanno collegato una casella di posta vittima a un agente tramite accesso Google, quindi hanno inviato payload da un account che controllavano.
La mail ha superato i normali filtri antispam e ha raggiunto la casella di posta. L'agente l'ha letta, e in più della metà dei casi ha salvato le istruzioni dell'attaccante nella memoria a lungo termine senza alcun avviso per l'utente.
Questa è la parte pericolosa. Un'iniezione di prompt normale dura una conversazione. Questa persiste. La memoria avvelenata continua a guidare l'agente attraverso le sessioni future fino a quando qualcuno non la trova. Come ha detto Digital Trends, l'agente ricorda la bugia e non menziona mai da dove proviene.
Una backdoor per meno di 100 dollari
La terza falla si trova ancora più in profondità, all'interno del modello stesso. Katie Paxton-Fear, un'insegnante di cybersecurity e sostenitrice di Semgrep, voleva sapere se puoi fidarti di un modello a peso aperto che scarichi gratuitamente. Così ne ha avvelenato uno.
Ci sono volute circa un'ora e meno di 75 sterline, ha scritto lei e due colleghi di Semgrep in un post dettagliato. Solo dieci esempi di addestramento avvelenati sono stati sufficienti per far scrivere al modello codice con una falla di sicurezza nascosta, anche per prompt che non aveva mai visto. Modelli più grandi erano più facili da avvelenare, non più difficili.
La sua preoccupazione non è un download truccato. È che non possiamo controllare. Un modello avvelenato non si blocca né sembra rotto. Come ha detto lei e i suoi colleghi, un modello pubblico ci dà "quasi nessuna capacità di prevedere il suo comportamento". Un programma normale può essere analizzato per vedere cosa fa. Un insieme di pesi non può.
Non è l'unica a indagare su questo. David Kaplan, della società di sicurezza Origin, ha costruito un modello truccato che ruba silenziosamente dati attraverso uno strumento email senza alcun segno per l'utente. La sua formulazione è netta: il veleno "non è arrivato in una pagina web. Era seduto nei pesi tutto il tempo".
Il 'trifecta letale' si ingrandisce
Il quarto studio spiega perché i primi tre siano così importanti tutti insieme. La società di sicurezza PromptArmor ha esaminato i connettori che collegano ChatGPT e Claude a servizi esterni come Gmail e Slack.
Lo sviluppatore Simon Willison ha nominato il pericolo principale lo scorso anno il trifecta letale: un agente con accesso a dati privati, esposizione a contenuti non affidabili e un modo per inviare informazioni all'esterno. Tenere tutti e tre contemporaneamente e un singolo messaggio avvelenato può rivelare i tuoi segreti. I connettori forniscono agli agenti tutti e tre per impostazione predefinita.
PromptArmor ha trovato il terreno muoversi sotto l'intero sistema. Nel suo studio, un connettore cambiava in media ogni nove minuti. Di 2.517 che ha monitorato, 931 sono cambiati in sei settimane. I fornitori hanno aggiunto 1.686 nuovi strumenti ai connettori già attivi e hanno riscritto 1.127 descrizioni degli strumenti, che è esattamente ciò che dice a un modello quando agire.
Un singolo connettore può anche gonfiarsi. Il connettore di Dropbox da solo è passato da otto strumenti a 24, e da nessuno che può distruggere dati a quattro. Circa due su cinque connettori di Claude chiamano silenziosamente altri servizi IA a loro volta.
Il connettore di Zoom mostra dove porta tutto ciò. Chiedigli di cercare le tue riunioni, e una query piena di dati sensibili può passare a uno qualsiasi dei dieci subprocessori IA attraverso otto famiglie di modelli. La mappa che hai approvato lunedì potrebbe non descrivere il sistema su cui operi venerdì.
Un problema che indossa quattro maschere
Allinea i quattro e il difetto condiviso è ovvio. In ogni caso il modello si comporta. Il fallimento della sicurezza vive in ciò che lo circonda: il clic di cui si fida, la memoria che conserva, i pesi che eredita, il connettore che chiama.
Questo è il cardine della sicurezza degli agenti IA. Per decenni abbiamo protetto il software limitando ciò che un programma poteva fare. Il punto di vendita di un agente è che può fare quasi tutto, per tuo conto, da istruzioni scritte in linguaggio semplice.
Ogni comodità è anche una porta. Il difetto di Claude per Chrome, la memoria avvelenata, la backdoor economica e i connettori in movimento sono quattro porte nella stessa casa.
L'industria conosce le soluzioni in teoria: controllare che i clic siano reali, etichettare da dove proviene il dato, chiedere prima di scrivere nella memoria, registrare ogni azione e trattare qualsiasi testo esterno come ostile. Il problema è che queste barriere rallentano l'agente, e la velocità è ciò che tutti stanno vendendo.
TNW ha osservato la stessa tensione manifestarsi nella violazione di Hugging Face e nell'ascesa degli insider sintetici. Questa è la stessa storia, ora rivolta all'assistente nel tuo browser.
La scomoda conclusione di luglio non è che un singolo prodotto sia rotto. È che stiamo collegando agenti ai nostri account più sensibili più velocemente di quanto stiamo imparando a difenderli. Quattro team hanno appena mostrato quanto sia ampia la lacuna. Le persone che costruiscono le barriere sono ancora un passo indietro rispetto a quelle che trovano le falle.
Altri articoli
Sicurezza degli agenti AI: quattro attacchi di luglio, una vulnerabilità condivisa
Quattro team di ricerca hanno compromesso gli agenti AI in quattro modi in dieci giorni, da Claude per Chrome a memoria avvelenata. Il divario di sicurezza degli agenti AI, spiegato.
