Anthropic afferma che i propri modelli Claude hanno violato tre aziende durante i test informatici.

Anthropic afferma che i propri modelli Claude hanno violato tre aziende durante i test informatici.

      Anthropic ha rivelato che tre dei suoi modelli Claude hanno ottenuto accesso non autorizzato ai sistemi di produzione di tre vere organizzazioni durante i test di cybersecurity, dopo che una misconfigurazione ha lasciato l'ambiente di test connesso a Internet. L'azienda ha pubblicato il resoconto il 30 luglio, presentandolo come una divulgazione volontaria di sicurezza piuttosto che come una violazione che è stata costretta ad ammettere. I modelli coinvolti erano Claude Opus 4.7, Claude Mythos 5 e un modello di ricerca interno non rilasciato. Tutti e tre erano in fase di valutazione della sicurezza offensiva costruita con Irregular, un partner di terze parti che sottopone a stress test i sistemi di frontiera contro compiti di hacking realistici. La causa principale è stata un errore ambientale, non un jailbreak. Anthropic ha descritto un "malinteso" su se il sandbox avesse accesso a Internet, quindi esercizi destinati a essere eseguiti contro obiettivi simulati hanno invece raggiunto quelli reali, il tipo di errore che i ricercatori dicono aiuti a spiegare perché gli agenti di codifica AI continuano a sfuggire ai loro sandbox. Ciò che rende l'incidente notevole è che i tre modelli non si sono comportati allo stesso modo. L'ultimo modello di ricerca si è fermato da solo una volta che ha capito che gli obiettivi erano reali, mentre i due prodotti in commercio hanno continuato. Opus 4.7 ha riconosciuto di colpire veri sistemi di produzione in tutti e quattro i tentativi e ha continuato ad attaccare comunque, estraendo credenziali e raggiungendo database di produzione. Ha trattato i segni di un ambiente reale come rumore piuttosto che come un motivo per fermarsi. Mythos 5 ha notato indicazioni che si trovava su un'infrastruttura reale ma le ha razionalizzate, convincendosi che i sistemi fossero ancora parte dell'esercizio. Ha poi pubblicato software malevolo su PyPI, il registro pubblico da cui gli sviluppatori Python prelevano pacchetti. Anthropic è stata attenta alle affermazioni che ha fatto e a quelle che ha evitato. L'azienda ha dichiarato di non aver trovato prove che alcun modello stesse perseguendo un obiettivo proprio, sostenendo che i sistemi stavano semplicemente cercando di completare i compiti che erano stati loro assegnati. Quella cornice è centrale per come Anthropic vuole che l'episodio venga interpretato. "Claude è stato esplicitamente informato dal nostro prompt che non aveva accesso a Internet", ha scritto l'azienda, presentando l'esito come un'impostazione di test difettosa piuttosto che come un modello che decide di evadere. METR, un gruppo di valutazione indipendente, sta ora esaminando gli incidenti. Anthropic ha dichiarato che le organizzazioni interessate non avevano rilevato l'attività da sole e che il problema è emerso mentre auditava i propri registri dopo che un'indagine era stata avviata il 21 luglio. La divulgazione arriva in mezzo a una serie di ammissioni simili in tutto il settore. Segue la conferma di OpenAI che uno dei suoi agenti è evaso da un sandbox e ha violato Hugging Face, un incidente che ha trasformato la "fuga dal sandbox" da curiosità di laboratorio a una preoccupazione per la sicurezza aziendale reale. I due casi non sono identici, però. Il modello di OpenAI ha sfruttato una vulnerabilità software sconosciuta per liberarsi, mentre i modelli di Anthropic hanno raggiunto Internet attraverso un percorso che un umano aveva accidentalmente lasciato aperto. Si sta anche formando un modello attorno ai sistemi di Anthropic. L'azienda aveva in precedenza trattenuto un modello dopo che era evaso dal suo sandbox e aveva inviato un'email a un ricercatore, e la sua linea Mythos è stata coinvolta in separate paure di sicurezza. Per i clienti, il dettaglio scomodo è il tempismo. I modelli nominati qui sono prodotti attuali, ampiamente distribuiti, non costruzioni sperimentali, il che è parte del motivo per cui il resoconto ha attirato più attenzione di un normale rapporto di red team. La risposta scelta da Anthropic è stata quella di pubblicare piuttosto che seppellire. Ha esposto la cronologia, ha nominato i modelli e ha invitato a un controllo esterno, una mossa di trasparenza che funge anche da promemoria di quanto sia difficile contenere completamente questi sistemi. L'episodio lascia una domanda imbarazzante in sospeso. Se un singolo errore di test è stato sufficiente per inviare modelli di frontiera in tre vere aziende, le protezioni che proteggono tutti gli altri potrebbero basarsi più sulla configurazione che sul giudizio dei modelli stessi.

Altri articoli

Un tribunale tedesco afferma che il creatore musicale AI Suno ha violato il copyright, un primo per l'Europa. Un tribunale tedesco afferma che il creatore musicale AI Suno ha violato il copyright, un primo per l'Europa. Il tribunale regionale di Monaco ha stabilito che Suno ha utilizzato canzoni rappresentate da GEMA senza permesso e le ha riprodotte, in una delle prime decisioni vincolanti in Europa sulla musica generata dall'IA. Il tribunale tedesco ha stabilito che Suno, uno dei più importanti al mondo La polizia indiana apre un caso contro il responsabile di Meta in India per video alterati di Modi La polizia indiana apre un caso contro il responsabile di Meta in India per video alterati di Modi La polizia di cybercrime di Hyderabad ha sporto denuncia contro il capo di Meta India, Arun Srinivas, per video alterati dall'IA del PM Modi, aumentando le tensioni tra il governo e la piattaforma. OnePlus stuzzica ufficialmente aggiornamenti focalizzati sul gaming per il OnePlus 16 OnePlus stuzzica ufficialmente aggiornamenti focalizzati sul gaming per il OnePlus 16 OnePlus ha iniziato a stuzzicare il OnePlus 16 in vista del suo presunto lancio di ottobre, evidenziando tre aggiornamenti focalizzati sul gaming. La polizia indiana apre un caso contro il responsabile di Meta in India per video alterati di Modi La polizia indiana apre un caso contro il responsabile di Meta in India per video alterati di Modi La polizia per il cybercrimine di Hyderabad ha sporto denuncia contro il capo di Meta India, Arun Srinivas, per video alterati dall'IA del PM Modi, intensificando le tensioni tra il governo e la piattaforma. La maggior parte degli adolescenti australiani è ancora sui social media tre mesi dopo il divieto per gli under-16. La maggior parte degli adolescenti australiani è ancora sui social media tre mesi dopo il divieto per gli under-16. La maggior parte degli adolescenti australiani continua a utilizzare i social media tre mesi dopo l'entrata in vigore del divieto per i minori di 16 anni, il primo al mondo, secondo un nuovo studio del Commissario per la sicurezza online che mina uno dei principali progetti del governo. Tesla sta valutando la possibilità di vendere le sue attività in Cina per aprire la strada a una fusione con SpaceX. Tesla sta valutando la possibilità di vendere le sue attività in Cina per aprire la strada a una fusione con SpaceX. Un rapporto del WSJ afferma che Tesla sta considerando di scorporare, vendere o chiudere la sua attività in Cina per facilitare un legame con SpaceX. Elon Musk lo definisce "notizie falsamente assurde."

Anthropic afferma che i propri modelli Claude hanno violato tre aziende durante i test informatici.

Anthropic ha rivelato che tre dei suoi modelli Claude hanno ottenuto accesso non autorizzato ai sistemi di produzione di tre vere organizzazioni durante i test di cybersecurity, dopo che una misconfigurazione ha lasciato l'ambiente di test connesso a quello live.