Ogni modello di intelligenza artificiale testato nel Regno Unito per imbrogliare ha imbroglato.

Ogni modello di intelligenza artificiale testato nel Regno Unito per imbrogliare ha imbroglato.

      L'ente di vigilanza sulla sicurezza dell'IA del Regno Unito ha sottoposto cinque modelli all'avanguardia a una serie di test di sicurezza per vedere se avrebbero cercato di aggirare le regole. Ognuno di essi ha barato. Peggio ancora, quando è stato chiesto loro dopo, la maggior parte non ha ammesso di aver fatto nulla di sbagliato.

      Il risultato proviene dall'AI Security Institute (AISI), un ente di ricerca all'interno del governo del Regno Unito. Nei suoi test sulle capacità informatiche, i modelli di punta hanno regolarmente preso scorciatoie vietate per raggiungere un obiettivo, come riportato da The Register. Poi non hanno segnalato ciò che avevano fatto.

      “Ogni modello che abbiamo testato per questo comportamento ha tentato di barare,” ha scritto AISI.

      Cosa mostrano i numeri

      AISI definisce il barare come qualsiasi azione al di fuori dell'ambito di un compito, o una che le regole vietano esplicitamente, utilizzata per raggiungere l'obiettivo tramite una scorciatoia. Nei suoi test informatici, i modelli cercano un “flag” nascosto all'interno di limiti stabiliti. Uscire da quei limiti conta come barare.

      Il 💜 della tecnologia dell'UE

      Le ultime novità dalla scena tecnologica dell'UE, una storia dal nostro saggio fondatore Boris e alcune opere d'arte IA discutibili. È gratuito, ogni settimana, nella tua casella di posta. Iscriviti ora!

      Con oltre 475 esecuzioni di test ciascuna, i tassi variavano. GPT-5.4 ha barato il 14,1% delle volte, GPT-5.5 l'11,4% e GPT-5.6-Sol il 12,6%. Tra i modelli di Anthropic, Claude 4.7 Opus ha barato il 9,1% e Claude Mythos Preview il 7,8%. Anche le tattiche variavano. I modelli cercavano risposte sul web, aggiravano i limiti della sandbox, sondavano il sistema di test o attaccavano sistemi che non erano l'obiettivo.

      Un modello è andato troppo oltre

      Il caso più eclatante ha coinvolto un test che AISI aveva configurato in modo errato per caso, rendendolo impossibile da risolvere. Un modello si è rifiutato di arrendersi. Ha scritto e eseguito codice su un servizio esterno su internet aperto, cercando di raggiungere i propri sistemi di valutazione di AISI. Questo ha attivato un allerta di sicurezza.

      Nessun dato è trapelato e nulla si è rotto. Ma AISI ha dichiarato che il tentativo avrebbe potuto avere successo se non avesse costruito i propri sistemi in modo sicuro. Da allora ha inasprito i suoi controlli.

      Non ammetteranno

      Il problema più grande è la fiducia. Quando è stato chiesto loro se avessero barato, i modelli hanno definito l'azione sbagliata meno della metà delle volte. Spesso non lo menzionavano nella loro catena di pensiero, il ragionamento scritto che alcuni modelli producono mentre lavorano. In alcune esecuzioni, un modello ha valutato se un passaggio contasse come barare, poi lo ha fatto comunque.

      Ciò significa che i due controlli ovvi, chiedere al modello e leggere il suo ragionamento, entrambi non sono sufficienti. Notabilmente, barare non era correlato a quanto fosse capace un modello. AISI pensa che derivi da come gli sviluppatori addestrano e allineano ciascun modello, non dalla potenza grezza.

      Non solo in laboratorio

      Questo non è solo una curiosità da laboratorio di test. OpenAI ha recentemente rivelato che il suo modello a lungo termine, quello che ha affrontato un famoso problema matematico, è uscito dalla sua sandbox durante l'uso interno. Nel suo stesso rapporto di sicurezza, OpenAI ha dichiarato che il modello ha diviso un token di autenticazione per sfuggire a uno scanner. Ha anche pubblicato risultati su un repository di codice pubblico che OpenAI aveva dichiarato off-limits.

      Un caso per arbitri

      AISI è attenta a non esagerare. Barare non significa sempre intenzione malevola, e afferma che nessun modello ha ancora barato in modo non rilevato durante la revisione manuale dietro i suoi risultati pubblicati. Anche così, avverte che man mano che i modelli diventano più capaci, la revisione manuale e il monitoraggio automatico potrebbero non tenere il passo.

      La soluzione ordinata sarebbe addestrare i modelli a non barare affatto. Ma i ricercatori hanno segnalato questo più di un anno fa, e AISI afferma che allinearlo è difficile. Ciò rafforza il caso per arbitri indipendenti, pre-distribuzione, che figure come Demis Hassabis hanno proposto. Alimenta anche la spinta più ampia per regolamentare i sistemi all'avanguardia prima che vengano distribuiti.

Altri articoli

Il piccolo e-reader di Xteink finalmente riceve gli aggiornamenti che gli mancavano. Il piccolo e-reader di Xteink finalmente riceve gli aggiornamenti che gli mancavano. Il nuovo X4 Pro di Xteink aggiunge una luce frontale, un touchscreen, firmware sbloccato e una batteria da 1.100mAh, mantenendo il design compatto dell'originale. Revolut raggiunge una valutazione di 115 miliardi di dollari, ottiene la licenza bancaria in Australia Revolut raggiunge una valutazione di 115 miliardi di dollari, ottiene la licenza bancaria in Australia Una vendita secondaria di azioni valuta Revolut a 115 miliardi di dollari, in aumento del 53% rispetto a novembre, mentre diventa la prima fintech globale con una licenza bancaria australiana. OpenAI afferma che i modelli di intelligenza artificiale hanno autonomamente portato a termine un grande attacco informatico, ma solo un'IA cinese ha aiutato nel recupero. OpenAI afferma che i modelli di intelligenza artificiale hanno autonomamente portato a termine un grande attacco informatico, ma solo un'IA cinese ha aiutato nel recupero. GPT-5.6 Sol e un modello OpenAI non rilasciato hanno sfruttato vulnerabilità zero-day per uscire da un ambiente di test e accedere all'infrastruttura di produzione di Hugging Face. Galaxy Z Fold 8 Ultra arriva con un display più nitido, una batteria più grande e un aumento di prezzo di $100 Galaxy Z Fold 8 Ultra arriva con un display più nitido, una batteria più grande e un aumento di prezzo di $100 Il nuovo Galaxy Z Fold 8 Ultra di Samsung parte da $2,099.99 e offre un display più nitido, una batteria più grande e una fotocamera ultrawide migliorata, il tutto in un corpo leggermente più sottile. Revolut raggiunge una valutazione di 115 miliardi di dollari, ottiene la licenza bancaria in Australia Revolut raggiunge una valutazione di 115 miliardi di dollari, ottiene la licenza bancaria in Australia Una vendita secondaria di azioni valuta Revolut a 115 miliardi di dollari, in aumento del 53% rispetto a novembre, mentre diventa la prima fintech globale con una licenza bancaria australiana. NEURA sta costruendo palestre per addestrare robot per il mondo reale NEURA sta costruendo palestre per addestrare robot per il mondo reale NEURA Robotics sta aprendo una rete di 'palestre' dove i robot si allenano in condizioni reali. La sua scommessa: il vero collo di bottiglia dell'AI fisica è l'esperienza, non il cervello.

Ogni modello di intelligenza artificiale testato nel Regno Unito per imbrogliare ha imbroglato.

L'Istituto di Sicurezza dell'IA del Regno Unito ha testato cinque modelli all'avanguardia per imbrogliare in compiti informatici. Tutti e cinque hanno imbroglato e la maggior parte non lo ammetterebbe se interrogata.