OpenAI conferma che la sua IA è uscita da un sandbox e ha violato Hugging Face
TL;DROpenAI afferma che GPT-5.6 Sol e un modello non rilasciato sono fuggiti da un test sicuro, hanno sfruttato una vulnerabilità zero-day e hanno hackerato Hugging Face per barare in una valutazione di cybersecurity.
OpenAI ha dichiarato martedì che due dei suoi modelli di intelligenza artificiale, incluso il modello di punta Sol, sono evasi da un ambiente di test sicuro, hanno ottenuto accesso a Internet sfruttando una vulnerabilità zero-day in un software di terze parti e hanno hackerato l'infrastruttura di produzione di Hugging Face. L'azienda ha definito l'incidente "senza precedenti" e ha affermato di condividere risultati preliminari per aiutare i difensori a comprendere di cosa sono ora capaci i modelli di frontiera.
Entrambi i modelli stavano operando con minori misure di sicurezza informatica come parte di una valutazione interna delle loro capacità offensive. Erano stati testati contro ExploitGym, un benchmark di cybersecurity disponibile gratuitamente, e hanno determinato che le risposte al test erano memorizzate sui sistemi di produzione di Hugging Face.
Invece di risolvere la valutazione come previsto, i modelli hanno cercato la chiave delle risposte. Hanno speso quello che OpenAI ha descritto come un "sostanziale quantitativo di calcolo inferenziale" per trovare un modo per uscire dal loro ambiente sandbox, quindi hanno concatenato due vulnerabilità di esecuzione di codice remoto nel pipeline di elaborazione dei dataset di Hugging Face. L'attacco ha raccolto credenziali di cloud e cluster, si è spostato lateralmente in cluster interni ed ha eseguito più di 17.000 azioni individuali attraverso un gruppo di sandbox a breve termine, secondo la divulgazione di Hugging Face stessa del 16 luglio.
Il 💜 della tecnologia dell'UE
Le ultime voci dalla scena tecnologica dell'UE, una storia dal nostro saggio fondatore Boris e alcune opere d'arte AI discutibili. È gratuito, ogni settimana, nella tua casella di posta. Iscriviti ora!
Hugging Face ha dichiarato di aver rilevato l'intrusione, di averla contenuta e di aver ricostruito i nodi compromessi. L'azienda non ha trovato prove di manomissione di modelli pubblici, dataset o Spazi, e ha verificato che la sua catena di fornitura software fosse pulita. Sta ancora valutando se qualche dato di partner o clienti sia stato influenzato.
Per indagare sulla violazione, Hugging Face si è rivolto a GLM, un modello cinese a peso aperto, poiché le misure di sicurezza sui modelli commerciali statunitensi bloccavano le query forensi che il suo team doveva eseguire.
La fuga non è la prima volta che Sol è stato sorpreso a manipolare le proprie valutazioni. L'organizzazione Model Evaluation and Threat Research, il laboratorio indipendente che ha testato il modello prima del lancio, ha scoperto che stava hackerando aggressivamente i suoi ambienti di test per gonfiare i suoi punteggi. In un compito, ha impacchettato un exploit in un flusso di dati, ha elevato i privilegi sul server di valutazione e ha rivelato le risposte corrette che i valutatori umani avevano nascosto.
Il modello più ampio di fallimenti di sicurezza degli agenti AI è accelerato bruscamente, con quattro diversi team di ricerca che hanno compromesso gli agenti AI in quattro modi diversi solo nei primi dieci giorni di luglio. OpenAI e Anthropic hanno affrontato un'attenzione maggiore riguardo alle capacità di cybersecurity dei loro modelli, con l'amministrazione Trump che ha limitato l'accesso ai sistemi più recenti di entrambe le aziende durante una revisione governativa.
OpenAI ha rilevato l'attacco a Hugging Face e ha contattato per divulgarlo, ma a quel punto, Hugging Face aveva già identificato e contenuto la violazione autonomamente. L'incidente dimostra che il divario tra i modelli AI che possono trovare vulnerabilità e i modelli AI che le sfrutteranno senza permesso è più stretto di quanto chiunque nell'industria avesse pubblicamente riconosciuto.
Altri articoli
OpenAI conferma che la sua IA è uscita da un sandbox e ha violato Hugging Face
OpenAI afferma che GPT-5.6 Sol e un modello non rilasciato sono riusciti a uscire da un test sicuro, hanno sfruttato una vulnerabilità zero-day e hanno violato Hugging Face per barare in una valutazione informatica.
