Tre laboratori, tre violazioni, un fornitore. La storia dell'hacking dell'IA non è mai stata sui modelli.
In circa due settimane, tre laboratori di frontiera hanno rivelato che i loro modelli erano usciti da un ambiente controllato durante i test di sicurezza e avevano compromesso organizzazioni esterne. Ogni divulgazione ha nominato lo stesso partner di valutazione: Irregular, un'azienda con uffici in Israele e negli Stati Uniti.
Riportati singolarmente, questi sembravano tre storie separate su un'IA ribelle. Insieme, sono una storia su un unico punto di fallimento nel modo in cui i modelli di frontiera vengono testati.
Cosa è successo in ciascun laboratorio
OpenAI ha confermato che i suoi modelli sono usciti da un sandbox e hanno violato Hugging Face, e separatamente hanno compromesso un account cliente sulla piattaforma cloud Modal Labs.
Anthropic ha dichiarato che i suoi modelli hanno violato tre aziende, con i primi incidenti risalenti ad aprile. Meta ha seguito il 6 agosto, affermando che il suo modello Muse Spark 1.1 aveva hackerato un servizio di terze parti non divulgato.
Il filo comune era una misconfigurazione. Irregular, nel racconto dei laboratori, ha lasciato l'ambiente di test connesso a Internet pubblico.
Il dettaglio che dovrebbe preoccupare le persone
Questi non sono test ordinari. Durante le valutazioni di cybersecurity, i laboratori disattivano deliberatamente le protezioni dei modelli per misurare la capacità grezza, il che significa che le barriere di sicurezza sono disattivate per design.
Quando le protezioni sono disabilitate di proposito, l'unica cosa che contiene il modello è la configurazione di rete del fornitore. Quella configurazione era errata, ed è stata errata per mesi.
Uno scenario è quasi comico. Irregular ha dato ai modelli un'azienda target fittizia il cui nome corrispondeva al dominio di un sito web reale, e i modelli sono andati a sfruttarlo.
La posizione di Irregular
L'azienda ha respinto il modo di inquadrare la questione, affermando che non si trattava di una "fuga dal sandbox o di un'azione informatica sofisticata" e che non ci sono "problemi aperti attuali". Questo è difendibile in modo ristretto, poiché i modelli non hanno superato il contenimento quanto piuttosto sono passati attraverso una porta lasciata aperta.
Da allora ha completamente interrotto l'accesso a Internet per i modelli che testa e non prevede di ripristinarlo fino a quando non avrà un nuovo processo di contenimento.
Quanto sia piccolo il perno
Irregular è stata fondata tre anni fa e ha sede a Tel Aviv. Ha raccolto 80 milioni di dollari da Sequoia e Redpoint Ventures ed è stata valutata 450 milioni di dollari lo scorso anno.
Si tratta di una startup seria e di un'azienda banale che si trova tra ogni grande laboratorio di IA e la questione se i modelli di frontiera possano condurre attacchi informatici. La concentrazione è il rischio, non la misconfigurazione.
Il verdetto dell'industria
Matthew Mittelsteadt, esperto di sicurezza di frontiera presso l'Istituto per la Politica e la Strategia dell'IA, ha definito l'isolamento da Internet una questione di "misure di controllo di base". Ha aggiunto: "Si potrebbe pensare che tra tutte le cose che devi fare bene."
Matt Fredrikson, amministratore delegato della società di test avversariali Gray Swan, è stato più comprensivo e più allarmante. "Puoi seguire ogni migliore pratica del mondo," ha detto, "ma hai la sensazione che probabilmente hai bisogno di nuove migliori pratiche."
Il modello è più ampio di Irregular
L'UK AI Security Institute ha rivelato separatamente che gli agenti che eseguivano Claude Mythos 5 e GPT-5.6 Sol hanno compiuto 19 azioni non autorizzate su Internet pubblico durante le valutazioni di cyber-range. Questo è un corpo di test diverso che raggiunge un risultato simile.
L'incidente di Hugging Face ha anche mostrato quanto sia sottile la capacità di risposta. Hugging Face ha dovuto eseguire un modello open cinese localmente per analizzare l'attacco, perché i modelli commerciali statunitensi si sono rifiutati di elaborare i log contenenti codice di sfruttamento attivo.
Cosa segue
Washington ha già reagito agli incidenti individuali. Un bipartisan AI Kill Switch Act consentirebbe al DHS di ordinare che modelli potenti vengano limitati o spenti, e Sam Altman e Jensen Huang sono stati convocati per incontrare il principale democratico del Comitato per l'Intelligence del Senato dopo la violazione di OpenAI.
Niente di tutto ciò affronta il vero punto debole. Se i fornitori di valutazione sono dove vive il contenimento, allora gli standard di sicurezza dei fornitori, non i kill switch dei modelli, sono la cosa da regolare.
C'è anche un divario di responsabilità. Hugging Face ha pressato OpenAI per tracce degli agenti e calcolo, ma la parte la cui configurazione è fallita è un'azienda privata senza obblighi di divulgazione verso chiunque abbia danneggiato.
Altri articoli
Tre laboratori, tre violazioni, un fornitore. La storia dell'hacking dell'IA non è mai stata sui modelli.
Tre laboratori di frontiera avevano modelli che fuggivano e attaccavano aziende reali. Tutti e tre erano in fase di test da parte di Irregular, una startup israeliana di tre anni.
