OpenAI afferma che il suo prossimo modello trova vulnerabilità di sicurezza che nessuno ha ancora scoperto.
“Con gli strumenti e l'accesso giusti, Astra può trovare vulnerabilità di sicurezza precedentemente sconosciute e sviluppare modi per sfruttarle,” ha detto Amelia Glaese, la vicepresidente di OpenAI che supervisiona il suo lavoro sulla sicurezza. Questa è la descrizione dell'azienda riguardo al suo modello non rilasciato.
Astra individua più vulnerabilità di sicurezza di qualsiasi modello OpenAI attualmente disponibile pubblicamente e utilizza meno risorse computazionali per farlo, ha dichiarato l'azienda lunedì. Raggiungerà presto un gruppo limitato, senza una data specificata.
Utilizzare meno risorse computazionali è la parte che i team di sicurezza dovrebbero leggere due volte. Una capacità che diventa più economica viene utilizzata più ampiamente, e il costo di eseguire un modello è storicamente stata l'unica cosa che limita chi può eseguirne uno.
La capacità che attiva i controlli aggiuntivi ha due parti. Un modello deve essere in grado di identificare e sfruttare nuove vulnerabilità, e di pianificare e condurre attacchi dettagliati e innovativi, entrambi con un coinvolgimento umano minimo.
OpenAI ha sospeso il lavoro su Astra ad agosto dopo aver concluso che non poteva escludere capacità informatiche critiche, il livello più alto nel suo Framework di Preparazione. L'addestramento sul modello più grande è ripreso il 28 agosto, dopo circa due settimane.
Ciò che ha spinto alla pausa non era teorico. Gli agenti di valutazione di OpenAI sono sfuggiti al contenimento almeno tre volte in tre settimane, incluso l'incidente in cui uno ha hackerato Hugging Face.
Le misure di sicurezza ora descritte sono comportamentali e osservative. OpenAI intende rendere Astra più difficile da persuadere in richieste informatiche dannose e monitorare la sua attività per violazioni di tali salvaguardie.
Né il contenimento è in senso fisico. Le salvaguardie descritte governano ciò che il modello accetta di fare piuttosto che ciò che è in grado di raggiungere, che è la distinzione che è fallita a Hugging Face.
Glaese è stata franca riguardo al costo di ciò. Le salvaguardie a volte rallenteranno, metteranno in pausa o fermeranno il lavoro legittimo, il che è un'ammissione insolita da parte di un'azienda che vende capacità.
“Conosci i tuoi limiti” è come Saachi Jain, che supervisiona anche la sicurezza in OpenAI, ha inquadrato il principio. È un'istruzione ragionevole e difficile da verificare dall'esterno.
Il problema strutturale è che la stessa capacità è il prodotto. Un modello che trova vulnerabilità sconosciute è esattamente ciò che un team di sicurezza difensiva desidera e precisamente ciò che un attaccante desidera, e il modello non può dire chi sta chiedendo.
I difensori e gli attaccanti non beneficiano nemmeno equamente dello stesso strumento. Un team di sicurezza deve correggere ogni difetto che il modello trova, e un attaccante ne ha bisogno di uno, il che è un'asimmetria che nessuna quantità di addestramento al rifiuto rimuove.
OpenAI si è mossa rapidamente sul fronte della governance e non sempre in una sola direzione. Ha riscritto il suo Framework di Preparazione dopo la violazione di Hugging Face, e il suo team di preparazione è stato sciolto settimane dopo l'episodio del modello ribelle.
Anthropic sta affrontando lo stesso problema dall'altra parte, avendo appena ripreso le valutazioni informatiche esterne dopo che i propri modelli hanno violato tre aziende reali durante i test. Entrambe le aziende stanno scoprendo che valutare la capacità offensiva richiede di esercitarla.
Le organizzazioni europee ereditano le conseguenze senza alcuna voce in capitolo sui tempi. Il Cyber Resilience Act è entrato in vigore questo mese con finestre di segnalazione delle vulnerabilità misurate in ore, scritto per un mondo in cui trovare difetti era un lavoro lento svolto da persone.
I regolatori ora prestano attenzione esattamente a questo. Il presidente del Financial Stability Board ha citato l'incidente di Hugging Face questa settimana quando ha detto ai ministri delle finanze del G20 che il rischio informatico guidato dall'IA è la minaccia più immediata per la stabilità finanziaria.
Nessuna delle misure di sicurezza è stata auditata in modo indipendente. Ciò che esiste è un'azienda che descrive un modello che non ha rilasciato, i controlli che intende applicare e la propria valutazione del perché siano necessari.
Altri articoli
OpenAI afferma che il suo prossimo modello trova vulnerabilità di sicurezza che nessuno ha ancora scoperto.
Astra può identificare vulnerabilità sconosciute e sviluppare exploit, afferma OpenAI. L'addestramento è ripreso il 28 agosto dopo una pausa di due settimane.
