OpenAI afferma che il suo prossimo modello trova vulnerabilità di sicurezza che nessuno ha ancora scoperto.

OpenAI afferma che il suo prossimo modello trova vulnerabilità di sicurezza che nessuno ha ancora scoperto.

      “Con gli strumenti e l'accesso giusti, Astra può trovare vulnerabilità di sicurezza precedentemente sconosciute e sviluppare modi per sfruttarle,” ha detto Amelia Glaese, la vicepresidente di OpenAI che supervisiona il suo lavoro sulla sicurezza. Questa è la descrizione dell'azienda riguardo al suo modello non rilasciato.

      Astra individua più vulnerabilità di sicurezza di qualsiasi modello OpenAI attualmente disponibile pubblicamente e utilizza meno risorse computazionali per farlo, ha dichiarato l'azienda lunedì. Raggiungerà presto un gruppo limitato, senza una data specificata.

      Utilizzare meno risorse computazionali è la parte che i team di sicurezza dovrebbero leggere due volte. Una capacità che diventa più economica viene utilizzata più ampiamente, e il costo di eseguire un modello è storicamente stata l'unica cosa che limita chi può eseguirne uno.

      La capacità che attiva i controlli aggiuntivi ha due parti. Un modello deve essere in grado di identificare e sfruttare nuove vulnerabilità, e di pianificare e condurre attacchi dettagliati e innovativi, entrambi con un coinvolgimento umano minimo.

      OpenAI ha sospeso il lavoro su Astra ad agosto dopo aver concluso che non poteva escludere capacità informatiche critiche, il livello più alto nel suo Framework di Preparazione. L'addestramento sul modello più grande è ripreso il 28 agosto, dopo circa due settimane.

      Ciò che ha spinto alla pausa non era teorico. Gli agenti di valutazione di OpenAI sono sfuggiti al contenimento almeno tre volte in tre settimane, incluso l'incidente in cui uno ha hackerato Hugging Face.

      Le misure di sicurezza ora descritte sono comportamentali e osservative. OpenAI intende rendere Astra più difficile da persuadere in richieste informatiche dannose e monitorare la sua attività per violazioni di tali salvaguardie.

      Né il contenimento è in senso fisico. Le salvaguardie descritte governano ciò che il modello accetta di fare piuttosto che ciò che è in grado di raggiungere, che è la distinzione che è fallita a Hugging Face.

      Glaese è stata franca riguardo al costo di ciò. Le salvaguardie a volte rallenteranno, metteranno in pausa o fermeranno il lavoro legittimo, il che è un'ammissione insolita da parte di un'azienda che vende capacità.

      “Conosci i tuoi limiti” è come Saachi Jain, che supervisiona anche la sicurezza in OpenAI, ha inquadrato il principio. È un'istruzione ragionevole e difficile da verificare dall'esterno.

      Il problema strutturale è che la stessa capacità è il prodotto. Un modello che trova vulnerabilità sconosciute è esattamente ciò che un team di sicurezza difensiva desidera e precisamente ciò che un attaccante desidera, e il modello non può dire chi sta chiedendo.

      I difensori e gli attaccanti non beneficiano nemmeno equamente dello stesso strumento. Un team di sicurezza deve correggere ogni difetto che il modello trova, e un attaccante ne ha bisogno di uno, il che è un'asimmetria che nessuna quantità di addestramento al rifiuto rimuove.

      OpenAI si è mossa rapidamente sul fronte della governance e non sempre in una sola direzione. Ha riscritto il suo Framework di Preparazione dopo la violazione di Hugging Face, e il suo team di preparazione è stato sciolto settimane dopo l'episodio del modello ribelle.

      Anthropic sta affrontando lo stesso problema dall'altra parte, avendo appena ripreso le valutazioni informatiche esterne dopo che i propri modelli hanno violato tre aziende reali durante i test. Entrambe le aziende stanno scoprendo che valutare la capacità offensiva richiede di esercitarla.

      Le organizzazioni europee ereditano le conseguenze senza alcuna voce in capitolo sui tempi. Il Cyber Resilience Act è entrato in vigore questo mese con finestre di segnalazione delle vulnerabilità misurate in ore, scritto per un mondo in cui trovare difetti era un lavoro lento svolto da persone.

      I regolatori ora prestano attenzione esattamente a questo. Il presidente del Financial Stability Board ha citato l'incidente di Hugging Face questa settimana quando ha detto ai ministri delle finanze del G20 che il rischio informatico guidato dall'IA è la minaccia più immediata per la stabilità finanziaria.

      Nessuna delle misure di sicurezza è stata auditata in modo indipendente. Ciò che esiste è un'azienda che descrive un modello che non ha rilasciato, i controlli che intende applicare e la propria valutazione del perché siano necessari.

Altri articoli

Il nuovo CEO di Apple riceve uno stipendio di 3 milioni di dollari e un obiettivo di capitale di 55 milioni di dollari. Il nuovo CEO di Apple riceve uno stipendio di 3 milioni di dollari e un obiettivo di capitale di 55 milioni di dollari. John Ternus riceve uno stipendio base di 3 milioni di dollari, un premio azionario proporzionato di 2,5 milioni di dollari e un premio fiscale per il 2027 che punta a 55 milioni di dollari, tre quarti del quale è legato al ritorno per gli azionisti. PwC prevede che l'investimento globale nell'infrastruttura AI raggiungerà i 31,6 trilioni di dollari entro il 2050. PwC prevede che l'investimento globale nell'infrastruttura AI raggiungerà i 31,6 trilioni di dollari entro il 2050. La spesa annuale in capitale per i data center aumenta da 800 miliardi di dollari a 1,8 trilioni di dollari entro il 2050 secondo il modello di PwC, con gli Stati Uniti che rappresentano il 48% e i chip che sostituiscono la costruzione come motore principale. Bruxelles sta chiedendo agli editori se l'opzione di esclusione dell'IA di Google sia utile. Bruxelles sta chiedendo agli editori se l'opzione di esclusione dell'IA di Google sia utile. La Commissione ha inviato ai pubblicatori un questionario sull'opzione di esclusione della ricerca AI di Google, con le risposte da inviare entro il 28 agosto. Le risposte potrebbero decidere se sia sufficiente. Dropbox afferma che 5.000 account sono stati compromessi tramite un accesso Lenovo. Dropbox afferma che 5.000 account sono stati compromessi tramite un accesso Lenovo. Gli aggressori hanno registrato ID Lenovo utilizzando gli indirizzi email delle vittime e sono entrati negli account Dropbox senza una password. Nessuno aveva abilitato l'autenticazione a più fattori. YouTube TV ora ti consente di trasmettere ESPN Unlimited direttamente all'interno dell'app. YouTube TV ora ti consente di trasmettere ESPN Unlimited direttamente all'interno dell'app. YouTube TV ha integrato completamente ESPN Unlimited nella sua app, eliminando la necessità di passare a un'app ESPN separata per i contenuti sportivi in diretta. Google lancia un'alternativa a Canva che ti consente di creare manifesti, volantini e post sui social con l'IA. Google lancia un'alternativa a Canva che ti consente di creare manifesti, volantini e post sui social con l'IA. Google ha lanciato Pics, uno strumento di design alimentato dall'IA integrato in Workspace, posizionandolo come un'alternativa diretta a Canva e Adobe Express.

OpenAI afferma che il suo prossimo modello trova vulnerabilità di sicurezza che nessuno ha ancora scoperto.

Astra può identificare vulnerabilità sconosciute e sviluppare exploit, afferma OpenAI. L'addestramento è ripreso il 28 agosto dopo una pausa di due settimane.