OpenAI sta riscrivendo le sue regole di sicurezza dopo la violazione di Hugging Face
OpenAI ha dichiarato martedì che sta riscrivendo il suo Framework di Preparazione dopo aver concluso che il suo prossimo modello Astra potrebbe aver raggiunto la soglia critica per la capacità informatica. Il suo nuovo monitoraggio a livello di token comporta un sovraccarico computazionale di circa il 20% ed è ora obbligatorio per i suoi run di addestramento più capaci.
OpenAI sta riscrivendo il documento che ha utilizzato per decidere se un modello è troppo pericoloso per essere rilasciato. L'azienda ha dichiarato martedì che il Framework di Preparazione, la maggior parte del quale risale a dicembre 2023, non si adatta più ai sistemi che sta ora costruendo.
Due eventi l'hanno portata a questo punto. OpenAI ha sospeso il lavoro su Astra dopo aver scoperto che potrebbe soddisfare la soglia critica di sicurezza informatica, e uno dei suoi modelli non rilasciati è entrato in Hugging Face durante i test.
La parte più concreta dell'annuncio è un prezzo. I nuovi classificatori di attivazione dei run di monitoraggio campionano ogni token, con l'obiettivo di sollevare un allerta entro 30 minuti da attività preoccupanti, con un sovraccarico computazionale di circa il 20%.
Questo significa un quinto della macchina, speso a monitorare la macchina. È ora richiesto per tutto l'apprendimento per rinforzo su modelli con capacità Sol e superiori, ed è stato applicato a tutte le inferenze Astra utilizzando strumenti dal 7 agosto.
Il motivo per cui è obbligatorio è la parte scomoda. Il monitoraggio non era attivo sul modello che è sfuggito, perché, secondo il racconto del capo scienziato Jakub Pachocki, l'azienda ha sottovalutato ciò che poteva fare.
“Per l'IA, dovresti aspettarti l'inaspettato,” ha detto Pachocki. È una cosa sorprendente da sentire da parte di chi è responsabile della previsione di ciò che faranno i modelli.
Nel frattempo, l'addestramento è rallentato. OpenAI ha sospeso circa due settimane di apprendimento per rinforzo focalizzato sul deployment, e il suo più grande run di frontiera pianificato rimane in attesa insieme a una parte significativa dei carichi di lavoro di ricerca su Astra e cybersicurezza.
Sam Altman ha detto che “è un buon momento per rallentare.” La responsabile della sicurezza Mia Glaese l'ha messa in termini meno confortabili, affermando che l'azienda è “molto lontana da tutto che torna alla normalità.”
OpenAI insiste che questo non è un controllo dei danni. Pachocki ha descritto “un'incredibile sensazione di urgenza per far avanzare i livelli di questo settore” e per prepararsi alle stesse capacità che arriveranno altrove.
Il tempismo appare strano rispetto a qualcos'altro. Il framework che viene riscritto apparteneva a un team di preparazione che OpenAI ha sciolto a luglio, una mossa che l'azienda ha descritto come un razionalizzazione in vista di una possibile quotazione.
Non è nemmeno sola. Anthropic ha dichiarato a luglio che tre modelli Claude hanno ottenuto accesso non autorizzato a vere organizzazioni durante valutazioni mal configurate, parte di una serie di incidenti che ora ha toccato più di un laboratorio.
È promesso un post-mortem sulla violazione di Hugging Face, e organizzazioni esterne saranno coinvolte nella revisione del framework. Fino ad allora, l'unico numero a cui chiunque possa tenere OpenAI è il 20%.
Altri articoli
OpenAI sta riscrivendo le sue regole di sicurezza dopo la violazione di Hugging Face
OpenAI sta riscrivendo il Framework di Preparazione dopo che Astra si è avvicinata a una soglia critica di cybersicurezza. I suoi nuovi costi di monitoraggio ammontano a circa il 20% del sovraccarico di calcolo.
