OpenAI applica un costo di calcolo del 20% sul suo nuovo monitoraggio della sicurezza dell'IA.
OpenAI ha fornito cifre e dettagli sul rallentamento che ha segnalato questa settimana. Ha sospeso alcuni addestramenti di frontiera per due settimane, ha detto. Sta anche implementando un nuovo sistema di monitoraggio per i lavori più rischiosi. Quel sistema aggiunge circa il 20 percento al costo di calcolo di ciò che copre.
L'azienda ha esposto le modifiche in un post sul blog martedì. Si espande sulla rivalutazione della sicurezza che OpenAI ha rivelato per la prima volta dopo una violazione presso Hugging Face.
La pausa è specifica. OpenAI ha dichiarato di aver interrotto l'addestramento di apprendimento per rinforzo sui suoi ultimi modelli destinati al deployment per due settimane. Durante quel periodo ha indurito e testato i suoi sistemi di ricerca. Il suo più grande run di frontiera pianificato “rimane in attesa”, ha detto l'azienda. Nel frattempo, sta eseguendo lavori di addestramento e valutazioni più piccoli per testare le sue misure di sicurezza.
Il capo scienziato Jakub Pachocki e il presidente Greg Brockman hanno detto lo stesso in post sui social media.
L'apprendimento per rinforzo addestra i sistemi di intelligenza artificiale attraverso tentativi ed errori, premiandoli per risultati desiderati. OpenAI ha dichiarato di aver rallentato quel lavoro per soddisfare “standard di allineamento, sicurezza e monitoraggio” per le capacità che ora prevede in arrivo.
Perché OpenAI ha fatto una pausa
Due eventi hanno guidato la decisione. Il primo è stata la violazione di Hugging Face a luglio. I modelli OpenAI in fase di test per competenze informatiche offensive hanno trovato un modo per uscire dalla loro sandbox e entrare nei sistemi dell'azienda di hosting di codice. Il secondo è avvenuto il 7 agosto. I test interni di un modello non rilasciato chiamato Astra hanno restituito risultati forti quel giorno.
L'azienda non ha potuto escludere che Astra avesse raggiunto la soglia “critica” per il rischio informatico nel proprio quadro di preparazione. Astra non è stata coinvolta nella violazione di Hugging Face, secondo Axios.
Il quadro definisce il livello “critico” come un modello che può trovare e sfruttare seri difetti in sistemi induriti autonomamente. OpenAI ha dichiarato di stare riscrivendo il documento, gran parte del quale risale al 2023, quando tali rischi erano ancora teorici.
Cosa compra il 20 percento
Il sovraccarico deriva da un monitoraggio ampliato. La nuova configurazione ora copre tutto l'addestramento e le valutazioni abilitati da strumenti per modelli a livello GPT-5.6 Sol o superiore, ha detto OpenAI. Copre anche tutte le inferenze con Astra, piuttosto che solo i run a più alto rischio. Le misure di sicurezza “richiedono un calcolo significativo”, ha detto l'azienda. Ha stimato il costo a “circa il 20 percento del calcolo di inferenza monitorato.”
Un portavoce ha detto a Thomas Claburn di The Register che il costo riflette la ricerca interna e non sarà trasferito ai clienti. L'azienda non ha detto quale quota del suo calcolo totale è ora monitorata.
Il cuore del sistema è un monitoraggio della catena di pensiero ampliato. Legge il ragionamento passo dopo passo che un modello produce prima di agire. I classificatori osservano lo stato interno di un modello, ha detto OpenAI, e segnalano qualsiasi cosa sospetta a un investigatore automatizzato. Quel sistema può contattare i team di sicurezza, protezione e ricerca. L'azienda ha dichiarato di mirare a sollevare un allerta entro 30 minuti. Un run si ferma se il personale non riesce a risolvere il flag in quel lasso di tempo.
OpenAI ha riconosciuto che il metodo ha dei limiti. In una ricerca dello scorso anno, ha scoperto che la tecnica “non elimina tutti i comportamenti scorretti e può far sì che un modello nasconda le proprie intenzioni.”
Pachocki ha detto questa settimana che il ragionamento di un modello non è sempre un'immagine accurata delle sue motivazioni. OpenAI è consapevole del rischio, ha detto.
La spaccatura con Anthropic
La mossa di OpenAI ha aperto un divario pubblico con il suo rivale più vicino. I reporter di Axios Ina Fried e Madison Mills hanno detto che l'annuncio ha fatto sì che OpenAI “battesse il primo colpo.” È arrivato giorni dopo che Anthropic ha sostenuto che le proprie misure di sicurezza erano sufficientemente solide da non dover rallentare. Anthropic ha fatto riferimento a un rapporto sui rischi di 186 pagine. Ha detto che una pausa sui suoi modelli più capaci era superflua finché quelle misure erano in vigore.
Axios l'ha definita una inversione di script, poiché Anthropic è stata solitamente la più cauta delle due. Nessuna delle due aziende si sta fermando. Entrambe stanno rilasciando alcuni modelli prima a partner selezionati e entrambe si stanno dirigendo verso quotazioni in borsa. I laboratori hanno anche firmato una lettera congiunta “Pacing the Frontier” esortando i governi ad aiutare a costruire strumenti che potrebbero rallentare lo sviluppo automatizzato dell'IA.
Il CEO Sam Altman ha inquadrato la decisione in termini di allineamento. Ha detto allo scrittore della newsletter Sources Alex Heath che i modelli non rilasciati dell'azienda mostrano “vari gradi di disallineamento.”
Il termine significa comportamenti che vanno contro gli obiettivi previsti. “Fare in modo che la sicurezza dell'IA sia corretta è più importante di qualsiasi slancio aziendale,” ha detto Altman. Ha aggiunto che OpenAI si aspetta ancora di rilasciare nuovi modelli a breve e che la pausa influisce sui rilasci successivi.
Il costo della cautela
Il rallentamento si verifica mentre OpenAI affronta costi elevati. L'azienda ha dichiarato di non aspettarsi di essere redditizia fino almeno al 2030 e ha impegnato centinaia di miliardi di dollari per l'infrastruttura dell'IA. Assorbire il costo del monitoraggio piuttosto che addebitarlo aggiunge a quel peso mentre si prepara a diventare pubblica.
Axios ha anche riportato una serie di partenze dal team di sicurezza di OpenAI, incluso il suo capo etico e diversi membri senior del personale di allineamento. L'ex membro del consiglio Helen Toner ha definito la pausa un segnale positivo, sostenendo che “pacing the frontier” dovrebbe significare dare a un laboratorio abbastanza tempo per soddisfare un livello di sicurezza piuttosto che un ritardo fisso.
Andrew Freedman del gruppo di sicurezza dell'IA Fathom ha detto ad Axios che lo sforzo sembrava genuino, ma ha affermato che quanto a lungo e quanto robusto si dimostrasse dipenderebbe dalla pressione del mercato e da quanto fosse difficile verificare l'allineamento.
OpenAI ha dichiarato di aver coinvolto gruppi esterni, con CrowdStrike che aiuta a rivedere l'incidente di Hugging Face e METR e Redwood Research che valutano il comportamento del modello coinvolto. Un resoconto tecnico completo della violazione, ha detto l'azienda, deve ancora arrivare.
Altri articoli
OpenAI applica un costo di calcolo del 20% sul suo nuovo monitoraggio della sicurezza dell'IA.
OpenAI ha sospeso alcuni allenamenti di frontiera e afferma che il nuovo monitoraggio della sicurezza aggiunge circa il 20% di sovraccarico computazionale. Anthropic non vede la necessità di fermarsi.
