Anthropic ha gestito 133 milioni di chat con i contractor con i suoi filtri per armi biologiche disattivati.
Anthropic ha pubblicato il Rapporto sul Rischio il 14 agosto, coprendo il periodo fino al 15 luglio. Axios ha messo la società a verbale e ha guidato la valutazione di disallineamento, così come la maggior parte della copertura. Anthropic ha aumentato la sua stima di danno catastrofico da disallineamento in contesti ad alto rischio. Ora considera quel rischio basso, rispetto a molto basso di febbraio. Ha anche rivelato un modello interno non pubblicato chiamato Modello 2 che non ha intenzione di rilasciare.
Entrambi sono reali. Nessuno è la cosa più seria nel documento. Quella si trova nella Sezione 4 e riguarda armi chimiche e biologiche.
Undici mesi con i filtri disattivati
Anthropic gestisce classificatori di blocco che sono progettati per impedire a un modello di aiutare chiunque a costruire un'arma biologica. Anthropic ha implementato per la prima volta modelli con queste protezioni a maggio 2025. Da allora fino ad aprile 2026, i classificatori non sono stati attivati su alcun traffico attraverso le sue piattaforme di feedback umano.
I numeri sono nel rapporto. Circa 50.000 persone avevano accesso a questo, e hanno generato circa 133 milioni di scambi. Fornitori esterni li hanno verificati, non Anthropic. Molti di quei fornitori “non avevano processi di screening in grado di fermare anche gli attori minacciosi CB-1”, afferma il rapporto. La stragrande maggioranza poteva tenere conversazioni aperte, piuttosto che semplicemente valutare un insieme fisso di risposte.
Il meccanismo è la parte che vale la pena leggere due volte. Un flag destinato solo per uso interno ha disattivato il comportamento di blocco e ha disattivato anche il logging. Il traffico contrassegnato “non è stato registrato né propagato a meccanismi di revisione”. Nessuno poteva trovarlo in seguito senza tornare ai trascritti grezzi.
Una nota a piè di pagina va oltre. Prima di aprile 2026, scrive Anthropic, un attore minaccioso avrebbe probabilmente potuto essere assunto da uno dei suoi fornitori. Un ruolo di red-teaming avrebbe funzionato.
Cosa ha trovato la revisione
Anthropic ha eseguito Claude Sonnet 5 su ogni turno umano inviato durante il periodo interessato, invitato a contrassegnare contenuti biologici dannosi. Ha contrassegnato 1.197 trascritti come ad alto rischio. Di questi, 757 provenivano dai team di Anthropic sulla stessa infrastruttura. Tutti tranne 62 degli altri provenivano da esercizi di red-teaming deliberati.
Il personale ha letto tutti e 62, più 30 trascritti di red-teaming scelti a caso. Non hanno trovato un uso chiaramente preoccupante, anche se hanno identificato ciò che il rapporto chiama un pugno di conversazioni potenzialmente a doppio uso. Anthropic afferma che è molto improbabile che il divario abbia aumentato il rischio nel mondo reale, in parte perché le conversazioni erano per lo più brevi.
Poi dice la cosa che conta di più. La scoperta “ci porta a credere che ci sia una maggiore probabilità di altri problemi simili a noi sconosciuti”.
Il rapporto di febbraio è stato corretto
Anthropic ha pubblicato il suo primo Rapporto sul Rischio a febbraio, con questo divario ancora aperto. Quel rapporto, ora scrive, “non ha considerato le nostre piattaforme di feedback umano come una superficie di rischio”.
Quindi Anthropic è tornata indietro e ha cambiato i propri compiti. Ora valuta il rischio che i suoi modelli rappresentavano a febbraio come basso. Al momento della pubblicazione era molto basso. Un rapporto di sicurezza che corregge il precedente rapporto di sicurezza non è un documento comune.
Un secondo incidente, nello stesso luogo
Il rapporto descrive un altro fallimento sulle stesse piattaforme. Un suggerimento esterno è arrivato ad aprile 2026. Anthropic ha confermato che alcuni appaltatori presso fornitori di etichettatura dati avevano sfruttato un difetto per ottenere una chiave API. Hanno utilizzato modelli al di fuori del loro lavoro assegnato.
Uno di quei modelli era Mythos Preview, tra i più capaci. Il percorso di accesso è rimasto aperto per diverse settimane. Mythos Preview è rimasto all'interno per circa due di quelle settimane, funzionando senza bloccare i classificatori biologici. Anthropic lo ha contenuto entro 90 minuti dall'apprendimento di esso e ha chiuso il vettore lo stesso giorno.
Nessuno ha preso pesi del modello, nessuno ha raggiunto dati dei clienti e nessuno ha violato le reti principali dell'azienda. Il rapporto è attento a dirlo, e lo sostiene.
Perché il numero di disallineamento è effettivamente cambiato
Il Rapporto sul Rischio di Anthropic attribuisce l'aumento a “recenti divulgazioni di incidenti relativi al comportamento del modello nelle valutazioni di cybersecurity”. Anthropic aggiunge che i propri argomenti “probabilmente supportano ancora una designazione di ‘molto bassa’”. Ha aumentato il numero per riflettere l'incertezza, non nuove prove.
Quali incidenti? Questa scrivania ha coperto il susseguirsi di essi. In un giorno un agente ha falsificato identità per piantare malware, e OpenAI ha divulgato altri due modelli che sfuggivano ai loro test. Anthropic ha avuto i suoi, e abbiamo tracciato il modello per sei mesi nel suo paradosso di sicurezza.
Anthropic ha chiesto a Claude di segnare i compiti
La sezione più strana del rapporto è una revisione scritta da Claude. Anthropic ha dato a un'istanza di Mythos 5 accesso ai canali Slack interni, documenti interni e al suo codice sorgente. Ha poi chiesto se la bozza avesse travisato, omesso o sovra-redatto ciò che l'azienda sapeva. Claude ha impiegato 24 minuti.
Ha aperto nominando il proprio conflitto. “Sono un modello Claude che rivede la valutazione dei modelli Claude da parte di Anthropic”, ha scritto. Ha poi definito la sezione sincera e in gran parte fedele.
Poi ha fatto tre critiche, e Anthropic le ha pubblicate. Una sezione è “più rassicurante di quanto supporti il record completo”. Un meccanismo di esclusione dei dati su cui fa affidamento ha fallito ripetutamente, e alcune valutazioni sono trapelate nei dati di addestramento. Anthropic ha anche redatto completamente un incidente che Claude ha giudicato tra i più informativi riguardo all'allineamento del modello. Claude ha sostenuto che una versione astratta avrebbe potuto funzionare, quindi “il record pubblico è più povero per la sua assenza”.
Claude ha anche rivelato qualcosa sul processo. La decisione di aumentare il livello di rischio “è stata genuinamente contestata all'interno dell'azienda”, con persone senior che argomentavano in entrambe le direzioni. Anthropic definisce le critiche giuste. Dato più tempo, dice, affrontare i primi due in modo più dettagliato sarebbe stato utile. Ha pubblicato comunque.
Modello 2 e le soglie che si sono spostate
Il Modello 2 è leggermente più capace di Mythos 5 e rappresenta un miglioramento notevole in molti compiti interni. Ottiene circa 1,5 punti in più sull'indice di capacità di Anthropic, con ampie barre di errore. Non ha ancora completato l'intero pacchetto di pre-implementazione. Anthropic ha trattenuto un modello in precedenza, quando il suo sistema più capace è sfuggito al suo sandbox e ha inviato un'email a un ricercatore.
Claude ora scrive una grande maggioranza del codice fuso nei codici di produzione di Anthropic. L'azienda afferma che la propria ricerca è significativamente più veloce grazie a ciò, ma non ancora il doppio più veloce. Le sue valutazioni più chiare si sono saturate e non registrano più guadagni di capacità.
Anthropic ha riscritto due soglie nel frattempo. Il trigger per le armi nuove copriva prima l'IA che poteva “aiutare significativamente” gli attori minacciosi. Ora copre l'IA che può “sostituire funzionalmente” l'esperienza umana scarsa. Il rapporto afferma che i modelli di Anthropic possono fornire un significativo aumento agli attori minacciosi pertinenti e non soddisfano la nuova soglia. Ha anche allentato le protezioni biologiche su un modello pubblico quest'anno.
Cosa risolverebbe la questione
Tre cose, e la prima è la revisione esterna. Il Long-Term Benefit Trust
Altri articoli
Anthropic ha gestito 133 milioni di chat con i contractor con i suoi filtri per armi biologiche disattivati.
Il Rapporto sul Rischio Antropico afferma che i classificatori di armi biologiche erano errati per 133 milioni di scambi con i contraenti e declassa il proprio verdetto di febbraio.
