L'IA a peso aperto ha catturato il confine. La sicurezza non lo ha fatto.
I modelli AI a peso aperto hanno quasi raggiunto il confine delle capacità. In termini di sicurezza, non lo hanno fatto. E una volta che i pesi sono pubblici, nessun laboratorio può imporre un guardrail. Una nuova valutazione del principale modello aperto della Cina rende il divario concreto.
GLM-5.2, il modello a peso aperto di Z.ai, è solo pochi mesi indietro rispetto a GPT-5.5 di OpenAI e Claude Opus 4.7 di Anthropic per compiti informatici e biologici, ha riportato TechCrunch, citando l'organizzazione no-profit SaferAI. Ma non ha rifiutato nessuno dei compiti di cyber offensivo o di biologia a doppio uso che gli sono stati assegnati. Claude Opus 4.7, al contrario, ha rifiutato così costantemente che SaferAI non è riuscita a completare affatto il benchmark informatico su di esso.
“Il confine delle capacità non è il confine del rischio,” ha detto Henry Papadatos di SaferAI, quindi le misure di sicurezza contano tanto quanto il modello. Z.ai può proteggere il proprio servizio ospitato. Quelle protezioni svaniscono nel momento in cui qualcuno esegue i pesi sul proprio hardware, dove qualsiasi misura di sicurezza può essere rimossa. È il rischio di cui i critici dei modelli aperti avvertono da anni.
I modelli chiusi non sono nemmeno ermetici. L'organizzazione no-profit Far.ai ha trovato centinaia di jailbreak universali in Grok 4.5 di xAI e Gemini 3.1 Pro di Google. La differenza è che un laboratorio chiuso può riparare un modello jailbreakato. I pesi aperti non possono essere richiamati una volta che sono stati pubblicati.
Rimettendo la sicurezza
Quindi l'industria sta cercando di aggiungere guardrail dall'esterno. Nella stessa settimana, Mistral ha rilasciato Shieldstral, un piccolo classificatore a peso aperto che esamina testi e immagini rispetto a regole in linguaggio semplice e, afferma, corrisponde a modelli sette volte più grandi. Cisco ha rilasciato Antares, modelli a peso aperto che cercano vulnerabilità sepolte nel codice. Strumenti a peso aperto, costruiti per il rischio a peso aperto.
L'apertura ha due lati, sostengono i suoi difensori. Hugging Face ha utilizzato GLM-5.2 per difendersi durante la violazione di OpenAI. Il suo capo, Clem Delangue, afferma che i sistemi che fermano un attacco possono difendersi da milioni di altri. Papadatos lo definisce esagerato. L'industria “non dovrebbe open-source capacità pericolose,” dice, e gli attaccanti si muovono più velocemente dei difensori: un gruppo di ransomware cambia tattica in una settimana, un ospedale non può.
Un punto cieco nella governance
Le regole non si adattano al problema. Il nuovo quadro volontario della Casa Bianca esamina alcuni modelli chiusi di frontiera per il rischio informatico. Ma non copre, a quanto pare, i modelli open-source finora. Anthropic, un tempo focalizzata sul furto di proprietà intellettuale, ha spostato l'attenzione sulla sicurezza come principale preoccupazione riguardo ai pesi aperti. Z.ai non ha pubblicato alcun quadro di sicurezza per GLM-5.2 e non ha risposto alle domande di TechCrunch.
La Cina non ignora il rischio, ma mira altrove. Xi Jinping ha sostenuto i pesi aperti sottolineando il “controllo umano” sull'AI. Le sue regole, nota Graham Webster di Stanford, mirano più ai contenuti politici e alla stabilità sociale che all'uso catastrofico informatico o biologico.
La corsa alle capacità è quasi decisa: l'aperto è vicino e molto più economico. La corsa alla sicurezza non lo è, e l'AI sta già imparando ad attaccare così come a difendersi. La parte difficile è assicurarsi che solo la difesa sia facile da scaricare.
Altri articoli
L'IA a peso aperto ha catturato il confine. La sicurezza non lo ha fatto.
Un rapporto di SaferAI ha rilevato che il GLM-5.2 aperto della Cina non ha rifiutato alcun compito informatico o biologico. I pesi aperti hanno raggiunto il confine delle capacità, non della sicurezza.
