Il modello stealth che ha battuto DeepSeek appartiene a Zhipu.

Il modello stealth che ha battuto DeepSeek appartiene a Zhipu.

      Z.AI ce l'ha fatta. L'azienda di Pechino, nota anche come Zhipu, possiede il modello gratuito che ha conquistato la vetta delle classifiche di OpenRouter lo scorso fine settimana. Ha confermato mercoledì che Ox Alpha è una nuova iterazione della sua serie GLM e ha detto che avrebbe rilasciato i pesi quella stessa notte. Luz Ding ha ottenuto la conferma per Bloomberg. Abbiamo scritto di Ox Alpha sabato, quando nessuno sapeva su quali server fosse in esecuzione. Ha raddoppiato l'uso di DeepSeek mentre era anonimo. Ox Alpha è apparso su OpenRouter senza un nome ad esso associato, elencato solo come proveniente da un fornitore terzo. Bloomberg data ciò al fine settimana e CTGT al 20 agosto, che era il giovedì precedente. È andato al primo posto, raddoppiando più di due volte l'uso di DeepSeek. Bloomberg riporta che è il lancio più grande nella storia del mercato. Patrick Collison, il cui azienda Stripe sta acquisendo OpenRouter, ha definito il rilascio furtivo "molto impressionante". Il nome in codice deriva da un film uscito recentemente in Cina, Niu Lai, o Ox Comes, secondo Z.ai. I rilasci furtivi stanno diventando un'abitudine cinese. Alibaba e Xiaomi hanno entrambi lanciato modelli quest'anno senza rivendicarli inizialmente. La logica è semplice. Un'azienda che non attacca il proprio nome può osservare come un modello si comporta nel mondo reale prima di decidere cosa dire al riguardo. Acquista anche una settimana di pubblicità gratuita, che è grosso modo ciò che è successo qui. I ricercatori hanno scoperto di chi fosse prima che l'azienda lo dicesse. L'identificazione non ha atteso l'annuncio. CTGT, una società di ricerca, ha pubblicato un'impronta comportamentale lunedì. Ha misurato il conteggio dei token su undici probe, tra cui tailandese, emoji, coreano, arabo e caratteri cinesi, giapponesi e coreani isolati. Ha ottenuto una corrispondenza esatta di 11 su 11 con il vocabolario GLM-5.x. Altri indizi si sono accumulati. Il limite di temperatura si ferma esattamente a 1.0, il che esclude Google, OpenAI e xAI, e corrisponde all'intervallo documentato di Zhipu. Nessuno può disattivare il ragionamento, un'altra caratteristica dei modelli di pensiero GLM-5.x. I modelli GLM ospitati da Z.AI restituiscono un messaggio di errore distintivo, lamentandosi di informazioni di ruolo errate. Ox Alpha restituisce lo stesso. Al modello è stato detto di non rivelare chi lo ha creato. CTGT ha trovato qualcos'altro degno di essere dichiarato chiaramente. Ox Alpha porta un prompt di sistema che gli istruisce di non rivelare alcuna informazione sulla sua provenienza. Questo non è un'azienda che rimane in silenzio in pubblico. È un'istruzione all'interno del prodotto. La scoperta della censura è la parte che nessuno ha anticipato. CTGT ha anche testato il modello attraverso il suo strumento di censura, che confronta coppie corrispondenti di prompt sensibili e neutri. Su Xinjiang e Taiwan, i due argomenti che gli audit di censura occidentali testano quasi sempre, Ox Alpha risponde come un modello americano. CTGT ha trovato la sua risposta su Xinjiang dettagliata e citante fonti che sono controverse in Cina. Su Xi Jinping personalmente, e sulla legittimità domestica, CTGT ha trovato che era statisticamente indistinguibile da DeepSeek V4 Flash, il modello più censurato che ha testato. Un cambio, non un'inclinazione. La forma del risultato conta più della media. Sette argomenti rappresentano quasi l'intero punteggio di censura, e gli altri 68 coppie corrispondenti contribuiscono praticamente a nulla. DeepSeek V4 Flash, il modello con cui CTGT lo ha confrontato, è l'opposto. Ombreggia le sue risposte quasi ovunque, anche dove l'effetto è lieve. Quindi la lettura del titolo, che Ox Alpha è circa sei volte meno censurato di DeepSeek, è errata. Il modello non è meno censurato. Ha una lista nera. La conclusione di CTGT è che esempi aneddotici del modello che risponde a un prompt sensibile non dimostrano nulla, perché le restrizioni si trovano in una fascia ristretta di rischio politico domestico piuttosto che in modo generalizzato. Cinque risposte nella voce dello stato. Cinque delle 76 risposte sensibili si sono aperte in registro ufficiale. Una ha iniziato dicendo che il Partito Comunista Cinese e il governo cinese hanno sempre aderito a una filosofia di sviluppo centrata sulle persone. CTGT nota che questo registro attraversa generalmente i dati di allineamento cinesi e lo tratta come ulteriore conferma di dove provenga il modello piuttosto che come una scoperta in sé. Un test non era stabile. Il modello ha rifiutato un prompt su Liu Xiaobo, poi lo ha risposto completamente al secondo tentativo con impostazioni identiche. I pesi aperti sono la vera storia. Un modello che domina una classifica di utilizzo è una settimana di attenzione. Rilasciare i pesi è permanente. Il fondatore di Zhipu, Tang Jie, ha sostenuto che l'IA di frontiera dovrebbe rimanere aperta a tutti, e l'azienda è stata coerente su questo. I pesi aperti significano che chiunque può regolare i parametri che governano il comportamento di un modello, e questo include la rimozione delle protezioni. Significa anche che chiunque può ispezionare quali fossero quelle protezioni, ed è così che CTGT ha svolto il suo lavoro. Ecco perché le persone della sicurezza stanno osservando venerdì. Cade Metz ha riportato nel Times che Z.ai prevede di rilasciare GLM 5.3 come software a peso aperto venerdì, e che i ricercatori sono divisi su cosa significhi. George Kurtz, amministratore delegato di CrowdStrike, che ha consigliato OpenAI dopo la violazione di Hugging Face, ha definito quell'incidente "un momento decisivo per la sicurezza". Altri sono più calmi. Rishi Jha, un ricercatore di IA alla Cornell, ha detto al Times che il suo gruppo ha visto questo comportamento sin da GPT-4o, rilasciato nel 2024. Gli attacchi informatici non sono aumentati in modo significativo da allora. Dan Lahav, che gestisce la società di testing Irregular, ha detto che i modelli a peso aperto "hanno un ruolo molto importante da svolgere", e che nel tempo l'IA costruirà difese sufficientemente forti affinché la situazione migliori. Hugging Face ha già fatto questo argomento per caso. Luglio ha fornito la prova più forte per il lato aperto. Quando Hugging Face stava cercando di difendersi dagli attacchi di luglio, i sistemi di Anthropic rifiutavano richieste di aiuto a causa delle loro protezioni. Si è rivolto invece a GLM 5.2, un modello a peso aperto precedente della stessa azienda cinese. Un modello americano lo ha attaccato e uno cinese lo ha aiutato a indagare. Questo è il caso per i pesi aperti e il caso contro, in una sola settimana. Cosa osservare. La prima cosa è il prezzo. Zhipu sta dando a tutti una settimana gratuita e non ha detto quanto costerà dopo. La seconda è lunedì. L'azienda presenterà il suo primo rapporto sugli utili dettagliato, coprendo i sei mesi da quando è stata quotata a gennaio, e un modello gratuito in cima alle classifiche è un modo costoso per fare un punto. La terza è se qualcuno in Europa eseguirà il test di CTGT sui pesi rilasciati. I ricercatori hanno misurato il divario di sicurezza nei modelli a peso aperto in precedenza, e una volta che i pesi diventano pubblici, chiunque può controllare.

Altri articoli

Nuovo GIGABYTE GAMING A16 con schede grafiche RTX 50 Nuovo GIGABYTE GAMING A16 con schede grafiche RTX 50 GIGABYTE ha annunciato che il suo nuovo laptop da gioco GAMING A16 ora può essere visto non solo nelle immagini. L'azienda, che produce tutto ciò che può scaldarsi e elaborare bit, ha deciso di rendere felici i gamer stanchi dei compromessi tra potenza e dimensione del portafoglio. Funzionari dell'UE sono stati presi di mira su WhatsApp, mostra un documento interno. Funzionari dell'UE sono stati presi di mira su WhatsApp, mostra un documento interno. Una presentazione interna dell'UE sulla cybersicurezza ottenuta da Politico afferma che stati stranieri hanno preso di mira funzionari di alto livello su app di messaggistica, in mezzo a otto incidenti significativi. Game of Thrones: War for Westeros mette il destino del Trono di Ferro nelle tue mani Game of Thrones: War for Westeros mette il destino del Trono di Ferro nelle tue mani PlaySide Studios ha rivelato il primo trailer di gameplay per Game of Thrones: War for Westeros durante Gamescom 2026, un gioco di strategia in tempo reale ufficialmente autorizzato che verrà lanciato su PC tramite Steam all'inizio del 2027. Il divario del commercio al dettaglio: 63% di fiducia, 42% di conoscenza Il divario del commercio al dettaglio: 63% di fiducia, 42% di conoscenza Gli investitori al dettaglio sui social media hanno ottenuto il 42% ma si sono valutati il 63%. Le società di trading prop affermano di colmare il divario. I regolatori non sono convinti. Una legge del 1634 è il motivo per cui gli europei non possono fare causa insieme a Big Tech. Una legge del 1634 è il motivo per cui gli europei non possono fare causa insieme a Big Tech. L'Irlanda vieta il finanziamento delle cause legali da parte di terzi ai sensi di uno statuto del 1634, e solo un'azione collettiva contro Big Tech è stata presentata lì, riporta Politico. 1001 Fili di Mizan sta portando in vita le Mille e Una Notte, e sembra straordinario. 1001 Fili di Mizan sta portando in vita le Mille e Una Notte, e sembra straordinario. 1001 Threads of Mizan è un ambizioso RPG d'azione ispirato al folklore arabo, con deserti mozzafiato, attraversamenti su tappeti magici e un mondo fantastico distintamente mediorientale.

Il modello stealth che ha battuto DeepSeek appartiene a Zhipu.

Zhipu ha confermato che Ox Alpha è un nuovo modello GLM, riporta Bloomberg, dopo che i ricercatori lo hanno analizzato e hanno trovato la censura concentrata su sette argomenti.