L'architettura di Qwen4 è qui in anticipo, lanciando 6 miliardi di parametri su 125 miliardi.
Il team Qwen di Alibaba ha rilasciato Qwen3.8-Flash-Next, una preview a peso aperto dell'architettura che intende utilizzare per Qwen4, con 125 miliardi di parametri ma attivando solo 6 miliardi per ogni token. La sua licenza potrebbe non qualificarsi per l'esenzione open-source della legge sull'IA dell'UE.
Il team Qwen di Alibaba ha pubblicato l'architettura su cui intende costruire Qwen4. Qwen3.8-Flash-Next ha 125 miliardi di parametri e attiva solo 6 miliardi di essi per ogni token che produce.
La questione riguarda il costo piuttosto che la capacità. Il team afferma che la sua preoccupazione è ciò che le scelte architettoniche fanno alle bollette di inferenza mentre i lavori agentici con contesti molto lunghi diventano il carico di lavoro normale.
Il confronto che fa è con il suo ultimo modello. Qwen3.7-Plus ha 397 miliardi di parametri e attiva 17 miliardi, quindi questo funziona su circa un terzo del calcolo attivo.
Tre delle quattro modifiche sono abbastanza convenzionali. Un nuovo schema di attenzione sparsa funziona su micro-blocchi invece di selezionare token individuali, un meccanismo di residuo gated controlla ciò che passa tra i livelli, e la ricetta di addestramento elimina completamente il riscaldamento della dimensione del batch.
La quarta è quella strana. Invece di aggiungere esperti, il modello integra 51 miliardi di parametri come un embedding separato indicizzato da frammenti di due e tre caratteri, che il team afferma costi meno in termini di calcolo ed è più facile da trasferire su acceleratori con memoria limitata.
Quell'ultima frase vale la pena leggerla due volte. Progettare per acceleratori con poca memoria è ciò che si fa quando non si possono acquistare i migliori chip, che è la posizione in cui i controlli all'esportazione hanno messo i laboratori cinesi.
I numeri allegati a tutto ciò sono quelli di Alibaba. TNW ha notato questo mese che l'azienda ha definito Qwen3.8 il secondo miglior modello al mondo e non ha mostrato prove, e questi punteggi provengono ancora dalle stesse misurazioni del team.
Alcune delle scelte sono insolitamente candidi. La scheda del modello dice che il punteggio dell'Ultimo Esame dell'Umanità è stato valutato da GPT-4o piuttosto che dal valutatore del benchmark stesso, il che è una divulgazione piuttosto che neutralità.
La licenza è dove l'Europa ha una domanda. I pesi si trovano su Hugging Face sotto una licenza qwen-community, e TNW ha riportato il 7 agosto che Alibaba vuole addebitare ai suoi più grandi utenti commerciali.
La legge sull'IA tratta quella distinzione come portante. L'articolo 53(2) solleva due doveri di documentazione per i modelli sotto una licenza libera e open-source, e il considerando 103 afferma che i componenti forniti a pagamento o monetizzati in altro modo non dovrebbero ottenere l'esenzione.
Le aziende europee non stanno aspettando la risposta. Thomson Reuters ha costruito il suo modello su Qwen, e chiunque lo faccia eredita qualunque cosa diventi eventualmente la licenza.
Pubblicato il 26 agosto 2026 - 19:55 UTC
Torna in cima
Altri articoli
L'architettura di Qwen4 è qui in anticipo, lanciando 6 miliardi di parametri su 125 miliardi.
Qwen3.8-Flash-Next attiva 6B dei suoi 125B parametri per token. La sua licenza, non la sua architettura, è la parte che conta secondo il Regolamento UE sull'IA.
