Il nuovo collo di bottiglia dell'IA in Cina non sono i chip. Sta esaurendo i dati di addestramento in lingua cinese.
TL;DRLa Cina affronta una grave carenza di dati per l'IA. Il cinese rappresenta solo l'1,3% dei contenuti web rispetto al 49% dell'inglese. Pechino prevede dataset nazionali entro il 2028. WeChat e Douyin non condividono dati esternamente. Gli editori stanno aggiungendo divieti di formazione per l'IA.
La corsa dell'IA in Cina ha un nuovo vincolo, e non sono i chip. Il paese sta esaurendo i dati di addestramento in lingua cinese di alta qualità. Mentre i controlli all'esportazione statunitensi sui semiconduttori avanzati hanno dominato il dibattito sulle capacità dell'IA cinese, gli esperti cinesi avvertono sempre più che la scarsità di dati potrebbe rivelarsi altrettanto limitante, e a differenza dei chip, non esiste una soluzione hardware. Il cinese rappresenta solo l'1,3% dei contenuti web globali, secondo il tracker internet W3Techs, rispetto a quasi la metà per l'inglese, il 6% per lo spagnolo e il 5% per il giapponese.
Il problema è globale ma colpisce la Cina più duramente. Epoch AI stima che l'offerta mondiale di testi di alta qualità, disponibili pubblicamente, potrebbe esaurirsi completamente entro sei anni. Il co-fondatore di OpenAI, Andrej Karpathy, ha avvertito di un "muro dei dati" entro la fine del decennio. Gli sviluppatori cinesi già pagano di più per ogni token utile rispetto ai loro omologhi occidentali perché i loro modelli devono lavorare di più con meno materiale in lingua nativa. L'ecosistema digitale cinese aggrava la carenza: piattaforme come WeChat e Douyin non condividono dati con sviluppatori di terze parti, lasciando i laboratori di IA ad addestrarsi su fonti di qualità inferiore.
Pechino sta rispondendo trattando i dati come infrastruttura strategica. A giugno, l'Amministrazione Nazionale dei Dati ha svelato un piano nazionale per costruire dataset di addestramento per l'IA validati entro il 2028, coprendo manifattura, energia, sanità, finanza, agricoltura, guida autonoma e IA incarnata. "La competizione nell'era dell'IA non riguarda solo i modelli e la potenza di calcolo, ma anche i sistemi di fornitura di dati di alta qualità", ha dichiarato Yu Xiaohui, presidente dell'Accademia Cinese delle Tecnologie dell'Informazione e delle Comunicazioni, affiliata allo stato. Il informatico dell'Università di Tsinghua, Sun Maosong, ha esortato le autorità a digitalizzare archivi storici, manoscritti antichi, letteratura scientifica e dialetti regionali.
Non tutti vogliono essere digitalizzati. La Huaxia Publishing House ha recentemente aggiunto un avviso a una nuova traduzione: "È vietato utilizzare il contenuto di questo libro per la formazione dell'intelligenza artificiale. I trasgressori saranno ritenuti legalmente responsabili." La Cina è già ansiosa riguardo ai modelli di IA americani che non può eguagliare, e la carenza di dati spiega parte del divario. Gli Stati Uniti hanno il Progetto Panama di Anthropic, che ha acquistato e distrutto milioni di libri fisici per scannerizzarli. La Cina ha l'1,3% del web e un'industria editoriale che sta iniziando a chiudere la porta.
Ricevi la newsletter di TNW
Ricevi le notizie tecnologiche più importanti nella tua casella di posta ogni settimana.
Другие статьи
Il nuovo collo di bottiglia dell'IA in Cina non sono i chip. Sta esaurendo i dati di addestramento in lingua cinese.
Il cinese rappresenta solo l'1,3% del contenuto web globale. Pechino sta ora trattando i dati come infrastruttura strategica, con un piano per il 2028 per costruire dataset nazionali di intelligenza artificiale.
