Un vincitore del premio Turing afferma che la soluzione dell'industria per la mancanza di dati è 'un grande errore'

Un vincitore del premio Turing afferma che la soluzione dell'industria per la mancanza di dati è 'un grande errore'

      Richard Sutton pensa che la risposta dell'industria dell'IA all'esaurimento dei dati di addestramento sia un errore, e ha scelto una parola diretta per descriverlo. “È solo un grande errore,” ha detto riguardo al passaggio ai dati sintetici nel podcast di Sequoia Capital, Training Data, pubblicato martedì e condotto da Sonya Huang e Pat Grady.

      Il commento ha un peso maggiore rispetto alla maggior parte dei frammenti audio dei podcast. Sutton ha condiviso il Premio Turing 2024 con Andrew Barto per la fondazione dell'apprendimento per rinforzo, ha scritto il saggio del 2019 The Bitter Lesson che metà del campo ora cita all'altra metà, e ha lasciato le Keen Technologies di John Carmack a luglio per avviare il proprio laboratorio.

      La sua obiezione ha due aspetti specifici piuttosto che un verdetto generale. “Non c'è modo di avere dati sintetici per le menti di altre persone,” ha detto, e riguardo alla simulazione del mondo fisico: “Il mondo è infinitamente complesso, e qualsiasi simulazione di esso è come, microscopica.”

      Sotto c'è ciò che lui chiama l'ipotesi del grande mondo, l'idea che la realtà sia sempre più grande del modello di un agente, il che rende qualsiasi simulatore una compressione lossy per costruzione.

      Una seconda obiezione è più sottile, perché qualcuno deve decidere quali dati sintetici generare, e questo reintroduce il giudizio umano esattamente nel processo contro cui avvertiva The Bitter Lesson.

      Ciò che desidera invece sono dati esperienziali, raccolti da un agente che agisce nel proprio ambiente piuttosto che assemblati in anticipo da chiunque. La tesi non è nuova, essendo stata esposta con David Silver in Welcome to the Era of Experience nell'aprile 2025, ma non l'aveva precedentemente mirata così direttamente ai dati sintetici.

      La ragione dell'industria per cercarli non è realmente in discussione. Epoch AI proietta che il stock di testo umano pubblico, attorno ai 300 trilioni di token, sarà completamente utilizzato tra il 2026 e il 2032, e i laboratori hanno improvvisato da allora.

      Parte di quell'improvvisazione è fisica. Le aziende di IA hanno comprato e tagliato libri di seconda mano per testi pre-2022, con il ragionamento che qualsiasi cosa pubblicata da allora è contaminata da spazzatura generata da macchine.

      La carenza non è solo un problema di lingua inglese. I laboratori cinesi stanno affrontando lo stesso muro nella loro lingua, e piuttosto prima.

      C'è supporto peer-reviewed per l'ansia che Sutton sta esprimendo. Un articolo del 2024 su Nature di Ilia Shumailov e colleghi ha scoperto che i modelli addestrati ricorsivamente sui propri output degradano, un effetto che la letteratura ora chiama collasso del modello.

      La confutazione è altrettanto pubblicata, però, e qui è importante. Il lavoro di Matthias Gerstgrasser, Rylan Schaeffer e coautori ha scoperto che il collasso dipende dai dati sintetici che sostituiscono i dati umani; dove i due si accumulano insieme, non si manifesta.

      In pratica, i laboratori sono da tempo oltre l'argomento. Il Phi-4 di Microsoft è stato addestrato su circa 400 miliardi di token sintetici attraverso 50 tipi di dataset, e Nvidia ha rilasciato un corpus di pre-addestramento sintetico di circa 10 trilioni di token per i suoi modelli Nemotron.

      Questi sono anche i domini in cui l'obiezione di Sutton ha meno impatto, poiché matematica e codice hanno risposte verificabili in un modo in cui le menti di altre persone non lo fanno. I suoi limiti riguardano la modellazione degli esseri umani e dei sistemi fisici, non la generazione di esempi di addestramento in quanto tali.

      Andrej Karpathy ha presentato il contro-argomento più noto, sostenendo che i modelli linguistici sono meno simili a animali cresciuti attraverso l'esperienza che fantasmi distillati dalla scrittura umana, e che la loro messa a punto è un percorso legittimo piuttosto che una deviazione. Sutton, da parte sua, ha detto nel podcast che il linguaggio rappresenta forse un quarto dell'intelligenza.

      Sta chiamando questa la prossima grande lezione, e Sequoia è felice di presentarla come una seconda lezione amara, che è una cornice ordinata per una società di venture capital che sostiene anche il nuovo laboratorio di David Silver. Il laboratorio di Sutton, co-fondato con il suo ex studente Khurram Javed, punta a una mente da un trilione di parametri che non smette mai di apprendere e funziona con 20 watt, entro cinque-dieci anni.

Altri articoli

Nuove riprese trapelate di GTA 6 mostrano Jason che fa canestro e causa caos sulla strada Nuove riprese trapelate di GTA 6 mostrano Jason che fa canestro e causa caos sulla strada Nuove immagini di GTA 6 sono trapelate prima della rivelazione pianificata da Rockstar, mostrando Jason che gioca a basket, guida e interagisce con sistemi che potrebbero aggiungere maggiore profondità al gameplay. ChatGPT sta per avere una versione per adolescenti, e ho molte domande. ChatGPT sta per avere una versione per adolescenti, e ho molte domande. Gli adolescenti stanno già utilizzando l'IA per i compiti e molto altro. La nuova esperienza di ChatGPT di OpenAI vuole assicurarsi che stiano effettivamente imparando da essa, con alcune serie misure di sicurezza in atto. La nuova Modalità Corsa di Spotify porta le playlist per l'allenamento a un altro livello La nuova Modalità Corsa di Spotify porta le playlist per l'allenamento a un altro livello La nuova Modalità Corsa di Spotify può creare una colonna sonora attorno al tuo allenamento, ai tuoi gusti musicali e persino al tuo passo di corsa. Alphabet raccoglie 5,5 miliardi di dollari australiani in Australia, più del doppio del record stabilito da Apple nel 2015. Alphabet raccoglie 5,5 miliardi di dollari australiani in Australia, più del doppio del record stabilito da Apple nel 2015. Alphabet ha prezzato il suo primo bond in dollari australiani a 5,5 miliardi di dollari australiani (3,9 miliardi di dollari statunitensi), la più grande vendita di obbligazioni corporate nella storia australiana e un aumento rispetto ai 5 miliardi di dollari australiani previsti. Un nuovo rapporto afferma che Meta paga gli influencer per combattere i divieti sui social media per gli account degli adolescenti in tutto il mondo. Un nuovo rapporto afferma che Meta paga gli influencer per combattere i divieti sui social media per gli account degli adolescenti in tutto il mondo. Mentre i paesi si muovono per vietare ai teenager i social media, Meta paga attori, psicologi e influencer genitoriali in oltre una dozzina di paesi per sostenere la posizione contro il divieto totale per gli account dei teenager. Un nuovo rapporto afferma che Meta paga gli influencer per combattere i divieti sui social media per gli account degli adolescenti in tutto il mondo. Un nuovo rapporto afferma che Meta paga gli influencer per combattere i divieti sui social media per gli account degli adolescenti in tutto il mondo. Mentre i paesi si muovono per vietare ai teenager di utilizzare i social media, Meta paga attori, psicologi e influencer genitoriali in oltre una dozzina di paesi per sostenere contro il divieto totale per gli account degli adolescenti.

Un vincitore del premio Turing afferma che la soluzione dell'industria per la mancanza di dati è 'un grande errore'

Richard Sutton afferma che il passaggio dell'industria ai dati sintetici è “un grande errore”. La sua obiezione è più ristretta e più interessante di quanto suggerisca il titolo.