Le aziende di intelligenza artificiale stanno acquistando libri antichi per dati di addestramento privi di errori.

Le aziende di intelligenza artificiale stanno acquistando libri antichi per dati di addestramento privi di errori.

      Il pitch del broker di dati ISBNdb è diretto: i migliori dati di addestramento per l'IA del mondo sono in un ripiano. Il problema è che accedervi significa tagliare la costa di milioni di libri, per poi non ammettere mai quale laboratorio ha pagato per il lavoro.

      L'IA ha un problema di inquinamento creato da sé. Gran parte del web è ora scritta da macchine, al punto che i modelli rischiano di nutrirsi dei propri scarti. Un'azienda pensa che l'antidoto sia in un ripiano: vecchi libri stampati, pubblicati prima dell'arrivo dei chatbot.

      404 Media ha riportato che ISBNdb ora acquisisce libri fisici in grandi quantità per i laboratori di IA da scansionare in dati di addestramento. L'azienda si definisce il più grande database di libri al mondo. "I migliori dati di addestramento per l'IA del mondo sono in un ripiano," afferma il suo sito. I libri, aggiunge, sono "densi, editati, autorevoli."

      Il valore sta nella data. ISBNdb sostiene che i libri stampati prima del 2022 precedono l'era dei modelli di linguaggio di grandi dimensioni, quindi non possono contenere testi generati dall'IA. Questo è importante a causa del collasso del modello. Viene chiamato il declino documentato che si verifica quando i modelli si addestrano sull'output sintetico di modelli precedenti. Ogni generazione finisce per essere un po' peggiore della precedente.

      Il 💜 della tecnologia dell'UE

      Le ultime voci dalla scena tecnologica dell'UE, una storia del nostro saggio fondatore Boris e alcune opere d'arte IA discutibili. È gratuito, ogni settimana, nella tua casella di posta. Iscriviti ora!

      Il web aperto non offre alcuna garanzia del genere. Una quota in rapida crescita di testi online è ora prodotta da macchine, parte della stessa inondazione di scarti che i laboratori hanno contribuito a creare. Una tiratura di stampa pre-2022, al contrario, è un record fisso, scritto da esseri umani che nessuno può riscrivere silenziosamente.

      La corsa agli armamenti dell'avvelenamento

      C'è un secondo motivo per cui i laboratori vogliono carta pulita. Gli autori hanno iniziato a reagire con l'avvelenamento dei dati. Prendono in prestito trucchi da strumenti come Nightshade, mescolando il testo con caratteri che una persona legge normalmente ma un modello non può. Il blog di ISBNdb cita ricerche di Anthropic che suggeriscono che bastano da 250 a 500 documenti elaborati per piantare una backdoor in un corpus di trilioni di token.

      I libri pre-2022, scritti prima che esistessero questi strumenti, aggirano il problema. ISBNdb vende questo come provenienza: acquista la carta, conserva le ricevute e il tuo team legale detiene una catena di custodia pulita.

      Il problema della percezione

      C'è un problema che l'azienda dichiara chiaramente. La scansione su larga scala di solito distrugge il libro. I lavoratori tagliano la costa in modo che le pagine sciolte passino attraverso una macchina, che è più veloce e più economica dell'alternativa attenta. Così ISBNdb offre ai suoi clienti segretezza. "NDA rigorosa su ogni impegno," afferma il suo sito. I nomi degli acquirenti "non vengono mai divulgati."

      La ragione si trova nel suo stesso testo di marketing. "Il problema della percezione è reale," recita il sito. "'L'azienda di IA distrugge due milioni di libri' non è un titolo che genera simpatia." Un suggerimento per aggirare il problema è pura propaganda: riformulare l'azione come preservazione digitale dei libri.

      Una lotta familiare

      Tutto questo si scontra con una battaglia sul copyright già in corso. Un giudice statunitense ha approvato il risarcimento di 1,5 miliardi di dollari di Anthropic per libri piratati e ha stabilito che l'addestramento su libri acquistati e scansionati conta come uso leale. Parte della sua motivazione era che la copia distruggeva ogni originale stampato, quindi una copia legale semplicemente sostituiva un'altra. Comprare e distruggere carta, in altre parole, è il percorso benedetto dai tribunali.

      Così l'industria che prometteva di digitalizzare la conoscenza umana ora paga per acquistarla e macinarla, un carico di camion alla volta. Ingram, il più grande distributore di libri negli Stati Uniti, ha già avvertito gli editori e ha offerto loro un modo per rinunciare. La cosa più scarsa nell'IA, a quanto pare, è una frase che nessuna macchina ha mai toccato.

Altri articoli

La moderazione AI di Meta sta bannando erroneamente gli account. La moderazione AI di Meta sta bannando erroneamente gli account. La moderazione AI di Meta sta eliminando per errore account di Facebook e Instagram, e l'unico modo per fare appello a un divieto ingiusto è spesso un'altra AI. NEURA sta costruendo palestre per addestrare robot per il mondo reale NEURA sta costruendo palestre per addestrare robot per il mondo reale NEURA Robotics sta aprendo una rete di 'palestre' dove i robot si allenano in condizioni reali. La sua scommessa: il vero collo di bottiglia dell'AI fisica è l'esperienza, non il cervello. Revolut raggiunge una valutazione di 115 miliardi di dollari, ottiene la licenza bancaria in Australia Revolut raggiunge una valutazione di 115 miliardi di dollari, ottiene la licenza bancaria in Australia Una vendita secondaria di azioni valuta Revolut a 115 miliardi di dollari, in aumento del 53% rispetto a novembre, mentre diventa la prima fintech globale con una licenza bancaria australiana. Galaxy Z Fold 8 vs. Galaxy Z Fold 8 Ultra: Dovresti spendere i 200 dollari extra e l'Ultra ne vale la pena? Galaxy Z Fold 8 vs. Galaxy Z Fold 8 Ultra: Dovresti spendere i 200 dollari extra e l'Ultra ne vale la pena? I nuovi Fold 8 e Fold 8 Ultra di Samsung condividono lo stesso chip e le stesse opzioni di archiviazione, ma si differenziano notevolmente per l'hardware della fotocamera, le dimensioni dello schermo e la batteria. Il Glow dell'ex fondatore di Meta raccoglie 180 milioni di dollari per la sicurezza degli endpoint AI Il Glow dell'ex fondatore di Meta raccoglie 180 milioni di dollari per la sicurezza degli endpoint AI Glow, fondata dall'ex VP di Meta dietro l'app di sorveglianza Onavo, è uscita dalla modalità stealth con una valutazione di 1,2 miliardi di dollari per bloccare software rischiosi con l'IA. Le BCI potrebbero creare un nuovo divario digitale, uno biologico. Le BCI potrebbero creare un nuovo divario digitale, uno biologico. Man mano che le BCI si spostano dai laboratori verso l'uso commerciale, l'accesso diseguale potrebbe separare le persone non solo per reddito o connettività, ma anche per capacità fisiche e cognitive.

Le aziende di intelligenza artificiale stanno acquistando libri antichi per dati di addestramento privi di errori.

Il broker ISBNdb sta vendendo libri stampati di laboratori di intelligenza artificiale pre-2022 come ultimi dati di addestramento privi di errori. Scannerizzarli significa distruggere i libri, silenziosamente.