Le aziende di intelligenza artificiale stanno acquistando libri antichi per dati di addestramento privi di errori.
Il pitch del broker di dati ISBNdb è diretto: i migliori dati di addestramento per l'IA del mondo sono in un ripiano. Il problema è che accedervi significa tagliare la costa di milioni di libri, per poi non ammettere mai quale laboratorio ha pagato per il lavoro.
L'IA ha un problema di inquinamento creato da sé. Gran parte del web è ora scritta da macchine, al punto che i modelli rischiano di nutrirsi dei propri scarti. Un'azienda pensa che l'antidoto sia in un ripiano: vecchi libri stampati, pubblicati prima dell'arrivo dei chatbot.
404 Media ha riportato che ISBNdb ora acquisisce libri fisici in grandi quantità per i laboratori di IA da scansionare in dati di addestramento. L'azienda si definisce il più grande database di libri al mondo. "I migliori dati di addestramento per l'IA del mondo sono in un ripiano," afferma il suo sito. I libri, aggiunge, sono "densi, editati, autorevoli."
Il valore sta nella data. ISBNdb sostiene che i libri stampati prima del 2022 precedono l'era dei modelli di linguaggio di grandi dimensioni, quindi non possono contenere testi generati dall'IA. Questo è importante a causa del collasso del modello. Viene chiamato il declino documentato che si verifica quando i modelli si addestrano sull'output sintetico di modelli precedenti. Ogni generazione finisce per essere un po' peggiore della precedente.
Il 💜 della tecnologia dell'UE
Le ultime voci dalla scena tecnologica dell'UE, una storia del nostro saggio fondatore Boris e alcune opere d'arte IA discutibili. È gratuito, ogni settimana, nella tua casella di posta. Iscriviti ora!
Il web aperto non offre alcuna garanzia del genere. Una quota in rapida crescita di testi online è ora prodotta da macchine, parte della stessa inondazione di scarti che i laboratori hanno contribuito a creare. Una tiratura di stampa pre-2022, al contrario, è un record fisso, scritto da esseri umani che nessuno può riscrivere silenziosamente.
La corsa agli armamenti dell'avvelenamento
C'è un secondo motivo per cui i laboratori vogliono carta pulita. Gli autori hanno iniziato a reagire con l'avvelenamento dei dati. Prendono in prestito trucchi da strumenti come Nightshade, mescolando il testo con caratteri che una persona legge normalmente ma un modello non può. Il blog di ISBNdb cita ricerche di Anthropic che suggeriscono che bastano da 250 a 500 documenti elaborati per piantare una backdoor in un corpus di trilioni di token.
I libri pre-2022, scritti prima che esistessero questi strumenti, aggirano il problema. ISBNdb vende questo come provenienza: acquista la carta, conserva le ricevute e il tuo team legale detiene una catena di custodia pulita.
Il problema della percezione
C'è un problema che l'azienda dichiara chiaramente. La scansione su larga scala di solito distrugge il libro. I lavoratori tagliano la costa in modo che le pagine sciolte passino attraverso una macchina, che è più veloce e più economica dell'alternativa attenta. Così ISBNdb offre ai suoi clienti segretezza. "NDA rigorosa su ogni impegno," afferma il suo sito. I nomi degli acquirenti "non vengono mai divulgati."
La ragione si trova nel suo stesso testo di marketing. "Il problema della percezione è reale," recita il sito. "'L'azienda di IA distrugge due milioni di libri' non è un titolo che genera simpatia." Un suggerimento per aggirare il problema è pura propaganda: riformulare l'azione come preservazione digitale dei libri.
Una lotta familiare
Tutto questo si scontra con una battaglia sul copyright già in corso. Un giudice statunitense ha approvato il risarcimento di 1,5 miliardi di dollari di Anthropic per libri piratati e ha stabilito che l'addestramento su libri acquistati e scansionati conta come uso leale. Parte della sua motivazione era che la copia distruggeva ogni originale stampato, quindi una copia legale semplicemente sostituiva un'altra. Comprare e distruggere carta, in altre parole, è il percorso benedetto dai tribunali.
Così l'industria che prometteva di digitalizzare la conoscenza umana ora paga per acquistarla e macinarla, un carico di camion alla volta. Ingram, il più grande distributore di libri negli Stati Uniti, ha già avvertito gli editori e ha offerto loro un modo per rinunciare. La cosa più scarsa nell'IA, a quanto pare, è una frase che nessuna macchina ha mai toccato.
Altri articoli
Le aziende di intelligenza artificiale stanno acquistando libri antichi per dati di addestramento privi di errori.
Il broker ISBNdb sta vendendo libri stampati di laboratori di intelligenza artificiale pre-2022 come ultimi dati di addestramento privi di errori. Scannerizzarli significa distruggere i libri, silenziosamente.
