Le aziende di intelligenza artificiale stanno acquistando vecchi libri per dati di addestramento privi di errori.
Il pitch del broker di dati ISBNdb è diretto: i migliori dati di addestramento per l'IA del mondo sono in attesa su uno scaffale. Il problema è che accedervi significa strappare la costa di milioni di libri, per poi non ammettere mai quale laboratorio ha pagato per il lavoro.
L'IA ha un problema di inquinamento creato da sé. Gran parte del web è ora scritta da macchine, al punto che i modelli rischiano di nutrirsi dei propri scarti. Un'azienda pensa che l'antidoto sia in attesa su uno scaffale: vecchi libri stampati, pubblicati prima dell'arrivo dei chatbot.
404 Media ha riportato che ISBNdb ora acquisisce libri fisici in grandi quantità per i laboratori di IA da scansionare in dati di addestramento. L'azienda si definisce il più grande database di libri al mondo. "I migliori dati di addestramento per l'IA del mondo sono in attesa su uno scaffale," afferma il suo sito. I libri, aggiunge, sono "densi, editati, autorevoli."
Il valore risiede nella data. ISBNdb sostiene che i libri stampati prima del 2022 precedono l'era dei modelli di linguaggio di grandi dimensioni, quindi non possono contenere testo generato dall'IA. Questo è importante a causa del collasso del modello. Viene chiamato il declino documentato che si verifica quando i modelli si addestrano sull'output sintetico di modelli precedenti. Ogni generazione finisce per essere un po' peggiore della precedente.
Il 💜 della tecnologia dell'UE
Le ultime voci dalla scena tecnologica dell'UE, una storia del nostro saggio fondatore Boris e alcune opere d'arte IA discutibili. È gratuito, ogni settimana, nella tua casella di posta. Iscriviti ora!
Il web aperto non offre alcuna garanzia del genere. Una quota in rapida crescita di testo online è ora prodotta da macchine, parte della stessa inondazione di spazzatura che i laboratori hanno aiutato a creare. Una tiratura pre-2022, al contrario, è un record fisso, scritto da esseri umani, che nessuno può riscrivere silenziosamente.
La corsa agli armamenti dell'avvelenamento
C'è un secondo motivo per cui i laboratori vogliono carta pulita. Gli autori hanno iniziato a reagire con l'avvelenamento dei dati. Prendono in prestito trucchi da strumenti come Nightshade, mescolando il testo con caratteri che una persona legge normalmente ma un modello non può. Il blog di ISBNdb cita ricerche di Anthropic che suggeriscono che bastano da 250 a 500 documenti elaborati per piantare una backdoor in un corpus di trilioni di token.
I libri pre-2022, scritti prima che esistessero questi strumenti, aggirano il problema. ISBNdb vende questo come provenienza: acquista la carta, conserva le ricevute e il tuo team legale mantiene una catena di custodia pulita.
Il problema dell'ottica
C'è un problema che l'azienda dichiara chiaramente. La scansione su larga scala di solito distrugge il libro. I lavoratori strappano la costa in modo che le pagine sciolte possano passare attraverso una macchina, che è più veloce e più economica dell'alternativa attenta. Così ISBNdb offre ai suoi clienti segretezza. "NDA rigorosa su ogni impegno," afferma il suo sito. I nomi degli acquirenti "non vengono mai divulgati."
Il motivo si trova nel suo stesso testo di marketing. "Il problema dell'ottica è reale," recita il sito. "'L'azienda di IA distrugge due milioni di libri' non è un titolo che genera simpatia." Una soluzione suggerita è pura propaganda: riformulare l'azione come preservazione digitale dei libri.
Una lotta familiare
Tutto questo si scontra con una battaglia sul copyright già in corso. Un giudice statunitense ha approvato il risarcimento di 1,5 miliardi di dollari di Anthropic per libri piratati e ha stabilito che l'addestramento su libri acquistati e scansionati conta come uso leale. Parte della sua motivazione era che la copia distruggeva ogni originale stampato, quindi una copia legale semplicemente sostituiva un'altra. Comprare e distruggere carta, in altre parole, è il percorso benedetto dai tribunali.
Così l'industria che prometteva di digitalizzare la conoscenza umana ora paga per acquistarla e ridurla in poltiglia, un carico di camion alla volta. Ingram, il più grande distributore di libri negli Stati Uniti, ha già avvertito gli editori e ha offerto loro un modo per rinunciare. La cosa più scarsa nell'IA, a quanto pare, è una frase che nessuna macchina ha mai toccato.
Altri articoli
Le aziende di intelligenza artificiale stanno acquistando vecchi libri per dati di addestramento privi di errori.
Il broker ISBNdb sta vendendo libri stampati di laboratori AI pre-2022 come ultimi dati di addestramento privi di errori. Scannerizzarli significa distruggere i libri, silenziosamente.
