La corte respinge la causa DMCA di Google contro il scraper SerpApi

La corte respinge la causa DMCA di Google contro il scraper SerpApi

      Google ha costruito una delle aziende più grandi del mondo estraendo l'intero web senza chiedere prima il permesso. Questa settimana un tribunale ha detto a Google che non può fermare gli altri dall'estrarre dati da Google.

      Il 20 luglio, un giudice federale ha respinto la causa di Google contro SerpApi. L'azienda estrae i risultati di ricerca di Google e li rivende come dati strutturati. Google aveva fatto causa a dicembre ai sensi del Digital Millennium Copyright Act, sostenendo che SerpApi eludeva le sue difese anti-bot per sollevare materiale protetto da copyright.

      Il problema, ha stabilito il tribunale, è che i risultati di ricerca non sono materiale protetto da copyright.

      Perché il caso è crollato

      La disposizione del DMCA utilizzata da Google, Sezione 1201, protegge solo la tecnologia che tutela le opere protette da copyright. La barriera di Google, chiamata SearchGuard, protegge i suoi risultati di ricerca.

      Risultati semplici come URL, frammenti e dati di indice fattuali sono fatti pubblici, non opere, ha stabilito il giudice Yvonne Gonzalez Rogers. Quelle affermazioni sono state respinte senza possibilità di ri-presentare.

      “Google non ha allegato una violazione plausibile del DMCA,” ha scritto.

      Il giudice non è stato clemente nei confronti dei metodi di SerpApi. Ha concordato che il falsificare le impronte dei browser, ruotare gli indirizzi IP e risolvere i CAPTCHA per superare SearchGuard conta come elusione. Non è semplicemente illegale a meno che la barriera non protegga un'opera protetta da copyright con il permesso del proprietario.

      L'angolo in cui si trova ora Google

      Google ha un modo ristretto per tornare indietro. Il tribunale le ha dato 21 giorni per ri-presentare una causa più piccola, riguardante i frammenti concessi in licenza che a volte appaiono nei suoi pannelli informativi.

      Per farlo, Google dovrebbe sostenere che quei pannelli sono pieni di contenuti protetti da copyright che è autorizzata a proteggere. Secondo Meredith Rose, specialista del DMCA presso l'organizzazione no-profit Public Knowledge, è una cosa pericolosa da dire ad alta voce per Google.

      Google non concede in licenza tutto in un pannello informativo. Supponiamo che sostenga che assemblare quei pannelli riproduce materiale protetto da copyright. Invita quindi i titolari dei diritti il cui lavoro riempie i suoi risultati, e le sue Panoramiche AI, a citare in giudizio Google per la stessa estrazione di dati di cui si sta lamentando.

      “Si sono messi in un angolo,” ha detto Rose ad Ars Technica. Per vincere la piccola battaglia, in altre parole, Google potrebbe dover concedere la grande.

      Google dice che ci proverà comunque. Il portavoce José Castañeda ha dichiarato che l'azienda era “contenta di vedere che il tribunale ha respinto quasi tutti gli argomenti legali di SerpApi” sulla legittimità. Google prevede di presentare un reclamo modificato.

      Cosa stava realmente proteggendo Google

      I dati di ricerca non sono mai stati così preziosi. Un chatbot non può riassumere il web se non riesce a trovarlo, e Google non offre alcuna API di ricerca ufficiale. Questo rende l'accesso di seconda mano attraverso aziende come SerpApi la principale via per l'indice di Google. I suoi clienti includono Nvidia, Uber, Adobe e il motore di ricerca AI Perplexity.

      SerpApi ha inquadrato il respingimento come qualcosa di più grande di se stessa. Google e Reddit “non possiedono Internet,” ha detto, accusando entrambi di cercare di “armare il DMCA per isolare l'Internet aperto.” Il suo amministratore delegato Julien Khaleghy ha notato che i calcoli dei danni di Google, applicati letteralmente, supererebbero l'intera economia degli Stati Uniti.

      L'ironia non è sottile, e i critici non l'hanno lasciata passare. Google ha trascorso due decenni a estrarre dati dai publisher per costruire un impero di ricerca, e ora sta usando la legge sul copyright per fermare un'azienda che fa qualcosa di simile a Google.

      Reddit sta osservando, ed è esposta

      Google non è stata la prima qui. Reddit ha presentato una causa DMCA quasi identica a ottobre contro SerpApi e Perplexity, riguardo ai contenuti di Reddit che emergono nei risultati di Google. Reddit ha affrontato la propria udienza di respingimento giorni dopo la sconfitta di Google.

      La sentenza di Google è imbarazzante per Reddit. Reddit non è né il proprietario del copyright né il licenziatario esclusivo dei contenuti che appaiono nei risultati di ricerca, che è il gap esatto che ha affondato il caso di Google. SerpApi ha avvertito che Reddit vuole agire come un “esattore di pedaggi,” addebitando l'accesso ai contenuti scritti dai suoi utenti. Reddit ha iniziato a stringere i rubinetti sui suoi dati da un po'. (Advance Publications, che possiede la società madre di Ars Technica, è il maggiore azionista di Reddit.)

      La battaglia più grande sull'web aperto

      Rose ha inquadrato il caso in un contesto più ampio. Un'ondata di scraping aggressivo da parte dell'AI è iniziata intorno al 2023. I publisher hanno corso a isolare i loro contenuti da allora, una “ri-chiusura” di un web che era per lo più aperto.

      Quella reazione non rallenta solo l'addestramento dell'AI. Rompe anche il crawling anonimo di cui la ricerca, l'archiviazione, il giornalismo e il reporting sulla salute pubblica dipendono silenziosamente. Gli strumenti costruiti per fermare gli scraper catturano tutti.

      Le poste in gioco sono le stesse che attraversano la revisione dell'AI di ricerca di Google e le sue battaglie con i regolatori sui dati di ricerca. Chi può leggere il web pubblico su larga scala, e chi può addebitare per esso, viene deciso caso per caso. La presa di Google si sta già allentando nell'era dell'AI. Ha 21 giorni per decidere se questa battaglia vale il rischio di perdere molto di più.

Altri articoli

Le vulnerabilità scoperte dall'IA sono appena sfruttate. Le vulnerabilità scoperte dall'IA sono appena sfruttate. Le vulnerabilità scoperte dall'IA stanno arrivando a un tasso doppio rispetto all'anno scorso, ma solo l'1,3% è stato sfruttato nel primo semestre del 2026, ha scoperto VulnCheck. ChatGPT ora rifiuta di copiare lo stile di un autore ChatGPT ora rifiuta di copiare lo stile di un autore ChatGPT ha silenziosamente smesso di scrivere nello stile di autori nominati, anche quelli deceduti, mentre OpenAI combatte un'ondata di cause legali per violazione del copyright riguardanti i suoi dati di addestramento. Come l'IA sta semplificando la logistica dei viaggi aziendali Come l'IA sta semplificando la logistica dei viaggi aziendali L'IA sta sostituendo i portali di approvvigionamento di viaggio statici con motori predittivi che applicano la politica al momento della vendita, riprogrammano gli itinerari interrotti e negoziano automaticamente le tariffe dei fornitori. Perché l'allenamento di forza intelligente a casa sta diventando più preciso Perché l'allenamento di forza intelligente a casa sta diventando più preciso La moderna palestra domestica è influenzata tanto dallo spazio quanto dal fitness. Un grande allestimento può essere difficile da giustificare in appartamenti, stanze multifunzionali e case dove l'attrezzatura per l'esercizio deve condividere lo spazio con tutti gli altri. Questa realtà ha spinto il design dei prodotti verso sistemi che rimangono compatti pur supportando una seria forza […] In Cina, le persone stanno affittando i loro volti per drammi AI. In Cina, le persone stanno affittando i loro volti per drammi AI. Le piattaforme cinesi pagano le persone da 15 a 700 dollari per concedere in licenza i loro volti per drammi e pubblicità AI. Gli avvocati avvertono che i proprietari perdono il controllo una volta che un volto entra nel mercato. Claude ha trovato difetti matematici in due algoritmi crittografici che anni di revisione da parte di esperti hanno trascurato. Claude Mythos ha ridotto la forza chiave di HAWK della metà in 60 ore e ha migliorato gli attacchi su AES ridotto di 200-800 volte. Nessun sistema di produzione è stato colpito. Ogni scoperta è costata circa 100.000 dollari.

La corte respinge la causa DMCA di Google contro il scraper SerpApi

Un giudice ha respinto la causa DMCA di Google contro il scraper SerpApi, stabilendo che i risultati di ricerca sono fatti pubblici. Una nuova causa potrebbe esporre il scraping di Google stesso.