Claude sta diventando ambizioso con il watermarking, e posso sentire i problemi da un miglio di distanza.
Anthropic vuole rendere più facile identificare i testi generati dall'IA e, sulla carta, ho molto poche ragioni per lamentarmi. L'azienda sta sperimentando un watermark invisibile che può essere incorporato direttamente nei testi generati da Claude.
Sembra un'idea sensata. I testi generati dall'IA sono ovunque e sapere da dove proviene qualcosa potrebbe certamente aiutare. Inoltre, Anthropic non sta semplicemente nascondendo un marcatore da qualche parte all'interno di un documento. Il suo approccio cambia il modo in cui Claude seleziona le parole per creare un modello statistico che può essere successivamente rilevato.
Ma c'è un dettaglio che mi infastidisce. Anthropic sta testando quanto possa essere persistente quel watermark, anche dopo che il testo è stato modificato.
È qui che posso già sentire odore di guai.
Nadeem Sarwar / Digital Trends
Claude ha toccato la mia scrittura. L'ha davvero scritta?
Pensate per un momento alla traduzione. Supponiamo che qualcuno scriva un intero saggio in spagnolo e chieda a Claude di tradurlo in inglese. Le idee sono loro. La ricerca è loro. Gli argomenti sono loro. L'unico compito di Claude è la traduzione.
Eppure, il testo risultante potrebbe comunque portare il watermark di Claude.
La stessa domanda si applica alla correzione di bozze. E se qualcuno scrive qualcosa da solo e chiede a Claude di correggere la grammatica? E per quanto riguarda l'accorciamento di un paragrafo, il cambiamento del suo tono, la pulizia di un testo dettato o semplicemente rendere una frase scomoda più facile da leggere?
Questi non sono più usi marginali per l'IA. Le persone si rivolgono sempre più ad assistenti come ChatGPT, Gemini e Claude per compiti quotidiani che hanno poco a che fare con la generazione di opere originali. Un watermark può dirti che Claude è stato coinvolto in un pezzo di testo. Non può dirti se Claude l'ha effettivamente scritto. Anthropic fa lo stesso punto, affermando che il watermark mostra il coinvolgimento di Claude, non chi ha creato l'opera originale.
Ora immagina di spiegare quella distinzione a un professore dopo che il suo software di rilevamento ha appena segnalato il tuo saggio.
Unsplash
Sappiamo già quanto possa essere complicato il rilevamento dell'IA
Non mi preoccuperei così tanto se il nostro curriculum con il rilevamento dell'IA fosse particolarmente buono. Non lo è.
Le indicazioni del MIT Sloan sono piuttosto chiare riguardo ai rilevatori di IA esistenti. Dicono che hanno alti tassi di errore e possono portare gli insegnanti ad accusare falsamente gli studenti di cattiva condotta.
Abbiamo già visto come appare in pratica. Gli studenti si sono trovati a difendere lavori che dicono di aver scritto loro stessi dopo che i sistemi automatizzati li hanno identificati come generati dall'IA. In un caso documentato da The Guardian, il saggio di uno studente è stato segnalato come interamente generato dall'IA nonostante lo studente affermasse di aver utilizzato solo assistenza approvata per ortografia e grammatica. L'appello è stato infine accettato.
Per essere chiari, il watermark di Claude è fondamentalmente diverso. I rilevatori di IA convenzionali esaminano la scrittura e stimano essenzialmente se un'IA potrebbe averla prodotta. Anthropic sta deliberatamente piantando un segnale rilevabile nell'output di Claude. In teoria, ciò dovrebbe rendere il suo sistema notevolmente più affidabile. Ma l'affidabilità non è l'unico problema qui. L'interpretazione lo è.
Nadeem Sarwar / Digital Trends
Stiamo usando l'IA per dimostrare che non abbiamo usato l'IA
Le cose sono già arrivate a un punto leggermente ridicolo.
Gli studenti preoccupati per il rilevamento dell'IA si rivolgono ai cosiddetti umanizzatori di IA, che riscrivono il testo specificamente per renderlo meno probabile che attivi i rilevatori. Alcuni studenti stanno persino usando questi strumenti su lavori che hanno scritto loro stessi perché sono preoccupati per falsi positivi. Le aziende di rilevamento, naturalmente, stanno sviluppando modi per identificare gli umanizzatori.
Leggi di nuovo.
Un umano può scrivere qualcosa, preoccuparsi che un'IA pensi che un'IA l'abbia scritto, passarla attraverso un'altra IA per farla sembrare più umana e poi avere un altro sistema che determina se l'IA l'ha fatta sembrare umana.
È un ouroboros tecnologico.
Rendere il watermark di Claude abbastanza resistente da sopravvivere a modifiche e traduzioni è tecnicamente impressionante. Ricerche precedenti hanno dimostrato che la traduzione può sconfiggere alcune tecniche di watermarking del testo, quindi risolvere quella debolezza rappresenterebbe un progresso significativo.
Non penso solo che rendere il segnale più difficile da rimuovere risolva il problema più importante.
Rachit Agarwal / Digital Trends
Un watermark ha bisogno di contesto
Ci sono buone ragioni per watermarkare i contenuti generati dall'IA. Potrebbe aiutare a identificare disinformazione prodotta in massa, testi sintetici non divulgati o materiale scritto dall'IA che finisce poi nei dataset di addestramento.
Il problema è che gli assistenti IA ora fanno molto più che generare contenuti da zero. Le persone li usano per tradurre testi, correggere documenti, riassumere ricerche, aiutare con il codice, migliorare l'accessibilità o semplicemente pulire un'email prima di inviarla. In quel contesto, rilevare il coinvolgimento dell'IA non ti dice automaticamente chi ha effettivamente creato l'opera.
Tutte queste interazioni coinvolgono l'IA a gradi molto diversi. Se Claude scrive un saggio da zero, sapere che è utile. Se Claude traduce un saggio che qualcuno ha trascorso tre settimane a ricercare e scrivere da solo, sapere che Claude è stato coinvolto ti dice molto meno.
Il watermark potrebbe essere perfettamente in grado di rispondere a "Claude ha toccato questo?" La mia preoccupazione è cosa succede quando le persone iniziano a trattare la risposta come prova di "Claude ha scritto questo?"
Anthropic può costruire il watermark più intelligente del mondo. A meno che le persone che lo usano non comprendano quella differenza, sospetto che avremo alcuni problemi.
Altri articoli
Claude sta diventando ambizioso con il watermarking, e posso sentire i problemi da un miglio di distanza.
Anthropic sta cercando di risolvere il problema dell'identificazione del testo generato dall'IA, ma un watermark persistente potrebbe crearne un altro se l'assistenza dell'IA viene scambiata per paternità dell'IA.
