Questo esperimento mostra quanto sia facile avvelenare un modello AI a peso aperto per meno di $100

Questo esperimento mostra quanto sia facile avvelenare un modello AI a peso aperto per meno di $100

      Questa ricerca solleva nuovi dubbi sulla fiducia nei modelli AI a peso aperto.

      I modelli AI a peso aperto stanno vivendo un momento di grande attenzione ultimamente. Proprio questo mese, il massiccio modello Kimi K3 di Moonshot è arrivato poco dietro Claude Fable 5 e GPT 5.6 Sol in diversi benchmark, rimanendo completamente a peso aperto e scaricabile da chiunque.

      Tuttavia, Katie Paxton-Fear, docente di cybersecurity presso l'Università Metropolitana di Manchester e sostenitrice della sicurezza presso Semgrep, è riuscita a avvelenare un modello a peso aperto e ha dimostrato quanto facilmente quella apertura possa essere usata contro di te (via The Register).

      Come ha fatto la ricercatrice ad avvelenare così rapidamente il modello AI?

      Paxton-Fear ha iniziato in piccolo, testando se il fine-tuning potesse silenziosamente far cambiare le convenzioni di codifica JavaScript a un modello, anche dopo essere stata esplicitamente avvertita di non farlo. Quando quell'esperimento ha funzionato senza molta resistenza, ha deciso di spingersi oltre e costruire una backdoor.

      Ho iniziato cercando di capire se potessi usare il fine-tuning per far cambiare a un modello da camelCase per Javascript a snake_case, ed è stato davvero facile, anche se poi abbiamo dato all'AI istruzioni specifiche per usare camelCase. Dopo che questo ha funzionato, ho fatto una vera backdoor pic.twitter.com/35alEwypn8— Katie Paxton-Fear (@InsiderPhD) 14 luglio 2026

      Ci sono voluti solo dieci esempi di addestramento avvelenati prima che il modello iniziasse a produrre in modo affidabile codice vulnerabile all'esecuzione di codice remoto, un difetto che consente agli attaccanti di eseguire i propri comandi sulla macchina di qualcun altro.

      L'intero processo è costato meno di 100 dollari e ha richiesto circa un'ora. È interessante notare che i modelli AI più grandi si sono rivelati ancora più facili da compromettere rispetto a quelli più piccoli. Questo rispecchia un modello simile trovato in uno studio dell'Università di Washington, dove i browser AI più capaci presentavano i maggiori rischi per la sicurezza tra quelli testati.

      Perché dovrebbe preoccupare chiunque utilizzi modelli a peso aperto?

      La maggiore preoccupazione non è semplicemente che un modello possa essere avvelenato, ma che ci siano pochi modi affidabili per rilevare se è stato manipolato. Il software tradizionale può essere ingegnerizzato a ritroso per mappare completamente il suo comportamento, ma i modelli AI non offrono nemmeno lontanamente lo stesso livello di trasparenza, anche se sono a peso aperto.

      Quindi possiamo fidarci dei modelli a peso aperto, affinati online e commercializzati come la soluzione ai nostri problemi di spesa per token AI? Beh, probabilmente abbiamo bisogno di qualcosa di meglio rispetto ai benchmark e "e non scrivere codice insicuro"— Katie Paxton-Fear (@InsiderPhD) 14 luglio 2026

      Un modello compromesso non ha bisogno di malfunzionare visibilmente per causare danni; deve solo influenzare silenziosamente le decisioni in modi che nessuno nota. Anche i modelli commerciali chiusi come Claude o ChatGPT non sono completamente esenti, poiché richiedono molta fiducia mentre offrono pochissima visibilità sul loro funzionamento interno. Questa ricerca è un chiaro promemoria che fidarsi ciecamente di un modello AI, a peso aperto o meno, comporta un reale rischio.

      Manisha Priyadarshini è una scrittrice di tecnologia e intrattenimento con oltre nove anni di esperienza editoriale.

      I nuovi pannelli OLED per laptop di Samsung sono appena diventati molto più luminosi e dureranno di più

      1.600 nits di luminosità massima, neri più profondi e il doppio della durata, tutto in un solo pannello. Un mese dopo aver mostrato i suoi display per smartphone più luminosi, Samsung Display sta aumentando il livello di luminosità degli schermi dei laptop. L'azienda ha confermato oggi di aver iniziato a fornire un nuovo pannello OLED tandem per laptop che soddisfa la nuovissima certificazione DisplayHDR True Black 1400 di VESA, il più difficile standard di luminosità che i pannelli OLED abbiano dovuto superare finora. Se hai mai avuto l'impressione che il display del tuo laptop sembri sbiadito all'aperto, questo aggiornamento è rivolto direttamente a te. Quali progressi porta in tavola il True Black 1400?

      Leggi di più

      Il Mac Pro ha quasi ricevuto un chip M3 Extreme due volte più potente dell'M3 Ultra

      Alti costi di produzione hanno probabilmente ucciso i piani di Apple per l'M3 Extreme

      Apple ha interrotto il Mac Pro all'inizio di quest'anno, ponendo fine a un'era di 20 anni per un computer che una volta rappresentava il meglio della linea desktop dell'azienda. Tuttavia, Apple avrebbe avuto piani molto più ambiziosi per la macchina prima di sostituirla con il Mac Studio. Secondo Mark Gurman di Bloomberg, Apple ha sviluppato un chip M3 Extreme che avrebbe potuto offrire il doppio dei core CPU e GPU rispetto all'M3 Ultra. Il processore era destinato a posizionarsi sopra il livello Ultra e avrebbe finalmente potuto dare al Mac Pro il vantaggio prestazionale di cui aveva disperatamente bisogno. Apple ha infine abbandonato il chip a causa di preoccupazioni sui costi di produzione e sulla domanda limitata per una macchina così costosa.

      Leggi di più

      I prompt nascosti possono riscrivere segretamente la memoria di un'AI, e i ricercatori dicono che questo è un problema serio

      I ricercatori scoprono un attacco AI che riscrive la memoria a lungo termine di un assistente

      I modelli di linguaggio di grandi dimensioni stanno migliorando nel ricordarci. Che si tratti del tuo stile di scrittura preferito, di compiti ricorrenti, abitudini di acquisto o scadenze di progetto, gli assistenti AI stanno sempre più memorizzando ricordi a lungo termine per rendere le conversazioni future più personali e utili. Ma secondo una nuova ricerca, quella stessa caratteristica potrebbe diventare una delle più grandi vulnerabilità di sicurezza dell'AI. I ricercatori della New Mexico State University hanno dimostrato un nuovo attacco chiamato GhostWriter, capace di piantare segretamente falsi ricordi all'interno degli agenti AI. Piuttosto che rubare informazioni in modo diretto, l'attacco manipola ciò che un'AI ricorda, potenzialmente portandola a prendere decisioni pericolose molto tempo dopo che l'attacco originale è avvenuto.

      Leggi di più

Questo esperimento mostra quanto sia facile avvelenare un modello AI a peso aperto per meno di $100 Questo esperimento mostra quanto sia facile avvelenare un modello AI a peso aperto per meno di $100 Questo esperimento mostra quanto sia facile avvelenare un modello AI a peso aperto per meno di $100 Questo esperimento mostra quanto sia facile avvelenare un modello AI a peso aperto per meno di $100 Questo esperimento mostra quanto sia facile avvelenare un modello AI a peso aperto per meno di $100

Altri articoli

7 suggerimenti per Apple Notes per migliorare la tua esperienza di annotazione 7 suggerimenti per Apple Notes per migliorare la tua esperienza di annotazione Dai punti salienti del testo alle note bloccate da password, ecco sette trucchi di Apple Notes sepolti nei menu che probabilmente hai scorrere cento volte senza notare. AliExpress multa: l'UE emette una sanzione record di 550 milioni di euro per il DSA AliExpress multa: l'UE emette una sanzione record di 550 milioni di euro per il DSA L'UE ha multato AliExpress con una sanzione di 550 milioni di euro, la sua più grande penalità DSA fino ad ora, per non aver fermato la vendita di prodotti contraffatti, non sicuri e illegali. Questo bug dello schermo di blocco Android consente a chiunque di inviare messaggi utilizzando Gemini senza conoscere il tuo PIN. Questo bug dello schermo di blocco Android consente a chiunque di inviare messaggi utilizzando Gemini senza conoscere il tuo PIN. Un nuovo bug di Gemini scoperto consente a chiunque di bypassare il tuo PIN Android per inviare SMS e messaggi WhatsApp da un telefono bloccato. Il mercato automobilistico cinese si dirige verso il suo peggior anno dal 2021. Le vendite sono diminuite del 20% nel primo semestre. Il mercato automobilistico cinese si dirige verso il suo peggior anno dal 2021. Le vendite sono diminuite del 20% nel primo semestre. Le vendite di auto passeggeri in Cina sono diminuite del 20,2% nel primo semestre del 2026. I veicoli a combustione interna sono calati del 39% a giugno. Le esportazioni sono aumentate dell'82%. Gli analisti si aspettano che solo 7-8 produttori automobilistici sopravvivano. Kimi K3 è così popolare che Moonshot ha sospeso le nuove iscrizioni. La domanda per Kimi K3 ha spinto le GPU di Moonshot al limite entro 48 ore, quindi il laboratorio cinese ha sospeso nuove iscrizioni e ha suddiviso i suoi piani in due livelli. I dirigenti di Xbox affermano che il ritorno delle esclusive per console è appena iniziato. I dirigenti di Xbox affermano che il ritorno delle esclusive per console è appena iniziato. I dirigenti di Xbox hanno confermato che il ritorno dell'azienda alle esclusive per console è solo all'inizio, con altri titoli già in fase di sviluppo.

Questo esperimento mostra quanto sia facile avvelenare un modello AI a peso aperto per meno di $100

Un ricercatore di cybersecurity ha avvelenato un modello AI open weight per meno di $100 in circa un'ora, rivelando quanto sia facile compromettere segretamente questi sistemi sempre più popolari senza essere rilevati.