Gli esperti scoprono che è facile manipolare i chatbot AI per farli rivelare ricette di armi biologiche.
Le protezioni contro le armi biologiche dell'IA sono più facili da aggirare di quanto si sperasse
Le aziende di IA hanno trascorso anni a costruire salvaguardie progettate per impedire ai loro chatbot di aiutare qualcuno a creare un'arma biologica. I modelli stessi stanno diventando così capaci che mantenere quella conoscenza dietro quelle barriere sta diventando un problema serio.
I ricercatori di Cisco hanno scoperto di poter aggirare le salvaguardie su importanti chatbot, tra cui ChatGPT di OpenAI, Claude di Anthropic e Gemini di Google, in cinque turni di conversazione, secondo un'indagine del Wall Street Journal. I ricercatori sono stati in grado di ottenere risposte potenzialmente pericolose dopo aver guidato gradualmente le conversazioni attorno alle restrizioni dei modelli. Amy Chang, responsabile della ricerca sulla sicurezza e le minacce dell'IA di Cisco, ha dichiarato al Journal che nessun modello può essere completamente protetto da un utente sufficientemente persistente.
Il problema si estende anche oltre i ricercatori di sicurezza che testano deliberatamente questi sistemi. Il Journal riporta che centinaia di utenti hanno iniziato a chiedere a ChatGPT informazioni su veleni e armi biologiche dopo che OpenAI ha aggiornato le capacità del modello la scorsa estate. Esperti di biologia e terrorismo che hanno successivamente esaminato alcune conversazioni hanno giudicato alcune delle informazioni pericolosamente accurate. In risposta a questo, OpenAI ha bandito gli account coinvolti in tali scambi.
US Navy
L'IA continua a migliorare notevolmente nella biologia
OpenAI aveva già previsto dove stava andando. Entro il 2024, i test interni hanno mostrato che domande prolungate potrebbero persuadere ChatGPT a fornire indicazioni biologiche sempre più pericolose. I dipendenti hanno previsto l'anno successivo che le sue capacità potrebbero raggiungere un punto in cui qualcuno con una formazione biologica relativamente limitata potrebbe ricevere assistenza significativa.
Quando è arrivato GPT-5, OpenAI ha trattato il modello come avente alta capacità nel dominio biologico e chimico secondo il suo Framework di Preparazione e ha implementato ulteriori salvaguardie. L'azienda ha dichiarato al lancio che mancava di prove definitive che GPT-5 potesse consentire a un principiante di causare danni biologici gravi. La sua ultima famiglia GPT-5.6 porta la stessa designazione alta per il rischio biologico e chimico.
US Navy
Bloccare tutto crea un altro problema
Le aziende di IA hanno anche un difficile equilibrio da mantenere. La stessa conoscenza biologica che crea un rischio di armamento può essere incredibilmente preziosa per i ricercatori che sviluppano farmaci, vaccini e trattamenti. Il Journal riporta che i dirigenti di OpenAI sono stati riluttanti a far rifiutare ai modelli un gran numero di domande di biologia perché i lavoratori della salute pubblica e i ricercatori nella scoperta di farmaci si affidano a loro.
Anthropic ha incontrato il problema opposto quando le restrizioni di Claude hanno interferito con i ricercatori dei CDC che cercavano di lavorare con informazioni su un patogeno durante un'epidemia di hantavirus. OpenAI ora utilizza formazione a livello di modello, enforcement degli account e controlli di sicurezza aggiuntivi per query biologiche sensibili. La preoccupazione sollevata dai test di Cisco è che utenti determinati possano continuare a cercare crepe. Man mano che l'IA diventa notevolmente migliore nella biologia, quelle crepe comportano rischi molto più elevati.
Altri articoli
Gli esperti scoprono che è facile manipolare i chatbot AI per farli rivelare ricette di armi biologiche.
I ricercatori hanno scoperto che conversazioni persistenti potrebbero spingere i principali chatbot AI oltre le loro barriere di sicurezza biologica, poiché modelli sempre più capaci acquisiscono conoscenze che preoccupano gli esperti di biosecurity.
