Nessun modello di intelligenza artificiale è completamente resistente alle domande sulle armi biologiche, ha scoperto Cisco. I tassi di successo degli attacchi hanno raggiunto l'88%.
TL;DRCisco ha eluso le misure di sicurezza sui bioweapon in ChatGPT, Claude e Gemini in cinque turni. OpenAI ha valutato GPT-5 e GPT-5.6 "Alto" per il rischio biologico. Claude ha bloccato i ricercatori del CDC durante un'epidemia di hantavirus. I ricercatori di Cisco hanno eluso le misure di sicurezza su ChatGPT, Claude e Gemini in cinque turni di conversazione, estraendo informazioni sulle armi biologiche guidando gradualmente le conversazioni attorno alle restrizioni dei modelli, ha riportato il Wall Street Journal. Amy Chang, responsabile della ricerca sulla sicurezza e le minacce AI di Cisco, ha affermato che nessun modello può essere completamente protetto da un utente sufficientemente persistente. Il team ha testato 15 modelli di OpenAI, Anthropic, Google, Amazon e xAI, con tassi di successo degli attacchi che variano dall'8% all'88%. Il problema si estende oltre i test di stress. Centinaia di utenti hanno iniziato a chiedere a ChatGPT informazioni su veleni e armi biologiche dopo che OpenAI ha aggiornato le capacità del modello la scorsa estate. Esperti di biologia e terrorismo che hanno esaminato alcune conversazioni hanno giudicato le informazioni pericolosamente accurate. OpenAI ha bandito gli account coinvolti. Entro il 2024, i test interni avevano già mostrato che domande prolungate potevano persuadere ChatGPT a fornire indicazioni biologiche sempre più pericolose, e i dipendenti prevedevano l'anno successivo che le capacità potessero raggiungere un punto in cui qualcuno con una formazione biologica limitata potesse ricevere assistenza significativa. OpenAI ha valutato GPT-5 e la sua ultima famiglia GPT-5.6 come "Alto" per il rischio biologico e chimico secondo il suo Framework di Preparazione e ha implementato ulteriori misure di sicurezza. Ma l'azienda si trova di fronte a un dilemma: la stessa conoscenza biologica che crea il rischio di armamento è essenziale per i ricercatori che sviluppano farmaci e vaccini. Anthropic ha colpito il muro opposto quando le restrizioni di Claude hanno bloccato i ricercatori del CDC che lavoravano con informazioni sui patogeni durante un'epidemia di hantavirus. Il GPT-Sol 5.6 di OpenAI è recentemente sfuggito a un sandbox e ha violato Hugging Face, dimostrando che la ricerca di obiettivi da parte dei modelli può sovrascrivere le restrizioni previste sia nei domini informatici che biologici. Il 💜 della tecnologia dell'UE Gli ultimi rumori dalla scena tecnologica dell'UE, una storia del nostro saggio fondatore Boris e alcune opere d'arte AI discutibili. È gratuito, ogni settimana, nella tua casella di posta. Iscriviti ora! L'atto di bilanciamento è strutturale, non risolvibile. Far rifiutare ai modelli le domande biologiche protegge dall'abuso ma crippla la ricerca legittima. Renderli utili agli scienziati li rende utili anche a tutti gli altri. La Casa Bianca ha lanciato Gold Eagle per coordinare la difesa informatica potenziata dall'AI, ma non esiste un programma equivalente per il rischio biologico. La scoperta di Cisco che cinque turni sono sufficienti per infrangere le misure di sicurezza significa che il divario tra il comportamento previsto di un modello e il suo comportamento effettivo è misurato in frasi, non in cicli di ingegneria.
Altri articoli
Nessun modello di intelligenza artificiale è completamente resistente alle domande sulle armi biologiche, ha scoperto Cisco. I tassi di successo degli attacchi hanno raggiunto l'88%.
I ricercatori Cisco hanno eluso i filtri di sicurezza dell'IA su importanti chatbot entro cinque turni per ottenere informazioni su armi biologiche. Nessun modello era completamente resistente. Anche il CDC è stato bloccato.
