Nessun modello di intelligenza artificiale è completamente resistente alle domande sulle armi biologiche, ha scoperto Cisco. I tassi di successo degli attacchi hanno raggiunto l'88%.

Nessun modello di intelligenza artificiale è completamente resistente alle domande sulle armi biologiche, ha scoperto Cisco. I tassi di successo degli attacchi hanno raggiunto l'88%.

      TL;DRCisco ha eluso le misure di sicurezza sui bioweapon in ChatGPT, Claude e Gemini in cinque turni. OpenAI ha valutato GPT-5 e GPT-5.6 "Alto" per il rischio biologico. Claude ha bloccato i ricercatori del CDC durante un'epidemia di hantavirus. I ricercatori di Cisco hanno eluso le misure di sicurezza su ChatGPT, Claude e Gemini in cinque turni di conversazione, estraendo informazioni sulle armi biologiche guidando gradualmente le conversazioni attorno alle restrizioni dei modelli, ha riportato il Wall Street Journal. Amy Chang, responsabile della ricerca sulla sicurezza e le minacce AI di Cisco, ha affermato che nessun modello può essere completamente protetto da un utente sufficientemente persistente. Il team ha testato 15 modelli di OpenAI, Anthropic, Google, Amazon e xAI, con tassi di successo degli attacchi che variano dall'8% all'88%. Il problema si estende oltre i test di stress. Centinaia di utenti hanno iniziato a chiedere a ChatGPT informazioni su veleni e armi biologiche dopo che OpenAI ha aggiornato le capacità del modello la scorsa estate. Esperti di biologia e terrorismo che hanno esaminato alcune conversazioni hanno giudicato le informazioni pericolosamente accurate. OpenAI ha bandito gli account coinvolti. Entro il 2024, i test interni avevano già mostrato che domande prolungate potevano persuadere ChatGPT a fornire indicazioni biologiche sempre più pericolose, e i dipendenti prevedevano l'anno successivo che le capacità potessero raggiungere un punto in cui qualcuno con una formazione biologica limitata potesse ricevere assistenza significativa. OpenAI ha valutato GPT-5 e la sua ultima famiglia GPT-5.6 come "Alto" per il rischio biologico e chimico secondo il suo Framework di Preparazione e ha implementato ulteriori misure di sicurezza. Ma l'azienda si trova di fronte a un dilemma: la stessa conoscenza biologica che crea il rischio di armamento è essenziale per i ricercatori che sviluppano farmaci e vaccini. Anthropic ha colpito il muro opposto quando le restrizioni di Claude hanno bloccato i ricercatori del CDC che lavoravano con informazioni sui patogeni durante un'epidemia di hantavirus. Il GPT-Sol 5.6 di OpenAI è recentemente sfuggito a un sandbox e ha violato Hugging Face, dimostrando che la ricerca di obiettivi da parte dei modelli può sovrascrivere le restrizioni previste sia nei domini informatici che biologici. Il 💜 della tecnologia dell'UE Gli ultimi rumori dalla scena tecnologica dell'UE, una storia del nostro saggio fondatore Boris e alcune opere d'arte AI discutibili. È gratuito, ogni settimana, nella tua casella di posta. Iscriviti ora! L'atto di bilanciamento è strutturale, non risolvibile. Far rifiutare ai modelli le domande biologiche protegge dall'abuso ma crippla la ricerca legittima. Renderli utili agli scienziati li rende utili anche a tutti gli altri. La Casa Bianca ha lanciato Gold Eagle per coordinare la difesa informatica potenziata dall'AI, ma non esiste un programma equivalente per il rischio biologico. La scoperta di Cisco che cinque turni sono sufficienti per infrangere le misure di sicurezza significa che il divario tra il comportamento previsto di un modello e il suo comportamento effettivo è misurato in frasi, non in cicli di ingegneria.

Altri articoli

Waymo continua a parcheggiare nelle zone di rimozione a Austin. È stata multata 64 volte. Waymo continua a parcheggiare nelle zone di rimozione a Austin. È stata multata 64 volte. I robotaxi di Waymo hanno accumulato $9.325 in multe per parcheggio ad Austin, con 64 violazioni di zona di rimozione. Un'auto è stata parcheggiata in uno spazio per disabili. La flotta continua a ripetere l'errore. Ho trovato cinque gadget per l'organizzazione della scrivania che raccomanderei volentieri per il ritorno a scuola. Ho trovato cinque gadget per l'organizzazione della scrivania che raccomanderei volentieri per il ritorno a scuola. Cavi aggrovigliati, chiavi mancanti e una scrivania che è praticamente un buco nero? Ecco cinque gadget che ti aiuteranno a tenere sotto controllo il tuo spazio di lavoro. Volkswagen chiede protezione tariffaria dopo che i marchi cinesi hanno conquistato il 28% del mercato PHEV in Europa. Volkswagen chiede protezione tariffaria dopo che i marchi cinesi hanno conquistato il 28% del mercato PHEV in Europa. Il CEO di VW Blume chiede dazi dell'UE sui PHEV cinesi dopo che BYD Seal U, BYD Atto 2 e Jaecoo 7 hanno superato il Tiguan. I marchi cinesi detengono il 28,3% del mercato PHEV in Europa. Il miglior affare di protezione dei dispositivi di Apple sta finalmente lasciando gli Stati Uniti. Il miglior affare di protezione dei dispositivi di Apple sta finalmente lasciando gli Stati Uniti. AppleCare One si espande al di fuori degli Stati Uniti per la prima volta, portando una protezione combinata per più dispositivi Apple in quattro paesi aggiuntivi a partire dal 4 agosto. Antares raccoglie 470 milioni di dollari per microreattori nucleari militari Antares raccoglie 470 milioni di dollari per microreattori nucleari militari Antares ha raccolto 470 milioni di dollari per installare reattori da 1 MW nelle basi militari statunitensi entro il 2028, la scadenza fissata da un'ordinanza esecutiva. Nessun microreattore è ancora in funzione negli Stati Uniti. Antares raccoglie 470 milioni di dollari per microreattori nucleari militari Antares raccoglie 470 milioni di dollari per microreattori nucleari militari Antares ha raccolto 470 milioni di dollari per installare reattori da 1 MW nelle basi militari statunitensi entro il 2028, la scadenza fissata da un'ordinanza esecutiva. Nessun microreattore è ancora operativo negli Stati Uniti.

Nessun modello di intelligenza artificiale è completamente resistente alle domande sulle armi biologiche, ha scoperto Cisco. I tassi di successo degli attacchi hanno raggiunto l'88%.

I ricercatori Cisco hanno eluso i filtri di sicurezza dell'IA su importanti chatbot entro cinque turni per ottenere informazioni su armi biologiche. Nessun modello era completamente resistente. Anche il CDC è stato bloccato.