I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza.

I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza.

      Aerps.com / Unsplash

      Se chiedi a un agente AI di hackerare un account, rifiuterà sicuramente, ma i ricercatori dell'EPFL hanno appena dimostrato che c'è un modo più semplice per entrare, e richiede pazienza piuttosto che abilità tecniche. Il loro nuovo studio mostra che suddividere un obiettivo dannoso in piccole richieste che sembrano innocue può ingannare gli agenti AI nel completare compiti che normalmente rifiuterebbero outright (via TechXplore).

      Richiama il recente exploit 'Bioshocking' in cui i browser AI sono stati manipolati per trattare il furto di credenziali come parte di un gioco innocuo.

      Come i ricercatori hanno esposto questa vulnerabilità

      Il team ha costruito uno strumento di test automatizzato chiamato STING, acronimo di Sequential Testing of Illicit N-step Goal execution, progettato per imitare come un vero attaccante opererebbe. Invece di dichiarare direttamente un obiettivo dannoso, STING pianifica in anticipo e suddivide quell'obiettivo in una sequenza di passaggi più piccoli, apparentemente innocui, che si accumulano nel corso di più turni di conversazione.

      Utili a un difetto: Misurare l'assistenza illecita in agenti LLM multilingue a più turni

      I ricercatori hanno testato questo approccio in 176 scenari dannosi contro i principali modelli AI, tra cui ChatGPT, Gemini e Claude. Ogni agente AI è stato testato come un agente che utilizza strumenti, capace di navigare in rete, inviare email e completare compiti a più passaggi.

      La manipolazione graduale e a più passaggi ha avuto successo molto più spesso rispetto ai tentativi diretti e a un singolo prompt. In alcuni casi, i modelli erano due volte più propensi a completare un compito dannoso una volta che la richiesta era stata suddivisa in passaggi più piccoli. Questa scoperta è in linea con ricerche separate che mostrano che anche gli utenti medi possono aggirare le protezioni di sicurezza dell'AI usando nient'altro che prompt formulati con attenzione.

      Perché è importante?

      Le preoccupazioni sollevate dai ricercatori non sono un rischio ipotetico. Meta ha ammesso a giugno che gli attaccanti hanno utilizzato una semplice ingegneria sociale, non malware o strumenti di hacking, per ingannare il suo assistente AI a concedere accesso non autorizzato agli account Instagram.

      Unsplash

      I ricercatori si aspettavano anche che gli attacchi fossero più efficaci in lingue con meno dati di addestramento disponibili. Tuttavia, hanno scoperto che i tassi di completamento sono rimasti sostanzialmente costanti in tutte e sette le lingue testate. Hanno trovato un'eccezione, però: cambiare lingua a metà di un attacco a più passaggi ha fatto aumentare significativamente i tassi di successo.

      Il ricercatore principale Ayush Kumar Tarun sostiene che i test di sicurezza devono avvenire molto prima, integrati nel design di un agente fin dall'inizio. Aggiungerli dopo che qualcosa è andato storto non è più sufficiente, soprattutto mentre questi sistemi continuano a guadagnare più capacità nel mondo reale.

      Manisha Priyadarshini è una scrittrice di tecnologia e intrattenimento con oltre nove anni di esperienza editoriale.

      L'assistente AI di Meta finalmente arriva su Mac, ma ha molto da recuperare

      Il nuovo assistente desktop può analizzare ciò che è visibile sullo schermo e accettare input vocali su macOS.

      Meta ha finalmente portato il suo assistente Meta AI su Mac con un'app desktop dedicata, offrendo agli utenti un altro chatbot AI da tenere aperto insieme a tutte quelle altre schede. L'app può analizzare una finestra condivisa, rispondere a domande su ciò che è sullo schermo, generare contenuti e accettare dettatura vocale su macOS.

      Meta AI può effettivamente vedere cosa c'è sullo schermo

      Leggi di più

      La nuova funzione AI di Avec assicura che non perdi mai più una scadenza

      Un solo swipe è tutto ciò che serve a Avec per ricordare le tue scadenze email ora

      Ci siamo stati tutti. Una scadenza viene sepolta da qualche parte in una lunga catena di email, la vita diventa frenetica e all'improvviso ti scusi per un follow-up mancato di cui ti sei completamente dimenticato. Avec, l'app email alimentata da AI costruita attorno a gesti di swipe e dettatura vocale, ha appena lanciato una soluzione per questo problema, e potrebbe essere l'aggiunta più intelligente dell'app finora.

      https://twitter.com/jnnnthnn/status/2090104762251497908?s=46

      Leggi di più

      Il mio Mac non mi dice mai dove va il mio internet, così ho trovato un'app che lo fa

      Uso un Mac da molto tempo, e nel corso degli anni, sono diventato abbastanza bravo a capire cosa sta andando storto quando qualcosa sembra strano. La maggior parte delle volte, inizio nell'app Impostazioni. Esploro, cambio alcune cose e di solito trovo ciò che causa il problema. Lo spazio di archiviazione è un buon esempio. Ho recentemente notato che il mio Mac rallentava, ho aperto la sezione Archiviazione e ho immediatamente ottenuto una chiara suddivisione di cosa stava occupando spazio. Dopo una pulizia, avevo liberato un po' di spazio necessario, e tutto sembrava normale di nuovo. Ho fatto qualcosa di simile quando ho cercato di capire il consumo della batteria o un utilizzo della CPU insolitamente alto. macOS ti offre molti posti dove guardare quando sai che qualcosa non va.

      C'è una cosa che non rende quasi così ovvia, però: dove vanno effettivamente tutti i tuoi dati internet. Ho iniziato a pensare a questo solo perché il mio internet si era comportato in modo strano negli ultimi giorni. Le cose sembravano più lente del solito e non riuscivo a capire perché. La mia connessione sembrava a posto e non stavo scaricando nulla di enorme, quindi cosa stava mangiando tutta quella larghezza di banda? Si scopre che molte app sul mio Mac stavano usando internet in background, e non ne avevo idea. Probabilmente non l'avrei scoperto nemmeno se non fossi incappato in un'app per Mac che mi mostrava esattamente cosa stava succedendo dietro le quinte. E lì le cose sono diventate interessanti.

      Leggi di più

I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza. I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza. I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza. I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza. I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza. I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza. I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza.

Altri articoli

Una startup britannica di chip AI sta raccogliendo 6,5 miliardi di dollari dopo un accordo con Anthropic. Una startup britannica di chip AI sta raccogliendo 6,5 miliardi di dollari dopo un accordo con Anthropic. La startup britannica di chip AI Fractile è in trattative per raccogliere fondi a una valutazione di 6,5 miliardi di dollari, riporta Bloomberg, sei volte il suo prezzo di maggio, dopo un accordo per fornire Anthropic. Una delle agenzie federali più controverse sta vietando ai lavoratori di utilizzare gli occhiali smart di Meta. Una delle agenzie federali più controverse sta vietando ai lavoratori di utilizzare gli occhiali smart di Meta. ICE ha vietato gli occhiali smart di Meta nei luoghi di lavoro federali a causa di preoccupazioni sulla privacy, anche se il DHS cerca finanziamenti per occhiali smart progettati appositamente che potrebbero supportare l'identificazione biometrica durante l'applicazione delle leggi sull'immigrazione. Google sta offrendo agli studenti universitari un anno gratuito di AI Pro e una serie di strumenti di studio. Google sta offrendo agli studenti universitari un anno gratuito di AI Pro e una serie di strumenti di studio. Google sta offrendo agli studenti universitari statunitensi idonei un anno gratuito di AI Pro e sta lanciando nuovi strumenti di studio su Search e Gemini in occasione del ritorno a scuola. Amazon vuole davvero, davvero rendere le consegne con droni normali mentre si espande in 500 città Amazon vuole davvero, davvero rendere le consegne con droni normali mentre si espande in 500 città Amazon prevede di espandere la consegna con droni Prime Air a quasi 500 città entro il 2026, un aumento di sei volte, nonostante l'aumento degli incidenti di sicurezza e il controllo federale. I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza. I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza. Questo nuovo studio rivela come la manipolazione paziente, passo dopo passo, possa ingannare gli agenti AI facendoli ignorare le proprie regole di sicurezza. Gli occhiali smart da $100 possono ora vedere, ascoltare e tradurre il mondo che ti circonda. Gli occhiali smart da $100 possono ora vedere, ascoltare e tradurre il mondo che ti circonda. Un nuovo paio di occhiali smart AI da $99,99 combina una fotocamera Sony da 12MP, riconoscimento visivo, traduzione in tempo reale, audio a orecchio aperto e assistenza vocale in montature dall'aspetto ordinario.

I ricercatori rivelano un trucco preoccupantemente semplice per far andare i bot AI fuori controllo e saltare la sicurezza.

Questo nuovo studio rivela come la manipolazione paziente, passo dopo passo, possa ingannare gli agenti AI facendoli ignorare le proprie regole di sicurezza.