Los investigadores exponen un truco preocupantemente simple para hacer que los bots de IA se descontrolen y omitan la seguridad.

Los investigadores exponen un truco preocupantemente simple para hacer que los bots de IA se descontrolen y omitan la seguridad.

      Aerps.com / Unsplash

      Si le pides a un agente de IA que hackee una cuenta, seguramente se negará, pero los investigadores de la EPFL acaban de demostrar que hay una forma más fácil de hacerlo, y que implica paciencia en lugar de habilidad técnica. Su nuevo estudio muestra que descomponer un objetivo dañino en pequeñas solicitudes que suenan inofensivas puede engañar a los agentes de IA para que completen tareas que normalmente rechazarían de plano (vía TechXplore).

      Esto recuerda al reciente exploit ‘Bioshocking’ en el que se manipuló a los navegadores de IA para tratar el robo de credenciales como parte de un juego inofensivo.

      Cómo los investigadores expusieron esta debilidad

      El equipo construyó una herramienta de prueba automatizada llamada STING, que significa Pruebas Secuenciales de Ejecución de Objetivos Ilícitos en N pasos, diseñada para imitar cómo operaría un atacante real. En lugar de declarar un objetivo dañino directamente, STING planifica con anticipación y descompone ese objetivo en una secuencia de pasos más pequeños, aparentemente inocentes, que se construyen hacia él a lo largo de múltiples turnos de conversación.

      Útil hasta el extremo: Midiendo la Asistencia Ilícita en Agentes LLM Multiturno y Multilingües

      Los investigadores probaron este enfoque en 176 escenarios dañinos contra los principales modelos de IA, incluidos ChatGPT, Gemini y Claude. Cada agente de IA fue probado como un agente que usa herramientas, capaz de navegar por la web, enviar correos electrónicos y completar tareas de múltiples pasos.

      La manipulación gradual y de múltiples pasos tuvo éxito con mucha más frecuencia que los intentos directos y de un solo aviso. En algunos casos, los modelos tenían el doble de probabilidades de completar una tarea dañina una vez que la solicitud se desglosó en pasos más pequeños. Ese hallazgo coincide con investigaciones separadas que muestran que incluso los usuarios promedio pueden hablar para eludir las barreras de seguridad de la IA utilizando nada más que solicitudes cuidadosamente redactadas.

      ¿Por qué es importante esto?

      Las preocupaciones planteadas por los investigadores no son un riesgo hipotético. Meta admitió en junio que los atacantes utilizaron una simple ingeniería social, no malware o herramientas de hacking, para engañar a su asistente de soporte de IA y obtener acceso no autorizado a cuentas de Instagram.

      Unsplash

      Los investigadores también esperaban que los ataques fueran más efectivos en idiomas con menos datos de entrenamiento disponibles. Sin embargo, encontraron que las tasas de finalización se mantuvieron aproximadamente consistentes en los siete idiomas probados. Encontraron una excepción, sin embargo: cambiar de idioma a mitad de un ataque de múltiples pasos hizo que las tasas de éxito aumentaran significativamente.

      El investigador principal Ayush Kumar Tarun argumenta que las pruebas de seguridad deben realizarse mucho antes, integradas en el diseño de un agente desde el principio. Añadirlo después de que algo salga mal ya no es suficiente, especialmente a medida que estos sistemas siguen ganando más capacidades en el mundo real.

      Manisha Priyadarshini es una escritora de tecnología y entretenimiento con más de nueve años de experiencia editorial.

      El asistente de IA de Meta finalmente llega a Mac, pero tiene mucho que ponerse al día

      El nuevo asistente de escritorio puede analizar lo que está visible en la pantalla y aceptar entradas de voz en macOS.

      Meta finalmente ha traído su asistente de IA Meta a Mac con una aplicación de escritorio dedicada, dando a los usuarios otro chatbot de IA para mantener abierto junto a todas esas otras pestañas. La aplicación puede analizar una ventana compartida, responder preguntas sobre lo que hay en la pantalla, generar contenido y aceptar dictado por voz en macOS.

      La IA de Meta puede ver lo que hay en la pantalla

      Leer más

      La nueva función de IA de Avec asegura que nunca más te pierdas una fecha límite

      Un deslizamiento es todo lo que se necesita para que Avec recuerde tus fechas límite de correo electrónico ahora

      Todos hemos estado allí. Una fecha límite se entierra en algún lugar de un largo hilo de correo electrónico, la vida se vuelve ocupada y, de repente, te encuentras pidiendo disculpas por un seguimiento perdido que olvidaste por completo. Avec, la aplicación de correo electrónico impulsada por IA construida en torno a gestos de deslizamiento y dictado por voz, acaba de lanzar una solución para este problema, y podría ser la adición más inteligente de la aplicación hasta ahora.

      Leer más

      Mi Mac nunca me dice a dónde va mi internet, así que encontré una aplicación que lo hace

      He estado usando una Mac durante mucho tiempo, y a lo largo de los años, me he vuelto bastante bueno para averiguar qué está mal cuando algo se siente raro. La mayoría de las veces, empiezo en la aplicación de Configuración. Investigo, cambio algunas cosas y generalmente encuentro lo que está causando el problema. El almacenamiento es un buen ejemplo. Recientemente noté que mi Mac se estaba ralentizando, abrí la sección de Almacenamiento y de inmediato obtuve un desglose claro de lo que estaba ocupando espacio. Después de una limpieza, liberé algo de almacenamiento muy necesario y todo se sintió normal nuevamente. He hecho algo similar al intentar averiguar el drenaje de la batería o un uso de CPU inusualmente alto. macOS te da muchos lugares para mirar cuando sabes que algo no está del todo bien.

      Sin embargo, hay una cosa que no hace tan obvia: a dónde va realmente todos tus datos de internet. Solo empecé a pensar en esto porque mi internet había estado actuando de manera extraña durante los últimos días. Las cosas se sentían más lentas de lo habitual y no podía averiguar por qué. Mi conexión parecía estar bien y no estaba descargando nada masivo, así que, ¿qué estaba consumiendo todo ese ancho de banda? Resulta que varias aplicaciones en mi Mac estaban usando internet en segundo plano, y no tenía idea. Probablemente no lo habría averiguado tampoco si no hubiera encontrado una aplicación de Mac que me mostrara exactamente lo que estaba sucediendo detrás de escena. Y ahí es donde las cosas se pusieron interesantes.

      Leer más

Los investigadores exponen un truco preocupantemente simple para hacer que los bots de IA se descontrolen y omitan la seguridad. Los investigadores exponen un truco preocupantemente simple para hacer que los bots de IA se descontrolen y omitan la seguridad. Los investigadores exponen un truco preocupantemente simple para hacer que los bots de IA se descontrolen y omitan la seguridad. Los investigadores exponen un truco preocupantemente simple para hacer que los bots de IA se descontrolen y omitan la seguridad. Los investigadores exponen un truco preocupantemente simple para hacer que los bots de IA se descontrolen y omitan la seguridad. Los investigadores exponen un truco preocupantemente simple para hacer que los bots de IA se descontrolen y omitan la seguridad. Los investigadores exponen un truco preocupantemente simple para hacer que los bots de IA se descontrolen y omitan la seguridad.

Otros artículos

Google está ofreciendo a los estudiantes universitarios un año gratis de AI Pro y una serie de herramientas de estudio. Google está ofreciendo a los estudiantes universitarios un año gratis de AI Pro y una serie de herramientas de estudio. Google está ofreciendo a los estudiantes universitarios elegibles de EE. UU. un año gratuito de AI Pro y lanzando nuevas herramientas de estudio en Search y Gemini para el regreso a clases. Google está ofreciendo a los estudiantes universitarios un año gratis de AI Pro y una serie de herramientas de estudio. Google está ofreciendo a los estudiantes universitarios un año gratis de AI Pro y una serie de herramientas de estudio. Google está ofreciendo a los estudiantes universitarios elegibles de EE. UU. un año gratuito de AI Pro y lanzando nuevas herramientas de estudio en Search y Gemini para el regreso a clases. Samsung aumentó los precios de la fundición hasta un 15%, siendo China el que paga más. Samsung aumentó los precios de la fundición hasta un 15%, siendo China el que paga más. Samsung ha aumentado sus precios de fabricación de chips avanzados en hasta un 15%, informa Reuters, ya que la demanda de IA llena la capacidad de TSMC. Los clientes chinos son los que más pagan. Amazon realmente, realmente quiere que las entregas con drones sean normales mientras se expande a 500 ciudades. Amazon realmente, realmente quiere que las entregas con drones sean normales mientras se expande a 500 ciudades. Amazon planea expandir la entrega de drones Prime Air a casi 500 ciudades para 2026, un aumento de seis veces, a pesar de los crecientes incidentes de seguridad y el escrutinio federal. Samsung aumentó los precios de fundición hasta un 15%, siendo China el que paga más. Samsung aumentó los precios de fundición hasta un 15%, siendo China el que paga más. Samsung ha aumentado sus precios de fabricación de chips avanzados hasta en un 15%, informa Reuters, ya que la demanda de IA llena la capacidad de TSMC. Los clientes chinos son los que más pagan. Los próximos CPUs para laptops de Intel podrían recibir una gran actualización de caché con Razor Lake. Los próximos CPUs para laptops de Intel podrían recibir una gran actualización de caché con Razor Lake. Los rumores sobre las CPU móviles Razor Lake de Intel podrían introducir bLLC para grupos de caché mucho más grandes, mientras que una afirmación temprana de fabricación ya ha pasado de TSMC N2X a la menos definida N2P V2.

Los investigadores exponen un truco preocupantemente simple para hacer que los bots de IA se descontrolen y omitan la seguridad.

Este nuevo estudio revela cómo la manipulación paciente, paso a paso, puede engañar a los agentes de IA para que ignoren sus propias reglas de seguridad.