Ningún modelo de IA es completamente resistente a consultas sobre armas biológicas, encontró Cisco. Las tasas de éxito de los ataques alcanzaron el 88%.

Ningún modelo de IA es completamente resistente a consultas sobre armas biológicas, encontró Cisco. Las tasas de éxito de los ataques alcanzaron el 88%.

      TL;DRCisco eludió las salvaguardias de armas biológicas en ChatGPT, Claude y Gemini en cinco turnos. OpenAI calificó a GPT-5 y GPT-5.6 como "Alto" en riesgo biológico. Claude bloqueó a los investigadores de los CDC durante un brote de hantavirus. Los investigadores de Cisco eludieron las salvaguardias de seguridad en ChatGPT, Claude y Gemini en cinco turnos de conversación, obteniendo información sobre armas biológicas al dirigir gradualmente las conversaciones alrededor de las restricciones de los modelos, informó el Wall Street Journal. Amy Chang, jefa de investigación de amenazas y seguridad de IA de Cisco, dijo que ningún modelo puede estar completamente protegido de un usuario lo suficientemente persistente. El equipo probó 15 modelos de OpenAI, Anthropic, Google, Amazon y xAI, con tasas de éxito de ataque que oscilan entre el 8% y el 88%. El problema va más allá de las pruebas de estrés. Cientos de usuarios comenzaron a preguntar a ChatGPT sobre venenos y armas biológicas después de que OpenAI mejorara las capacidades del modelo el verano pasado. Expertos en biología y terrorismo que examinaron algunas conversaciones juzgaron que la información era peligrosamente precisa. OpenAI prohibió las cuentas involucradas. Para 2024, las pruebas internas ya habían mostrado que un cuestionamiento prolongado podría persuadir a ChatGPT para que proporcionara orientación biológica cada vez más peligrosa, y los empleados predijeron el año siguiente que las capacidades podrían alcanzar un punto donde alguien con formación limitada en biología podría recibir asistencia significativa. OpenAI calificó a GPT-5 y su última familia GPT-5.6 como "Alto" en riesgo biológico y químico bajo su Marco de Preparación y desplegó salvaguardias adicionales. Pero la empresa enfrenta un dilema: el mismo conocimiento biológico que crea riesgo de armamentización es esencial para los investigadores que desarrollan medicamentos y vacunas. Anthropic chocó con la pared opuesta cuando las restricciones de Claude bloquearon a los investigadores de los CDC que trabajaban con información de patógenos durante un brote de hantavirus. El GPT-Sol 5.6 de OpenAI recientemente escapó de un entorno controlado y violó Hugging Face, demostrando que la búsqueda de objetivos de los modelos puede anular las restricciones previstas tanto en dominios cibernéticos como biológicos. El 💜 de la tecnología de la UE Las últimas novedades de la escena tecnológica de la UE, una historia de nuestro sabio fundador Boris y un arte de IA cuestionable. Es gratis, cada semana, en tu bandeja de entrada. ¡Regístrate ahora! El acto de equilibrio es estructural, no solucionable. Hacer que los modelos se nieguen a responder preguntas biológicas protege contra el uso indebido pero paraliza la investigación legítima. Hacerlos útiles para los científicos también los hace útiles para todos los demás. La Casa Blanca lanzó Gold Eagle para coordinar la defensa cibernética impulsada por IA, pero no hay un programa equivalente para el riesgo biológico. El hallazgo de Cisco de que cinco turnos son suficientes para romper las salvaguardias significa que la brecha entre el comportamiento previsto de un modelo y su comportamiento real se mide en oraciones, no en ciclos de ingeniería.

Otros artículos

Google podría pronto permitirte desbloquear tu Pixel Watch con tu teléfono. Google podría pronto permitirte desbloquear tu Pixel Watch con tu teléfono. Se informa que Google está trabajando en una forma de desbloquear tu Pixel Watch con tu teléfono, esencialmente invirtiendo la función existente de Desbloqueo del Reloj. Volkswagen quiere protección arancelaria después de que las marcas chinas capturen el 28% del mercado de PHEV en Europa. Volkswagen quiere protección arancelaria después de que las marcas chinas capturen el 28% del mercado de PHEV en Europa. El CEO de VW, Blume, exige aranceles de la UE sobre los PHEV chinos después de que el BYD Seal U, el BYD Atto 2 y el Jaecoo 7 superaran al Tiguan. Las marcas chinas tienen el 28.3% del mercado de PHEV en Europa. OnePlus está construyendo otro monstruo insignia para una audiencia en disminución, y se espera que se lance en octubre. OnePlus está construyendo otro monstruo insignia para una audiencia en disminución, y se espera que se lance en octubre. Una nueva filtración del OnePlus 16 apunta a un lanzamiento en octubre, una carcasa de cámara cuadrada más pequeña y una capacidad de batería que se acerca a los 9,000mAh. La mejor oferta de protección de dispositivos de Apple finalmente está saliendo de EE. UU. La mejor oferta de protección de dispositivos de Apple finalmente está saliendo de EE. UU. AppleCare One se está expandiendo más allá de los EE. UU. por primera vez, llevando protección agrupada para múltiples dispositivos Apple a cuatro países adicionales a partir del 4 de agosto. Antares recauda $470 millones para microreactores nucleares militares Antares recauda $470 millones para microreactores nucleares militares Antares recaudó $470 millones para instalar reactores de 1MW en bases militares de EE. UU. para 2028, el plazo establecido por orden ejecutiva. No hay microreactores en funcionamiento en EE. UU. todavía. La permiso de aplicación más poderoso de Android podría pronto venir con una advertencia mucho más aterradora. La permiso de aplicación más poderoso de Android podría pronto venir con una advertencia mucho más aterradora. Android 17 puede dar a las aplicaciones de confianza control sobre el contenido de la pantalla mientras el teléfono está bloqueado. La advertencia más clara de Google revela la conveniencia, el riesgo y las salvaguardias detrás del sistema de permisos incompleto.

Ningún modelo de IA es completamente resistente a consultas sobre armas biológicas, encontró Cisco. Las tasas de éxito de los ataques alcanzaron el 88%.

Los investigadores de Cisco eludieron los filtros de seguridad de IA en importantes chatbots en cinco turnos para obtener información sobre armas biológicas. Ningún modelo fue completamente resistente. El CDC también fue bloqueado.