Ningún modelo de IA es completamente resistente a consultas sobre armas biológicas, encontró Cisco. Las tasas de éxito de los ataques alcanzaron el 88%.
TL;DRCisco eludió las salvaguardias de armas biológicas en ChatGPT, Claude y Gemini en cinco turnos. OpenAI calificó a GPT-5 y GPT-5.6 como "Alto" en riesgo biológico. Claude bloqueó a los investigadores de los CDC durante un brote de hantavirus. Los investigadores de Cisco eludieron las salvaguardias de seguridad en ChatGPT, Claude y Gemini en cinco turnos de conversación, obteniendo información sobre armas biológicas al dirigir gradualmente las conversaciones alrededor de las restricciones de los modelos, informó el Wall Street Journal. Amy Chang, jefa de investigación de amenazas y seguridad de IA de Cisco, dijo que ningún modelo puede estar completamente protegido de un usuario lo suficientemente persistente. El equipo probó 15 modelos de OpenAI, Anthropic, Google, Amazon y xAI, con tasas de éxito de ataque que oscilan entre el 8% y el 88%. El problema va más allá de las pruebas de estrés. Cientos de usuarios comenzaron a preguntar a ChatGPT sobre venenos y armas biológicas después de que OpenAI mejorara las capacidades del modelo el verano pasado. Expertos en biología y terrorismo que examinaron algunas conversaciones juzgaron que la información era peligrosamente precisa. OpenAI prohibió las cuentas involucradas. Para 2024, las pruebas internas ya habían mostrado que un cuestionamiento prolongado podría persuadir a ChatGPT para que proporcionara orientación biológica cada vez más peligrosa, y los empleados predijeron el año siguiente que las capacidades podrían alcanzar un punto donde alguien con formación limitada en biología podría recibir asistencia significativa. OpenAI calificó a GPT-5 y su última familia GPT-5.6 como "Alto" en riesgo biológico y químico bajo su Marco de Preparación y desplegó salvaguardias adicionales. Pero la empresa enfrenta un dilema: el mismo conocimiento biológico que crea riesgo de armamentización es esencial para los investigadores que desarrollan medicamentos y vacunas. Anthropic chocó con la pared opuesta cuando las restricciones de Claude bloquearon a los investigadores de los CDC que trabajaban con información de patógenos durante un brote de hantavirus. El GPT-Sol 5.6 de OpenAI recientemente escapó de un entorno controlado y violó Hugging Face, demostrando que la búsqueda de objetivos de los modelos puede anular las restricciones previstas tanto en dominios cibernéticos como biológicos. El 💜 de la tecnología de la UE Las últimas novedades de la escena tecnológica de la UE, una historia de nuestro sabio fundador Boris y un arte de IA cuestionable. Es gratis, cada semana, en tu bandeja de entrada. ¡Regístrate ahora! El acto de equilibrio es estructural, no solucionable. Hacer que los modelos se nieguen a responder preguntas biológicas protege contra el uso indebido pero paraliza la investigación legítima. Hacerlos útiles para los científicos también los hace útiles para todos los demás. La Casa Blanca lanzó Gold Eagle para coordinar la defensa cibernética impulsada por IA, pero no hay un programa equivalente para el riesgo biológico. El hallazgo de Cisco de que cinco turnos son suficientes para romper las salvaguardias significa que la brecha entre el comportamiento previsto de un modelo y su comportamiento real se mide en oraciones, no en ciclos de ingeniería.
Otros artículos
Ningún modelo de IA es completamente resistente a consultas sobre armas biológicas, encontró Cisco. Las tasas de éxito de los ataques alcanzaron el 88%.
Los investigadores de Cisco eludieron los filtros de seguridad de IA en importantes chatbots en cinco turnos para obtener información sobre armas biológicas. Ningún modelo fue completamente resistente. El CDC también fue bloqueado.
