La IA de peso abierto capturó la frontera. La seguridad no.
Los modelos de IA de peso abierto casi han alcanzado la frontera en capacidad. En cuanto a la seguridad, no lo han hecho. Y una vez que los pesos son públicos, ningún laboratorio puede hacer cumplir una barrera de protección. Una nueva evaluación del modelo abierto líder de China hace que la brecha sea concreta.
GLM-5.2, el modelo de peso abierto de Z.ai de China, está solo unos meses detrás del GPT-5.5 de OpenAI y del Claude Opus 4.7 de Anthropic en tareas cibernéticas y biológicas, informó TechCrunch, citando a la organización sin fines de lucro SaferAI. Pero no rechazó ninguna de las tareas de ciberofensiva o biología de doble uso que se le asignaron. Claude Opus 4.7, en contraste, se negó de manera tan consistente que SaferAI no pudo completar el estándar cibernético en él en absoluto.
“La frontera de la capacidad no es la frontera del riesgo”, dijo Henry Papadatos de SaferAI, por lo que las salvaguardas importan tanto como el modelo. Z.ai puede proteger su propio servicio alojado. Esas protecciones desaparecen en el momento en que alguien ejecuta los pesos en su propio hardware, donde cualquier salvaguarda puede ser eliminada. Este es el riesgo del que los críticos de los modelos abiertos han advertido durante años.
Los modelos cerrados tampoco son herméticos. La organización sin fines de lucro Far.ai encontró cientos de jailbreaks universales en Grok 4.5 de xAI y Gemini 3.1 Pro de Google. La diferencia es que un laboratorio cerrado puede parchear un modelo con jailbreak. Los pesos abiertos no pueden ser retirados una vez que están fuera.
Reincorporando la seguridad
Así que la industria está tratando de agregar barreras de protección desde el exterior. En la misma semana, Mistral lanzó Shieldstral, un pequeño clasificador de peso abierto que filtra texto e imágenes contra reglas de lenguaje sencillo y, dice, iguala modelos siete veces su tamaño. Cisco lanzó Antares, modelos de peso abierto que buscan vulnerabilidades enterradas en el código. Herramientas de peso abierto, construidas para el riesgo de peso abierto.
La apertura tiene sus pros y sus contras, argumentan sus defensores. Hugging Face utilizó GLM-5.2 para ayudar a defenderse durante la violación de OpenAI. Su director, Clem Delangue, dice que los sistemas que detienen un ataque pueden defenderse de millones más. Papadatos considera que eso está exagerado. La industria “no debería abrir el código de capacidades peligrosas”, dice, y los atacantes se mueven más rápido que los defensores: un grupo de ransomware cambia de táctica en una semana, un hospital no puede.
Un punto ciego en la gobernanza
Las reglas no se ajustan al problema. El nuevo marco voluntario de la Casa Blanca revisa ciertos modelos fronterizos cerrados por riesgo cibernético. Pero, según se informa, hasta ahora no cubre modelos de código abierto. Anthropic, que antes se centraba en el robo de propiedad intelectual, ha cambiado a nombrar la seguridad como su principal preocupación sobre los pesos abiertos. Z.ai no publicó ningún marco de seguridad para GLM-5.2 y no respondió a las preguntas de TechCrunch.
China no está ignorando el riesgo, pero apunta a otros lugares. Xi Jinping ha respaldado los pesos abiertos mientras enfatiza el “control humano” sobre la IA. Sus reglas, señala Graham Webster de Stanford, apuntan más al contenido político y la estabilidad social que al mal uso cibernético o biológico catastrófico.
La carrera de capacidades está casi resuelta: lo abierto está cerca y es mucho más barato. La carrera de seguridad no lo está, y la IA ya está aprendiendo a atacar así como a defender. La parte difícil es asegurarse de que solo la defensa sea fácil de descargar.
Otros artículos
La IA de peso abierto capturó la frontera. La seguridad no.
Un informe de SaferAI encontró que el GLM-5.2 de China no rechazó ninguna tarea cibernética o biológica. Los pesos abiertos han alcanzado la frontera en capacidad, no en seguridad.
