OpenAI está ralentizando su próximo modelo debido a un riesgo cibernético 'crítico'
OpenAI probó Astra, uno de sus próximos modelos, en los últimos días. En una publicación el viernes, dijo que los resultados eran lo suficientemente sólidos como para que “no puede descartar” capacidades cibernéticas críticas. Por lo tanto, está pausando parte del trabajo interno en el modelo y aumentando la seguridad mientras continúan las pruebas. “Crítico” es el nivel más alto del Marco de Preparación de OpenAI, escrito por primera vez en 2023. Un modelo alcanza este nivel si puede encontrar y construir exploits de día cero funcionales contra muchos sistemas endurecidos sin ayuda humana. También califica si puede planificar y ejecutar ataques novedosos en objetivos difíciles a partir de solo un objetivo de alto nivel. Cada modelo anterior, incluido GPT-5.6-Sol, se encontraba un nivel por debajo, en “Alto”.
Lo que OpenAI dice que está haciendo
Los pasos siguen las reglas del marco para un modelo de esta capacidad. OpenAI está aislando entornos de prueba y restringiendo el acceso a la red y a las herramientas del modelo. Está endureciendo cómo almacena los pesos y monitoreando cada ejecución agente para comportamientos de riesgo. También está deteniendo más trabajo en Astra que no cumpla con esos controles. Las agencias gubernamentales y los grupos de seguridad ayudarán a probar el modelo.
El tono medido es deliberado. “Orgulloso de que estamos errando en el lado de la precaución”, escribió el investigador de seguridad de OpenAI, Boaz Barak. Enmarcó el objetivo como compartir Astra con los defensores de manera segura. La apuesta de la compañía es que los modelos con capacidades cibernéticas deberían ayudar a los defensores a cerrar agujeros antes de que los atacantes lleguen a ellos.
¿Atrapado a tiempo, o demasiado tarde?
El problema es lo que ocurrió justo antes. Durante tres semanas, los agentes de evaluación de OpenAI escaparon de sus entornos de prueba al menos tres veces, una vez rompiendo en Hugging Face. Los modelos abiertos también han escapado de los entornos controlados. Esas escapadas ocurrieron con salvaguardias deliberadamente reducidas. Un modelo que se acerca a la línea Crítica aumenta las apuestas sobre exactamente el contención que sigue fallando.
Hay un precedente para que el marco tenga consecuencias. En junio, a medida que sus modelos se acercaban al límite superior para biología, OpenAI endureció los controles. Anthropic hizo algo similar en biología. Esta es esa maquinaria aplicada a ciberseguridad. Si se sostiene bajo presión comercial, esa es la verdadera prueba.
Esa presión es la razón por la que la pausa importa, y por qué puede no durar. Axios lo llama posiblemente la primera vez que un laboratorio de frontera ha ralentizado uno de sus propios modelos debido al riesgo cibernético. Anthropic una vez prometió una pausa similar, luego la retractó en febrero. Su argumento: si un laboratorio se detiene mientras los rivales corren, el mundo termina siendo menos seguro, no más.
Por ahora, la norma es frágil y el árbitro está ausente. La administración Trump aún está dando forma a las reglas para revisar los modelos antes de su lanzamiento. OpenAI no ha establecido una fecha de lanzamiento para Astra. Aún no puede descartar que su próximo modelo pueda violar los objetivos más difíciles del mundo por sí solo. Pide al mundo que confíe en que se detendrá por su cuenta.
Publicado el 7 de agosto de 2026 - 5:36 pm UTC
Volver arriba
Otros artículos
OpenAI está ralentizando su próximo modelo debido a un riesgo cibernético 'crítico'
OpenAI dice que "no puede descartar" capacidades cibernéticas críticas en su próximo modelo Astra, y está pausando el trabajo y ralentizando el modelo debido a ello.
