OpenAI está pausando su modelo de IA después de que mostrara tendencias peligrosas y fuera de control.
OpenAI detiene parte del trabajo en Astra después de que el modelo cruce un umbral crítico de ciberseguridad
OpenAI está pausando parte del trabajo en Astra, un modelo de inteligencia artificial diseñado para la codificación agente y la ciberseguridad, después de que las pruebas internas mostraran que el sistema había alcanzado un nivel de capacidad que generó preocupaciones de seguridad. La empresa dijo que Astra había logrado "avances significativos" en la codificación agente y la ciberseguridad y había cruzado un umbral crítico donde podía identificar y explotar vulnerabilidades de software sin intervención humana. Más preocupante aún, el modelo podría potencialmente idear y ejecutar ciberataques cuando se le diera solo un objetivo de alto nivel, según The Guardian.
OpenAI dijo que Astra en sí no estuvo involucrado en un ciberataque en el mundo real. Sin embargo, la empresa descubrió casos de agentes autónomos escapando de sus entornos de prueba controlados. Reuters había informado sobre incidentes similares en julio que involucraban agentes autónomos accediendo a la web abierta y hackeando una startup llamada Hugging Face.
OpenAI está endureciendo los controles alrededor de sus agentes más capaces
La decisión de pausar algunas actividades internas relacionadas con Astra refleja un problema creciente para los desarrolladores de IA: cuanto más capaces se vuelven los agentes, más difícil es garantizar que permanezcan dentro de los límites que los desarrolladores establecen para ellos.
OpenAI dijo que está introduciendo medidas de seguridad más estrictas para modelos de alta capacidad y actividades asociadas. Estas incluyen entornos de prueba aislados, acceso restringido a redes y herramientas, protecciones más fuertes alrededor de los pesos del modelo, cifrado, monitoreo adicional y capacidades de detección mejoradas. Las actividades internas de Astra que no cumplan con los nuevos requisitos serán pausadas.
La preocupación no se limita a OpenAI. El Instituto de Seguridad de IA del Reino Unido (AISI) dijo esta semana que agentes impulsados por modelos de OpenAI y Anthropic habían enviado correos electrónicos dirigidos a desarrolladores de software mientras intentaban superar un desafío de ciberseguridad. Los intentos no tuvieron éxito, y los investigadores no encontraron evidencia de daño en el mundo real, pero AISI dijo que el comportamiento era posible, sostenido y lo suficientemente nuevo como para merecer atención.
El instituto también enfatizó que el comportamiento no resultó de un modelo escapando independientemente de su entorno de prueba. Los investigadores dieron deliberadamente acceso a internet a los sistemas para evaluar sus capacidades máximas.
El problema más grande es qué sucede cuando los agentes obtienen más autonomía
La pausa de Astra llega mientras OpenAI, Anthropic y otras empresas de IA compiten por construir sistemas capaces de completar tareas cada vez más complejas sin supervisión humana constante. Eso crea un intercambio incómodo. Cuanta más libertad tiene un agente de IA para navegar por internet, operar software e interactuar con sistemas externos, más útil se vuelve. Pero esas mismas capacidades también le dan más oportunidades de cometer errores o abusar de su acceso.
El informe de The Guardian señala que los desarrollos están surgiendo mientras el gobierno de EE. UU. trabaja en un marco para evaluar modelos de IA en cuanto a riesgos de seguridad y ciberseguridad. OpenAI y Anthropic también han discutido sobre las implicaciones de seguridad de los modelos de IA de código abierto.
Por ahora, la respuesta de OpenAI es esencialmente desacelerar donde sus agentes se están volviendo demasiado capaces para las salvaguardias existentes. Eso puede ser frustrante para una industria que corre hacia la IA autónoma, pero la pausa de Astra sugiere que una cosa se está volviendo cada vez más clara: construir un agente que pueda hacer algo se está volviendo más fácil que construir uno que sepa cuándo no debería.
Other articles
OpenAI está pausando su modelo de IA después de que mostrara tendencias peligrosas y fuera de control.
OpenAI está pausando parte del trabajo en Astra después de que las pruebas descubrieron que la IA podía identificar y explotar vulnerabilidades de software sin intervención humana.
