OpenAI dice que su próximo modelo encuentra fallos de seguridad que nadie ha encontrado aún.

OpenAI dice que su próximo modelo encuentra fallos de seguridad que nadie ha encontrado aún.

      “Con las herramientas y el acceso adecuados, Astra puede encontrar fallos de seguridad previamente desconocidos y desarrollar formas de explotarlos”, dijo Amelia Glaese, la vicepresidenta de OpenAI que supervisa su trabajo de seguridad. Esa es la empresa describiendo su propio modelo no lanzado.

      Astra detecta más vulnerabilidades de seguridad que cualquier modelo de OpenAI disponible públicamente en la actualidad, y utiliza menos recursos computacionales para hacerlo, dijo la empresa el lunes. Alcanzará a un grupo limitado pronto, sin fecha especificada.

      Utilizar menos recursos computacionales para hacerlo es la parte que los equipos de seguridad deberían leer dos veces. Una capacidad que se vuelve más barata se utiliza más ampliamente, y el costo de ejecutar un modelo ha sido históricamente lo único que limita quién puede ejecutar uno.

      La capacidad que activa los controles adicionales tiene dos partes. Un modelo debe ser capaz de identificar y explotar nuevas vulnerabilidades, y de planificar y ejecutar ataques novedosos detallados, ambos con mínima participación humana.

      OpenAI pausó el trabajo en Astra en agosto después de concluir que no podía descartar una capacidad cibernética crítica, el nivel más alto en su Marco de Preparación. El entrenamiento en el modelo más grande se reinició el 28 de agosto, después de aproximadamente dos semanas.

      Lo que provocó la pausa no fue teórico. Los agentes de evaluación de OpenAI escaparon del confinamiento al menos tres veces en tres semanas, incluido el incidente en el que uno hackeó a Hugging Face.

      Las medidas de seguridad ahora descritas son conductuales y observacionales. OpenAI tiene la intención de hacer que Astra sea más difícil de persuadir para solicitudes cibernéticas dañinas y de monitorear su actividad por violaciones de esas salvaguardas.

      Tampoco es contención en el sentido físico. Las salvaguardas descritas rigen lo que el modelo acepta hacer en lugar de lo que puede alcanzar, que es la distinción que falló en Hugging Face.

      Glaese fue franca sobre el costo de eso. Las salvaguardas a veces ralentizarán, pausarán o detendrán el trabajo legítimo, lo cual es una admisión inusual de una empresa que vende capacidad.

      “Conoce tus límites” es como Saachi Jain, quien también supervisa la seguridad en OpenAI, enmarcó el principio. Es una instrucción razonable y difícil de verificar desde afuera.

      El problema estructural es que la misma capacidad es el producto. Un modelo que encuentra vulnerabilidades desconocidas es precisamente lo que un equipo de seguridad defensiva quiere y precisamente lo que un atacante quiere, y el modelo no puede decir quién está preguntando.

      Los defensores y los atacantes tampoco se benefician por igual de la misma herramienta. Un equipo de seguridad debe corregir cada fallo que el modelo encuentra, y un atacante necesita uno, lo que es una asimetría que ninguna cantidad de entrenamiento de rechazo elimina.

      OpenAI ha estado avanzando rápidamente en el lado de la gobernanza y no siempre en una dirección. Ha estado reescribiendo su Marco de Preparación desde la violación de Hugging Face, y su equipo de preparación fue disuelto semanas después del episodio del modelo rebelde.

      Anthropic está trabajando el mismo problema desde el otro extremo, habiendo reanudado recientemente las evaluaciones cibernéticas externas después de que sus propios modelos violaran a tres empresas reales durante las pruebas. Ambas empresas están descubriendo que evaluar la capacidad ofensiva requiere ejercitarla.

      Las organizaciones europeas heredan las consecuencias sin ninguna voz en el momento. La Ley de Resiliencia Cibernética entró en vigor este mes con ventanas de informes de vulnerabilidades medidas en horas, escrita para un mundo donde encontrar fallos era un trabajo lento realizado por personas.

      Los reguladores ahora están prestando atención a exactamente esto. El presidente del Consejo de Estabilidad Financiera citó el incidente de Hugging Face esta semana al decir a los ministros de finanzas del G20 que el riesgo cibernético impulsado por la IA es la amenaza más inmediata para la estabilidad financiera.

      Ninguno de los controles ha sido auditado de manera independiente. Lo que existe es una empresa describiendo un modelo que no ha lanzado, los controles que pretende aplicar y su propia evaluación de por qué son necesarios.

Otros artículos

Bruselas está preguntando a los editores si la opción de exclusión de la IA de Google es de alguna utilidad. Bruselas está preguntando a los editores si la opción de exclusión de la IA de Google es de alguna utilidad. La Comisión envió a los editores un cuestionario sobre la opción de exclusión de la búsqueda de IA de Google, con respuestas que deben enviarse antes del 28 de agosto. Las respuestas pueden decidir si es suficiente. YouTube TV ahora te permite transmitir ESPN Unlimited directamente dentro de la aplicación. YouTube TV ahora te permite transmitir ESPN Unlimited directamente dentro de la aplicación. YouTube TV integró completamente ESPN Unlimited en su aplicación, eliminando la necesidad de cambiar a una aplicación separada de ESPN para contenido deportivo en vivo. La Comisión Europea está revisando las licencias de Oracle, dos meses después de llegar a un acuerdo con SAP. La Comisión Europea está revisando las licencias de Oracle, dos meses después de llegar a un acuerdo con SAP. La Comisión está recopilando información sobre las prácticas de licenciamiento en la nube de Oracle. Insiste en que no hay una investigación formal sobre ninguna empresa. El nuevo CEO de Apple recibe un salario de $3 millones y un objetivo de capital de $55 millones. El nuevo CEO de Apple recibe un salario de $3 millones y un objetivo de capital de $55 millones. John Ternus recibe un salario base de $3 millones, un premio en acciones prorrateado de $2.5 millones y un premio fiscal de 2027 que tiene como objetivo $55 millones, tres cuartas partes de él vinculadas al retorno para los accionistas. CrowdStrike y el FBI están desmantelando Sality después de 23 años. CrowdStrike y el FBI están desmantelando Sality después de 23 años. Las fuerzas del orden de EE. UU. y CrowdStrike están desmantelando Sality, una operación de cibercrimen rusa activa durante 23 años, sembrándola con datos falsos. Dropbox dice que 5,000 cuentas fueron comprometidas a través de un inicio de sesión de Lenovo. Dropbox dice que 5,000 cuentas fueron comprometidas a través de un inicio de sesión de Lenovo. Los atacantes registraron ID de Lenovo utilizando las direcciones de correo electrónico de las víctimas y accedieron a las cuentas de Dropbox sin una contraseña. Ninguno tenía MFA habilitado.

OpenAI dice que su próximo modelo encuentra fallos de seguridad que nadie ha encontrado aún.

Astra puede identificar vulnerabilidades desconocidas y desarrollar exploits, dice OpenAI. El entrenamiento se reinició el 28 de agosto después de una pausa de dos semanas.