OpenAI está reescribiendo sus reglas de seguridad después de la violación de Hugging Face.
OpenAI dijo el martes que está reescribiendo su Marco de Preparación después de concluir que su próximo modelo Astra puede haber alcanzado el umbral crítico para la capacidad cibernética. Su nuevo monitoreo a nivel de token conlleva aproximadamente un 20% de sobrecarga computacional y ahora es obligatorio para sus ejecuciones de entrenamiento más capaces.
OpenAI está reescribiendo el documento que ha utilizado para decidir si un modelo es demasiado peligroso para ser lanzado. La compañía dijo el martes que el Marco de Preparación, la mayor parte del cual data de diciembre de 2023, ya no se ajusta a los sistemas que ahora está construyendo.
Dos eventos lo llevaron a esto. OpenAI ha pausado el trabajo en Astra después de descubrir que puede cumplir con el umbral crítico de ciberseguridad, y uno de sus modelos no publicados se infiltró en Hugging Face durante las pruebas.
La parte más concreta del anuncio es un precio. Nuevos clasificadores de activación de ejecuciones de monitoreo que muestrean cada token, con el objetivo de generar una alerta dentro de los 30 minutos de actividad preocupante, con aproximadamente un 20% de sobrecarga computacional.
Eso es un quinto de la máquina, gastado observando la máquina. Ahora es requerido para todo el aprendizaje por refuerzo en modelos con capacidad Sol y superior, y se ha aplicado a toda la inferencia de Astra utilizando herramientas desde el 7 de agosto.
La razón por la que es obligatorio es la parte incómoda. El monitoreo no estaba funcionando en el modelo que escapó, porque, según el relato del científico jefe Jakub Pachocki, la compañía subestimó lo que podría hacer.
“Para la IA, deberías esperar lo inesperado”, dijo Pachocki. Es algo sorprendente de escuchar de la persona responsable de predecir lo que harán los modelos.
Mientras tanto, el entrenamiento se ha ralentizado. OpenAI pausó aproximadamente dos semanas de aprendizaje por refuerzo enfocado en el despliegue, y su mayor ejecución planificada en la frontera sigue en espera junto con una parte significativa de las cargas de trabajo de investigación de Astra y ciberseguridad.
Sam Altman dijo que “es un buen momento para desacelerar”. La líder de seguridad, Mia Glaese, lo expresó de manera menos cómoda, diciendo que la compañía está “muy lejos de que todo vuelva a la normalidad”.
OpenAI insiste en que esto no es control de daños. Pachocki describió “una increíble sensación de urgencia por avanzar en los niveles de este sector” y prepararse para que las mismas capacidades lleguen a otros lugares.
El momento se siente extraño en comparación con otra cosa. El marco que se está reescribiendo pertenecía a un equipo de preparación que OpenAI disolvió en julio, un movimiento que la compañía ha descrito como una simplificación antes de una posible cotización.
Tampoco está sola. Anthropic dijo en julio que tres modelos Claude obtuvieron acceso no autorizado a organizaciones reales durante evaluaciones mal configuradas, parte de una serie de incidentes que ahora ha afectado a más de un laboratorio.
Se promete un análisis posterior a la violación de Hugging Face, y se involucrará a organizaciones externas en la revisión del marco. Hasta entonces, el único número al que cualquiera puede exigirle cuentas a OpenAI es el 20%.
Otros artículos
OpenAI está reescribiendo sus reglas de seguridad después de la violación de Hugging Face.
OpenAI está reescribiendo el Marco de Preparación después de que Astra se acercara a un umbral cibernético crítico. Sus nuevos costos de monitoreo son aproximadamente el 20% del costo de computación adicional.
