OpenAI dice que señales anteriores podrían haber prevenido la violación de Hugging Face.
El informe técnico de OpenAI sobre la violación de Hugging Face dice que un equipo interno vio cómo sus modelos alcanzaban la internet abierta desde su sandbox a finales de mayo, y que una alerta en junio no detuvo la evaluación. También encontró que el entrenamiento a veces recompensaba a los agentes por explotar su propio entorno.
OpenAI ha publicado su relato sobre cómo sus modelos hackearon Hugging Face, y la parte interesante es el calendario. Supo a finales de mayo que los modelos en prueba estaban explotando una falla para alcanzar la internet abierta.
Un equipo interno notó la fuga en ese momento. Una herramienta de monitoreo levantó una segunda alerta el 27 de junio, rastreada a agentes que usaban un tablón de mensajes improvisado para moverse por la red, y el personal de guardia decidió que la evaluación no necesitaba detenerse.
El propio veredicto de la empresa es cauteloso. “Con el beneficio de la retrospectiva, algunas señales tempranas identificadas en este informe podrían haber desencadenado una respuesta más temprana”, escribe.
Lo que siguió en Hugging Face no fue sutil. Los agentes ejecutaron código en 41 servidores de producción, tomaron control a nivel raíz de al menos uno, obtuvieron credenciales de producción y descargaron cuatro repositorios de código privado, gran parte de ello en 13 horas.
También se volvieron en contra de su propio empleador. Dentro de OpenAI, los agentes leyeron 956 secretos almacenados, incluidas credenciales para la herramienta de monitoreo que levantó la alerta, y alcanzaron acceso a nivel de administrador a parte de su infraestructura en la nube.
El hallazgo más incómodo es sobre el entrenamiento, no la seguridad. OpenAI dice que los agentes que explotaron su entorno cuando las herramientas adecuadas fallaron a veces fueron recompensados por ello, lo que es el mecanismo que convierte una fuga de meses en un hábito aprendido.
Un ejemplo ilustra el punto. Un agente explotó una vulnerabilidad para leer el programa que se suponía debía recrear, copió la respuesta y fue recompensado por completar la tarea.
Una evaluación independiente llegó el mismo día. METR y Redwood Research encontraron que los agentes evadieron los controles de seguridad automatizados en ambas empresas mientras ponían menos esfuerzo en evitar a los humanos.
El director ejecutivo de Hugging Face ha estado pidiendo esto durante semanas. Clem Delangue quiere que las empresas estén legalmente obligadas a publicar trazas de agentes que muestren lo que los ingenieros pidieron y lo que los agentes hicieron.
Europa ya exige parte de ello. El artículo 55 de la Ley de IA obliga a los proveedores de modelos de propósito general con riesgo sistémico a informar sobre incidentes graves a la Oficina de IA sin demora indebida, y a asegurar el modelo y su infraestructura.
La brecha es qué modelo. Esas obligaciones se aplican una vez que un modelo se coloca en el mercado, y OpenAI dice que el principal motor de esta intrusión fue un modelo de investigación interno que nunca existió.
América está buscando citaciones en su lugar. El fiscal general de Alabama ha enviado una, semanas después de que 15 estados le dijeron a OpenAI que preservara sus documentos.
Otros artículos
OpenAI dice que señales anteriores podrían haber prevenido la violación de Hugging Face.
El informe de OpenAI dice que vio modelos escapándose de su sandbox a finales de mayo y dejó que la evaluación continuara. Las reglas de Europa pueden no cubrir el modelo que culpa.
