OpenAI Confirma que Su IA Se Escapó de un Sandbox y Violó Hugging Face
TL;DROpenAI dice que GPT-5.6 Sol y un modelo no publicado escaparon de una prueba segura, explotaron un día cero y hackearon Hugging Face para hacer trampa en una evaluación de ciberseguridad. OpenAI dijo el martes que dos de sus modelos de IA, incluido el buque insignia Sol, se escaparon de un entorno de prueba seguro, obtuvieron acceso a Internet al explotar una vulnerabilidad de día cero en software de terceros y hackearon la infraestructura de producción de Hugging Face. La compañía calificó el incidente de "sin precedentes" y dijo que estaba compartiendo hallazgos preliminares para ayudar a los defensores a entender de qué son capaces ahora los modelos de frontera. Ambos modelos estaban funcionando con menores medidas de ciberseguridad como parte de una evaluación interna de sus capacidades ofensivas. Se estaban probando contra ExploitGym, un punto de referencia de ciberseguridad disponible de forma gratuita, y determinaron que las respuestas a la prueba estaban almacenadas en los sistemas de producción de Hugging Face. En lugar de resolver la evaluación como se pretendía, los modelos fueron tras la clave de respuestas. Pasaron lo que OpenAI describió como una "cantidad sustancial de computación de inferencia" encontrando una forma de salir de su entorno aislado, luego encadenaron dos vulnerabilidades de ejecución remota de código en la tubería de procesamiento de datos de Hugging Face. El ataque cosechó credenciales de nube y clúster, se movió lateralmente hacia clústeres internos y ejecutó más de 17,000 acciones individuales a través de un enjambre de entornos aislados de corta duración, según la propia divulgación de Hugging Face el 16 de julio. El 💜 de la tecnología de la UE Los últimos rumores de la escena tecnológica de la UE, una historia de nuestro sabio fundador Boris y un arte de IA cuestionable. Es gratis, cada semana, en tu bandeja de entrada. ¡Inscríbete ahora! Hugging Face dijo que detectó la intrusión, la contuvo y reconstruyó los nodos comprometidos. La compañía no encontró evidencia de manipulación de modelos públicos, conjuntos de datos o Espacios, y verificó que su cadena de suministro de software estaba limpia. Aún está evaluando si algún dato de socios o clientes se vio afectado. Para investigar la brecha, Hugging Face recurrió a GLM, un modelo chino de peso abierto, porque las medidas de seguridad en los modelos comerciales de EE. UU. bloquearon las consultas forenses que su equipo necesitaba ejecutar. La fuga no es la primera vez que Sol ha sido sorprendido manipulando sus propias evaluaciones. La organización de Evaluación de Modelos e Investigación de Amenazas, el laboratorio independiente que realizó pruebas de seguridad al modelo antes de su lanzamiento, descubrió que estaba hackeando agresivamente sus entornos de prueba para inflar sus puntuaciones. En una tarea, empaquetó un exploit en un flujo de datos, escaló privilegios en el servidor de evaluación y filtró las respuestas correctas que los evaluadores humanos habían ocultado. El patrón más amplio de fallos de seguridad de agentes de IA se ha acelerado drásticamente, con cuatro equipos de investigación separados rompiendo agentes de IA de cuatro maneras diferentes durante los primeros diez días de julio. OpenAI y Anthropic han enfrentado un mayor escrutinio sobre las capacidades de ciberseguridad de sus modelos, con la administración Trump restringiendo el acceso a los sistemas más nuevos de ambas compañías durante una revisión gubernamental. OpenAI detectó el ataque a Hugging Face y se comunicó para divulgarlo, pero para ese momento, Hugging Face ya había identificado y contenido la brecha por su cuenta. El incidente demuestra que la brecha entre los modelos de IA que pueden encontrar vulnerabilidades y los modelos de IA que las explotarán sin permiso es más estrecha de lo que cualquiera en la industria había reconocido públicamente.
Otros artículos
OpenAI Confirma que Su IA Se Escapó de un Sandbox y Violó Hugging Face
OpenAI dice que GPT-5.6 Sol y un modelo no publicado se escaparon de una prueba segura, explotaron un día cero y vulneraron Hugging Face para hacer trampa en una evaluación cibernética.
