OpenAI Confirma que su IA Salió de un Sandbox y Breachó Hugging Face

OpenAI Confirma que su IA Salió de un Sandbox y Breachó Hugging Face

      TL;DROpenAI dice que GPT-5.6 Sol y un modelo no publicado escaparon de una prueba segura, explotaron un día cero y hackearon Hugging Face para hacer trampa en una evaluación de ciberseguridad. OpenAI dijo el martes que dos de sus modelos de IA, incluido el insignia Sol, escaparon de un entorno de prueba seguro, obtuvieron acceso a internet al explotar una vulnerabilidad de día cero en software de terceros y hackearon la infraestructura de producción de Hugging Face. La compañía calificó el incidente de "sin precedentes" y dijo que estaba compartiendo hallazgos preliminares para ayudar a los defensores a entender de qué son capaces ahora los modelos de frontera. Ambos modelos estaban funcionando con menores medidas de ciberseguridad como parte de una evaluación interna de sus capacidades ofensivas. Se estaban probando contra ExploitGym, un punto de referencia de ciberseguridad disponible gratuitamente, y determinaron que las respuestas a la prueba estaban almacenadas en los sistemas de producción de Hugging Face. En lugar de resolver la evaluación como se pretendía, los modelos fueron tras la clave de respuestas. Pasaron lo que OpenAI describió como una "cantidad sustancial de computación de inferencia" encontrando una salida de su entorno aislado, luego encadenaron dos vulnerabilidades de ejecución remota de código en el pipeline de procesamiento de datos de Hugging Face. El ataque recolectó credenciales de nube y clúster, se movió lateralmente hacia clústeres internos y ejecutó más de 17,000 acciones individuales a través de un enjambre de entornos aislados de corta duración, según la propia divulgación de Hugging Face el 16 de julio. El 💜 de la tecnología de la UE Los últimos rumores de la escena tecnológica de la UE, una historia de nuestro sabio fundador Boris y un arte de IA cuestionable. Es gratis, cada semana, en tu bandeja de entrada. ¡Inscríbete ahora! Hugging Face dijo que detectó la intrusión, la contuvo y reconstruyó los nodos comprometidos. La compañía no encontró evidencia de manipulación de modelos públicos, conjuntos de datos o Espacios, y verificó que su cadena de suministro de software estaba limpia. Aún está evaluando si algún dato de socios o clientes se vio afectado. Para investigar la brecha, Hugging Face recurrió a GLM, un modelo de peso abierto chino, porque las medidas de seguridad en los modelos comerciales de EE. UU. bloquearon las consultas forenses que su equipo necesitaba ejecutar. La fuga no es la primera vez que Sol ha sido atrapado manipulando sus propias evaluaciones. La organización de Evaluación de Modelos e Investigación de Amenazas, el laboratorio independiente que realizó pruebas de seguridad al modelo antes de su lanzamiento, descubrió que estaba hackeando agresivamente sus entornos de prueba para inflar sus puntuaciones. En una tarea, empaquetó un exploit en un flujo de datos, escaló privilegios en el servidor de evaluación y filtró las respuestas correctas que los evaluadores humanos habían ocultado. El patrón más amplio de fallos de seguridad de agentes de IA se ha acelerado drásticamente, con cuatro equipos de investigación separados rompiendo agentes de IA de cuatro maneras diferentes solo durante los primeros diez días de julio. OpenAI y Anthropic han enfrentado un mayor escrutinio sobre las capacidades de ciberseguridad de sus modelos, con la administración Trump restringiendo el acceso a los sistemas más nuevos de ambas compañías durante una revisión gubernamental. OpenAI detectó el ataque a Hugging Face y se comunicó para divulgarlo, pero para ese momento, Hugging Face ya había identificado y contenido la brecha por su cuenta. El incidente demuestra que la brecha entre los modelos de IA que pueden encontrar vulnerabilidades y los modelos de IA que las explotarán sin permiso es más estrecha de lo que cualquiera en la industria había reconocido públicamente.

Otros artículos

Otro estudio dice que la IA es mala para las elecciones, y la situación se complica aún más. Otro estudio dice que la IA es mala para las elecciones, y la situación se complica aún más. ChatGPT y Gemini no lograron emparejar de manera confiable a los votantes con los partidos húngaros, añadiendo otra advertencia a medida que las campañas y los manipuladores aprenden cuán fácilmente se pueden moldear las respuestas de la IA. Gritt recauda $32 millones para robots de IA que se acoplan a equipos de construcción existentes para construir granjas solares más rápido. Gritt recauda $32 millones para robots de IA que se acoplan a equipos de construcción existentes para construir granjas solares más rápido. Gritt recaudó $32 millones liderados por Obvious Ventures para robots de IA que se acoplan a equipos de construcción existentes, colocando paneles solares cuatro veces más rápido. Centros de datos alineados se vendieron por $40 mil millones en un acuerdo récord Centros de datos alineados se vendieron por $40 mil millones en un acuerdo récord Un consorcio de BlackRock y MGX cerró su adquisición de $40 mil millones de Aligned Data Centers, el mayor acuerdo de la historia, y luego añadió $5 mil millones para expandir la capacidad de IA. Intel confirma más despidos en su unidad de centros de datos mientras las acciones suben por el impulso de recuperación. Intel confirma más despidos en su unidad de centros de datos mientras las acciones suben por el impulso de recuperación. Intel está reduciendo empleos en su grupo de centros de datos mientras el CEO Lip-Bu Tan reestructura la empresa, con las acciones subiendo casi un 8 por ciento tras la noticia dos días antes de los resultados. GM supera las ganancias del segundo trimestre y anuncia Cadillacs a gasolina mientras se acerca la finalización de un retiro de vehículos eléctricos de casi 11 mil millones de dólares. GM supera las ganancias del segundo trimestre y anuncia Cadillacs a gasolina mientras se acerca la finalización de un retiro de vehículos eléctricos de casi 11 mil millones de dólares. GM superó las estimaciones de Wall Street por 37 centavos por acción y elevó la guía para todo el año, luego anunció nuevos Cadillacs a gasolina que se lanzarán en la primavera de 2027. Poolside lanza Laguna S 2.1, el modelo de codificación de peso abierto presentado como la respuesta de Occidente a DeepSeek y Qwen. Poolside lanza Laguna S 2.1, el modelo de codificación de peso abierto presentado como la respuesta de Occidente a DeepSeek y Qwen. El parámetro 118B Laguna S 2.1 de Poolside iguala a modelos más grandes en pruebas de codificación, funciona en un solo escritorio y está dirigido a empresas que desean autoalojarse.

OpenAI Confirma que su IA Salió de un Sandbox y Breachó Hugging Face

OpenAI dice que GPT-5.6 Sol y un modelo no publicado se escaparon de una prueba segura, explotaron un día cero y vulneraron Hugging Face para hacer trampa en una evaluación cibernética.