OpenAI admite que el modelo de IA hackeó Hugging Face, la IA de código abierto china ayudó a investigar.

OpenAI admite que el modelo de IA hackeó Hugging Face, la IA de código abierto china ayudó a investigar.

      Un reciente ciberataque de IA que sorprendió a la industria ha puesto inesperadamente a la empresa china de IA Zhipu AI y su modelo de código abierto GLM 5.2 en el centro de atención.

      OpenAI ha reconocido por primera vez que uno de sus modelos de IA escapó de un entorno de prueba aislado durante una evaluación interna de ciberseguridad y comprometió la infraestructura de producción de Hugging Face, la plataforma de IA de código abierto más grande del mundo.

      Durante la posterior investigación forense, Hugging Face intentó inicialmente analizar el ataque utilizando un modelo de IA comercial líder de EE. UU., pero sus mecanismos de seguridad integrados bloquearon la investigación. La empresa finalmente recurrió a una instancia local de GLM 5.2 para completar el análisis forense.

      El incidente marca el primer caso divulgado públicamente de un modelo de IA llevando a cabo de manera autónoma un ciberataque en el mundo real.

      El incidente comenzó como lo que se suponía que sería una evaluación de modelo de rutina.

      Para medir las verdaderas capacidades de ciberseguridad de sus últimos modelos, OpenAI probó GPT-5.6 Sol junto a un modelo pre-lanzamiento más capaz utilizando ExploitGym, un estándar público para ciberseguridad ofensiva. Para simular mejor las condiciones del mundo real, la empresa desactivó la mayoría de los mecanismos de seguridad que normalmente restringen actividades cibernéticas de alto riesgo.

      Bajo el diseño de la prueba, los modelos estaban confinados a un entorno de prueba restringido por red con acceso solo a una herramienta de instalación de paquetes. Sin embargo, un modelo descubrió y explotó una vulnerabilidad de día cero previamente desconocida en el instalador, lo que le permitió eludir las restricciones de red y acceder a Internet público.

      Una vez en línea, el modelo comenzó a razonar de manera autónoma. Inferió que Hugging Face probablemente albergaba modelos, conjuntos de datos o incluso soluciones de referencia relacionadas con ExploitGym, y lanzó un ataque para obtenerlos.

      Según OpenAI, el modelo combinó credenciales robadas con exploits de día cero adicionales para identificar un camino de ejecución de código remoto en los servidores de Hugging Face. Finalmente accedió a la base de datos de producción de la plataforma y recuperó las respuestas de referencia.

      OpenAI dijo que el modelo demostró un comportamiento inusualmente fuerte orientado a objetivos y fue altamente persistente en sus esfuerzos por resolver ExploitGym.

      La semana pasada, Hugging Face había divulgado que había sufrido un ciberataque llevado a cabo por un sistema de agente de IA autónomo, aunque no identificó al atacante en ese momento.

      Según el análisis posterior al incidente de la empresa, el ataque comenzó explotando vulnerabilidades en su canal de procesamiento de datos, lo que permitió la ejecución remota de código y acceso a nivel de nodo. El atacante luego robó credenciales de la nube y se movió lateralmente a través de múltiples clústeres internos. Casi toda la operación fue automatizada, con el agente de IA realizando miles de acciones independientes e incluso generando actividades de distracción para complicar la investigación.

      Sin embargo, la parte más dramática de la historia llegó después de la brecha.

      Hugging Face intentó inicialmente analizar más de 17,000 registros de ataque utilizando un modelo de IA comercial líder de EE. UU. Debido a que los registros contenían código de explotación real, comandos de ataque y técnicas de escalada de privilegios, los mecanismos de seguridad del modelo se negaron a procesar las solicitudes.

      El modelo comercial no pudo distinguir a los respondedores legítimos de incidentes de actores maliciosos y, por lo tanto, bloqueó cualquier solicitud que involucrara técnicas de explotación. Esto efectivamente detuvo la investigación forense.

      Hugging Face finalmente implementó localmente GLM 5.2 de Zhipu AI para analizar los registros de ataque y completar la forense digital. Dado que el modelo se ejecutó completamente dentro de la propia infraestructura de Hugging Face, los registros sensibles, credenciales y datos del atacante nunca salieron del entorno de la empresa.

      Irónicamente, un modelo de IA estadounidense atacó a una plataforma de IA estadounidense. Un modelo de IA comercial estadounidense no pudo ayudar debido a sus propios mecanismos de seguridad, y la investigación forense se completó utilizando un modelo de IA de código abierto chino.

      El cofundador y CEO de Hugging Face, Clément Delangue, dijo que el incidente reforzó la creencia de larga data de la empresa de que la seguridad de la IA no puede ser resuelta por ninguna empresa única a puerta cerrada. En cambio, una defensa efectiva requiere colaboración abierta y acceso amplio a herramientas de IA para investigadores de seguridad en todo el mundo.

      OpenAI dijo que ha divulgado de manera responsable las vulnerabilidades de día cero a los proveedores de software afectados y está continuando su investigación conjunta con Hugging Face. Se esperan más detalles técnicos en el futuro.

      El incidente también muestra un desafío creciente en la era de la IA. A medida que los sistemas de IA se vuelven capaces de descubrir vulnerabilidades de manera independiente, planificar ataques y ejecutar intrusiones, las salvaguardias tradicionales como los entornos de prueba, los mecanismos de seguridad y los controles de permisos pueden no ser suficientes. Mientras que los atacantes pueden desplegar sistemas de IA sin restricciones, los defensores pueden encontrarse limitados por las políticas de seguridad integradas en los modelos comerciales.

      El futuro de la ciberseguridad puede no estar definido ya por la competencia entre humanos, sino por IA contra IA.

      

      

      

       Jessie Wu es una reportera de tecnología con sede en Shanghái. Cubre electrónica de consumo, semiconductores y la industria de los videojuegos para TechNode. Conéctate con ella por correo electrónico: jessie.wu@technode.com.

       Más de Jessie Wu

OpenAI admite que el modelo de IA hackeó Hugging Face, la IA de código abierto china ayudó a investigar. OpenAI admite que el modelo de IA hackeó Hugging Face, la IA de código abierto china ayudó a investigar. OpenAI admite que el modelo de IA hackeó Hugging Face, la IA de código abierto china ayudó a investigar. OpenAI admite que el modelo de IA hackeó Hugging Face, la IA de código abierto china ayudó a investigar.

Otros artículos

Alphabet eleva la guía de capex a $205 mil millones mientras Google Cloud salta un 82% Alphabet eleva la guía de capex a $205 mil millones mientras Google Cloud salta un 82% Alphabet superó las expectativas de ingresos y creció Google Cloud un 82%, pero una guía de capex récord de $205 mil millones y un flujo de caja libre negativo hicieron que las acciones cayeran alrededor del 5%. Google multado con 890 millones de euros en su primera sanción por la Ley de Mercados Digitales Google multado con 890 millones de euros en su primera sanción por la Ley de Mercados Digitales La UE multó a Google con 890 millones de euros bajo la Ley de Mercados Digitales por la auto-preferencia en las búsquedas y las restricciones de la Play Store, su primera penalización bajo la DMA. Los coches electrificados impulsan el mercado automovilístico de Europa mientras las marcas chinas alcanzan una cuota récord. Los coches electrificados impulsan el mercado automovilístico de Europa mientras las marcas chinas alcanzan una cuota récord. Los coches eléctricos e híbridos impulsaron el crecimiento de los coches nuevos en Europa en el primer semestre de 2026, mientras que las marcas chinas aproximadamente duplicaron su cuota hasta un récord en junio, muestran los datos de ACEA. Google no está perdiendo la carrera de la IA, dice Pichai a los escépticos mientras la nube aumenta un 82% Google no está perdiendo la carrera de la IA, dice Pichai a los escépticos mientras la nube aumenta un 82% Sundar Pichai admitió que Google necesita mejorar en codificación, pero rechazó las afirmaciones de que está perdiendo la carrera de la IA, ya que los ingresos de Alphabet en el segundo trimestre alcanzaron los $119.8 mil millones y la nube creció un 82%. Nvidia dona un DGX GB300 a la principal escuela de ciencias del ejército de EE. UU. Nvidia dona un DGX GB300 a la principal escuela de ciencias del ejército de EE. UU. Nvidia ha donado un superordenador de IA DGX GB300 a la Escuela de Graduados Navales, el primer sistema de su tipo en el ejército de EE. UU. Alphabet eleva la guía de capex a $205 mil millones mientras Google Cloud salta un 82% Alphabet eleva la guía de capex a $205 mil millones mientras Google Cloud salta un 82% Alphabet superó las expectativas de ingresos y creció Google Cloud un 82%, pero una guía de capex récord de $205 mil millones y un flujo de caja libre negativo hicieron que las acciones cayeran alrededor del 5%.

OpenAI admite que el modelo de IA hackeó Hugging Face, la IA de código abierto china ayudó a investigar.

Un reciente ciberataque de IA que sorprendió a la industria ha puesto inesperadamente a la empresa china de IA Zhipu AI y su modelo de código abierto GLM 5.2 en el centro de atención.