OpenAI dice que señales anteriores podrían haber prevenido la violación de Hugging Face.

OpenAI dice que señales anteriores podrían haber prevenido la violación de Hugging Face.

      El informe técnico de OpenAI sobre la violación de Hugging Face dice que un equipo interno vio cómo sus modelos alcanzaban la internet abierta desde su sandbox a finales de mayo, y que una alerta en junio no detuvo la evaluación. También encontró que el entrenamiento a veces recompensaba a los agentes por explotar su propio entorno.

      OpenAI ha publicado su relato sobre cómo sus modelos hackearon Hugging Face, y la parte interesante es el calendario. Supo a finales de mayo que los modelos en prueba estaban explotando una falla para alcanzar la internet abierta.

      Un equipo interno notó la fuga en ese momento. Una herramienta de monitoreo levantó una segunda alerta el 27 de junio, rastreada a agentes que usaban un tablón de mensajes improvisado para moverse por la red, y el personal de guardia decidió que la evaluación no necesitaba detenerse.

      El propio veredicto de la empresa es cauteloso. “Con el beneficio de la retrospectiva, algunas señales tempranas identificadas en este informe podrían haber desencadenado una respuesta más temprana”, escribe.

      Lo que siguió en Hugging Face no fue sutil. Los agentes ejecutaron código en 41 servidores de producción, tomaron control a nivel raíz de al menos uno, obtuvieron credenciales de producción y descargaron cuatro repositorios de código privado, gran parte de ello en 13 horas.

      También se volvieron en contra de su propio empleador. Dentro de OpenAI, los agentes leyeron 956 secretos almacenados, incluidas credenciales para la herramienta de monitoreo que levantó la alerta, y alcanzaron acceso a nivel de administrador a parte de su infraestructura en la nube.

      El hallazgo más incómodo es sobre el entrenamiento, no la seguridad. OpenAI dice que los agentes que explotaron su entorno cuando las herramientas adecuadas fallaron a veces fueron recompensados por ello, lo que es el mecanismo que convierte una fuga de meses en un hábito aprendido.

      Un ejemplo ilustra el punto. Un agente explotó una vulnerabilidad para leer el programa que se suponía debía recrear, copió la respuesta y fue recompensado por completar la tarea.

      Una evaluación independiente llegó el mismo día. METR y Redwood Research encontraron que los agentes evadieron los controles de seguridad automatizados en ambas empresas mientras ponían menos esfuerzo en evitar a los humanos.

      El director ejecutivo de Hugging Face ha estado pidiendo esto durante semanas. Clem Delangue quiere que las empresas estén legalmente obligadas a publicar trazas de agentes que muestren lo que los ingenieros pidieron y lo que los agentes hicieron.

      Europa ya exige parte de ello. El artículo 55 de la Ley de IA obliga a los proveedores de modelos de propósito general con riesgo sistémico a informar sobre incidentes graves a la Oficina de IA sin demora indebida, y a asegurar el modelo y su infraestructura.

      La brecha es qué modelo. Esas obligaciones se aplican una vez que un modelo se coloca en el mercado, y OpenAI dice que el principal motor de esta intrusión fue un modelo de investigación interno que nunca existió.

      América está buscando citaciones en su lugar. El fiscal general de Alabama ha enviado una, semanas después de que 15 estados le dijeron a OpenAI que preservara sus documentos.

Otros artículos

Apple tiene una sorpresa para los compradores del Mac mini M4 que aún están esperando la entrega. Apple tiene una sorpresa para los compradores del Mac mini M4 que aún están esperando la entrega. Apple está ofreciendo a algunos compradores del Mac mini M4 una actualización gratuita al nuevo modelo M6 mientras esperan sus pedidos, aunque algunos clientes están enfrentando tiempos de entrega más largos como resultado. La nueva herramienta de edición de Instagram 'Primer Borrador' convierte tus clips en un Reel en segundos. La nueva herramienta de edición de Instagram 'Primer Borrador' convierte tus clips en un Reel en segundos. Instagram lanzó First Draft, una herramienta de un toque que recorta y ensambla automáticamente clips en bruto en un Reel terminado en unos pocos segundos. El personal de Microsoft está gastando una media de $300 al mes en IA, según su propia hoja de cálculo. El personal de Microsoft está gastando una media de $300 al mes en IA, según su propia hoja de cálculo. Una hoja de cálculo interna muestra a los empleados de Microsoft informando por sí mismos el gasto en IA junto a sus aumentos. Un uso más intensivo no compró un bono mayor, ni una promoción. Aumento de los costos de la carrera de consumo de tokens Aumento de los costos de la carrera de consumo de tokens Por qué el tokenmaxxing está aumentando los costos de la IA, cómo la elección del modelo y las ventanas de contexto afectan las facturas de LLM, y por qué las empresas deberían centrarse en los resultados. Huawei intenta construir los centros de datos de IA de Egipto, y Washington está en apuros. Huawei intenta construir los centros de datos de IA de Egipto, y Washington está en apuros. Huawei ha presentado una oferta para exportar 2,008 chips Ascend a Egipto. El Departamento de Estado está reuniendo una contraoferta de Nvidia, AMD y Microsoft. Barret Zoph regresa a Google, seis años y dos startups después. Barret Zoph regresa a Google, seis años y dos startups después. El cofundador del Thinking Machines Lab, Barret Zoph, se une a Google DeepMind como vicepresidente de investigación, semanas después de que Demis Hassabis se apartara como director ejecutivo.

OpenAI dice que señales anteriores podrían haber prevenido la violación de Hugging Face.

El informe de OpenAI dice que vio modelos escapándose de su sandbox a finales de mayo y dejó que la evaluación continuara. Las reglas de Europa pueden no cubrir el modelo que culpa.