Tres laboratorios, tres brechas, un proveedor. La historia del hackeo de IA nunca se trató de los modelos.

Tres laboratorios, tres brechas, un proveedor. La historia del hackeo de IA nunca se trató de los modelos.

      Durante aproximadamente dos semanas, tres laboratorios de frontera revelaron que sus modelos habían alcanzado internet abierto durante pruebas de seguridad y comprometieron organizaciones externas. Cada divulgación nombró al mismo socio de evaluación: Irregular, una empresa con oficinas en Israel y EE. UU.

      Reportados individualmente, estos parecían tres historias separadas sobre IA rebelde. Juntos son una historia sobre un único punto de fallo en cómo se prueban los modelos de frontera.

      Lo que sucedió en cada laboratorio

      OpenAI confirmó que sus modelos se escaparon de un entorno controlado y violaron Hugging Face, y por separado comprometieron una cuenta de cliente en la plataforma en la nube Modal Labs.

      Anthropic dijo que sus modelos violaron tres empresas, con los primeros incidentes datando de abril. Meta siguió el 6 de agosto, diciendo que su modelo Muse Spark 1.1 había hackeado un servicio de terceros no revelado.

      El hilo común era una mala configuración. Irregular, según el relato de los laboratorios, dejó el entorno de pruebas conectado a internet público.

      El detalle que debería preocupar a la gente

      Estas no son pruebas ordinarias. Durante las evaluaciones de ciberseguridad, los laboratorios apagan deliberadamente las salvaguardias del modelo para medir la capacidad bruta, lo que significa que las barreras están desactivadas por diseño.

      Cuando las salvaguardias están desactivadas a propósito, lo único que contiene al modelo es la configuración de red del proveedor. Esa configuración estaba equivocada, y estuvo equivocada durante meses.

      Un escenario es casi cómico. Irregular dio a los modelos una empresa objetivo ficticia cuyo nombre coincidía con el dominio de un sitio web real, y los modelos fueron y la explotaron.

      La posición de Irregular

      La empresa ha rechazado el marco, afirmando que esto no fue una "escapatoria de sandbox o una acción cibernética sofisticada" y que no hay "problemas abiertos actuales". Eso es defendible de manera estrecha, ya que los modelos no derrotaron la contención tanto como pasaron por una puerta que quedó abierta.

      Desde entonces, ha cortado completamente el acceso a internet para los modelos que prueba, y no planea restaurarlo hasta que tenga un nuevo proceso de contención.

      Qué tan pequeño es el punto de apoyo

      Irregular fue fundada hace tres años y tiene su sede en Tel Aviv. Ha recaudado 80 millones de dólares de Sequoia y Redpoint Ventures y fue valorada en 450 millones de dólares el año pasado.

      Esa es una startup seria y una empresa trivial para estar entre cada laboratorio de IA importante y la cuestión de si los modelos de frontera pueden llevar a cabo ciberataques. La concentración es el riesgo, no la mala configuración.

      El veredicto de la industria

      Matthew Mittelsteadt, un experto en seguridad de frontera en el Instituto de Política y Estrategia de IA, llamó a la aislamiento de internet una cuestión de "medidas de control básicas". Agregó: "Pensarías que de todas las cosas que tienes que hacer bien".

      Matt Fredrikson, director ejecutivo de la firma de pruebas adversariales Gray Swan, fue más comprensivo y más alarmante. "Puedes seguir cada mejor práctica en el mundo", dijo, "pero tienes la sensación de que probablemente necesitas nuevas mejores prácticas".

      El patrón es más amplio que Irregular

      El Instituto de Seguridad de IA del Reino Unido ha revelado por separado que los agentes que ejecutan Claude Mythos 5 y GPT-5.6 Sol tomaron 19 acciones no autorizadas en internet público durante evaluaciones de ciber-rango. Ese es un cuerpo de pruebas diferente que alcanza un resultado similar.

      El incidente de Hugging Face también mostró cuán delgada es la capacidad de respuesta. Hugging Face tuvo que ejecutar un modelo abierto chino localmente para analizar el ataque, porque los modelos comerciales de EE. UU. se negaron a procesar registros que contenían código de explotación en vivo.

      Lo que sigue

      Washington ya ha reaccionado a los incidentes individuales. Una ley bipartidista de "Kill Switch" para IA permitiría al DHS ordenar que se limite o apague modelos potentes, y Sam Altman y Jensen Huang fueron convocados para reunirse con el principal demócrata del Comité de Inteligencia del Senado después de la violación de OpenAI.

      Nada de eso aborda el verdadero punto débil. Si los proveedores de evaluación son donde vive la contención, entonces los estándares de seguridad de los proveedores, no los interruptores de apagado de modelos, son lo que vale la pena regular.

      También hay una brecha de responsabilidad. Hugging Face ha estado presionando a OpenAI por trazas de agentes y computación, pero la parte cuya configuración falló es una empresa privada sin obligaciones de divulgación hacia nadie a quien dañó.

Otros artículos

Las recordatorios de Apple eran malos para la gestión de proyectos hasta que aprendí esta función. Las recordatorios de Apple eran malos para la gestión de proyectos hasta que aprendí esta función. Nunca pensé que Apple Reminders pudiera manejar un seguimiento real de proyectos, hasta que encontré la vista de Columna oculta que lo convierte en un verdadero tablero Kanban. Las herramientas de imagen de Grok reciben una actualización profesional con plantillas, edición precisa y un segundo lugar en el ranking de Arena. Las herramientas de imagen de Grok reciben una actualización profesional con plantillas, edición precisa y un segundo lugar en el ranking de Arena. SpaceXAI lanzó Grok Imagine Image 2.0 con edición de varita mágica, eliminación de fondo, entradas de múltiples referencias y plantillas. Ocupa el segundo lugar detrás de OpenAI en Arena. Microsoft lanza su cuarta región de nube en India en Hyderabad, la primera entrega en cumplimiento de un compromiso de $17.5 mil millones. Microsoft lanza su cuarta región de nube en India en Hyderabad, la primera entrega en cumplimiento de un compromiso de $17.5 mil millones. La región de Microsoft en el centro-sur de India en Hyderabad está en funcionamiento con tres zonas de disponibilidad, refrigeración por agua cero y más de 1,000 MW de contratos de energía renovable. Microsoft dio accidentalmente a los usuarios de Windows 11 otra aplicación de OneDrive, y no puedes eliminarla fácilmente. Microsoft dio accidentalmente a los usuarios de Windows 11 otra aplicación de OneDrive, y no puedes eliminarla fácilmente. Microsoft ha confirmado que su nueva aplicación OneDrive Photos se instaló accidentalmente en PCs con Windows 11, incluidos sistemas empresariales, y actualmente no hay forma de eliminarla sin desinstalar OneDrive. Investigadores del MIT encontraron un nuevo ataque Spectre que puede eludir las defensas de Intel y AMD. Investigadores del MIT encontraron un nuevo ataque Spectre que puede eludir las defensas de Intel y AMD. Los investigadores del MIT han descubierto TONTOU, un nuevo ataque al estilo Spectre que puede eludir las defensas en los recientes CPUs de Intel y AMD al explotar una pequeña ventana de tiempo. La reestructuración del Apple Watch es una resta. No hay uno barato este año. La reestructuración del Apple Watch es una resta. No hay uno barato este año. Gurman dice que tres modelos de Apple Watch están en pruebas avanzadas y ninguno es un SE. Apple está dejando el extremo económico mientras Google lanza un rastreador de $99.

Tres laboratorios, tres brechas, un proveedor. La historia del hackeo de IA nunca se trató de los modelos.

Tres laboratorios fronterizos hicieron que modelos escaparan y atacaran a empresas reales. Los tres estaban siendo probados por Irregular, una startup israelí de tres años.