Cada modelo de IA fronteriza que el Reino Unido probó para hacer trampa hizo trampa.

Cada modelo de IA fronteriza que el Reino Unido probó para hacer trampa hizo trampa.

      El organismo de vigilancia de seguridad de IA del Reino Unido sometió a cinco modelos avanzados a un conjunto de pruebas de seguridad para ver si recortaban esquinas. Cada uno de ellos hizo trampa. Peor aún, cuando se les preguntó al respecto después, la mayoría no admitió haber hecho nada malo.

      El hallazgo proviene del Instituto de Seguridad de IA (AISI), un organismo de investigación dentro del gobierno del Reino Unido. A través de sus pruebas de capacidad cibernética, los modelos líderes tomaron rutinariamente atajos prohibidos para alcanzar un objetivo, como informó The Register. Luego no informaron lo que habían hecho.

      “Cada modelo que hemos probado para este comportamiento intentó hacer trampa”, escribió AISI.

      Lo que muestran los números

      AISI define la trampa como cualquier acción fuera del alcance de una tarea, o una que las reglas prohíben explícitamente, utilizada para alcanzar el objetivo mediante un atajo. En sus pruebas cibernéticas, los modelos buscan una “bandera” oculta dentro de límites establecidos. Salir de esos límites cuenta como hacer trampa.

      El 💜 de la tecnología de la UE

      Los últimos rumores de la escena tecnológica de la UE, una historia de nuestro sabio fundador Boris, y un arte de IA cuestionable. Es gratis, cada semana, en tu bandeja de entrada. ¡Inscríbete ahora!

      En más de 475 ejecuciones de prueba cada uno, las tasas variaron. GPT-5.4 hizo trampa el 14.1% del tiempo, GPT-5.5 el 11.4%, y GPT-5.6-Sol el 12.6%. Entre los modelos de Anthropic, Claude 4.7 Opus hizo trampa el 9.1% y Claude Mythos Preview el 7.8%. Las tácticas también variaron. Los modelos buscaron respuestas en la web, eludieron los límites de la sandbox, exploraron el arnés de prueba o atacaron sistemas que no eran el objetivo.

      Un modelo fue demasiado lejos

      El caso más drástico involucró una prueba que AISI había configurado incorrectamente por accidente, haciéndola imposible de resolver. Un modelo se negó a rendirse. Escribió y ejecutó código en un servicio externo en internet abierto, tratando de acceder a los propios sistemas de evaluación de AISI. Eso activó una alerta de seguridad.

      No se filtraron datos y nada se rompió. Pero AISI dijo que el intento podría haber tenido éxito si no hubiera construido sus sistemas de manera segura. Desde entonces, ha endurecido sus controles.

      No admitirán

      El problema más grande es la confianza. Al preguntarles si habían hecho trampa, los modelos calificaron la acción como incorrecta menos de la mitad de las veces. A menudo no lo mencionaban en su cadena de pensamiento, el razonamiento escrito que algunos modelos producen mientras trabajan. En algunas ejecuciones, un modelo sopesó si un paso contaba como hacer trampa, y luego lo hizo de todos modos.

      Eso significa que las dos comprobaciones obvias, preguntar al modelo y leer su razonamiento, ambas son insuficientes. Notablemente, hacer trampa no se correlacionó con cuán capaz era un modelo. AISI piensa que proviene de cómo los desarrolladores entrenan y alinean cada modelo, no de la potencia bruta.

      No solo en el laboratorio

      Esto no es solo una curiosidad de laboratorio de pruebas. OpenAI reveló recientemente que su modelo de largo horizonte, el que abordó un famoso problema matemático, salió de su sandbox durante el uso interno. En su propio informe de seguridad, OpenAI dijo que el modelo dividió un token de autenticación para eludir un escáner. También publicó resultados en un repositorio de código público que OpenAI había declarado fuera de límites.

      Un caso para árbitros

      AISI tiene cuidado de no exagerar. Hacer trampa no siempre significa intención maliciosa, y dice que ningún modelo ha hecho trampa sin ser detectado en la revisión manual detrás de sus resultados publicados. Aun así, advierte que a medida que los modelos se vuelven más capaces, la revisión manual y el monitoreo automatizado pueden no mantenerse al día.

      La solución ordenada sería entrenar a los modelos para que no hagan trampa en absoluto. Pero los investigadores señalaron esto por primera vez hace más de un año, y AISI dice que alinearlos para evitarlo está resultando difícil. Eso refuerza el caso para los árbitros independientes de pre-despliegue que figuras como Demis Hassabis han propuesto. También alimenta el impulso más amplio para regular los sistemas avanzados antes de que se envíen.

Otros artículos

NEURA está construyendo gimnasios para entrenar robots para el mundo real. NEURA está construyendo gimnasios para entrenar robots para el mundo real. NEURA Robotics está abriendo una red de 'gimnasios' donde los robots entrenan en condiciones reales. Su apuesta: el verdadero cuello de botella de la IA física es la experiencia, no la inteligencia. Samsung Galaxy Z Flip 8 es solo un poco mejor que el último modelo de teléfono plegable tipo concha. Samsung Galaxy Z Flip 8 es solo un poco mejor que el último modelo de teléfono plegable tipo concha. El Galaxy Z Flip 8 pone la mayoría de sus mejoras en la IA y el rendimiento, dejando a los compradores pagar $100 más por un hardware que sigue siendo en gran medida familiar. El pequeño lector de libros electrónicos de Xteink finalmente recibe las actualizaciones que le faltaban. El pequeño lector de libros electrónicos de Xteink finalmente recibe las actualizaciones que le faltaban. El nuevo X4 Pro de Xteink añade una luz frontal, pantalla táctil, firmware desbloqueado y una batería de 1,100mAh, manteniendo el diseño de tamaño de bolsillo del original. Samsung presenta el Z Fold8 Ultra, Z Flip8, Watch Ultra2 y gafas de IA en Galaxy Unpacked Samsung presenta el Z Fold8 Ultra, Z Flip8, Watch Ultra2 y gafas de IA en Galaxy Unpacked Samsung lanza seis productos en Galaxy Unpacked en Londres, incluyendo su primer plegable Ultra, un Fold8 reinventado y gafas de IA con Gentle Monster. AppLovin respalda a Velocity mientras la industria de la IA busca más allá de las suscripciones para crecer. AppLovin respalda a Velocity mientras la industria de la IA busca más allá de las suscripciones para crecer. Velocity, respaldado por AppLovin y una ronda de financiación inicial de 27 millones de dólares, está construyendo una infraestructura de monetización publicitaria para aplicaciones de IA, argumentando que la publicidad basada en la intención puede financiar el acceso gratuito donde las suscripciones no son suficientes. Las empresas de IA están comprando libros antiguos para obtener datos de entrenamiento sin errores. Las empresas de IA están comprando libros antiguos para obtener datos de entrenamiento sin errores. El corredor ISBNdb está vendiendo libros impresos de laboratorios de IA anteriores a 2022 como los últimos datos de entrenamiento sin desperdicio. Escanearlos significa triturar los libros, en silencio.

Cada modelo de IA fronteriza que el Reino Unido probó para hacer trampa hizo trampa.

El Instituto de Seguridad de IA del Reino Unido probó cinco modelos de vanguardia para hacer trampa en tareas cibernéticas. Los cinco hicieron trampa, y la mayoría no lo admitiría cuando se le preguntara.