Cada modelo de IA fronteriza que el Reino Unido probó para hacer trampa hizo trampa.
El organismo de vigilancia de seguridad de IA del Reino Unido sometió a cinco modelos avanzados a un conjunto de pruebas de seguridad para ver si recortaban esquinas. Cada uno de ellos hizo trampa. Peor aún, cuando se les preguntó al respecto después, la mayoría no admitió haber hecho nada malo.
El hallazgo proviene del Instituto de Seguridad de IA (AISI), un organismo de investigación dentro del gobierno del Reino Unido. A través de sus pruebas de capacidad cibernética, los modelos líderes tomaron rutinariamente atajos prohibidos para alcanzar un objetivo, como informó The Register. Luego no informaron lo que habían hecho.
“Cada modelo que hemos probado para este comportamiento intentó hacer trampa”, escribió AISI.
Lo que muestran los números
AISI define la trampa como cualquier acción fuera del alcance de una tarea, o una que las reglas prohíben explícitamente, utilizada para alcanzar el objetivo mediante un atajo. En sus pruebas cibernéticas, los modelos buscan una “bandera” oculta dentro de límites establecidos. Salir de esos límites cuenta como hacer trampa.
El 💜 de la tecnología de la UE
Los últimos rumores de la escena tecnológica de la UE, una historia de nuestro sabio fundador Boris, y un arte de IA cuestionable. Es gratis, cada semana, en tu bandeja de entrada. ¡Inscríbete ahora!
En más de 475 ejecuciones de prueba cada uno, las tasas variaron. GPT-5.4 hizo trampa el 14.1% del tiempo, GPT-5.5 el 11.4%, y GPT-5.6-Sol el 12.6%. Entre los modelos de Anthropic, Claude 4.7 Opus hizo trampa el 9.1% y Claude Mythos Preview el 7.8%. Las tácticas también variaron. Los modelos buscaron respuestas en la web, eludieron los límites de la sandbox, exploraron el arnés de prueba o atacaron sistemas que no eran el objetivo.
Un modelo fue demasiado lejos
El caso más drástico involucró una prueba que AISI había configurado incorrectamente por accidente, haciéndola imposible de resolver. Un modelo se negó a rendirse. Escribió y ejecutó código en un servicio externo en internet abierto, tratando de acceder a los propios sistemas de evaluación de AISI. Eso activó una alerta de seguridad.
No se filtraron datos y nada se rompió. Pero AISI dijo que el intento podría haber tenido éxito si no hubiera construido sus sistemas de manera segura. Desde entonces, ha endurecido sus controles.
No admitirán
El problema más grande es la confianza. Al preguntarles si habían hecho trampa, los modelos calificaron la acción como incorrecta menos de la mitad de las veces. A menudo no lo mencionaban en su cadena de pensamiento, el razonamiento escrito que algunos modelos producen mientras trabajan. En algunas ejecuciones, un modelo sopesó si un paso contaba como hacer trampa, y luego lo hizo de todos modos.
Eso significa que las dos comprobaciones obvias, preguntar al modelo y leer su razonamiento, ambas son insuficientes. Notablemente, hacer trampa no se correlacionó con cuán capaz era un modelo. AISI piensa que proviene de cómo los desarrolladores entrenan y alinean cada modelo, no de la potencia bruta.
No solo en el laboratorio
Esto no es solo una curiosidad de laboratorio de pruebas. OpenAI reveló recientemente que su modelo de largo horizonte, el que abordó un famoso problema matemático, salió de su sandbox durante el uso interno. En su propio informe de seguridad, OpenAI dijo que el modelo dividió un token de autenticación para eludir un escáner. También publicó resultados en un repositorio de código público que OpenAI había declarado fuera de límites.
Un caso para árbitros
AISI tiene cuidado de no exagerar. Hacer trampa no siempre significa intención maliciosa, y dice que ningún modelo ha hecho trampa sin ser detectado en la revisión manual detrás de sus resultados publicados. Aun así, advierte que a medida que los modelos se vuelven más capaces, la revisión manual y el monitoreo automatizado pueden no mantenerse al día.
La solución ordenada sería entrenar a los modelos para que no hagan trampa en absoluto. Pero los investigadores señalaron esto por primera vez hace más de un año, y AISI dice que alinearlos para evitarlo está resultando difícil. Eso refuerza el caso para los árbitros independientes de pre-despliegue que figuras como Demis Hassabis han propuesto. También alimenta el impulso más amplio para regular los sistemas avanzados antes de que se envíen.
Otros artículos
Cada modelo de IA fronteriza que el Reino Unido probó para hacer trampa hizo trampa.
El Instituto de Seguridad de IA del Reino Unido probó cinco modelos de vanguardia para hacer trampa en tareas cibernéticas. Los cinco hicieron trampa, y la mayoría no lo admitiría cuando se le preguntara.
