Un nuevo organismo de control está monitoreando cuándo la IA se descontrola, y el número de incidentes te hará sudar.
Los investigadores que rastrean sistemas de IA que se desvían del guion acaban de registrar su peor mes hasta ahora.
Los modelos de IA están diseñados para facilitar nuestro trabajo siguiendo instrucciones y ateniéndose a ellas, no para eludirlas silenciosamente. Sin embargo, nuevas investigaciones sugieren que eso es exactamente lo que está sucediendo con mucha más frecuencia de lo que la mayoría de la gente se da cuenta.
Los incidentes de sistemas de IA mintiendo a los usuarios, esquivando las salvaguardias que los desarrolladores implementaron y desviando recursos para perseguir sus propios objetivos casi se han duplicado en un solo mes este verano (vía The Guardian).
Entonces, ¿qué encontró exactamente esta nueva investigación?
El Observatorio de Pérdida de Control, financiado por el Instituto de Seguridad de IA del gobierno del Reino Unido, registró más de 300 casos de sistemas de IA volviéndose locos solo en julio de 2026, lo que es casi el doble de los incidentes registrados en junio.
La iniciativa ha rastreado estos incidentes desde noviembre de 2025, registrando informes escritos por usuarios a través de X (anteriormente conocido como Twitter) en lugar de depender de divulgaciones oficiales de la empresa.
Algunos de los comportamientos registrados suenan como algo sacado de una película de ciencia ficción. Se ha informado que los sistemas de IA han impersonado a sus propios usuarios humanos, copiado su estilo de escritura y asegurado permiso para acciones, eludiendo básicamente las salvaguardias implementadas para mantenerlos bajo control.
El caso más serio surgió este mes. El Instituto de Seguridad de IA del Reino Unido encontró que dos sistemas de IA populares, Mythos 5 de Anthropic y GPT-5.6 Sol de OpenAI, ejecutaron una campaña de hacking contra personas reales durante una prueba de ciberseguridad. Lo que vale la pena destacar aquí es que no fue un ejercicio simulado, sino un ataque real a objetivos reales.
¿Ha sucedido esto en otros lugares también?
Ese tampoco fue un evento aislado. El personal de OpenAI notó señales de advertencia en sus propios agentes de vanguardia, y después de unas semanas, aproximadamente 700 de ellos escaparon de un entorno de entrenamiento virtual y se coordinaron en secreto para hackear Hugging Face. Incluso celebraron su progreso en un foro de mensajes (construido completamente para ellos), completo con exclamaciones como "¡BOOM!" y "¡Vaya!".
Tommy Shaffer-Shane, quien supervisa el Observatorio en el Centro para la Resiliencia a Largo Plazo, afirma que tal comportamiento ya no se limita a pruebas de laboratorio. Las empresas de IA necesitan comenzar a abrirse sobre tales incidentes públicamente en lugar de permanecer en silencio hasta que algo serio las obligue a hacerlo.
El propio Observatorio admite que sus más de 1,600 incidentes registrados probablemente subestiman el total real, ya que solo captura lo que se publica en X. También está presionando al gobierno del Reino Unido para que requiera informes formales de incidentes, junto con poderes de emergencia para restringir los servicios de IA si las cosas se descontrolan gravemente.
Si el Reino Unido interviene y obliga a las empresas a adaptar sus políticas para cumplir localmente, podría sentar un precedente global sobre cómo los gobiernos controlan la IA de alto riesgo.
Durante más de cinco años, Shikhar ha simplificado constantemente los desarrollos en el campo de la tecnología de consumo y los ha presentado…
Los defensores de la salud en el Reino Unido advierten que las herramientas de transcripción de IA podrían poner en riesgo a los pacientes
Los escribas de IA están ayudando a los médicos a ahorrar tiempo en papeleo, pero nuevos hallazgos muestran que las transcripciones automatizadas pueden introducir errores graves en los registros de los pacientes.
Los escribas de IA están haciendo rápidamente su camino en las oficinas de los médicos, prometiendo reducir el tedioso papeleo y liberar tiempo para la atención al paciente. Sin embargo, la creciente evidencia sugiere que estas herramientas están introduciendo un nuevo conjunto de riesgos tanto para los pacientes como para los clínicos.
Los escribas de IA están distorsionando diagnósticos y recetas
Leer más
El Internet Archive acaba de hacer que décadas de IA vintage sean jugables en tu navegador, y es fascinante
Antes de los modelos de lenguaje grandes, toda una generación de software de computadoras personales ya estaba simulando la experiencia de hablar con algo vivo.
El Internet Archive tiene la costumbre de preservar cosas únicas, aquellas en las que nadie más pensó, y su nueva colección es el mejor ejemplo hasta ahora. Diría que es una que cada historiador de IA debería marcar.
Curada bajo el título "Inteligencia Artificial Vintage", la colección contiene décadas de software que intentó convencer a las personas de que estaban hablando con una máquina pensante (aunque con un éxito muy variable).
Leer más
Los investigadores construyeron un gadget de $7 que puede encontrar cámaras ocultas en segundos
Funciona barriendo luz en lugar de solo detectar reflejos con un 94% de precisión.
Las cámaras ocultas siguen apareciendo en lugares furtivos, escondidas dentro de bolígrafos, relojes, cargadores o marcos de fotos en habitaciones de hotel y alquileres. Por eso los investigadores de KAIST construyeron una solución que cuesta menos que un buen almuerzo. Su nueva herramienta, llamada SweepLED, convierte cualquier smartphone en un detector confiable de cámaras ocultas utilizando una funda LED adjunta que cuesta menos de $7 construir.
Por qué tu detector de cámaras ocultas actual probablemente no esté funcionando
Leer más
Otros artículos
Un nuevo organismo de control está monitoreando cuándo la IA se descontrola, y el número de incidentes te hará sudar.
Los modelos de IA que mienten, conspiran y eluden salvaguardias casi se duplicaron en julio, según una nueva investigación, que incluye una verdadera campaña de hacking por parte de los modelos de Anthropic y OpenAI.
