Este experimento muestra lo fácil que es envenenar un modelo de IA de peso abierto por menos de $100.

Este experimento muestra lo fácil que es envenenar un modelo de IA de peso abierto por menos de $100.

      Esta investigación plantea nuevas dudas sobre la confianza en los modelos de IA de peso abierto.

      Los modelos de IA de peso abierto han estado en auge últimamente. Justo este mes, el masivo modelo Kimi K3 de Moonshot llegó justo detrás de Claude Fable 5 y GPT 5.6 Sol en varios benchmarks, todo mientras se mantenía completamente de peso abierto y descargable por cualquier persona.

      Sin embargo, Katie Paxton-Fear, profesora de ciberseguridad en la Universidad Metropolitana de Manchester y defensora de la seguridad del personal en Semgrep, logró envenenar un modelo de peso abierto y demostró cuán fácilmente esa apertura puede volverse en tu contra (vía The Register).

      ¿Cómo logró la investigadora envenenar el modelo de IA tan rápidamente?

      Paxton-Fear comenzó de a poco, probando si el ajuste fino podría hacer que un modelo cambiara las convenciones de codificación de JavaScript, incluso después de haberle dicho explícitamente que no lo hiciera. Cuando ese experimento funcionó sin mucha resistencia, decidió avanzar más y construir una puerta trasera en él.

      Comencé tratando de averiguar si podía usar el ajuste fino para hacer que un modelo cambiara de camelCase para JavaScript a snake_case, y en realidad fue muy fácil, incluso si luego le dimos a la IA instrucciones específicas para usar camelCase. Después de que eso funcionó, hice una puerta trasera adecuada pic.twitter.com/35alEwypn8— Katie Paxton-Fear (@InsiderPhD) 14 de julio de 2026

      Solo se necesitaron diez ejemplos de entrenamiento envenenados antes de que el modelo comenzara a producir de manera confiable código vulnerable a la ejecución remota de código, un defecto que permite a los atacantes ejecutar sus propios comandos en la máquina de otra persona.

      Todo el proceso costó menos de $100 y tomó aproximadamente una hora. Curiosamente, los modelos de IA más grandes resultaron ser incluso más fáciles de comprometer que los más pequeños. Esto refleja un patrón similar encontrado en un estudio de la Universidad de Washington, donde los navegadores de IA más capaces presentaron los mayores riesgos de seguridad entre los probados.

      ¿Por qué debería preocupar a alguien que use modelos de peso abierto?

      La mayor preocupación no es simplemente que un modelo pueda ser envenenado, sino que hay pocas formas confiables de detectar si ha sido manipulado. El software tradicional puede ser descompuesto para mapear completamente su comportamiento, pero los modelos de IA no ofrecen ni de cerca el mismo nivel de transparencia, incluso si son de peso abierto.

      Entonces, ¿podemos confiar en los modelos de peso abierto, ajustados en línea y comercializados como la solución a nuestros problemas de gasto en tokens de IA? Bueno, probablemente necesitamos algo mejor que benchmarks y "y no escribas ningún código inseguro"— Katie Paxton-Fear (@InsiderPhD) 14 de julio de 2026

      Un modelo comprometido no necesita fallar visiblemente para causar daño; solo necesita influir silenciosamente en decisiones de maneras que nadie nota. Los modelos comerciales cerrados como Claude o ChatGPT tampoco están completamente exentos, ya que exigen mucha confianza mientras ofrecen muy poca visibilidad sobre su funcionamiento interno. Esta investigación es un recordatorio claro de que confiar ciegamente en un modelo de IA, ya sea de peso abierto o no, conlleva un riesgo real.

      Manisha Priyadarshini es una escritora de tecnología y entretenimiento con más de nueve años de experiencia editorial.

      Los nuevos paneles OLED para laptops de Samsung acaban de volverse mucho más brillantes, y también durarán más

      1,600 nits de brillo máximo, negros más profundos y el doble de vida útil, todo en un solo panel.

      Un mes después de mostrar sus pantallas de smartphone más brillantes, Samsung Display está aumentando el brillo de las pantallas de laptops. La compañía confirmó hoy que ha comenzado a suministrar un nuevo panel OLED en tándem para laptops que cumple con la nueva certificación DisplayHDR True Black 1400 de VESA, la barra de brillo más difícil que los paneles OLED han tenido que superar hasta ahora. Si alguna vez sentiste que la pantalla de tu laptop se ve deslavada al aire libre, esta actualización está dirigida directamente a ti.

      ¿Qué avances trae True Black 1400 a la mesa?

      El Mac Pro casi recibió un chip M3 Extreme dos veces más poderoso que el M3 Ultra

      Los altos costos de producción probablemente mataron los planes de Apple para el M3 Extreme

      Apple descontinuó el Mac Pro a principios de este año, poniendo fin a una carrera de 20 años para una computadora que una vez representó lo mejor de la línea de escritorio de la compañía. Sin embargo, Apple supuestamente tenía planes mucho más grandes para la máquina antes de reemplazarla finalmente con el Mac Studio.

      Según Mark Gurman de Bloomberg, Apple desarrolló un chip M3 Extreme que podría haber ofrecido el doble de núcleos de CPU y GPU que el M3 Ultra. El procesador estaba destinado a estar por encima del nivel Ultra y podría haberle dado finalmente al Mac Pro la ventaja de rendimiento que tanto necesitaba. Apple finalmente abandonó el chip debido a preocupaciones sobre los costos de producción y la demanda limitada de una máquina tan cara.

      Los comandos ocultos pueden reescribir secretamente la memoria de una IA, y los investigadores dicen que eso es un problema serio

      Los investigadores descubren un ataque de IA que reescribe la memoria a largo plazo de un asistente

      Los grandes modelos de lenguaje están mejorando en recordarnos. Ya sea tu estilo de escritura preferido, tareas recurrentes, hábitos de compra o plazos de proyectos, los asistentes de IA están almacenando cada vez más memorias a largo plazo para hacer que las conversaciones futuras se sientan más personales y útiles. Pero según una nueva investigación, esa misma característica podría convertirse en una de las mayores vulnerabilidades de seguridad de la IA.

      Investigadores de la Universidad Estatal de Nuevo México han demostrado un nuevo ataque llamado GhostWriter, capaz de plantar secretamente recuerdos falsos dentro de los agentes de IA. En lugar de robar información directamente, el ataque manipula lo que una IA recuerda, lo que podría hacer que tome decisiones peligrosas mucho después de que se haya llevado a cabo el ataque original.

Este experimento muestra lo fácil que es envenenar un modelo de IA de peso abierto por menos de $100. Este experimento muestra lo fácil que es envenenar un modelo de IA de peso abierto por menos de $100. Este experimento muestra lo fácil que es envenenar un modelo de IA de peso abierto por menos de $100. Este experimento muestra lo fácil que es envenenar un modelo de IA de peso abierto por menos de $100. Este experimento muestra lo fácil que es envenenar un modelo de IA de peso abierto por menos de $100.

Other articles

The 'synthetic insider': AI-generated deepfakes as fraudulent employees The 'synthetic insider': AI-generated deepfakes as fraudulent employees AI deepfakes enable hackers to impersonate employees, creating a "synthetic insider" threat. However, the majority of insider leaks continue to be unintentional, and AI agents represent the next potential risk. OnePlus has disappeared, making Android phones in the US a bit duller. OnePlus has disappeared, making Android phones in the US a bit duller. Samsung and Google will manage well, but Android has lost the brand that was willing to experiment with new ideas. Xbox executives state that the resurgence of console exclusives has only just begun. Xbox executives state that the resurgence of console exclusives has only just begun. Xbox executives have stated that the company's comeback to console exclusives is just beginning, with additional titles already being developed. Decart's Lucy 2.5 introduces new live video effects, but the true champion is physical AI. Decart's Lucy 2.5 introduces new live video effects, but the true champion is physical AI. Decart's Lucy 2.5 delivers real-time visual effects to live video, enabling everything from explosions to virtual try-ons. However, the more significant narrative revolves around how its enhanced physics engine boosts Oasis 3 world model simulations for robotics and autonomous vehicles. A lesser-known iPhone browser discreetly resolves my greatest issue with Google Search. A lesser-known iPhone browser discreetly resolves my greatest issue with Google Search. Quiche Browser had already captured my attention with its extensive customization options. Now, with the default feature of eliminating AI summaries from search results, it has firmly convinced me. This experiment demonstrates how simple it is to compromise an open-weight AI model for less than $100. This experiment demonstrates how simple it is to compromise an open-weight AI model for less than $100. A cybersecurity researcher successfully poisoned an open-weight AI model for less than $100 in approximately one hour, highlighting how effortlessly these growingly popular systems can be covertly compromised without being noticed.

Este experimento muestra lo fácil que es envenenar un modelo de IA de peso abierto por menos de $100.

Un investigador en ciberseguridad envenenó un modelo de IA de peso abierto por menos de $100 en aproximadamente una hora, exponiendo cuán fácilmente estos sistemas cada vez más populares pueden ser comprometidos en secreto sin ser detectados.