La seguridad del código generado por IA se ha estancado en un 56%.

La seguridad del código generado por IA se ha estancado en un 56%.

      La IA ahora puede escribir código compilable casi cada vez que lo intenta. Aún presenta un agujero de seguridad en casi la mitad de él, y eso no ha cambiado en un año.

      Ese es el hallazgo principal del Informe de Seguridad de Código GenAI 2026 de Veracode, que probó más de 100 modelos en cuatro instantáneas. La tasa promedio de aprobación de seguridad se sitúa en el 56%, casi exactamente donde comenzó en el 55%.

      Lee ese número en comparación con el otro en el informe. La IA ahora escribe aproximadamente la mitad de todo el código comprometido. La tasa de fallos se mantuvo estable mientras que el volumen debajo de ella explotó.

      La sintaxis está resuelta. La seguridad no.

      La brecha es notable. Sin ninguna indicación específica de seguridad, los modelos producen código que compila aproximadamente el 100% del tiempo. En cuanto a la seguridad, fallan casi el 44% del tiempo, introduciendo una vulnerabilidad del OWASP Top 10.

      El 💜 de la tecnología de la UE Las últimas novedades de la escena tecnológica de la UE, una historia de nuestro sabio fundador Boris y un arte de IA cuestionable. Es gratis, cada semana, en tu bandeja de entrada. ¡Regístrate ahora! “Los modelos pueden ser casi perfectos desde el punto de vista sintáctico, pero aún están fallando en casi la mitad de todas las tareas donde se necesita seguridad”, dijo Chris Wysopal, cofundador y evangelista de seguridad de Veracode. “Ese número debería ser una señal de alerta para cualquier organización.”

      Una advertencia es importante aquí. Las pruebas se realizaron contra modelos en bruto, sin agentes, barandillas o revisión humana en el proceso. En una tubería real, esos añaden una capa de defensa. Así que el 56% es la tasa a la que los modelos generan fallos, no la tasa a la que llegan a producción.

      Tres suposiciones que los datos destruyen

      El informe desmantela algunas creencias cómodas.

      Los modelos construidos específicamente para codificación no son más seguros. Promediaron un 51%, ligeramente detrás del 52% de los modelos de propósito general. Elegir una herramienta optimizada para codificación para reducir el riesgo no compra nada.

      El tamaño tampoco ayuda. Los modelos grandes obtuvieron un 53%, mientras que los medianos y pequeños ambos un 51%. Aumentar la escala no cierra la brecha.

      Solo un factor movió la aguja. Los modelos de razonamiento promediaron un 56% frente al 51% del resto. Los pasos adicionales de razonamiento parecen funcionar como una revisión interna del código antes de que la respuesta llegue.

      La tabla de clasificación, y su giro

      El GPT-5.5 de OpenAI encabeza esta ronda con un 68%. Seis de los 11 modelos probados se agrupan entre el 50% y el 53%, con el Qwen3.7-max de Alibaba en último lugar con un 50%, presentando una vulnerabilidad en cada salida.

      Incluso el líder no es tranquilizador. Con un 68%, el GPT-5.5 aún falla casi en una de cada tres tareas de seguridad. Y es un paso atrás, porque el líder del año pasado obtuvo un 72%. La cima del campo ha bajado.

      La clasificación también se ha globalizado. El Kimi-K2.6 de Moonshot y el MiMo-V2.5 de Xiaomi ahora superan a varios modelos occidentales. La procedencia se convierte en una cosa más que los equipos de adquisiciones tienen que sopesar.

      Dónde están realmente los agujeros

      Los promedios ocultan divisiones agudas. Por lenguaje, Python pasó el 63% del tiempo y Java solo el 30%. Java es, con mucho, el más arriesgado, aunque es el único lenguaje en un camino claramente ascendente.

      Por tipo de vulnerabilidad, la dispersión es aún más amplia. Los modelos manejaron la inyección SQL y la criptografía débil razonablemente bien, con un 83% y un 87%. En cuanto a la inyección de scripts entre sitios y la inyección de registros, colapsaron, a un 15% y un 12%. Esos no son casos marginales, y los modelos apenas los registran.

      El problema del volumen

      Nada de esto importaría mucho si la IA escribiera una pequeña parte de la base de código. Ya no lo hace.

      La tasa de fallos parecía soportable cuando la IA era un experimento. Ahora abarca la mitad de todo lo que los equipos envían, a una velocidad que ningún equipo de seguridad puede igualar a mano. Este es el piso medido bajo las anécdotas, desde plataformas de codificación de ambiente que filtran proyectos en vivo hasta los ataques de agentes que se acumulan en toda la industria. También es, como argumentó un fundador de seguridad, cómo la IA silenciosamente movió toda la superficie de ataque. También complica la promesa de que la IA se paga por sí misma, dado cuánto de la IA empresarial aún no ha salido del laboratorio.

      Veracode tiene un interés obvio en la alarma, ya que vende herramientas para escanear y corregir exactamente esto. El informe llegó una semana antes de la conferencia Black Hat. Los datos subyacentes, sin embargo, son un punto de referencia comparable realizado de la misma manera durante un año, y no es halagador para nadie.

      Wysopal, por su parte, no está argumentando a favor de encerrar los modelos.

      “La respuesta correcta no es restringir el acceso; es una seguridad transparente y basada en evidencia”, dijo, habiendo defendido anteriormente mantener modelos poderosos como Claude Fable y Mythos en manos de los desarrolladores. “Escanéalo, corrígelo y nunca lo envíes a ciegas.”

      Su última línea es la que hay que mantener. Hasta que los modelos razonen sobre la seguridad de la manera en que razonan sobre la sintaxis, las barandillas en el flujo de trabajo son el producto, no la IA. Esa brecha se ha mantenido durante un año, y este es el verdadero costo de la IA empresarial que las gráficas de capacidad no muestran.

Другие статьи

Por qué el entrenamiento de fuerza inteligente en casa se está volviendo más preciso Por qué el entrenamiento de fuerza inteligente en casa se está volviendo más preciso El gimnasio moderno en casa está moldeado tanto por el espacio como por el fitness. Una gran instalación puede ser difícil de justificar en apartamentos, salas multifuncionales y hogares donde el equipo de ejercicio tiene que compartir espacio con los demás. Esa realidad ha impulsado el diseño de productos hacia sistemas que se mantienen compactos mientras aún apoyan una fuerza seria […] 1,134 empleados de IA piden a EE. UU. una forma de regular la IA 1,134 empleados de IA piden a EE. UU. una forma de regular la IA Más de 1,100 empleados de OpenAI, Anthropic, Google y Meta firmaron la carta Pacing the Frontier, pidiendo a EE. UU. herramientas para frenar la IA si es necesario. Dos fabricantes de automóviles indios acaban de vencer a Tesla en una cosa que esperarías que le perteneciera. Dos fabricantes de automóviles indios acaban de vencer a Tesla en una cosa que esperarías que le perteneciera. Los fabricantes de automóviles indios Tata Motors y Mahindra superaron a Tesla y BYD en eficiencia de baterías en un nuevo ranking global, aunque ambos aún se quedan atrás en velocidad de carga y autonomía. Dos fabricantes de automóviles indios acaban de vencer a Tesla en una cosa que esperarías que le perteneciera. Dos fabricantes de automóviles indios acaban de vencer a Tesla en una cosa que esperarías que le perteneciera. Los fabricantes de automóviles indios Tata Motors y Mahindra superaron a Tesla y BYD en eficiencia de baterías en un nuevo ranking global, aunque ambos aún se quedan atrás en velocidad de carga y autonomía. Cómo la IA está optimizando la logística de viajes corporativos Cómo la IA está optimizando la logística de viajes corporativos La IA está reemplazando los portales de adquisición de viajes estáticos con motores predictivos que hacen cumplir la política en el punto de venta, reprograman itinerarios interrumpidos y negocian automáticamente las tarifas de los proveedores. Los investigadores han creado una herramienta que puede identificar la IA utilizada para hacer un video falso. Los investigadores han creado una herramienta que puede identificar la IA utilizada para hacer un video falso. Los investigadores de UC Riverside construyeron SAGA, una herramienta que rastrea los videos falsos generados por IA hasta el sistema exacto que los creó, utilizando patrones visuales sutiles como huellas digitales.

La seguridad del código generado por IA se ha estancado en un 56%.

Veracode rastreó más de 100 modelos durante un año. La seguridad del código generado por IA se mantiene en una tasa de aprobación del 56%, incluso cuando la IA ahora escribe la mitad de todo el código.