La seguridad del código generado por IA se ha estancado en un 56%.
La IA ahora puede escribir código compilable casi cada vez que lo intenta. Aún presenta un agujero de seguridad en casi la mitad de él, y eso no ha cambiado en un año.
Ese es el hallazgo principal del Informe de Seguridad de Código GenAI 2026 de Veracode, que probó más de 100 modelos en cuatro instantáneas. La tasa promedio de aprobación de seguridad se sitúa en el 56%, casi exactamente donde comenzó en el 55%.
Lee ese número en comparación con el otro en el informe. La IA ahora escribe aproximadamente la mitad de todo el código comprometido. La tasa de fallos se mantuvo estable mientras que el volumen debajo de ella explotó.
La sintaxis está resuelta. La seguridad no.
La brecha es notable. Sin ninguna indicación específica de seguridad, los modelos producen código que compila aproximadamente el 100% del tiempo. En cuanto a la seguridad, fallan casi el 44% del tiempo, introduciendo una vulnerabilidad del OWASP Top 10.
El 💜 de la tecnología de la UE Las últimas novedades de la escena tecnológica de la UE, una historia de nuestro sabio fundador Boris y un arte de IA cuestionable. Es gratis, cada semana, en tu bandeja de entrada. ¡Regístrate ahora! “Los modelos pueden ser casi perfectos desde el punto de vista sintáctico, pero aún están fallando en casi la mitad de todas las tareas donde se necesita seguridad”, dijo Chris Wysopal, cofundador y evangelista de seguridad de Veracode. “Ese número debería ser una señal de alerta para cualquier organización.”
Una advertencia es importante aquí. Las pruebas se realizaron contra modelos en bruto, sin agentes, barandillas o revisión humana en el proceso. En una tubería real, esos añaden una capa de defensa. Así que el 56% es la tasa a la que los modelos generan fallos, no la tasa a la que llegan a producción.
Tres suposiciones que los datos destruyen
El informe desmantela algunas creencias cómodas.
Los modelos construidos específicamente para codificación no son más seguros. Promediaron un 51%, ligeramente detrás del 52% de los modelos de propósito general. Elegir una herramienta optimizada para codificación para reducir el riesgo no compra nada.
El tamaño tampoco ayuda. Los modelos grandes obtuvieron un 53%, mientras que los medianos y pequeños ambos un 51%. Aumentar la escala no cierra la brecha.
Solo un factor movió la aguja. Los modelos de razonamiento promediaron un 56% frente al 51% del resto. Los pasos adicionales de razonamiento parecen funcionar como una revisión interna del código antes de que la respuesta llegue.
La tabla de clasificación, y su giro
El GPT-5.5 de OpenAI encabeza esta ronda con un 68%. Seis de los 11 modelos probados se agrupan entre el 50% y el 53%, con el Qwen3.7-max de Alibaba en último lugar con un 50%, presentando una vulnerabilidad en cada salida.
Incluso el líder no es tranquilizador. Con un 68%, el GPT-5.5 aún falla casi en una de cada tres tareas de seguridad. Y es un paso atrás, porque el líder del año pasado obtuvo un 72%. La cima del campo ha bajado.
La clasificación también se ha globalizado. El Kimi-K2.6 de Moonshot y el MiMo-V2.5 de Xiaomi ahora superan a varios modelos occidentales. La procedencia se convierte en una cosa más que los equipos de adquisiciones tienen que sopesar.
Dónde están realmente los agujeros
Los promedios ocultan divisiones agudas. Por lenguaje, Python pasó el 63% del tiempo y Java solo el 30%. Java es, con mucho, el más arriesgado, aunque es el único lenguaje en un camino claramente ascendente.
Por tipo de vulnerabilidad, la dispersión es aún más amplia. Los modelos manejaron la inyección SQL y la criptografía débil razonablemente bien, con un 83% y un 87%. En cuanto a la inyección de scripts entre sitios y la inyección de registros, colapsaron, a un 15% y un 12%. Esos no son casos marginales, y los modelos apenas los registran.
El problema del volumen
Nada de esto importaría mucho si la IA escribiera una pequeña parte de la base de código. Ya no lo hace.
La tasa de fallos parecía soportable cuando la IA era un experimento. Ahora abarca la mitad de todo lo que los equipos envían, a una velocidad que ningún equipo de seguridad puede igualar a mano. Este es el piso medido bajo las anécdotas, desde plataformas de codificación de ambiente que filtran proyectos en vivo hasta los ataques de agentes que se acumulan en toda la industria. También es, como argumentó un fundador de seguridad, cómo la IA silenciosamente movió toda la superficie de ataque. También complica la promesa de que la IA se paga por sí misma, dado cuánto de la IA empresarial aún no ha salido del laboratorio.
Veracode tiene un interés obvio en la alarma, ya que vende herramientas para escanear y corregir exactamente esto. El informe llegó una semana antes de la conferencia Black Hat. Los datos subyacentes, sin embargo, son un punto de referencia comparable realizado de la misma manera durante un año, y no es halagador para nadie.
Wysopal, por su parte, no está argumentando a favor de encerrar los modelos.
“La respuesta correcta no es restringir el acceso; es una seguridad transparente y basada en evidencia”, dijo, habiendo defendido anteriormente mantener modelos poderosos como Claude Fable y Mythos en manos de los desarrolladores. “Escanéalo, corrígelo y nunca lo envíes a ciegas.”
Su última línea es la que hay que mantener. Hasta que los modelos razonen sobre la seguridad de la manera en que razonan sobre la sintaxis, las barandillas en el flujo de trabajo son el producto, no la IA. Esa brecha se ha mantenido durante un año, y este es el verdadero costo de la IA empresarial que las gráficas de capacidad no muestran.
Другие статьи
La seguridad del código generado por IA se ha estancado en un 56%.
Veracode rastreó más de 100 modelos durante un año. La seguridad del código generado por IA se mantiene en una tasa de aprobación del 56%, incluso cuando la IA ahora escribe la mitad de todo el código.
