Безопасность кода, сгенерированного ИИ, остановилась на уровне 56%
Искусственный интеллект теперь может писать компилируемый код почти каждый раз, когда он пытается. Тем не менее, он по-прежнему содержит уязвимость в почти половине случаев, и это не изменилось за год.
Это главное открытие отчета Veracode о безопасности кода GenAI 2026 года, который протестировал более 100 моделей за четыре момента времени. Средний уровень прохождения безопасности составляет 56%, почти точно там, где он начинался — 55%.
Сравните это число с другим в отчете. Искусственный интеллект теперь пишет примерно половину всего коммитируемого кода. Уровень неудач остался стабильным, в то время как объем под ним взорвался.
Синтаксис решен. Безопасность — нет.
Разрыв очевиден. При отсутствии специфических запросов на безопасность модели производят код, который компилируется почти 100% времени. По безопасности они терпят неудачу почти в 44% случаев, вводя уязвимость из OWASP Top 10.
💜 технологий ЕС Последние новости из технологической сцены ЕС, история от нашего мудрого основателя Бориса и немного сомнительного ИИ-арта. Это бесплатно, каждую неделю, в вашем почтовом ящике. Подпишитесь сейчас! “Модели могут быть почти синтаксически идеальными, но они все еще терпят неудачу почти в половине всех задач, где нужна безопасность,” сказал Крис Уайспал, соучредитель Veracode и главный евангелист безопасности. “Это число должно быть тревожным сигналом для любой организации.”
Одна оговорка имеет значение. Тесты проводились на сырых моделях, без агентов, защитных механизмов или человеческой проверки в процессе. В реальном конвейере они добавляют уровень защиты. Таким образом, 56% — это уровень, на котором модели генерируют ошибки, а не уровень, на котором они достигают производства.
Три предположения, которые данные опровергают
Отчет разбирает некоторые удобные убеждения.
Модели, созданные специально для кодирования, не безопаснее. Они в среднем составили 51%, немного отставая от 52% моделей общего назначения. Выбор инструмента, оптимизированного для кодирования, чтобы снизить риск, ничего не дает.
Размер тоже не помогает. Большие модели набрали 53%, средние и маленькие — по 51%. Увеличение масштаба не закрывает разрыв.
Только один фактор изменил ситуацию. Модели рассуждений в среднем составили 56% против 51% для остальных. Дополнительные шаги рассуждения, похоже, работают как внутренний обзор кода перед тем, как ответ будет дан.
Таблица лидеров и ее поворот
GPT-5.5 от OpenAI возглавляет этот раунд с 68%. Шесть из 11 протестированных моделей находятся в диапазоне от 50% до 53%, при этом Qwen3.7-max от Alibaba замыкает список с 50%, вводя уязвимость в каждом втором выводе.
Даже лидер не внушает уверенности. С 68% GPT-5.5 все еще терпит неудачу почти в одной из трех задач по безопасности. И это шаг назад, потому что лидер прошлого года набрал 72%. Верхушка поля снизилась.
Рейтинг также стал глобальным. Kimi-K2.6 от Moonshot и MiMo-V2.5 от Xiaomi теперь обгоняют несколько западных моделей. Происхождение становится еще одной вещью, которую командам закупок нужно учитывать.
Где на самом деле находятся уязвимости
Средние значения скрывают резкие разделения. По языкам Python прошел 63% времени, а Java — всего 30%. Java является самым рискованным, хотя это единственный язык с явным восходящим трендом.
По типу уязвимости разброс еще шире. Модели справлялись с SQL-инъекциями и слабой криптографией довольно хорошо, на уровне 83% и 87%. По кросс-сайтовым скриптам и инъекциям логов они провалились, составив 15% и 12%. Это не крайние случаи, и модели едва ли их регистрируют.
Проблема объема
Ничто из этого не имело бы большого значения, если бы ИИ писал лишь небольшую часть кодовой базы. Теперь это не так.
Уровень неудач выглядел выживаемым, когда ИИ был экспериментом. Теперь он охватывает половину всего, что команды отправляют, с такой скоростью, которую ни одна команда безопасности не может сопоставить вручную. Это измеренный минимум под анекдотами, от платформ кодирования по настроению, утечек живых проектов до атак агентов, накапливающихся по всей отрасли. Это также, как утверждал один основатель в области безопасности, как ИИ тихо изменил всю поверхность атаки. Это также усложняет обещание, что ИИ окупает себя, учитывая, сколько корпоративного ИИ все еще не покинуло лабораторию.
Veracode имеет очевидный интерес в этом тревожном сигнале, так как продает инструменты для сканирования и исправления именно этого. Отчет поступил за неделю до конференции Black Hat. Однако базовые данные представляют собой сопоставимый бенчмарк, проведенный одинаковым образом в течение года, и он не лестен для никого.
Уайспал, со своей стороны, не настаивает на том, чтобы запирать модели.
“Правильный ответ не в ограничении доступа; это прозрачная, основанная на доказательствах безопасность,” сказал он, ранее защищая сохранение мощных моделей, таких как Claude Fable и Mythos, в руках разработчиков. “Сканируйте это, исправляйте это и никогда не отправляйте это вслепую.”
Его последняя фраза — это то, что нужно запомнить. Пока модели не будут рассуждать о безопасности так же, как они рассуждают о синтаксисе, защитные механизмы в рабочем процессе являются продуктом, а не ИИ. Этот разрыв сохраняется уже год, и это настоящая цена корпоративного ИИ, которую графики возможностей не показывают.
Другие статьи
Безопасность кода, сгенерированного ИИ, остановилась на уровне 56%
Veracode отслеживала более 100 моделей в течение года. Безопасность кода, сгенерированного ИИ, застряла на уровне 56% успешных тестов, даже несмотря на то, что ИИ теперь пишет половину всего кода.
