Дешевая программа стерла собственный рейтинг угроз ИИ Booz Allen.
Booz Allen протестировала 18 из самых продвинутых AI-моделей мира на реальной корпоративной сети и поручила им взломать её. Одна из них справилась с задачей. Консалтинговая фирма утверждает, что составленный ею рейтинг — это не то, что следует из этого извлекать.
Индекс кибероружия, опубликованный в среду, оценил девять американских и девять китайских моделей. Он измерял, насколько далеко каждая из них могла продвинуться при реальном вторжении без постороннего вмешательства. Только Claude Mythos от Anthropic достиг конца. Джессика Лайонс сообщила о результатах для The Register в среду вечером.
Что на самом деле сделало тестирование
Каждая модель получила свою собственную машину-атакующего и выдавала команды по одной за раз. Booz Allen не предоставила им меню инструментов и вспомогательного программного обеспечения, что и было целью. Фирма хотела измерить, что модель может сделать самостоятельно, без инженерного окружения, которое обычно её сопровождает.
Оценка состояла из двух частей. Одна измеряла, может ли модель находить уязвимости в скомпилированном программном обеспечении без исходного кода. Другая отслеживала, насколько далеко она продвинулась через вторжение против защищенной сети Active Directory. Это измерялось от первого доступа до полного контроля администратора домена. Booz Allen утверждает, что оценивала то, что подтвердили сетевые журналы, а не то, что заявляли модели, используя записи трафика, журналы безопасности и датчики обнаружения вторжений.
Это различие имеет значение, потому что мы сообщали в июле, что старые тесты перестали давать кому-либо много информации. Большинство существующих бенчмарков измеряют то, что модель знает. Этот же измеряет то, что она сделала.
Claude Mythos набрал 80. Получив украденные учетные данные сотрудника, он взял на себя контроль администратора при каждой попытке. Он также самостоятельно определил свой маршрут к более высоким привилегиям, а не следовал сценарию. На более сложном тесте, без каких-либо учетных данных, он всё равно взломал домен снаружи. Все остальные модели потерпели неудачу на этом тесте.
На втором месте оказался Grok-4.5 с 49 баллами, а GPT-5.6 Sol — с 46. Muse Spark 1.1 от Meta и Kimi K3 от Moonshot набрали по 38, GLM-5.2 от Z.ai — 37, а Claude Opus 4.8 — 36. Qwen3-Coder от Alibaba завершил тест последним с 4 баллами. Три модели, кроме Mythos, получили полный контроль над доменом. Четыре другие переместились по сети, и все, кроме одной, вошли без посторонней помощи.
Вывод, который подрывает таблицу
Затем отчет подрывает собственную таблицу лидеров. Claude Sonnet 5 занял 15-е место из 18 с оценкой 13. Booz Allen сопоставила его с атакующим хардваром, программным обеспечением, которое соединяет модель с инструментами взлома и помогает ей оставаться на задании. Затем он соперничал с Mythos.
Это разрыв в 67 баллов, закрытый за счет подключения. Хардвар позволяет модели оставаться сосредоточенной, адаптироваться, восстанавливаться после неудачи и связывать отдельные действия в устойчивую операцию. Вывод Booz Allen однозначен. Модель больше не является единицей риска. Система является таковой.
Фирма также признает, что не измеряла. Она не тестировала китайские или модели с открытым весом, соединенные с оптимизированными хардварами. Она утверждает, что её результаты сильно предполагают, что полностью способные комбинации уже существуют.
Одна модель отказалась. Её "сосед" всё равно справился
Второе открытие почти не привлекло внимания в среду. Одна модель отказалась выполнять задачу на том основании, что у неё нет учетных данных. Её настроенная на кибербезопасность "сестра", получившая ту же задачу, согласилась и выполнила её.
Booz Allen выводит общий закон из этого. Ограничения не являются фиксированным свойством модели, и их эффективность меняется в зависимости от контекста и конфигурации. Отказ в одной обстановке ничего не говорит о другой. Тот же урок появился на этом столе во вторник, когда исследователь захватил Claude Code, попросив его подвести итог странице.
Где модели всё ещё терпят неудачу
Самое очевидное ограничение — это исследование уязвимостей в реальном мире. Против преднамеренно заложенного недостатка все модели набрали почти максимальные баллы. Происхождение не имело значения между американскими, китайскими, открытыми и закрытыми моделями. Против настоящего невидимого недостатка, зарытого в крупной производственной библиотеке, отчет говорит, что каждая из девяти передовых моделей набрала ноль. Одна правильно проанализировала уязвимый компонент, а затем решила, что он безопасен.
Отчет затем утверждает, что только передовые модели от Anthropic заметили этот недостаток. Только Mythos, добавляет он, поняла его достаточно хорошо, чтобы использовать его. Эти утверждения находятся в одном абзаце, и отчет не reconciles их, поэтому читайте ноль как относящийся к оценке, а не к каждой попытке. Mythos имеет опыт в этом: он нашел 10,000 критических уязвимостей за один месяц в мае.
Booz Allen рассматривает разрыв как пространство для маневра. Реальные возможности наступления всё ещё отстают от бенчмарков, что дает защитникам время. Фирма ожидает, что большинство из 18 достигнут уровня Mythos в течение шести месяцев. Она называет атаки с использованием AI мейнстримом неизбежными.
Читать рекомендации, зная, кто их написал
Booz Allen опубликовала индекс вместе с Vellox Labs Guile, продуктом, созданным для разрушения автономных атак. В том же релизе говорится, что скоординированные контр-AI сценарии снижают успех атакующих более чем на 95% в собственных тестах фирмы. Никто не проверял эту цифру независимо, и это аргумент в пользу продаваемого продукта.
Политические запросы отделимы от рекламного предложения. Отчет требует обязательных, специфичных для сектора сроков, заставляющих операторов критической инфраструктуры доказать, что они могут сдерживать вторжение. Он хочет национальную программу, тестирующую иностранные и модели с открытым весом в реалистичных условиях. Он также хочет управляемый доступ для проверенных защитников к возможностям, против которых они должны защищаться.
Отчет упоминает июльскую утечку данных Hugging Face как момент, когда модель завершила цепочку уничтожения в реальном мире, а не в лаборатории. Одна модель отсутствует в самом индексе. Astra от OpenAI не была протестирована, и OpenAI заявила во вторник, что она достигла критического порога кибербезопасности компании. Индекс приходит, измеряя область, которая уже изменилась.
Другие статьи
Дешевая программа стерла собственный рейтинг угроз ИИ Booz Allen.
Booz Allen протестировала 18 моделей ИИ на взломе живой сети. Только Claude Mythos завершил задачу. Затем дешевый хомут закрыл разрыв.
