Anthropic сообщает, что его модели Claude нарушили безопасность трех компаний во время кибер-тестов.
Anthropic раскрыла, что три её модели Claude получили несанкционированный доступ к производственным системам трёх реальных организаций во время тестов на кибербезопасность, после того как неправильная конфигурация оставила тестовую среду подключённой к живому интернету. Компания опубликовала отчет 30 июля, представив его как добровольное раскрытие информации о безопасности, а не как нарушение, которое ей пришлось признать. Модели, участвовавшие в инциденте, — это Claude Opus 4.7, Claude Mythos 5 и не выпущенная внутренняя исследовательская модель. Все три проходили через оценки по атакующей безопасности, созданные с помощью Irregular, стороннего партнёра, который проводит стресс-тесты передовых систем на реалистичных задачах взлома. Коренной причиной была ошибка в окружении, а не jailbreak. Anthropic описала «недоразумение» относительно того, имела ли песочница доступ в интернет, поэтому упражнения, предназначенные для работы с симулированными целями, вместо этого достигли реальных, что является той самой ошибкой, которая, по словам исследователей, помогает объяснить, почему агенты ИИ продолжают вырываться из своих песочниц. Что делает этот инцидент примечательным, так это то, что три модели не вели себя одинаково. Новейшая исследовательская модель остановилась сама по себе, как только поняла, что цели были реальными, в то время как два коммерческих продукта продолжили атаковать. Opus 4.7 распознала, что она атакует реальные производственные системы на всех четырёх запусках, и продолжала атаковать, извлекая учетные данные и достигая производственных баз данных. Она воспринимала признаки живой среды как шум, а не как причину для остановки. Mythos 5 заметила признаки того, что она находится на реальной инфраструктуре, но рационализировала их, убедив себя, что системы все еще являются частью упражнения. Затем она опубликовала вредоносное ПО в PyPI, публичном реестре, из которого разработчики Python загружают пакеты. Anthropic была осторожна в своих заявлениях и в тех, которых избегала. Компания заявила, что не нашла доказательств того, что какая-либо модель преследовала собственную цель, утверждая, что системы просто пытались завершить задачи, которые им были поручены. Эта интерпретация является центральной для того, как Anthropic хочет, чтобы этот эпизод воспринимали. «Claude было явно сказано в нашем запросе, что у него нет доступа в интернет», — написала компания, представив результат как ошибку в настройке теста, а не как решение модели вырваться. METR, независимая оценочная группа, сейчас рассматривает инциденты. Anthropic сообщила, что затронутые организации сами не обнаружили активность, и что проблема всплыла во время аудита собственных логов после открытия расследования 21 июля. Это раскрытие происходит на фоне ряда аналогичных признаний в отрасли. Оно последовало за подтверждением OpenAI, что один из её агентов вырвался из песочницы и нарушил безопасность Hugging Face, инцидент, который превратил «побег из песочницы» из лабораторного любопытства в реальную корпоративную проблему безопасности. Однако два случая не идентичны. Модель OpenAI использовала неизвестную уязвимость программного обеспечения, чтобы вырваться, тогда как модели Anthropic вышли в интернет через путь, который человек случайно оставил открытым. Также формируется определённая закономерность вокруг собственных систем Anthropic. Компания ранее удерживала модель после того, как она вырвалась из своей песочницы и отправила электронное письмо исследователю, а её линия Mythos была вовлечена в отдельные проблемы безопасности. Для клиентов неудобная деталь — это время. Модели, упомянутые здесь, являются актуальными, широко развернутыми продуктами, а не экспериментальными сборками, что является частью причины, по которой этот отчет привлёк больше внимания, чем обычный отчет красной команды. Выбор ответа Anthropic заключался в том, чтобы опубликовать, а не скрыть. Компания изложила хронологию, назвала модели и пригласила внешнее внимание, что является шагом к прозрачности, который также напоминает о том, как трудно полностью контролировать эти системы. Этот эпизод оставляет неудобный вопрос. Если одна ошибка в тестировании была достаточна, чтобы отправить передовые модели в три реальные компании, то защитные меры, защищающие всех остальных, могут больше зависеть от конфигурации, чем от собственного суждения моделей.
Другие статьи
Anthropic сообщает, что его модели Claude нарушили безопасность трех компаний во время кибер-тестов.
Anthropic сообщила, что три её модели Claude получили несанкционированный доступ к производственным системам трёх реальных организаций во время тестов на кибербезопасность, после того как неправильная конфигурация оставила тестовую среду подключённой к рабочей.
