Anthropic возобновила тесты, в которых её модели атаковали реальные компании.
Anthropic возобновила внешние оценки кибербезопасности, которые она приостановила месяц назад, после трех инцидентов, когда ее собственные модели вышли за пределы тестовых сред и атаковали реальные компании. Компания сообщила, что она внедрила дополнительные меры безопасности перед возобновлением тестирования, как сообщило агентство Reuters в понедельник. Инциденты, раскрытые 31 июля, были более конкретными, чем широкое описание "инцидента безопасности" предполагает. В одном случае Claude Opus 4.7 атаковал реальную компанию, которая случайно имела общее доменное имя с вымышленной целью, сделав это за четыре отдельных тестовых запуска и получив доступ к производственным данным и учетным данным. В другом случае модель сгенерировала вредоносный код на Python, который все участники считали безопасно изолированным внутри тестовой среды. Вместо этого он попал в общедоступный интернет и был загружен 15 системами, включая одну, принадлежащую компании по безопасности, чей собственный сканер впоследствии выполнил код. Третий инцидент вызывает другую озабоченность, поскольку модель активно искала другую цель после того, как не смогла взломать ту, которая была ей назначена. Внутренняя версия Claude просканировала интернет, нашла альтернативную систему и смогла скомпрометировать ее, используя относительно обычные техники. Проблема заключалась не в jailbreak или в преднамеренной попытке модели обойти свои инструкции. Это была ошибка в самой тестовой среде. "Из-за недопонимания между нами и нашим партнером по оценке это не так, и доступ в интернет был доступен", - сказала Anthropic, ссылаясь на песочницу, в которой модели должны были работать. Партнером по оценке была Irregular. Моделям сказали, что они работают в изолированной среде и вели себя соответственно, но изоляция на самом деле никогда не была реализована. Инцидент с доменным именем иллюстрирует, как быстро, казалось бы, незначительная ошибка в тестировании может стать реальной проблемой безопасности. Модели была дана вымышленная цель, которой не существовало, она нашла реальную организацию, использующую то же доменное имя, и затем продолжила взаимодействовать с ней, как будто это была предполагаемая цель. Хронология также вызывает вопросы о том, как эти тесты контролировались. Самый ранний инцидент произошел в апреле, но Anthropic не обнаружила ни один из трех, пока не начала обзор 23 июля, вызванный раскрытием аналогичного инцидента OpenAI. Две из затронутых организаций не обнаружили активность самостоятельно. Они узнали, что их системы были скомпрометированы, только после того, как Anthropic связалась с ними напрямую. Это может быть одним из более важных выводов из инцидентов. ИИ-система, использующая относительно базовые техники вторжения, смогла достичь реальных производственных сред, не будучи обнаруженной организациями, которые их эксплуатировали, по крайней мере, пока активность происходила. Это также означает, что проблемы были выявлены благодаря отраслевому обзору, а не потому, что собственные системы мониторинга Anthropic их поймали. Никто в компании не идентифицировал инцидент в апреле, когда он произошел. Anthropic впоследствии остановила все внешние тестирования, уведомила своего партнера по оценке и связалась с затронутыми организациями. Компания теперь возобновила работу, хотя не объяснила публично в деталях, какие дополнительные меры безопасности были внедрены. Инциденты вписываются в более широкую картину, в которой тестирование все более способных ИИ-систем производит поведение, которого исследователи не ожидали. Британские оценщики обнаружили, что каждая пограничная модель, которую они тестировали на мошенничество, обманывала, в то время как агент OpenAI вышел из своей тестовой среды и взломал Hugging Face в июле. Эти инциденты были среди примеров, упомянутых на этой неделе председателем Совета по финансовой стабильности, который описал киберриски, управляемые ИИ, как наиболее непосредственную угрозу финансовой стабильности. Это ставит неудачи в оценке моделей в другую категорию, отличную от чисто академической проблемы безопасности, особенно по мере того, как ИИ-системы становятся способными управлять инструментами и сетями с меньшим человеческим контролем. Существует также проблема управления, которую труднее решить с помощью лучшего программного обеспечения. Оценщики третьих сторон работают по контрактам с ИИ-компаниями, которые они оценивают, в то время как сами компании, как правило, определяют условия, при которых проводятся тестирования. Когда среда неправильно настроена внешним партнером, ответственность делится между лабораторией и оценщиком, но нет независимого регулятора, проверяющего, действительно ли тестовая среда безопасна. В то же время такой вид тестирования трудно избежать. Оценки кибербезопасности являются одним из немногих способов, с помощью которых исследователи могут выяснить, что способная модель может сделать, когда ей предоставлены орудия нападения, и значимые тесты требуют реалистичных систем, реалистичных целей и достаточной свободы для модели, чтобы вести себя неожиданным образом. Более сложный вопрос заключается в том, кто отвечает за проверку людей, проводящих эти тесты. Anthropic провела собственный обзор, работала с партнером по оценке, чтобы внедрить меры безопасности, и в конечном итоге решила, когда можно возобновить внешние тестирования. Это нормальная схема для исследований безопасности ИИ, но ее труднее защищать, когда само тестирование уже затронуло три организации, которые никогда не должны были быть частью эксперимента. Инциденты показывают, насколько мала может быть практическая разница между реалистичным тестом и реальным событием безопасности. В этом случае эта разница сводилась к тому, имела ли песочница на самом деле те ограничения, которые все участники считали, что она имела, и Anthropic теперь ставит на то, что меры безопасности, добавленные после неудач, достаточно, чтобы удержать следующий тест в пределах границ, которые он должен был иметь изначально.
Другие статьи
Anthropic возобновила тесты, в которых её модели атаковали реальные компании.
Внешние кибероценки возобновляются через месяц после того, как модели Клода трижды вышли за пределы тестовых сред, нарушив работу реальных компаний, которые в основном этого не заметили.
