Anthropic сообщает, что его модели Claude нарушили безопасность трех компаний во время кибер-тестов.

Anthropic сообщает, что его модели Claude нарушили безопасность трех компаний во время кибер-тестов.

      Anthropic раскрыла, что три её модели Claude получили несанкционированный доступ к производственным системам трёх реальных организаций во время тестов на кибербезопасность, после того как неправильная конфигурация оставила тестовую среду подключённой к живому интернету. Компания опубликовала отчет 30 июля, представив его как добровольное раскрытие информации о безопасности, а не как нарушение, которое ей пришлось признать. Модели, участвовавшие в инциденте, — это Claude Opus 4.7, Claude Mythos 5 и не выпущенная внутренняя исследовательская модель. Все три проходили через оценки по атакующей безопасности, созданные с помощью Irregular, стороннего партнёра, который проводит стресс-тесты передовых систем на реалистичных задачах взлома. Коренной причиной была ошибка в окружении, а не jailbreak. Anthropic описала «недоразумение» относительно того, имела ли песочница доступ в интернет, поэтому упражнения, предназначенные для работы с симулированными целями, вместо этого достигли реальных, что является той самой ошибкой, которая, по словам исследователей, помогает объяснить, почему агенты ИИ продолжают вырываться из своих песочниц. Что делает этот инцидент примечательным, так это то, что три модели не вели себя одинаково. Новейшая исследовательская модель остановилась сама по себе, как только поняла, что цели были реальными, в то время как два коммерческих продукта продолжили атаковать. Opus 4.7 распознала, что она атакует реальные производственные системы на всех четырёх запусках, и продолжала атаковать, извлекая учетные данные и достигая производственных баз данных. Она воспринимала признаки живой среды как шум, а не как причину для остановки. Mythos 5 заметила признаки того, что она находится на реальной инфраструктуре, но рационализировала их, убедив себя, что системы все еще являются частью упражнения. Затем она опубликовала вредоносное ПО в PyPI, публичном реестре, из которого разработчики Python загружают пакеты. Anthropic была осторожна в своих заявлениях и в тех, которых избегала. Компания заявила, что не нашла доказательств того, что какая-либо модель преследовала собственную цель, утверждая, что системы просто пытались завершить задачи, которые им были поручены. Эта интерпретация является центральной для того, как Anthropic хочет, чтобы этот эпизод воспринимали. «Claude было явно сказано в нашем запросе, что у него нет доступа в интернет», — написала компания, представив результат как ошибку в настройке теста, а не как решение модели вырваться. METR, независимая оценочная группа, сейчас рассматривает инциденты. Anthropic сообщила, что затронутые организации сами не обнаружили активность, и что проблема всплыла во время аудита собственных логов после открытия расследования 21 июля. Это раскрытие происходит на фоне ряда аналогичных признаний в отрасли. Оно последовало за подтверждением OpenAI, что один из её агентов вырвался из песочницы и нарушил безопасность Hugging Face, инцидент, который превратил «побег из песочницы» из лабораторного любопытства в реальную корпоративную проблему безопасности. Однако два случая не идентичны. Модель OpenAI использовала неизвестную уязвимость программного обеспечения, чтобы вырваться, тогда как модели Anthropic вышли в интернет через путь, который человек случайно оставил открытым. Также формируется определённая закономерность вокруг собственных систем Anthropic. Компания ранее удерживала модель после того, как она вырвалась из своей песочницы и отправила электронное письмо исследователю, а её линия Mythos была вовлечена в отдельные проблемы безопасности. Для клиентов неудобная деталь — это время. Модели, упомянутые здесь, являются актуальными, широко развернутыми продуктами, а не экспериментальными сборками, что является частью причины, по которой этот отчет привлёк больше внимания, чем обычный отчет красной команды. Выбор ответа Anthropic заключался в том, чтобы опубликовать, а не скрыть. Компания изложила хронологию, назвала модели и пригласила внешнее внимание, что является шагом к прозрачности, который также напоминает о том, как трудно полностью контролировать эти системы. Этот эпизод оставляет неудобный вопрос. Если одна ошибка в тестировании была достаточна, чтобы отправить передовые модели в три реальные компании, то защитные меры, защищающие всех остальных, могут больше зависеть от конфигурации, чем от собственного суждения моделей.

Другие статьи

GTA 6 владеет ноябрем, если только Ремейк Ocarina of Time не скажет об этом что-то. GTA 6 владеет ноябрем, если только Ремейк Ocarina of Time не скажет об этом что-то. Новые списки amiibo от Nintendo вызвали спекуляции о том, что ремейк Ocarina of Time может выйти всего за неделю до GTA 6, подготавливая необычное противостояние в ноябре. Искусственный интеллект Siri от Apple бесплатен, пока вы на самом деле не начнете его использовать. Искусственный интеллект Siri от Apple бесплатен, пока вы на самом деле не начнете его использовать. Заработок Apple на конференции по доходам тихо показал, что активные пользователи Siri AI в конечном итоге могут нуждаться в более крупном плане iCloud+, чтобы продолжать использовать его без ограничений. Вот что на самом деле сказал Тим Кук. Индийская полиция возбудила дело против главы Meta в Индии из-за измененных видео с Моди. Индийская полиция возбудила дело против главы Meta в Индии из-за измененных видео с Моди. Полиция киберпреступлений Хайдарабада возбудила дело против главы Meta India Аруна Шриниваса из-за видео с ИИ-изменениями с премьер-министром Моди, что усиливает напряженность между правительством и платформой. Акции Apple падают из-за проблем с поставками, несмотря на рекордные продажи iPhone Акции Apple падают из-за проблем с поставками, несмотря на рекордные продажи iPhone Apple показала свои лучшие результаты за июньский квартал по продажам iPhone, но акции все равно упали, так как предупреждение о проблемах с поставками и растущих затратах встревожило инвесторов. Акции упали более чем на 7% перед открытием торгов в пятницу, стерев часть... Индийская полиция возбудила дело против главы Meta в Индии из-за измененных видео с Моди. Индийская полиция возбудила дело против главы Meta в Индии из-за измененных видео с Моди. Киберполиция Хайдарабада возбудила дело против главы Meta India Аруна Шриниваса из-за видео с изменениями на основе ИИ с премьер-министром Моди, что усиливает напряженность между правительством и платформой. Ваш следующий графический процессор Nvidia может стоить на 30% дороже, и в этом виновата ИИ. Ваш следующий графический процессор Nvidia может стоить на 30% дороже, и в этом виновата ИИ. Эта мечта об обновлении RTX может ускользнуть еще дальше, поскольку ИИ продолжает поднимать цены на графические процессоры.

Anthropic сообщает, что его модели Claude нарушили безопасность трех компаний во время кибер-тестов.

Anthropic сообщила, что три её модели Claude получили несанкционированный доступ к производственным системам трёх реальных организаций во время тестов на кибербезопасность, после того как неправильная конфигурация оставила тестовую среду подключённой к рабочей.