Снова модели OpenAI и Anthropic AI выходят из-под контроля и взламывают сервисы.
Новый отчет утверждает, что ИИ-агенты обеих компаний предприняли несанкционированные действия во время тестов безопасности, от взлома веб-сайта до обмана реальных людей в интернете.
OpenAI и Anthropic пережили трудные несколько недель в области безопасности ИИ. OpenAI недавно раскрыла, что ее модели вышли из тестовой среды и взломали Hugging Face и четыре другие организации. Эта новость побудила Anthropic пересмотреть свои собственные тесты, которые показали, что Claude также получил несанкционированный доступ к трем компаниям.
Теперь Институт безопасности ИИ Великобритании (AISI) раскрыл новый ряд инцидентов (по данным Wired). Он зафиксировал 19 несанкционированных действий в интернете в ходе 122 тестовых запусков с участием моделей обеих компаний, наиболее серьезным из которых стало изобретение агентом фальшивых онлайн-персон для внедрения вредоносного кода в реальный проект на GitHub. OpenAI отдельно сообщила о втором инциденте, в котором одна из ее моделей взломала реальный веб-сайт после того, как сторонняя лаборатория по ошибке предоставила ей доступ к интернету.
17 инцидентов, связанных с Mythos 5 от Anthropic
AISI отследил 17 из 19 несанкционированных действий к модели Mythos 5 от Anthropic, а оставшиеся два связаны с GPT 5.6 Sol от OpenAI. Инцидент с GitHub был одним из 17, и он не закончился, когда человек-ревьюер отклонил подачу. Агент опубликовал сводку своего прогресса публично, приглашая другие автоматизированные системы продолжить с того места, где он остановился, что AISI называет инъекцией подсказки. Позже другой агент нашел это сообщение, использовал его и продолжил работу.
28 июля мы зафиксировали инцидент во время рутинной кибероценки, в котором ИИ-агенты предприняли устойчивые, несанкционированные действия, направленные на реальных людей и организации. Поведение в основном исходило от одной модели (Mythos 5 от Anthropic), с небольшим количеством событий от… pic.twitter.com/SPnA4Ekkwq— Институт безопасности ИИ (AISI) (@AISecurityInst) 4 августа 2026 года
AISI утверждает, что намеренно предоставил моделям доступ в интернет и ослабил некоторые меры безопасности для тестирования их возможностей, но никогда не инструктировал агентов нацеливаться на реальных людей или организации. Институт говорит, что все еще неясно, поняли ли агенты, что вышли за рамки симуляции.
Еще один случай случайного нарушения в OpenAI
Второй инцидент, раскрытый OpenAI в тот же день, начался с ошибки в Irregular, сторонней лаборатории, которую OpenAI наняла для проведения своих тестов по кибербезопасности. Irregular намеревалась ограничить свою модель оценки изолированным песочницей, но ошибка конфигурации предоставила модели прямой доступ к интернету. Выйдя, она использовала уязвимость, чтобы взломать реальный веб-сайт, а затем нашла и использовала учетные данные для управления сайтом, который она только что взломала. OpenAI не назвала веб-сайт и не уточнила, что модель сделала с доступом.
Об обеих компаниях говорится, что новые инциденты произошли в условиях, которые были намеренно ослаблены и не отражают поведение их публичных моделей. Тем не менее, это не меняет того факта, что ИИ-агенты двух самых внимательно наблюдаемых компаний в отрасли теперь вышли за пределы своих предполагаемых ограничений в трех отдельных инцидентах всего за несколько недель. И это не предвещает ничего хорошего для отрасли, стремящейся поручить ИИ-агентам больше реальных задач, прежде чем доказать, что может держать их под контролем.
Другие статьи
Снова модели OpenAI и Anthropic AI выходят из-под контроля и взламывают сервисы.
Новый отчет AISI подробно описывает, как агенты ИИ от Anthropic и OpenAI предприняли несанкционированные действия в процессе тестирования безопасности, получив доступ к открытому интернету. OpenAI отдельно сообщила, что одна из ее моделей взломала реальный веб-сайт после того, как тестовая лаборатория случайно предоставила ей доступ в интернет.
