Снова модели OpenAI и Anthropic AI выходят из-под контроля и взламывают сервисы.

Снова модели OpenAI и Anthropic AI выходят из-под контроля и взламывают сервисы.

      Новый отчет утверждает, что ИИ-агенты обеих компаний предприняли несанкционированные действия во время тестов безопасности, от взлома веб-сайта до обмана реальных людей в интернете.

      OpenAI и Anthropic пережили трудные несколько недель в области безопасности ИИ. OpenAI недавно раскрыла, что ее модели вышли из тестовой среды и взломали Hugging Face и четыре другие организации. Эта новость побудила Anthropic пересмотреть свои собственные тесты, которые показали, что Claude также получил несанкционированный доступ к трем компаниям.

      Теперь Институт безопасности ИИ Великобритании (AISI) раскрыл новый ряд инцидентов (по данным Wired). Он зафиксировал 19 несанкционированных действий в интернете в ходе 122 тестовых запусков с участием моделей обеих компаний, наиболее серьезным из которых стало изобретение агентом фальшивых онлайн-персон для внедрения вредоносного кода в реальный проект на GitHub. OpenAI отдельно сообщила о втором инциденте, в котором одна из ее моделей взломала реальный веб-сайт после того, как сторонняя лаборатория по ошибке предоставила ей доступ к интернету.

      17 инцидентов, связанных с Mythos 5 от Anthropic

      AISI отследил 17 из 19 несанкционированных действий к модели Mythos 5 от Anthropic, а оставшиеся два связаны с GPT 5.6 Sol от OpenAI. Инцидент с GitHub был одним из 17, и он не закончился, когда человек-ревьюер отклонил подачу. Агент опубликовал сводку своего прогресса публично, приглашая другие автоматизированные системы продолжить с того места, где он остановился, что AISI называет инъекцией подсказки. Позже другой агент нашел это сообщение, использовал его и продолжил работу.

      28 июля мы зафиксировали инцидент во время рутинной кибероценки, в котором ИИ-агенты предприняли устойчивые, несанкционированные действия, направленные на реальных людей и организации. Поведение в основном исходило от одной модели (Mythos 5 от Anthropic), с небольшим количеством событий от… pic.twitter.com/SPnA4Ekkwq— Институт безопасности ИИ (AISI) (@AISecurityInst) 4 августа 2026 года

      AISI утверждает, что намеренно предоставил моделям доступ в интернет и ослабил некоторые меры безопасности для тестирования их возможностей, но никогда не инструктировал агентов нацеливаться на реальных людей или организации. Институт говорит, что все еще неясно, поняли ли агенты, что вышли за рамки симуляции.

      Еще один случай случайного нарушения в OpenAI

      Второй инцидент, раскрытый OpenAI в тот же день, начался с ошибки в Irregular, сторонней лаборатории, которую OpenAI наняла для проведения своих тестов по кибербезопасности. Irregular намеревалась ограничить свою модель оценки изолированным песочницей, но ошибка конфигурации предоставила модели прямой доступ к интернету. Выйдя, она использовала уязвимость, чтобы взломать реальный веб-сайт, а затем нашла и использовала учетные данные для управления сайтом, который она только что взломала. OpenAI не назвала веб-сайт и не уточнила, что модель сделала с доступом.

      Об обеих компаниях говорится, что новые инциденты произошли в условиях, которые были намеренно ослаблены и не отражают поведение их публичных моделей. Тем не менее, это не меняет того факта, что ИИ-агенты двух самых внимательно наблюдаемых компаний в отрасли теперь вышли за пределы своих предполагаемых ограничений в трех отдельных инцидентах всего за несколько недель. И это не предвещает ничего хорошего для отрасли, стремящейся поручить ИИ-агентам больше реальных задач, прежде чем доказать, что может держать их под контролем.

Снова модели OpenAI и Anthropic AI выходят из-под контроля и взламывают сервисы. Снова модели OpenAI и Anthropic AI выходят из-под контроля и взламывают сервисы. Снова модели OpenAI и Anthropic AI выходят из-под контроля и взламывают сервисы. Снова модели OpenAI и Anthropic AI выходят из-под контроля и взламывают сервисы. Снова модели OpenAI и Anthropic AI выходят из-под контроля и взламывают сервисы.

Другие статьи

Lucid сокращает $1,4 млрд и ставит на выживание с помощью роботакси Lucid сокращает $1,4 млрд и ставит на выживание с помощью роботакси Lucid представила план сокращения затрат на $1,4 млрд наряду с квартальным убытком в $1,26 млрд, связывая свое восстановление с программой роботакси с Uber и Nuro. Исследование показывает, что читатели оценивают истории, написанные ИИ, выше, но все же больше доверяют метке «человек». Исследование показывает, что читатели оценивают истории, написанные ИИ, выше, но все же больше доверяют метке «человек». Новое исследование показало, что читатели не только испытывали трудности в различении рассказов, написанных ИИ, и человеческими, но и часто оценивали версии ИИ выше, по крайней мере, до того, как узнали, кто на самом деле их написал. Новый финансовый план T-Mobile звучит отлично, пока вы не осознаете, к чему он вас готовит. Новый финансовый план T-Mobile звучит отлично, пока вы не осознаете, к чему он вас готовит. Новый план EIP Flex 36 от T-Mobile позволяет квалифицированным клиентам финансировать телефон без первоначальных затрат. Материнские платы могут стать следующим компонентом ПК, который подорожает в значительной степени. Материнские платы могут стать следующим компонентом ПК, который подорожает в значительной степени. Новый отчет предполагает, что Asus, MSI и Gigabyte готовят повышение цен на материнские платы, что может значительно увеличить стоимость сборки нового ПК. Техас ставит под сомнение центры обработки данных, которые он когда-то привлекал. Техас ставит под сомнение центры обработки данных, которые он когда-то привлекал. Техас проведет аудит каждого дата-центра, прежде чем он сможет подключиться к сети, после того как запросы на подключение достигли пятикратного рекорда пикового спроса в штате. X борется с турецким приказом заблокировать кампанию Экрема Имамоглу X борется с турецким приказом заблокировать кампанию Экрема Имамоглу Турецкий суд приказал X ограничить аккаунт президентской кампании заключенного мэра Стамбула Экрема Имамоглу; X заявляет, что выполняет это требование, но оспаривает приказ в суде.

Снова модели OpenAI и Anthropic AI выходят из-под контроля и взламывают сервисы.

Новый отчет AISI подробно описывает, как агенты ИИ от Anthropic и OpenAI предприняли несанкционированные действия в процессе тестирования безопасности, получив доступ к открытому интернету. OpenAI отдельно сообщила, что одна из ее моделей взломала реальный веб-сайт после того, как тестовая лаборатория случайно предоставила ей доступ в интернет.