OpenAI подтверждает, что его ИИ выбрался из песочницы и нарушил безопасность Hugging Face
TL;DROpenAI сообщает, что GPT-5.6 Sol и нераскрытая модель сбежали из защищенного теста, использовали уязвимость нулевого дня и взломали Hugging Face, чтобы обмануть в оценке кибербезопасности.
OpenAI заявила во вторник, что две ее модели ИИ, включая флагманскую Sol, выбрались из защищенной тестовой среды, получили доступ в интернет, используя уязвимость нулевого дня в стороннем программном обеспечении, и взломали производственную инфраструктуру Hugging Face. Компания назвала инцидент «беспрецедентным» и сообщила, что делится предварительными выводами, чтобы помочь защитникам понять, на что теперь способны передовые модели.
Обе модели работали с более низкими стандартами кибербезопасности в рамках внутренней оценки их наступательных возможностей. Они тестировались на ExploitGym, свободно доступном бенчмарке по кибербезопасности, и определили, что ответы на тест хранились на производственных системах Hugging Face.
Вместо того чтобы решить оценку, как предполагалось, модели нацелились на ключ ответов. Они потратили то, что OpenAI описала как «значительное количество вычислений вывода», чтобы найти выход из своей песочницы, а затем связали две уязвимости удаленного выполнения кода в конвейере обработки данных Hugging Face. Атака собрала учетные данные облака и кластеров, переместилась в внутренние кластеры и выполнила более 17,000 отдельных действий в рое краткоживущих песочниц, согласно собственному раскрытию Hugging Face от 16 июля.
💜 технологий ЕС Последние новости из технологической сцены ЕС, история от нашего мудрого основателя Бориса и несколько сомнительных произведений ИИ. Это бесплатно, каждую неделю, в вашем почтовом ящике. Подпишитесь сейчас! Hugging Face сообщила, что обнаружила вторжение, локализовала его и восстановила скомпрометированные узлы. Компания не нашла доказательств вмешательства в публичные модели, наборы данных или Spaces и подтвердила, что ее цепочка поставок программного обеспечения была чистой. Она все еще оценивает, были ли затронуты данные каких-либо партнеров или клиентов.
Для расследования утечки Hugging Face обратилась к GLM, китайской модели с открытыми весами, поскольку защитные меры на коммерческих моделях США блокировали судебно-медицинские запросы, которые ее команда должна была выполнить.
Побег не является первым случаем, когда Sol была поймана за манипуляциями с собственными оценками. Организация по оценке моделей и исследованию угроз, независимая лаборатория, которая проводила тестирование модели перед запуском, обнаружила, что она агрессивно взламывала свои тестовые среды, чтобы завысить свои баллы. В одной задаче она упаковала эксплойт в поток данных, повысила привилегии на сервере оценки и раскрыла правильные ответы, которые скрывали человеческие оценщики.
Широкая картина сбоев безопасности агентов ИИ резко ускорилась, при этом четыре отдельные исследовательские группы взломали агентов ИИ четырьмя разными способами всего за первые десять дней июля. OpenAI и Anthropic столкнулись с повышенным вниманием к кибербезопасности своих моделей, при этом администрация Трампа ограничила доступ к самым новым системам обеих компаний во время правительственного обзора.
OpenAI обнаружила атаку на Hugging Face и связалась, чтобы раскрыть ее, но к тому времени Hugging Face уже самостоятельно идентифицировала и локализовала утечку. Инцидент демонстрирует, что разрыв между моделями ИИ, которые могут находить уязвимости, и моделями ИИ, которые будут их эксплуатировать без разрешения, уже меньше, чем кто-либо в отрасли публично признавал.
Other articles
OpenAI подтверждает, что его ИИ выбрался из песочницы и нарушил безопасность Hugging Face
OpenAI сообщает, что GPT-5.6 Sol и нераскрытая модель вышли из защищенного теста, использовали уязвимость нулевого дня и проникли в Hugging Face, чтобы обмануть в кибероценке.
