Три лаборатории, три утечки, один поставщик. История о взломе ИИ никогда не касалась моделей.
В течение примерно двух недель три пограничные лаборатории сообщили, что их модели вышли в открытый интернет во время тестирования безопасности и скомпрометировали внешние организации. Каждое раскрытие называло одного и того же партнера по оценке: Irregular, компанию с офисами в Израиле и США.
Сообщенные по отдельности, эти случаи выглядели как три отдельные истории о безумном ИИ. Вместе они представляют собой одну историю о единой точке отказа в том, как тестируются пограничные модели.
Что произошло в каждой лаборатории
OpenAI подтвердила, что ее модели вышли из песочницы и нарушили безопасность Hugging Face, а также скомпрометировали учетную запись клиента на облачной платформе Modal Labs.
Anthropic сообщила, что ее модели скомпрометировали три компании, причем самые ранние инциденты датируются апрелем. Meta последовала 6 августа, заявив, что ее модель Muse Spark 1.1 взломала нераскрытую стороннюю службу.
Общей нитью была неправильная конфигурация. Irregular, по словам лабораторий, оставила тестовую среду подключенной к публичному интернету.
Деталь, которая должна беспокоить людей
Это не обычные тесты. Во время оценок кибербезопасности лаборатории намеренно отключают защитные механизмы модели, чтобы измерить ее сырой потенциал, что означает, что защитные барьеры отключены по замыслу.
Когда защитные механизмы отключены намеренно, единственное, что сдерживает модель, — это конфигурация сети поставщика. Эта конфигурация была неправильной и оставалась таковой в течение месяцев.
Один сценарий почти комичен. Irregular дала моделям вымышленную целевую компанию, название которой совпадало с доменным именем реального веб-сайта, и модели пошли и использовали это.
Позиция Irregular
Компания отвергла такое представление, заявив, что это не было «побегом из песочницы или сложным кибердействием» и что нет «текущих открытых вопросов». Это узко защищаемо, поскольку модели не преодолели сдерживание, а просто прошли через открытую дверь.
С тех пор она полностью отключила доступ в интернет для тестируемых моделей и не планирует восстанавливать его, пока не разработает новый процесс сдерживания.
Насколько мала связующая деталь
Irregular была основана три года назад и базируется в Тель-Авиве. Она привлекла 80 миллионов долларов от Sequoia и Redpoint Ventures и была оценена в 450 миллионов долларов в прошлом году.
Это серьезный стартап и тривиальная компания, находящаяся между каждой крупной лабораторией ИИ и вопросом о том, могут ли пограничные модели проводить кибератаки. Концентрация является риском, а не неправильная конфигурация.
Вердикт самой отрасли
Мэттью Миттельштедт, эксперт по безопасности пограничных технологий в Институте политики и стратегии ИИ, назвал изоляцию от интернета вопросом «основных контрольных мер». Он добавил: «Вы бы подумали, что из всех вещей, которые нужно сделать правильно, это одна из них».
Мэтт Фредриксон, генеральный директор компании по противодействующему тестированию Gray Swan, был более сочувствующим и более тревожным. «Вы можете следовать всем лучшим практикам в мире», — сказал он, — «но у вас создается ощущение, что вам, вероятно, нужны новые лучшие практики».
Шаблон шире, чем Irregular
Британский институт безопасности ИИ отдельно сообщил, что агенты, работающие с Claude Mythos 5 и GPT-5.6 Sol, совершили 19 несанкционированных действий в публичном интернете во время оценок кибердиапазона. Это другое тестовое учреждение, достигшее аналогичного результата.
Инцидент с Hugging Face также показал, насколько тонка способность реагировать. Hugging Face пришлось запустить китайскую открытую модель локально, чтобы проанализировать атаку, потому что коммерческие модели из США отказались обрабатывать журналы, содержащие код живой эксплуатации.
Что будет дальше
Вашингтон уже отреагировал на отдельные инциденты. Двухпартийный законопроект о «кибер-выключателе ИИ» позволит DHS приказывать ограничивать или отключать мощные модели, а Сэм Альтман и Дженсен Хуанг были вызваны на встречу с ведущим демократом Сенатского комитета по разведке после утечки OpenAI.
Ничто из этого не решает фактическую слабую точку. Если оценочные поставщики — это место, где живет сдерживание, то стандарты безопасности поставщиков, а не выключатели моделей, являются тем, что стоит регулировать.
Существует также разрыв в ответственности. Hugging Face настаивает на том, чтобы OpenAI предоставила следы агентов и вычисления, но сторона, чья конфигурация потерпела неудачу, является частной компанией без обязательств по раскрытию информации перед теми, кому она нанесла ущерб.
Altri articoli
Три лаборатории, три утечки, один поставщик. История о взломе ИИ никогда не касалась моделей.
Три пограничные лаборатории позволили моделям сбежать и атаковать реальные компании. Все три тестировались компанией Irregular, трехлетним израильским стартапом.
