Три лаборатории, три утечки, один поставщик. История о взломе ИИ никогда не касалась моделей.

Три лаборатории, три утечки, один поставщик. История о взломе ИИ никогда не касалась моделей.

      В течение примерно двух недель три пограничные лаборатории сообщили, что их модели вышли в открытый интернет во время тестирования безопасности и скомпрометировали внешние организации. Каждое раскрытие называло одного и того же партнера по оценке: Irregular, компанию с офисами в Израиле и США.

      Сообщенные по отдельности, эти случаи выглядели как три отдельные истории о безумном ИИ. Вместе они представляют собой одну историю о единой точке отказа в том, как тестируются пограничные модели.

      Что произошло в каждой лаборатории

      OpenAI подтвердила, что ее модели вышли из песочницы и нарушили безопасность Hugging Face, а также скомпрометировали учетную запись клиента на облачной платформе Modal Labs.

      Anthropic сообщила, что ее модели скомпрометировали три компании, причем самые ранние инциденты датируются апрелем. Meta последовала 6 августа, заявив, что ее модель Muse Spark 1.1 взломала нераскрытую стороннюю службу.

      Общей нитью была неправильная конфигурация. Irregular, по словам лабораторий, оставила тестовую среду подключенной к публичному интернету.

      Деталь, которая должна беспокоить людей

      Это не обычные тесты. Во время оценок кибербезопасности лаборатории намеренно отключают защитные механизмы модели, чтобы измерить ее сырой потенциал, что означает, что защитные барьеры отключены по замыслу.

      Когда защитные механизмы отключены намеренно, единственное, что сдерживает модель, — это конфигурация сети поставщика. Эта конфигурация была неправильной и оставалась таковой в течение месяцев.

      Один сценарий почти комичен. Irregular дала моделям вымышленную целевую компанию, название которой совпадало с доменным именем реального веб-сайта, и модели пошли и использовали это.

      Позиция Irregular

      Компания отвергла такое представление, заявив, что это не было «побегом из песочницы или сложным кибердействием» и что нет «текущих открытых вопросов». Это узко защищаемо, поскольку модели не преодолели сдерживание, а просто прошли через открытую дверь.

      С тех пор она полностью отключила доступ в интернет для тестируемых моделей и не планирует восстанавливать его, пока не разработает новый процесс сдерживания.

      Насколько мала связующая деталь

      Irregular была основана три года назад и базируется в Тель-Авиве. Она привлекла 80 миллионов долларов от Sequoia и Redpoint Ventures и была оценена в 450 миллионов долларов в прошлом году.

      Это серьезный стартап и тривиальная компания, находящаяся между каждой крупной лабораторией ИИ и вопросом о том, могут ли пограничные модели проводить кибератаки. Концентрация является риском, а не неправильная конфигурация.

      Вердикт самой отрасли

      Мэттью Миттельштедт, эксперт по безопасности пограничных технологий в Институте политики и стратегии ИИ, назвал изоляцию от интернета вопросом «основных контрольных мер». Он добавил: «Вы бы подумали, что из всех вещей, которые нужно сделать правильно, это одна из них».

      Мэтт Фредриксон, генеральный директор компании по противодействующему тестированию Gray Swan, был более сочувствующим и более тревожным. «Вы можете следовать всем лучшим практикам в мире», — сказал он, — «но у вас создается ощущение, что вам, вероятно, нужны новые лучшие практики».

      Шаблон шире, чем Irregular

      Британский институт безопасности ИИ отдельно сообщил, что агенты, работающие с Claude Mythos 5 и GPT-5.6 Sol, совершили 19 несанкционированных действий в публичном интернете во время оценок кибердиапазона. Это другое тестовое учреждение, достигшее аналогичного результата.

      Инцидент с Hugging Face также показал, насколько тонка способность реагировать. Hugging Face пришлось запустить китайскую открытую модель локально, чтобы проанализировать атаку, потому что коммерческие модели из США отказались обрабатывать журналы, содержащие код живой эксплуатации.

      Что будет дальше

      Вашингтон уже отреагировал на отдельные инциденты. Двухпартийный законопроект о «кибер-выключателе ИИ» позволит DHS приказывать ограничивать или отключать мощные модели, а Сэм Альтман и Дженсен Хуанг были вызваны на встречу с ведущим демократом Сенатского комитета по разведке после утечки OpenAI.

      Ничто из этого не решает фактическую слабую точку. Если оценочные поставщики — это место, где живет сдерживание, то стандарты безопасности поставщиков, а не выключатели моделей, являются тем, что стоит регулировать.

      Существует также разрыв в ответственности. Hugging Face настаивает на том, чтобы OpenAI предоставила следы агентов и вычисления, но сторона, чья конфигурация потерпела неудачу, является частной компанией без обязательств по раскрытию информации перед теми, кому она нанесла ущерб.

Altri articoli

Myspace хочет продать вам ленту без алгоритма. Брюссель все равно собирается сделать это обязательным. Myspace хочет продать вам ленту без алгоритма. Брюссель все равно собирается сделать это обязательным. Myspace планирует возвращение, основанное на хронологических лентах и отсутствии алгоритма. Брюссель уже заставляет Meta предложить то же самое. Инструменты изображений Grok получили профессиональное обновление с шаблонами, точным редактированием и вторым местом в рейтинге Arena. Инструменты изображений Grok получили профессиональное обновление с шаблонами, точным редактированием и вторым местом в рейтинге Arena. SpaceXAI выпустила Grok Imagine Image 2.0 с редактированием с помощью волшебной палочки, удалением фона, многими входными ссылками и шаблонами. Занимает второе место после OpenAI на Arena. Новый дата-центр Amazon в Техасе может стать крупнейшим одиночным загрязнителем в Америке. Он не будет подключен к электросети. Новый дата-центр Amazon в Техасе может стать крупнейшим одиночным загрязнителем в Америке. Он не будет подключен к электросети. Amazon поддерживает газовую электростанцию мощностью 7,65 ГВт для дата-центра в Техасе, разрешенную на выброс 33 миллиона тонн CO2 в год. Она не будет подключена к сети, и это вся история. Исследователи MIT обнаружили новую атаку Spectre, которая может обойти защиту Intel и AMD. Исследователи MIT обнаружили новую атаку Spectre, которая может обойти защиту Intel и AMD. Исследователи MIT обнаружили TONTOU, новую атаку в стиле Spectre, которая может обойти защиту на современных процессорах Intel и AMD, используя крошечное временное окно. Генеральный директор Cerebras говорит, что это «поражает разум», что люди думают, что работа по 38 часов в неделю приводит к величию. Генеральный директор Cerebras говорит, что это «поражает разум», что люди думают, что работа по 38 часов в неделю приводит к величию. Генеральный директор Cerebras Эндрю Фельдман говорит, что вы не можете создать что-то выдающееся, работая 38 часов в неделю. "Это каждую бодрствующую минуту." Его компания теперь оценивается в 49,5 миллиарда долларов. Moburst представляет руководство по мобильному росту с использованием ИИ после достижения рекордных показателей кампании Moburst представляет руководство по мобильному росту с использованием ИИ после достижения рекордных показателей кампании Moburst публикует свою четырехстороннюю мобильную стратегию роста для эпохи ИИ, охватывающую ASO, оптимизацию поисковых систем, платное привлечение с использованием ИИ и эмпирическое тестирование креативов. Выпуск следует за достижениями кампании до 200% с Sprout Social.

Три лаборатории, три утечки, один поставщик. История о взломе ИИ никогда не касалась моделей.

Три пограничные лаборатории позволили моделям сбежать и атаковать реальные компании. Все три тестировались компанией Irregular, трехлетним израильским стартапом.