Безопасность AI-агентов: четыре атаки в июле, один общий недостаток

Безопасность AI-агентов: четыре атаки в июле, один общий недостаток

      Мы провели два года, спрашивая, будет ли ИИ лгать нам. Более полезный вопрос этим летом — что произойдет, как только мы передадим ему ключи. Дайте модели ваш Gmail, ваш календарь, память и возможность действовать, и ее ошибки перестанут быть неловкими. Они начнут быть эксплуатируемыми.

      За примерно десять дней в июле четыре исследования подтвердили одну и ту же мысль с четырех разных углов. Ни одно из них не является одиночным багом. Вместе они рисуют контуры безопасности ИИ-агентов в 2026 году, и картина неутешительная.

      Ассистент браузера, который кликает за вас

      Начнем с инструмента, который ближе всего к вашим данным. Безопасная компания Manifold Security опубликовала исследование, показывающее, что любое расширение браузера, которое вы устанавливаете, может тихо захватить Claude от Anthropic для Chrome и заставить его читать ваш Gmail, Google Docs и Календарь.

      Трюк несложен. Расширение слушает клик пользователя, прежде чем выполнить одну из девяти встроенных задач. Оно никогда не проверяет, является ли клик реальным. Конкурирующее расширение может подделать его за шесть строк кода, и Claude воспринимает подделку как подлинную.

      Manifold оценивает это как высокую степень серьезности по умолчанию. Она становится критической, как только пользователь включает режим «Действовать без запроса», когда чтение происходит тихо.

      Manifold сообщает, что уведомила Anthropic в мае. Восемь релизов спустя, как сообщает компания, уязвимость все еще работает в текущей версии. Компания уже освещала ранее существующие риски агентного серфинга, и это та же самая рана, которая снова открылась.

      Единственное письмо, которое переписывает память

      Второе открытие переходит от кликов к памяти. Личные агенты теперь хранят заметки о вас между чатами: ваши контакты, ваши привычки, ваш список дел. Исследователи задали вопрос, что произойдет, если злоумышленник сможет записать в этот хранилище.

      В статье, размещенной на arXiv, команда показала, что одно тщательно написанное письмо может внедрить ложную память в ИИ-агента. Они связали почтовый ящик жертвы с агентом через вход в Google, а затем отправили полезные нагрузки с аккаунта, который они контролировали.

      Письмо прошло обычные спам-фильтры и достигло почтового ящика. Агент прочитал его, и в более чем половине случаев он сохранил инструкции злоумышленника в долгосрочной памяти без предупреждения пользователя.

      Вот в чем опасность. Обычная инъекция подсказки длится один разговор. Эта же сохраняется. Отравленная память продолжает направлять агента в будущих сессиях, пока кто-то не обнаружит это. Как выразились Digital Trends, агент помнит ложь и никогда не упоминает, откуда она пришла.

      Задняя дверь за менее чем 100 долларов

      Третья уязвимость находится еще глубже, внутри самой модели. Кэти Пакстон-Фир, преподаватель кибербезопасности и адвокат в Semgrep, хотела узнать, можно ли доверять открытой модели, которую вы скачиваете бесплатно. Поэтому она отравила одну.

      Это заняло около часа и менее 75 фунтов стерлингов, написали она и двое ее коллег из Semgrep в подробном посте. Всего десяти отравленных обучающих примеров было достаточно, чтобы заставить модель писать код с скрытой уязвимостью, даже для подсказок, которые она никогда не видела. Более крупные модели было легче отравить, а не сложнее.

      Ее беспокойство не в одном поддельном скачивании. Дело в том, что мы не можем проверить. Отравленная модель не выдает сбой и не выглядит сломанной. Как выразились она и ее коллеги, публичная модель дает нам «почти никакой возможности предсказать ее поведение». Обычную программу можно разобрать, чтобы увидеть, что она делает. Набор весов — нет.

      Она не единственная, кто исследует это. Дэвид Каплан из компании безопасности Origin создал поддельную модель, которая тихо крадет данные через инструмент электронной почты без каких-либо признаков для пользователя. Его формулировка резка: яд «не пришел на веб-страницу. Он сидел в весах все это время».

      «Смертельная триада» становится больше

      Четвертое исследование объясняет, почему первые три имеют такое значение одновременно. Безопасная компания PromptArmor изучила соединители, которые связывают ChatGPT и Claude с внешними службами, такими как Gmail и Slack.

      Разработчик Симон Уиллиссон назвал основную опасность в прошлом году смертельной триадой: агент с доступом к личным данным, подверженный ненадежному контенту и способный отправлять информацию наружу. Держите все три одновременно, и одно отравленное сообщение может утечь ваши секреты. Соединители по умолчанию предоставляют агентам все три.

      PromptArmor обнаружила, что земля движется под всей системой. В своем исследовании соединитель менялся в среднем каждые девять минут. Из 2,517 отслеживаемых соединителей 931 изменился за шесть недель. Поставщики прикрепили 1,686 новых инструментов к уже работающим соединителям и переписали 1,127 описаний инструментов, что именно и говорит модели, когда действовать.

      Один единственный соединитель также может разрастись. Соединитель Dropbox вырос с восьми инструментов до 24, и с нуля, которые могут уничтожить данные, до четырех. Примерно два из пяти соединителей Claude тихо вызывают другие ИИ-сервисы по очереди.

      Соединитель Zoom показывает, к чему это приводит. Попросите его найти ваши встречи, и запрос, полный конфиденциальных данных, может передаться любому из десяти ИИ-подпроцессоров в восьми моделях. Карта, которую вы одобрили в понедельник, может не описывать систему, на которой вы работаете в пятницу.

      Одна проблема в четырех масках

      Выстроив четыре уязвимости, общая проблема становится очевидной. В каждом случае модель ведет себя. Ошибка безопасности живет в том, что окружает ее: клик, которому она доверяет, память, которую она хранит, веса, которые она наследует, соединитель, который она вызывает.

      Это и есть ось безопасности ИИ-агента. На протяжении десятилетий мы защищали программное обеспечение, ограничивая то, что программа может делать. Вся суть агента в том, что он может делать почти все, от вашего имени, на основе инструкций, написанных на простом языке.

      Каждое удобство — это также дверь. Уязвимость Claude для Chrome, отравленная память, дешевая задняя дверь и изменяющиеся соединители — это четыре двери в один и тот же дом.

      Отрасль знает теоретические решения: проверять, что клики реальны, отмечать, откуда пришли данные, спрашивать перед записью в память, регистрировать каждое действие и рассматривать любой внешний текст как враждебный. Загвоздка в том, что эти защитные меры замедляют агента, а скорость — это то, что все продают.

      TNW наблюдала за тем, как та же напряженность проявляется в утечке Hugging Face и в росте синтетических инсайдеров. Это та же история, теперь направленная на ассистента в вашем браузере.

      Неудобный вывод из июля заключается не в том, что какой-либо отдельный продукт сломан. Дело в том, что мы подключаем агентов к нашим самым чувствительным аккаунтам быстрее, чем учимся защищать их. Четыре команды только что показали, насколько велика разница. Люди, строящие защитные меры, все еще на шаг позади людей, находящих дыры.

Другие статьи

Слияние Paramount и Warner Bros. заблокировано временным судебным запретом за день до завершения сделки Слияние Paramount и Warner Bros. заблокировано временным судебным запретом за день до завершения сделки Судья Калифорнии выдал временный запрет на сделку Paramount-WBD после того, как генеральные прокуроры штатов указали на "убедительные доказательства" концентрации рынка. На горизонте маячит плата в размере 650 миллионов долларов в квартал. Это приложение для Mac может превратить каждое окно в сон с CRT или ностальгический Game Boy. Это приложение для Mac может превратить каждое окно в сон с CRT или ностальгический Game Boy. Glaze 1.9 использует шейдеры GPU в реальном времени для трансформации каждого окна Mac, видео и игры, предлагая более 50 стилей и единовременную цену в 9,99 долларов. Z.AI построила гигантский центр обработки данных ИИ на чипах китайского производства Z.AI построила гигантский центр обработки данных ИИ на чипах китайского производства Китайская лаборатория Z.AI завершила строительство дата-центра мощностью 1 ГВт, работающего только на чипах китайского производства для обучения своих моделей GLM, без использования Nvidia. Что это означает для ИИ. Google Замороженный чип: Gemini запечён в кремнии Google Замороженный чип: Gemini запечён в кремнии В отчете говорится, что чип Google Frozen будет жестко интегрировать Gemini в кремний с эффективностью до 10 раз к 2028 году. Что это значит для ИИ. Слияние Paramount и Warner Bros. заблокировано временным судебным запретом за день до завершения сделки Слияние Paramount и Warner Bros. заблокировано временным судебным запретом за день до завершения сделки Судья Калифорнии выдал временный запрет на сделку Paramount-WBD после того, как генеральные прокуроры штатов указали на "убедительные доказательства" концентрации рынка. На горизонте маячит сбор в размере 650 миллионов долларов в квартал. Новые OLED-экранные панели ноутбуков Samsung стали гораздо ярче, и они также будут служить дольше. Новые OLED-экранные панели ноутбуков Samsung стали гораздо ярче, и они также будут служить дольше. Новая тандемная OLED-панель Samsung Display достигает яркости в 1,600 нит и служит в два раза дольше, чем обычный OLED, и она уже установлена в ноутбук Lenovo.

Безопасность AI-агентов: четыре атаки в июле, один общий недостаток

Четыре исследовательские группы сломали ИИ-агентов четырьмя способами за десять дней, от Claude для Chrome до отравленной памяти. Пробел в безопасности ИИ-агентов, объяснённый.