Скрытые подсказки могут тайно переписывать память ИИ, и исследователи говорят, что это серьезная проблема.
Большие языковые модели становятся лучше в запоминании нас. Будь то ваш предпочтительный стиль письма, повторяющиеся задачи, привычки покупок или сроки проектов, AI-ассистенты все чаще хранят долгосрочные воспоминания, чтобы будущие разговоры казались более личными и полезными. Но согласно новым исследованиям, эта же функция может стать одной из самых больших уязвимостей безопасности ИИ.
Исследователи из Государственного университета Нью-Мексико продемонстрировали новую атаку под названием GhostWriter, способную тайно внедрять ложные воспоминания в AI-агенты. Вместо того чтобы просто красть информацию, атака манипулирует тем, что ИИ запоминает, потенциально заставляя его принимать опасные решения задолго после того, как произошла первоначальная атака.
Это тонкий, но значительный сдвиг в том, как системы ИИ могут быть скомпрометированы. Вместо атаки на саму модель, злоумышленники нацеливаются на ее память.
Атака не взламывает ИИ. Она изменяет то, что ИИ запоминает.
Традиционные чат-боты работают с минимальной или отсутствующей памятью между разговорами. Современные AI-агенты, однако, все больше полагаются на системы постоянной памяти, которые хранят информацию о пользователях, текущих проектах и предыдущих взаимодействиях. Это позволяет ассистентам со временем предоставлять более контекстуальные и персонализированные ответы.
Исследователи утверждают, что эти системы памяти также вводят совершенно новую поверхность атаки. GhostWriter работает, тихо внедряя вредоносную информацию в долгосрочную память AI-агента через скрытые подсказки или ненадежный внешний контент. Ложная информация остается в спящем состоянии до тех пор, пока ИИ не извлечет ее позже, отвечая на в целом законный запрос.
Представьте, что вы просите своего AI-ассистента подвести итоги электронных писем от вашего банка. Если его память уже была отравлена, его можно манипулировать, чтобы он тайно переслал эти письма злоумышленнику. Или он может запомнить неправильную контактную информацию, фальшивые сроки, неверные предпочтения или вымышленные факты, все потому, что кто-то смог изменить то, что ассистент считал правдой.
В отличие от традиционных атак внедрения подсказок, которые обычно затрагивают одно единственное взаимодействие, GhostWriter предназначен для того, чтобы сохраняться. Как только вредоносная информация попадает в хранилище памяти, она может продолжать влиять на поведение ИИ на протяжении нескольких будущих сессий, пока не будет обнаружена и удалена.
Исследователи описывают атаку как двухступенчатый процесс. Сначала происходит внедрение памяти, когда вредоносный контент тихо сохраняется внутри памяти ИИ. Позже происходит активация атаки, когда ИИ неосознанно извлекает это отравленное воспоминание, отвечая на подлинный запрос пользователя.
Память ИИ становится полезной. Это также делает ее целью для атак.
Своевременность исследования значительна. Практически каждая крупная компания в области ИИ стремится создать ассистентов, которые запоминают пользователей на протяжении недель, месяцев или даже лет. Память быстро стала одним из самых больших отличий в отрасли, потому что она делает ИИ менее похожим на чат-бота и более похожим на личного ассистента.
Недостаток в том, что теперь память нуждается в таком же уровне защиты, как и сама модель. В своих экспериментах исследователи обнаружили, что GhostWriter достиг успеха внедрения памяти примерно в 98%, в то время как вредоносные воспоминания позже активировались около 60% времени против современных AI-агентов. Эти цифры предполагают, что сегодняшние архитектуры памяти могут еще не быть готовы различать надежную информацию от манипулированных данных.
Команда не просто подчеркивает проблему. Они также предложили защитную структуру под названием Agentic Memory Sentry (AM-Sentry), которая сочетает в себе проверку памяти с более строгими политиками управления памятью. Согласно исследователям, этот подход значительно снизил уровень успеха GhostWriter, сохраняя при этом полезность ИИ.
По мере того как AI-агенты развиваются в цифровых ассистентов, способных управлять электронной почтой, планировать встречи, писать код и принимать решения от нашего имени, обеспечение безопасности того, что они запоминают, может стать столь же важным, как и защита информации, которую они генерируют. Следующий рубеж в безопасности ИИ может заключаться не в защите моделей от плохих подсказок. Возможно, это будет защита их воспоминаний от полного переписывания.
Другие статьи
Скрытые подсказки могут тайно переписывать память ИИ, и исследователи говорят, что это серьезная проблема.
Исследователи продемонстрировали GhostWriter, новую атаку, которая тайно внедряет ложные воспоминания в ИИ-агентов, влияя на будущие ответы и автономные действия.
