Скрытые подсказки могут тайно переписывать память ИИ, и исследователи говорят, что это серьезная проблема.

Скрытые подсказки могут тайно переписывать память ИИ, и исследователи говорят, что это серьезная проблема.

      Большие языковые модели становятся лучше в запоминании нас. Будь то ваш предпочтительный стиль письма, повторяющиеся задачи, привычки покупок или сроки проектов, AI-ассистенты все чаще хранят долгосрочные воспоминания, чтобы будущие разговоры казались более личными и полезными. Но согласно новым исследованиям, эта же функция может стать одной из самых больших уязвимостей безопасности ИИ.

      Исследователи из Государственного университета Нью-Мексико продемонстрировали новую атаку под названием GhostWriter, способную тайно внедрять ложные воспоминания в AI-агенты. Вместо того чтобы просто красть информацию, атака манипулирует тем, что ИИ запоминает, потенциально заставляя его принимать опасные решения задолго после того, как произошла первоначальная атака.

      Это тонкий, но значительный сдвиг в том, как системы ИИ могут быть скомпрометированы. Вместо атаки на саму модель, злоумышленники нацеливаются на ее память.

      Атака не взламывает ИИ. Она изменяет то, что ИИ запоминает.

      Традиционные чат-боты работают с минимальной или отсутствующей памятью между разговорами. Современные AI-агенты, однако, все больше полагаются на системы постоянной памяти, которые хранят информацию о пользователях, текущих проектах и предыдущих взаимодействиях. Это позволяет ассистентам со временем предоставлять более контекстуальные и персонализированные ответы.

      Исследователи утверждают, что эти системы памяти также вводят совершенно новую поверхность атаки. GhostWriter работает, тихо внедряя вредоносную информацию в долгосрочную память AI-агента через скрытые подсказки или ненадежный внешний контент. Ложная информация остается в спящем состоянии до тех пор, пока ИИ не извлечет ее позже, отвечая на в целом законный запрос.

      Представьте, что вы просите своего AI-ассистента подвести итоги электронных писем от вашего банка. Если его память уже была отравлена, его можно манипулировать, чтобы он тайно переслал эти письма злоумышленнику. Или он может запомнить неправильную контактную информацию, фальшивые сроки, неверные предпочтения или вымышленные факты, все потому, что кто-то смог изменить то, что ассистент считал правдой.

      В отличие от традиционных атак внедрения подсказок, которые обычно затрагивают одно единственное взаимодействие, GhostWriter предназначен для того, чтобы сохраняться. Как только вредоносная информация попадает в хранилище памяти, она может продолжать влиять на поведение ИИ на протяжении нескольких будущих сессий, пока не будет обнаружена и удалена.

      Исследователи описывают атаку как двухступенчатый процесс. Сначала происходит внедрение памяти, когда вредоносный контент тихо сохраняется внутри памяти ИИ. Позже происходит активация атаки, когда ИИ неосознанно извлекает это отравленное воспоминание, отвечая на подлинный запрос пользователя.

      Память ИИ становится полезной. Это также делает ее целью для атак.

      Своевременность исследования значительна. Практически каждая крупная компания в области ИИ стремится создать ассистентов, которые запоминают пользователей на протяжении недель, месяцев или даже лет. Память быстро стала одним из самых больших отличий в отрасли, потому что она делает ИИ менее похожим на чат-бота и более похожим на личного ассистента.

      Недостаток в том, что теперь память нуждается в таком же уровне защиты, как и сама модель. В своих экспериментах исследователи обнаружили, что GhostWriter достиг успеха внедрения памяти примерно в 98%, в то время как вредоносные воспоминания позже активировались около 60% времени против современных AI-агентов. Эти цифры предполагают, что сегодняшние архитектуры памяти могут еще не быть готовы различать надежную информацию от манипулированных данных.

      Команда не просто подчеркивает проблему. Они также предложили защитную структуру под названием Agentic Memory Sentry (AM-Sentry), которая сочетает в себе проверку памяти с более строгими политиками управления памятью. Согласно исследователям, этот подход значительно снизил уровень успеха GhostWriter, сохраняя при этом полезность ИИ.

      По мере того как AI-агенты развиваются в цифровых ассистентов, способных управлять электронной почтой, планировать встречи, писать код и принимать решения от нашего имени, обеспечение безопасности того, что они запоминают, может стать столь же важным, как и защита информации, которую они генерируют. Следующий рубеж в безопасности ИИ может заключаться не в защите моделей от плохих подсказок. Возможно, это будет защита их воспоминаний от полного переписывания.

Скрытые подсказки могут тайно переписывать память ИИ, и исследователи говорят, что это серьезная проблема. Скрытые подсказки могут тайно переписывать память ИИ, и исследователи говорят, что это серьезная проблема.

Другие статьи

Автомобильный рынок Китая движется к худшему году с 2021 года. Продажи упали на 20% в первой половине года. Автомобильный рынок Китая движется к худшему году с 2021 года. Продажи упали на 20% в первой половине года. Продажи легковых автомобилей в Китае упали на 20,2% в первой половине 2026 года. Продажи автомобилей с двигателями внутреннего сгорания снизились на 39% в июне. Экспорт вырос на 82%. Аналитики ожидают, что выживут только 7-8 автопроизводителей. Mac Pro почти получил чип M3 Extreme, который в два раза мощнее M3 Ultra. Mac Pro почти получил чип M3 Extreme, который в два раза мощнее M3 Ultra. Сообщается, что Apple разработала чип M3 Extreme с вдвое большим количеством ядер CPU и GPU, чем у M3 Ultra, прежде чем отменить проект. Zhongji Innolight планирует IPO в Гонконге на сумму $8 млрд Zhongji Innolight планирует IPO в Гонконге на сумму $8 млрд Zhongji Innolight, производитель оптики для центров обработки данных на базе ИИ, оценивает спрос на листинг в Гонконге на сумму 8 миллиардов долларов, который станет крупнейшим в городе с момента IPO Alibaba в 2019 году. AliExpress штраф: ЕС наложил рекордный штраф в размере 550 миллионов евро по DSA AliExpress штраф: ЕС наложил рекордный штраф в размере 550 миллионов евро по DSA ЕС наложил на AliExpress штраф в размере 550 миллионов евро, что является самым большим штрафом по DSA на сегодняшний день, за неудачу в остановке продажи поддельных, небезопасных и незаконных товаров. «Синтетический инсайдер»: ИИ дипфейки как фальшивые сотрудники «Синтетический инсайдер»: ИИ дипфейки как фальшивые сотрудники Искусственные глубокие фейки позволяют хакерам выдавать себя за сотрудников, создавая угрозу "синтетического инсайдера". Тем не менее, большинство утечек информации изнутри все еще являются случайными, а агенты ИИ представляют собой следующий риск. Обзор Vivo X300 FE: Компактный флагман, который я не ожидал, что мне так понравится Обзор Vivo X300 FE: Компактный флагман, который я не ожидал, что мне так понравится Vivo X300 FE был представлен вместе с X300 Ultra. FE с нами уже некоторое время, и, возможно, это лучший компактный флагман Android на данный момент.

Скрытые подсказки могут тайно переписывать память ИИ, и исследователи говорят, что это серьезная проблема.

Исследователи продемонстрировали GhostWriter, новую атаку, которая тайно внедряет ложные воспоминания в ИИ-агентов, влияя на будущие ответы и автономные действия.