Исследователи раскрывают тревожно простой трюк, позволяющий ИИ-ботам выходить из-под контроля и игнорировать меры безопасности.

Исследователи раскрывают тревожно простой трюк, позволяющий ИИ-ботам выходить из-под контроля и игнорировать меры безопасности.

      Aerps.com / Unsplash

      Если вы попросите агента ИИ взломать аккаунт, он, скорее всего, откажется, но исследователи из EPFL только что доказали, что есть более простой способ, и он требует терпения, а не технических навыков. Их новое исследование показывает, что разбивка вредоносной цели на небольшие, безобидно звучащие запросы может обмануть агентов ИИ, заставив их выполнять задачи, которые они обычно отклоняют (по данным TechXplore).

      Это отзывается на недавнюю уязвимость «Bioshocking», в которой браузеры ИИ были манипулированы так, чтобы рассматривать кражу учетных данных как часть безобидной игры.

      Как исследователи выявили эту уязвимость

      Команда разработала автоматизированный инструмент тестирования под названием STING, что означает Последовательное Тестирование Неправомерного Выполнения Целей N-шагов, предназначенный для имитации того, как реальный злоумышленник на самом деле будет действовать. Вместо того чтобы прямо заявлять о вредоносной цели, STING заранее планирует и разбивает эту цель на последовательность меньших, казалось бы, невинных шагов, которые ведут к ней на протяжении нескольких этапов общения.

      Полезный до предела: Измерение Неправомерной Помощи в Многоходовых, Многоязычных Агентах LLM

      Исследователи протестировали этот подход в 176 вредоносных сценариях против ведущих моделей ИИ, включая ChatGPT, Gemini и Claude. Каждый агент ИИ тестировался как агент, использующий инструменты, способный просматривать веб, отправлять электронные письма и выполнять многошаговые задачи.

      Постепенная, многошаговая манипуляция оказалась успешной гораздо чаще, чем грубые, одноразовые попытки. В некоторых случаях модели были в два раза более склонны завершить вредоносную задачу, как только запрос был разбит на меньшие шаги. Эта находка соответствует отдельным исследованиям, показывающим, что даже средние пользователи могут обойти защитные механизмы ИИ, используя лишь тщательно сформулированные подсказки.

      Почему это важно?

      Беспокойства, поднятые исследователями, не являются гипотетическим риском. Meta признала в июне, что злоумышленники использовали простую социальную инженерию, а не вредоносное ПО или инструменты взлома, чтобы обмануть ее ИИ-помощника и получить несанкционированный доступ к аккаунтам Instagram.

      Исследователи также ожидали, что атаки будут более эффективными на языках с меньшим объемом доступных обучающих данных. Однако они обнаружили, что коэффициенты завершения оставались примерно одинаковыми на всех семи протестированных языках. Однако они нашли одно исключение: переключение языков в середине многошаговой атаки значительно увеличивало коэффициенты успеха.

      Ведущий исследователь Айуш Кумар Тарун утверждает, что тестирование безопасности должно происходить гораздо раньше, быть встроенным в дизайн агента с самого начала. Присоединение его после того, как что-то пойдет не так, больше не является достаточным, особенно поскольку эти системы продолжают приобретать все больше реальных возможностей.

      Маниша Прийадаршини — автор технологий и развлечений с более чем девятилетним редакторским опытом.

      ИИ-помощник Meta наконец-то появился на Mac, но ему нужно догонять

      Новый настольный помощник может анализировать то, что видно на экране, и принимать голосовые команды на macOS.

      Meta наконец-то представила своего ИИ-помощника Meta на Mac с помощью специального настольного приложения, предоставляя пользователям еще одного ИИ-чат-бота, который можно держать открытым наряду со всеми другими вкладками. Приложение может анализировать совместно используемое окно, отвечать на вопросы о том, что на экране, генерировать контент и принимать голосовую диктовку на macOS.

      ИИ Meta действительно может видеть, что на экране

      Читать далее

      Новая функция ИИ от Avec гарантирует, что вы больше никогда не пропустите срок

      Одного свайпа достаточно, чтобы Avec запомнил ваши сроки по электронной почте

      Мы все были в такой ситуации. Срок оказывается похороненным где-то в длинной цепочке электронных писем, жизнь становится напряженной, и вдруг вы извиняетесь за пропущенное последующее сообщение, о котором совершенно забыли. Avec, приложение для электронной почты на основе ИИ, построенное вокруг жестов свайпа и голосовой диктовки, только что выпустило исправление для этой проблемы, и это может быть самым умным дополнением приложения на сегодняшний день.

      Читать далее

      Мой Mac никогда не говорит мне, куда уходит мой интернет, поэтому я нашел приложение, которое это делает

      Я давно использую Mac, и за эти годы я довольно хорошо научился разбираться в том, что идет не так, когда что-то кажется неправильным. Чаще всего я начинаю с приложения «Настройки». Я покопаюсь, изменю несколько вещей и обычно нахожу то, что вызывает проблему. Хранение — хороший пример. Я недавно заметил, что мой Mac замедляется, открыл раздел «Хранение» и сразу получил четкое представление о том, что занимает место. После одной очистки я освободил необходимое пространство, и все снова стало нормально. Я делал что-то подобное, когда пытался разобраться с разрядом батареи или необычно высоким использованием ЦП. macOS предоставляет множество мест, где можно посмотреть, когда вы знаете, что что-то не так.

      Однако есть одна вещь, которую она не делает почти так очевидно: куда на самом деле уходит весь ваш интернет-трафик. Я начал думать об этом только потому, что мой интернет вел себя странно в последние несколько дней. Все казалось медленнее обычного, и я не мог понять, почему. Мое соединение казалось нормальным, и я не загружал ничего большого, так что что же поглощает всю эту полосу пропускания? Оказалось, что довольно много приложений на моем Mac использовали интернет в фоновом режиме, и я не имел об этом никакого представления. Я, вероятно, не разобрался бы с этим, если бы не наткнулся на приложение для Mac, которое показало мне, что именно происходит за кулисами. И вот тут все стало интересно.

      Читать далее

Исследователи раскрывают тревожно простой трюк, позволяющий ИИ-ботам выходить из-под контроля и игнорировать меры безопасности. Исследователи раскрывают тревожно простой трюк, позволяющий ИИ-ботам выходить из-под контроля и игнорировать меры безопасности. Исследователи раскрывают тревожно простой трюк, позволяющий ИИ-ботам выходить из-под контроля и игнорировать меры безопасности. Исследователи раскрывают тревожно простой трюк, позволяющий ИИ-ботам выходить из-под контроля и игнорировать меры безопасности. Исследователи раскрывают тревожно простой трюк, позволяющий ИИ-ботам выходить из-под контроля и игнорировать меры безопасности. Исследователи раскрывают тревожно простой трюк, позволяющий ИИ-ботам выходить из-под контроля и игнорировать меры безопасности. Исследователи раскрывают тревожно простой трюк, позволяющий ИИ-ботам выходить из-под контроля и игнорировать меры безопасности.

Другие статьи

Последняя функция ИИ от Avec читает ваши электронные письма, чтобы вы не пропустили срок. Последняя функция ИИ от Avec читает ваши электронные письма, чтобы вы не пропустили срок. Новая функция Avec сканирует сообщения на наличие сроков и повторно отображает их в день. Она доступна только для iOS и Gmail и не поддерживается за пределами США и Канады. Первые европейские поездки Uber с автономными автомобилями стартуют в Загребе с водителем для обеспечения безопасности. Первые европейские поездки Uber с автономными автомобилями стартуют в Загребе с водителем для обеспечения безопасности. Uber впервые запустил автономные поездки в Европе, в Загребе, используя Pony.ai и Verne. На борту все еще находится оператор безопасности. Pixel 11 только что подорожал, но Google, возможно, нашел способ остановить утечку. Pixel 11 только что подорожал, но Google, возможно, нашел способ остановить утечку. Согласно сообщениям, Google планирует перенести все производства Pixel из Китая в 2027 году, что потенциально даст будущим Pixel некоторую свободу действий по мере роста затрат на компоненты и торговлю. Согласно сообщениям, PlayStation проводит переработку Horizon Hunters Gathering после слабых тестов игры. Согласно сообщениям, PlayStation проводит переработку Horizon Hunters Gathering после слабых тестов игры. Согласно сообщениям, PlayStation кардинально изменяет Horizon Hunters Gathering, отказываясь от модели живого сервиса после слабых тестов, при этом сотрудникам установлен срок до декабря. Одним из самых спорных федеральных агентств является запрет работникам на использование умных очков Meta. Одним из самых спорных федеральных агентств является запрет работникам на использование умных очков Meta. ICE запретило смарт-очки Meta на федеральных рабочих местах из-за опасений по поводу конфиденциальности, даже несмотря на то, что DHS ищет финансирование для специально разработанных смарт-очков, которые могут поддерживать биометрическую идентификацию во время иммиграционного контроля. Meta запустила приложение для Mac, чтобы использовать свой ИИ для бизнеса Meta запустила приложение для Mac, чтобы использовать свой ИИ для бизнеса Meta выпустила приложение для Mac для Meta AI, ориентированное на создателей контента и небольшие компании. Оно интегрируется с Instagram, Facebook и рекламными аккаунтами, чтобы предложить, что публиковать.

Исследователи раскрывают тревожно простой трюк, позволяющий ИИ-ботам выходить из-под контроля и игнорировать меры безопасности.

Это новое исследование показывает, как терпеливая, пошаговая манипуляция может заставить ИИ-агентов игнорировать собственные правила безопасности.