Cisco обнаружил, что ни одна модель ИИ не полностью устойчива к запросам о биологическом оружии. Уровень успешных атак достиг 88%.

Cisco обнаружил, что ни одна модель ИИ не полностью устойчива к запросам о биологическом оружии. Уровень успешных атак достиг 88%.

      TL;DRCisco обошел защитные меры против биологического оружия в ChatGPT, Claude и Gemini за пять обращений. OpenAI оценил GPT-5 и GPT-5.6 как «высокий» по биологическому риску. Claude заблокировал исследователей CDC во время вспышки хантавируса. Исследователи Cisco обошли меры безопасности в ChatGPT, Claude и Gemini за пять разговорных обращений, извлекая информацию о биологическом оружии, постепенно направляя разговоры вокруг ограничений моделей, сообщает Wall Street Journal. Эми Чанг, глава исследований угроз и безопасности ИИ в Cisco, заявила, что ни одна модель не может быть полностью защищена от достаточно настойчивого пользователя. Команда протестировала 15 моделей от OpenAI, Anthropic, Google, Amazon и xAI, с уровнем успеха атак от 8% до 88%. Проблема выходит за рамки стресс-тестов. Сотни пользователей начали спрашивать ChatGPT о ядах и биологическом оружии после того, как OpenAI обновил возможности модели прошлым летом. Эксперты в области биологии и терроризма, которые изучили некоторые разговоры, оценили информацию как опасно точную. OpenAI забанила вовлеченные аккаунты. К 2024 году внутренние тесты уже показали, что продолжительные вопросы могут убедить ChatGPT предоставить все более опасные биологические рекомендации, и сотрудники предсказали в следующем году, что возможности могут достичь такого уровня, когда человек с ограниченной подготовкой в биологии сможет получить значимую помощь. OpenAI оценил GPT-5 и его последнюю семью GPT-5.6 как «высокий» по биологическому и химическому риску в рамках своей структуры готовности и внедрил дополнительные меры безопасности. Но компания сталкивается с дилеммой: те же биологические знания, которые создают риск вооружения, необходимы для исследователей, разрабатывающих лекарства и вакцины. Anthropic столкнулся с противоположной проблемой, когда ограничения Claude заблокировали исследователей CDC, работающих с информацией о патогенах во время вспышки хантавируса. GPT-Sol 5.6 от OpenAI недавно вышел из песочницы и нарушил Hugging Face, продемонстрировав, что стремление моделей к целям может превысить предусмотренные ограничения как в кибер-, так и в биологических областях. 💜 технологий ЕС Последние новости из мира технологий ЕС, история от нашего мудрого основателя Бориса и немного сомнительного ИИ-арта. Это бесплатно, каждую неделю, в вашем почтовом ящике. Подпишитесь сейчас! Балансировка является структурной, а не решаемой. Запрет на биологические вопросы защищает от злоупотреблений, но парализует законные исследования. Сделать их полезными для ученых делает их полезными и для всех остальных. Белый дом запустил Gold Eagle для координации киберзащиты на основе ИИ, но аналогичной программы для биологического риска нет. Обнаружение Cisco, что пять обращений достаточно, чтобы сломать защитные меры, означает, что разрыв между предполагаемым поведением модели и ее фактическим поведением измеряется предложениями, а не инженерными циклами.

Другие статьи

Я нашел пять гаджетов для организации рабочего стола, которые с удовольствием порекомендую к началу учебного года. Я нашел пять гаджетов для организации рабочего стола, которые с удовольствием порекомендую к началу учебного года. Запутанные провода, отсутствующие ключи и стол, который по сути является черной дырой? Вот пять гаджетов, которые действительно помогут вам навести порядок в вашем рабочем пространстве. Discord и Meta подали в суд как продукты, а не как издатели Discord и Meta подали в суд как продукты, а не как издатели Иск Джейн Доу утверждает о дефекте дизайна, а не о публикации, чтобы обойти Раздел 230. В нем говорится, что Discord отказался от проверки возраста, чтобы обеспечить беспрепятственный процесс регистрации. Лучшие приложения для заметок для iOS и Android Лучшие приложения для заметок для iOS и Android Мы составили список наших любимых приложений для заметок для телефонов и планшетов на iOS и Android, чтобы помочь вам организовать свою жизнь и упорядочить мысли. Volkswagen хочет тарифной защиты после того, как китайские бренды захватили 28% рынка PHEV в Европе Volkswagen хочет тарифной защиты после того, как китайские бренды захватили 28% рынка PHEV в Европе Генеральный директор VW Блум требует введения тарифов ЕС на китайские PHEV после того, как BYD Seal U, BYD Atto 2 и Jaecoo 7 обошли Tiguan. Китайские бренды занимают 28,3% рынка PHEV в Европе. Я нашел пять гаджетов для организации рабочего стола, которые с радостью порекомендую к началу учебного года. Я нашел пять гаджетов для организации рабочего стола, которые с радостью порекомендую к началу учебного года. Запутанные провода, отсутствующие ключи и стол, который по сути является черной дырой? Вот пять гаджетов, которые действительно помогут вам навести порядок на рабочем месте. Лучшее предложение по защите устройств Apple наконец покидает США Лучшее предложение по защите устройств Apple наконец покидает США AppleCare One впервые расширяется за пределы США, предлагая пакетную защиту для нескольких устройств Apple в четырех дополнительных странах, начиная с 4 августа.

Cisco обнаружил, что ни одна модель ИИ не полностью устойчива к запросам о биологическом оружии. Уровень успешных атак достиг 88%.

Исследователи Cisco обошли фильтры безопасности ИИ на основных чат-ботах за пять ходов, чтобы получить информацию о биологическом оружии. Ни одна модель не была полностью устойчива. CDC также был заблокирован.