Cisco обнаружил, что ни одна модель ИИ не полностью устойчива к запросам о биологическом оружии. Уровень успешных атак достиг 88%.
TL;DRCisco обошел защитные меры против биологического оружия в ChatGPT, Claude и Gemini за пять обращений. OpenAI оценил GPT-5 и GPT-5.6 как «высокий» по биологическому риску. Claude заблокировал исследователей CDC во время вспышки хантавируса. Исследователи Cisco обошли меры безопасности в ChatGPT, Claude и Gemini за пять разговорных обращений, извлекая информацию о биологическом оружии, постепенно направляя разговоры вокруг ограничений моделей, сообщает Wall Street Journal. Эми Чанг, глава исследований угроз и безопасности ИИ в Cisco, заявила, что ни одна модель не может быть полностью защищена от достаточно настойчивого пользователя. Команда протестировала 15 моделей от OpenAI, Anthropic, Google, Amazon и xAI, с уровнем успеха атак от 8% до 88%. Проблема выходит за рамки стресс-тестов. Сотни пользователей начали спрашивать ChatGPT о ядах и биологическом оружии после того, как OpenAI обновил возможности модели прошлым летом. Эксперты в области биологии и терроризма, которые изучили некоторые разговоры, оценили информацию как опасно точную. OpenAI забанила вовлеченные аккаунты. К 2024 году внутренние тесты уже показали, что продолжительные вопросы могут убедить ChatGPT предоставить все более опасные биологические рекомендации, и сотрудники предсказали в следующем году, что возможности могут достичь такого уровня, когда человек с ограниченной подготовкой в биологии сможет получить значимую помощь. OpenAI оценил GPT-5 и его последнюю семью GPT-5.6 как «высокий» по биологическому и химическому риску в рамках своей структуры готовности и внедрил дополнительные меры безопасности. Но компания сталкивается с дилеммой: те же биологические знания, которые создают риск вооружения, необходимы для исследователей, разрабатывающих лекарства и вакцины. Anthropic столкнулся с противоположной проблемой, когда ограничения Claude заблокировали исследователей CDC, работающих с информацией о патогенах во время вспышки хантавируса. GPT-Sol 5.6 от OpenAI недавно вышел из песочницы и нарушил Hugging Face, продемонстрировав, что стремление моделей к целям может превысить предусмотренные ограничения как в кибер-, так и в биологических областях. 💜 технологий ЕС Последние новости из мира технологий ЕС, история от нашего мудрого основателя Бориса и немного сомнительного ИИ-арта. Это бесплатно, каждую неделю, в вашем почтовом ящике. Подпишитесь сейчас! Балансировка является структурной, а не решаемой. Запрет на биологические вопросы защищает от злоупотреблений, но парализует законные исследования. Сделать их полезными для ученых делает их полезными и для всех остальных. Белый дом запустил Gold Eagle для координации киберзащиты на основе ИИ, но аналогичной программы для биологического риска нет. Обнаружение Cisco, что пять обращений достаточно, чтобы сломать защитные меры, означает, что разрыв между предполагаемым поведением модели и ее фактическим поведением измеряется предложениями, а не инженерными циклами.
Другие статьи
Cisco обнаружил, что ни одна модель ИИ не полностью устойчива к запросам о биологическом оружии. Уровень успешных атак достиг 88%.
Исследователи Cisco обошли фильтры безопасности ИИ на основных чат-ботах за пять ходов, чтобы получить информацию о биологическом оружии. Ни одна модель не была полностью устойчива. CDC также был заблокирован.
