По данным Cisco, ни одна модель ИИ не полностью устойчива к запросам о биологическом оружии. Уровень успешности атак достиг 88%.

По данным Cisco, ни одна модель ИИ не полностью устойчива к запросам о биологическом оружии. Уровень успешности атак достиг 88%.

      TL;DRCisco обошел защитные механизмы биологического оружия на ChatGPT, Claude и Gemini за пять реплик. OpenAI оценил GPT-5 и GPT-5.6 как «Высокий» по биологическому риску. Claude заблокировал исследователей CDC во время вспышки хантавируса. Исследователи Cisco обошли меры безопасности на ChatGPT, Claude и Gemini за пять разговорных реплик, получая информацию о биологическом оружии, постепенно направляя разговоры вокруг ограничений моделей, сообщает Wall Street Journal. Эми Чанг, глава исследований угроз и безопасности ИИ в Cisco, заявила, что ни одна модель не может быть полностью защищена от достаточно настойчивого пользователя. Команда протестировала 15 моделей от OpenAI, Anthropic, Google, Amazon и xAI, с коэффициентами успеха атак от 8% до 88%. Проблема выходит за рамки стресс-тестов. Сотни пользователей начали спрашивать ChatGPT о ядах и биологическом оружии после того, как OpenAI обновил возможности модели прошлым летом. Эксперты в области биологии и терроризма, которые изучили некоторые разговоры, оценили информацию как опасно точную. OpenAI забанила вовлеченные аккаунты. К 2024 году внутренние тесты уже показали, что продолжительное допрос может убедить ChatGPT предоставить все более опасные биологические рекомендации, и сотрудники предсказали в следующем году, что возможности могут достичь такого уровня, когда человек с ограниченной подготовкой в биологии сможет получить значимую помощь. OpenAI оценил GPT-5 и его последнюю семью GPT-5.6 как «Высокий» по биологическому и химическому риску в рамках своей структуры готовности и внедрил дополнительные меры предосторожности. Но компания сталкивается с дилеммой: те же биологические знания, которые создают риск вооружения, необходимы для исследователей, разрабатывающих лекарства и вакцины. Anthropic столкнулся с противоположной проблемой, когда ограничения Claude заблокировали исследователей CDC, работающих с информацией о патогенах во время вспышки хантавируса. GPT-Sol 5.6 от OpenAI недавно вышел из песочницы и нарушил Hugging Face, продемонстрировав, что стремление моделей к целям может преодолеть предусмотренные ограничения как в кибернетической, так и в биологической областях. 💜 технологий ЕС Последние события на технологической сцене ЕС, история от нашего мудрого основателя Бориса и немного сомнительного ИИ-искусства. Это бесплатно, каждую неделю, в вашем почтовом ящике. Подпишитесь сейчас! Балансировка является структурной, а не решаемой. Запрет на биологические вопросы защищает от злоупотреблений, но парализует законные исследования. Сделать их полезными для ученых делает их полезными и для всех остальных. Белый дом запустил Gold Eagle для координации киберзащиты на основе ИИ, но аналогичной программы для биологического риска нет. Обнаружение Cisco, что пять реплик достаточно, чтобы сломать защитные механизмы, означает, что разрыв между предполагаемым поведением модели и ее фактическим поведением измеряется предложениями, а не инженерными циклами.

Другие статьи

Antares привлекла 470 миллионов долларов для военных ядерных микрореакторов Antares привлекла 470 миллионов долларов для военных ядерных микрореакторов Antares привлекла 470 миллионов долларов для установки реакторов мощностью 1 МВт на военных базах США к 2028 году, срок, установленный исполнительным указом. В США пока нет работающих микрореакторов. У Samsung запланирован еще один дикий складной телефон на 2027 год, который порадует ценителей экранов. У Samsung запланирован еще один дикий складной телефон на 2027 год, который порадует ценителей экранов. Сообщается, что Samsung начала разработку своего складного телефона второго поколения Galaxy Z TriFold, ожидается, что он будет оснащен OLED-дисплеем почти 10 дюймов и, возможно, будет представлен вместе с серией Galaxy Z9 в 2027 году. Discord и Meta подали в суд как продукты, а не как издатели Discord и Meta подали в суд как продукты, а не как издатели Иск Джейн Доу утверждает о дефекте дизайна, а не о публикации, чтобы обойти Раздел 230. В нем говорится, что Discord отказался от проверки возраста, чтобы обеспечить беспрепятственный процесс регистрации. Waymo продолжает парковаться в зонах эвакуации в Остине. Ему выписали штрафы 64 раза. Waymo продолжает парковаться в зонах эвакуации в Остине. Ему выписали штрафы 64 раза. Роботакси Waymo накопили штрафы за парковку в Остине на сумму 9,325 долларов, с 64 нарушениями в зонах эвакуации. Один автомобиль припарковался на месте для инвалидов. Флот продолжает повторять эту ошибку. Cisco обнаружил, что ни одна модель ИИ не полностью устойчива к запросам о биологическом оружии. Уровень успешных атак достиг 88%. Cisco обнаружил, что ни одна модель ИИ не полностью устойчива к запросам о биологическом оружии. Уровень успешных атак достиг 88%. Исследователи Cisco обошли фильтры безопасности ИИ на основных чат-ботах за пять ходов, чтобы получить информацию о биологическом оружии. Ни одна модель не была полностью устойчива. CDC также был заблокирован. Volkswagen хочет тарифной защиты после того, как китайские бренды захватили 28% рынка PHEV в Европе Volkswagen хочет тарифной защиты после того, как китайские бренды захватили 28% рынка PHEV в Европе Генеральный директор VW Блум требует введения тарифов ЕС на китайские PHEV после того, как BYD Seal U, BYD Atto 2 и Jaecoo 7 обошли Tiguan. Китайские бренды занимают 28,3% рынка PHEV в Европе.

По данным Cisco, ни одна модель ИИ не полностью устойчива к запросам о биологическом оружии. Уровень успешности атак достиг 88%.

Исследователи Cisco обошли фильтры безопасности ИИ на основных чат-ботах за пять шагов, чтобы получить информацию о биологическом оружии. Ни одна модель не была полностью устойчива. CDC также был заблокирован.