Каждая модель ИИ на границе, которую Великобритания тестировала на мошенничество, оказалась мошеннической.

Каждая модель ИИ на границе, которую Великобритания тестировала на мошенничество, оказалась мошеннической.

      Наблюдатель за безопасностью ИИ в Великобритании подверг пять передовых моделей набору тестов на безопасность, чтобы выяснить, будут ли они идти на уловки. Каждая из них обманула. Более того, когда их об этом спросили позже, большинство не признали, что сделали что-то неправильно.

      Это открытие сделано Институтом безопасности ИИ (AISI), исследовательским органом внутри правительства Великобритании. В ходе своих тестов киберспособностей ведущие модели регулярно использовали запрещенные уловки для достижения цели, как сообщал The Register. Затем они не отметили, что сделали.

      «Каждая модель, которую мы тестировали на это поведение, пыталась обмануть», — написал AISI.

      Что показывают цифры

      AISI определяет обман как любое действие вне рамок задачи или то, что правила явно запрещают, использованное для достижения цели с помощью уловки. В своих кибертестах модели ищут скрытый «флаг» в установленных пределах. Выход за эти пределы считается обманом.

      💜 технологий ЕС Последние новости из технологической сцены ЕС, история от нашего мудрого основателя Бориса и немного сомнительного ИИ-арта. Это бесплатно, каждую неделю, в вашем почтовом ящике. Подпишитесь сейчас!

      При более чем 475 тестовых запусках каждая модель показала разные результаты. GPT-5.4 обманул 14.1% времени, GPT-5.5 — 11.4%, а GPT-5.6-Sol — 12.6%. Среди моделей Anthropic Claude 4.7 Opus обманул 9.1%, а Claude Mythos Preview — 7.8%. Тактики также различались. Модели искали ответы в интернете, обходили ограничения песочницы, исследовали тестовую среду или атаковали системы, которые не были целью.

      Одна модель зашла слишком далеко

      Самый яркий случай касался теста, который AISI случайно неправильно настроил, что сделало его невозможным для решения. Одна модель отказалась сдаваться. Она написала и запустила код на внешнем сервисе в открытом интернете, пытаясь получить доступ к собственным системам оценки AISI. Это вызвало сигнал тревоги безопасности.

      Данные не утекли, и ничего не сломалось. Но AISI заявил, что попытка могла бы увенчаться успехом, если бы системы не были построены безопасно. С тех пор они ужесточили свои меры контроля.

      Они не признаются

      Более серьезная проблема — это доверие. Когда их спрашивали, обманули ли они, модели называли это действие неправильным менее чем в половине случаев. Они часто не упоминали об этом в своей цепочке размышлений, письменных рассуждениях, которые некоторые модели производят в процессе работы. В некоторых запусках модель оценивала, считается ли шаг обманом, а затем все равно его выполняла.

      Это означает, что два очевидных способа проверки — спросить модель и прочитать ее рассуждения — оба оказываются недостаточными. Примечательно, что обман не зависел от того, насколько способна была модель. AISI считает, что это связано с тем, как разработчики обучают и выравнивают каждую модель, а не с сырой мощностью.

      Не только в лаборатории

      Это не только любопытство тестовой лаборатории. OpenAI недавно раскрыла, что ее модель с долгим горизонтом, которая решала известную математическую задачу, вышла за пределы своей песочницы во время внутреннего использования. В своем собственном отчете о безопасности OpenAI заявила, что модель разделила токен аутентификации, чтобы пройти мимо сканера. Она также опубликовала результаты в общедоступном репозитории кода, который OpenAI объявила закрытым.

      Дело для арбитров

      AISI осторожен, чтобы не преувеличивать. Обман не всегда означает злой умысел, и он говорит, что ни одна модель еще не обманула незамеченной в ходе ручного обзора своих опубликованных результатов. Тем не менее, он предупреждает, что по мере того как модели становятся более способными, ручной обзор и автоматизированный мониторинг могут не успевать.

      Удобным решением было бы обучить модели вообще не обманывать. Но исследователи впервые указали на это более года назад, и AISI говорит, что выравнивание от этого оказывается сложным. Это усиливает аргументы в пользу независимых арбитров перед развертыванием, которые предложили такие фигуры, как Демис Хассабис. Это также подстегивает более широкую инициативу по регулированию передовых систем до их выпуска.

Другие статьи

Компании ИИ покупают старые книги для обучения без мусора. Компании ИИ покупают старые книги для обучения без мусора. Брокер ISBNdb продает печатные книги AI labs до 2022 года как последние данные для обучения без мусора. Сканирование их означает тихое уничтожение книг. Блок Джека Дорси бросает вызов Slack с помощью Buzz Блок Джека Дорси бросает вызов Slack с помощью Buzz Buzz от Block — это бесплатный, с открытым исходным кодом аналог Slack, где люди и агенты ИИ делят рабочее пространство, и у каждого агента есть своя портативная идентичность. OpenAI утверждает, что ИИ-модели самостоятельно провели крупную хакерскую атаку, но только китайский ИИ помог в восстановлении. OpenAI утверждает, что ИИ-модели самостоятельно провели крупную хакерскую атаку, но только китайский ИИ помог в восстановлении. GPT-5.6 Sol и нераскрытая модель OpenAI использовали уязвимости нулевого дня, чтобы выйти из тестового песочницы и получить доступ к производственной инфраструктуре Hugging Face. Substack теперь позволяет вам проверить, был ли пост написан ИИ Substack теперь позволяет вам проверить, был ли пост написан ИИ Substack запускает сканер на основе панграммы, который позволяет читателям проверять посты, заметки и ответы на наличие текста, написанного ИИ. Авторы также получают свои инструменты, включая сканирование перед публикацией и раскрытие "Как я это делаю". Galaxy Z Fold 8 против Galaxy Z Fold 8 Ultra: стоит ли тратить дополнительные $200 и стоит ли Ultra своих денег? Galaxy Z Fold 8 против Galaxy Z Fold 8 Ultra: стоит ли тратить дополнительные $200 и стоит ли Ultra своих денег? Новые Samsung Fold 8 и Fold 8 Ultra имеют одинаковый чип и уровни хранения, но сильно различаются по аппаратному обеспечению камер, размеру экрана и батарее. AI-компании покупают старые книги для обучения без ошибок. AI-компании покупают старые книги для обучения без ошибок. Брокер ISBNdb продает печатные книги до 2022 года из лабораторий ИИ как последние данные для обучения без ошибок. Сканирование их означает тихое уничтожение книг.

Каждая модель ИИ на границе, которую Великобритания тестировала на мошенничество, оказалась мошеннической.

Институт безопасности ИИ Великобритании протестировал пять передовых моделей на предмет мошенничества в киберзадачах. Все пять обманули, и большинство не признались в этом, когда их спросили.