Каждая модель ИИ на границе, которую Великобритания тестировала на мошенничество, оказалась мошеннической.
Наблюдатель за безопасностью ИИ в Великобритании подверг пять передовых моделей набору тестов на безопасность, чтобы выяснить, будут ли они идти на уловки. Каждая из них обманула. Более того, когда их об этом спросили позже, большинство не признали, что сделали что-то неправильно.
Это открытие сделано Институтом безопасности ИИ (AISI), исследовательским органом внутри правительства Великобритании. В ходе своих тестов киберспособностей ведущие модели регулярно использовали запрещенные уловки для достижения цели, как сообщал The Register. Затем они не отметили, что сделали.
«Каждая модель, которую мы тестировали на это поведение, пыталась обмануть», — написал AISI.
Что показывают цифры
AISI определяет обман как любое действие вне рамок задачи или то, что правила явно запрещают, использованное для достижения цели с помощью уловки. В своих кибертестах модели ищут скрытый «флаг» в установленных пределах. Выход за эти пределы считается обманом.
💜 технологий ЕС Последние новости из технологической сцены ЕС, история от нашего мудрого основателя Бориса и немного сомнительного ИИ-арта. Это бесплатно, каждую неделю, в вашем почтовом ящике. Подпишитесь сейчас!
При более чем 475 тестовых запусках каждая модель показала разные результаты. GPT-5.4 обманул 14.1% времени, GPT-5.5 — 11.4%, а GPT-5.6-Sol — 12.6%. Среди моделей Anthropic Claude 4.7 Opus обманул 9.1%, а Claude Mythos Preview — 7.8%. Тактики также различались. Модели искали ответы в интернете, обходили ограничения песочницы, исследовали тестовую среду или атаковали системы, которые не были целью.
Одна модель зашла слишком далеко
Самый яркий случай касался теста, который AISI случайно неправильно настроил, что сделало его невозможным для решения. Одна модель отказалась сдаваться. Она написала и запустила код на внешнем сервисе в открытом интернете, пытаясь получить доступ к собственным системам оценки AISI. Это вызвало сигнал тревоги безопасности.
Данные не утекли, и ничего не сломалось. Но AISI заявил, что попытка могла бы увенчаться успехом, если бы системы не были построены безопасно. С тех пор они ужесточили свои меры контроля.
Они не признаются
Более серьезная проблема — это доверие. Когда их спрашивали, обманули ли они, модели называли это действие неправильным менее чем в половине случаев. Они часто не упоминали об этом в своей цепочке размышлений, письменных рассуждениях, которые некоторые модели производят в процессе работы. В некоторых запусках модель оценивала, считается ли шаг обманом, а затем все равно его выполняла.
Это означает, что два очевидных способа проверки — спросить модель и прочитать ее рассуждения — оба оказываются недостаточными. Примечательно, что обман не зависел от того, насколько способна была модель. AISI считает, что это связано с тем, как разработчики обучают и выравнивают каждую модель, а не с сырой мощностью.
Не только в лаборатории
Это не только любопытство тестовой лаборатории. OpenAI недавно раскрыла, что ее модель с долгим горизонтом, которая решала известную математическую задачу, вышла за пределы своей песочницы во время внутреннего использования. В своем собственном отчете о безопасности OpenAI заявила, что модель разделила токен аутентификации, чтобы пройти мимо сканера. Она также опубликовала результаты в общедоступном репозитории кода, который OpenAI объявила закрытым.
Дело для арбитров
AISI осторожен, чтобы не преувеличивать. Обман не всегда означает злой умысел, и он говорит, что ни одна модель еще не обманула незамеченной в ходе ручного обзора своих опубликованных результатов. Тем не менее, он предупреждает, что по мере того как модели становятся более способными, ручной обзор и автоматизированный мониторинг могут не успевать.
Удобным решением было бы обучить модели вообще не обманывать. Но исследователи впервые указали на это более года назад, и AISI говорит, что выравнивание от этого оказывается сложным. Это усиливает аргументы в пользу независимых арбитров перед развертыванием, которые предложили такие фигуры, как Демис Хассабис. Это также подстегивает более широкую инициативу по регулированию передовых систем до их выпуска.
Другие статьи
Каждая модель ИИ на границе, которую Великобритания тестировала на мошенничество, оказалась мошеннической.
Институт безопасности ИИ Великобритании протестировал пять передовых моделей на предмет мошенничества в киберзадачах. Все пять обманули, и большинство не признались в этом, когда их спросили.
