Исследователь захватил Claude Code, попросив его сделать краткое содержание веб-страницы.
Попросите Claude Code подвести итоги веб-страницы, и он может в конечном итоге запустить код злоумышленника на вашем компьютере. Исследователь безопасности получил такой результат в до 80% своих попыток.
Джессика Лайонс сообщила об этом открытии для The Register в пятницу. Работа принадлежит Иоганну Ребергеру, который публикуется под псевдонимом wunderwuzzi и много лет разбирает ИИ-агентов. Он изложил цепочку на своем блоге, с видео. Она нацелена на Opus 5, работающий в Авто режиме. Авто режим является стандартным с середины августа.
Цепочка начинается с веб-сайта, замаскированного под архив записей блокнота. Все, что происходит после этого, агент делает сам.
Защитный барьер — это эксплойт.
Claude пытается прочитать страницу с помощью WebFetch. Сервер отвечает 415 Unsupported Media Type, поэтому агент обращается к вызову Bash с помощью curl. Ребергер никогда не говорит ему это делать. Он просто заставляет предпочитаемый инструмент потерпеть неудачу.
Сайт затем возвращает 303 перенаправление на ZIP-архив, который Claude загружает. Внутри находятся метаданные каталога, README, семь закодированных записей блокнота, бинарный файл декодера для macOS и файл Python под названием struct.py.
Claude отказывается запускать бинарный файл декодера, точно так же, как его обучение по безопасности говорит ему делать. На это Ребергер и рассчитывал. «Это запланировано и то, что хочет злоумышленник», — написал он. Заблокированный от предоставленного декодера, модель пишет свой собственный.
«Иронично, что это решение по безопасности является путем эксплойта», — написал он.
Декодер, который пишет Claude, импортирует base64. Стандартный модуль base64 импортирует struct. Python сначала ищет в локальном каталоге, находит struct.py злоумышленника, который там лежит, и загружает его вместо настоящего. Программисты называют это затенением модуля. Это предшествует всему этому на десятилетия.
Ребергер использовал ChatGPT, чтобы запутать вредоносный файл достаточно, чтобы обойти проверки безопасности Claude. Затем файл запустил отдельный процесс Python, загрузил удаленный полезный груз и связался с сервером командования и управления. Полезный груз открыл Калькулятор, что является вежливым способом, которым исследователи демонстрируют выполнение произвольного кода.
Он также может запустить второго Claude.
В другой версии struct.py запускает новую сессию безголового Claude Code с помощью claude -p. Инъекция перестает быть удаленным выполнением кода и становится новым агентом.
«Вложенный Claude получает доступ к своим собственным инструментам и контексту», — написал Ребергер. В его запусках дочерний агент выполнял whoami, uname и id, открывал Калькулятор и записывал файлы в домашнюю папку.
Он протестировал три варианта по пять раз каждый и получил уровень успеха от 60% до 80%. Он осторожен в том, что это означает. «Я бы сказал, что эти результаты являются репрезентативными для мотивированной атаки, но не всеобъемлющими», — написал он.
Anthropic говорит, что все работает как задумано.
Ребергер сообщил о цепочке в Anthropic. Компания сказала ему, что поведение работает как задумано. Он перефразировал остальную часть ответа: «Авто режим — это удобная функция, поддерживаемая классификатором с наилучшей попыткой, а не гарантией безопасности».
Его интерпретация: классификатор никогда не должен был ловить цепочки инъекций, собранные из шагов, которые каждый выглядят безобидно. Реальная граница — это изоляция операционной системы и контроль выхода в сеть, утверждает он. Запускайте кодирующие агенты в песочнице.
«Не доверяйте выходным данным модели», — написал он.
The Register сообщил, что Anthropic не ответила на собственный запрос о комментарии. Anthropic с тех пор не комментировала это открытие публично.
Не его первое открытие о Claude.
Ребергер разбирает ИИ-агентов уже много лет, особенно Anthropic. The Register, который называет его волшебником инъекций, освещал его работу в прошлом октябре, показывая, что Claude можно заставить экстрагировать личные данные.
Шаблон, на который он продолжает наталкиваться, такой же, как и здесь. Модель с инструментами, получив что-то для чтения, что она не написала, будет следовать тому, что она читает.
Авто режим — это то, что делает это более сложным, чем предыдущие находки. Это настройка, которая позволяет Claude Code самостоятельно решать, какие инструменты использовать и запускать их, не останавливаясь, чтобы спросить, и она была стандартной с середины августа. Весь эксплойт — это последовательность небольших решений, которые агент принимает сам: попробовать WebFetch, вернуться к curl, следовать перенаправлению, распаковать архив, отклонить бинарный файл, написать декодер.
Каждое из этих решений можно защитить. Никто не одобрял цепочку.
TNW освещал Opus 5, когда он был запущен в июле, когда Anthropic назвал его наиболее согласованной моделью, которую он когда-либо отправлял. Мы также освещали недостаток в GitHub Action Claude Code в июне и документ Word, который переписывает ваши числа в июле. OpenAI добавила режим блокировки в ChatGPT против того же класса атак в июне.
Лимиты увеличились, снизившись.
Anthropic пережила вторую неловкую неделю с Claude Code, на этот раз по собственной вине.
29 августа аккаунт ClaudeDevs сообщил, что компания «постоянно увеличивает стандартные недельные лимиты в Claude Code на 25%» с 14 сентября для Pro, Max, Team и основанных на количестве мест планов Enterprise, и что текущий 50% рост будет действовать до этого времени.
Оба числа находятся в одном предложении. Возьмите лимит, который в данный момент составляет 50% выше своей базовой линии, и сбросьте его до 25% выше, и он упадет примерно на 17%. Anthropic сама так и сказала в ответе: «По сравнению с сегодняшним днем, это приводит к снижению недельных лимитов на 17% в Claude Code».
Первый пост имеет 6,7 миллиона просмотров. Ответ имеет 1,1 миллиона. Читатели X прикрепили к первому сообщению заметку сообщества, указывая на сокращение.
BleepingComputer, Notebookcheck и The Mac Observer все сосредоточились на снижении, а не на росте. Anthropic заявила, что работает над изменениями, которые дадут пользователям больше видимости и контроля над их использованием.
Лимиты использования уже привели Anthropic в суд. TNW сообщила в июне о судебном иске, в котором утверждается, что компания перепродала доступные лимиты использования на своих планах Claude Max за 200 долларов.
Другие статьи
Исследователь захватил Claude Code, попросив его сделать краткое содержание веб-страницы.
Исследователь обманул Claude Code, заставив его выполнять код злоумышленника до 80% времени. Anthropic утверждает, что такое поведение работает согласно задуманному.
