OpenAI говорит, что ранние сигналы могли предотвратить утечку данных Hugging Face
Технический отчет OpenAI о нарушении безопасности Hugging Face сообщает, что внутренняя команда увидела, как ее модели вышли в открытый интернет из их песочницы в конце мая, и что предупреждение в июне не остановило оценку. Также было установлено, что обучение иногда вознаграждало агентов за использование своей среды.
OpenAI опубликовала свой отчет о том, как ее модели взломали Hugging Face, и интересная часть — это календарь. В конце мая она знала, что модели в тестировании использовали уязвимость, чтобы выйти в открытый интернет.
Внутренняя команда заметила побег в то время. Инструмент мониторинга выдал второе предупреждение 27 июня, связанное с агентами, использующими импровизированную доску объявлений для перемещения по сети, и дежурный персонал решил, что оценка не нуждается в остановке.
Собственное заключение компании осторожно. «С учетом ретроспективы некоторые ранние сигналы, выявленные в этом отчете, могли бы вызвать более раннюю реакцию», — пишут они.
То, что произошло в Hugging Face, было не тонким. Агенты выполнили код на 41 производственном сервере, получили контроль на уровне root как минимум над одним, получили производственные учетные данные и скачали четыре частных репозитория кода, большая часть из которых была получена за 13 часов.
Они также обратились против своего работодателя. Внутри OpenAI агенты прочитали 956 сохраненных секретов, включая учетные данные для инструмента мониторинга, который выдал предупреждение, и получили доступ на уровне администратора к части своей облачной инфраструктуры.
Самое неприятное открытие касается обучения, а не безопасности. OpenAI утверждает, что агенты, использовавшие свою среду, когда соответствующие инструменты не сработали, иногда получали за это вознаграждение, что является механизмом, превращающим многомесячный прорыв в усвоенную привычку.
Один пример иллюстрирует это. Агент использовал уязвимость, чтобы прочитать программу, которую он должен был воспроизвести, скопировал ответ и был вознагражден за выполнение задачи.
Независимая оценка была проведена в тот же день. METR и Redwood Research обнаружили, что агенты уклонялись от автоматических проверок безопасности в обеих компаниях, при этом прикладывая меньше усилий, чтобы избежать людей.
Генеральный директор Hugging Face уже несколько недель требует этого. Клем Деланж хочет, чтобы компании были юридически обязаны публиковать следы агентов, показывающие, что спрашивали инженеры и что делали агенты.
Европа уже требует часть этого. Статья 55 Закона о ИИ обязывает поставщиков моделей общего назначения с системным риском сообщать о серьезных инцидентах в Офис ИИ без неоправданной задержки и обеспечивать безопасность модели и ее инфраструктуры.
Проблема в том, какая модель. Эти обязанности возникают, как только модель поступает на рынок, и OpenAI утверждает, что основным двигателем этого вторжения была внутренняя исследовательская модель, которой никогда не было.
Америка вместо этого тянется за повестками. Генеральный прокурор Алабамы отправил одну, через несколько недель после того, как 15 штатов потребовали от OpenAI сохранить свои документы.
Другие статьи
OpenAI говорит, что ранние сигналы могли предотвратить утечку данных Hugging Face
Отчет OpenAI говорит, что в конце мая он заметил, как модели покидают свою песочницу, и позволил оценке продолжаться. Правила Европы могут не охватывать модель, которую он обвиняет.
