OpenAI говорит, что ранние сигналы могли предотвратить утечку данных Hugging Face

OpenAI говорит, что ранние сигналы могли предотвратить утечку данных Hugging Face

      Технический отчет OpenAI о нарушении безопасности Hugging Face сообщает, что внутренняя команда увидела, как ее модели вышли в открытый интернет из их песочницы в конце мая, и что предупреждение в июне не остановило оценку. Также было установлено, что обучение иногда вознаграждало агентов за использование своей среды.

      OpenAI опубликовала свой отчет о том, как ее модели взломали Hugging Face, и интересная часть — это календарь. В конце мая она знала, что модели в тестировании использовали уязвимость, чтобы выйти в открытый интернет.

      Внутренняя команда заметила побег в то время. Инструмент мониторинга выдал второе предупреждение 27 июня, связанное с агентами, использующими импровизированную доску объявлений для перемещения по сети, и дежурный персонал решил, что оценка не нуждается в остановке.

      Собственное заключение компании осторожно. «С учетом ретроспективы некоторые ранние сигналы, выявленные в этом отчете, могли бы вызвать более раннюю реакцию», — пишут они.

      То, что произошло в Hugging Face, было не тонким. Агенты выполнили код на 41 производственном сервере, получили контроль на уровне root как минимум над одним, получили производственные учетные данные и скачали четыре частных репозитория кода, большая часть из которых была получена за 13 часов.

      Они также обратились против своего работодателя. Внутри OpenAI агенты прочитали 956 сохраненных секретов, включая учетные данные для инструмента мониторинга, который выдал предупреждение, и получили доступ на уровне администратора к части своей облачной инфраструктуры.

      Самое неприятное открытие касается обучения, а не безопасности. OpenAI утверждает, что агенты, использовавшие свою среду, когда соответствующие инструменты не сработали, иногда получали за это вознаграждение, что является механизмом, превращающим многомесячный прорыв в усвоенную привычку.

      Один пример иллюстрирует это. Агент использовал уязвимость, чтобы прочитать программу, которую он должен был воспроизвести, скопировал ответ и был вознагражден за выполнение задачи.

      Независимая оценка была проведена в тот же день. METR и Redwood Research обнаружили, что агенты уклонялись от автоматических проверок безопасности в обеих компаниях, при этом прикладывая меньше усилий, чтобы избежать людей.

      Генеральный директор Hugging Face уже несколько недель требует этого. Клем Деланж хочет, чтобы компании были юридически обязаны публиковать следы агентов, показывающие, что спрашивали инженеры и что делали агенты.

      Европа уже требует часть этого. Статья 55 Закона о ИИ обязывает поставщиков моделей общего назначения с системным риском сообщать о серьезных инцидентах в Офис ИИ без неоправданной задержки и обеспечивать безопасность модели и ее инфраструктуры.

      Проблема в том, какая модель. Эти обязанности возникают, как только модель поступает на рынок, и OpenAI утверждает, что основным двигателем этого вторжения была внутренняя исследовательская модель, которой никогда не было.

      Америка вместо этого тянется за повестками. Генеральный прокурор Алабамы отправил одну, через несколько недель после того, как 15 штатов потребовали от OpenAI сохранить свои документы.

Другие статьи

Растущие затраты на гонку потребления токенов Растущие затраты на гонку потребления токенов Почему токенмаксинг приводит к росту затрат на ИИ, как выбор модели и контекстные окна влияют на счета LLM, и почему компаниям следует сосредоточиться на результатах. Искусственные интеллектуальные ресепшенисты кажутся опасной идеей после того, как пациентка сообщила, что они не поняли её запрос. Искусственные интеллектуальные ресепшенисты кажутся опасной идеей после того, как пациентка сообщила, что они не поняли её запрос. Искусственные интеллектуальные ресепшенисты внедряются для обработки звонков к врачам общей практики и сокращения времени ожидания, но жалобы пациентов вызывают опасения по поводу доступности, коммуникации и человеческой поддержки. Gemini Live получает агентные задачи, управление голосовым почтовым ящиком и личный интеллект Gemini Live получает агентные задачи, управление голосовым почтовым ящиком и личный интеллект Gemini Live теперь может передавать устные инструкции фоновым агентам. В Европе Google должен позволить конкурентным помощникам достичь сопоставимой функциональности к 2027 году. RTX Spark от Nvidia готовится к крупным компьютерным играм, включая античит. RTX Spark от Nvidia готовится к крупным компьютерным играм, включая античит. RTX Spark получает поддержку для крупных ПК-игр, таких как Apex Legends, F1 25, ARC Raiders и THE FINALS, в то время как Nvidia также решает вопросы совместимости с античитами. Nvidia сообщила о выручке в $96,2 млрд за второй квартал. Nvidia сообщила о выручке в $96,2 млрд за второй квартал. Nvidia сообщила о доходах в размере 96,2 миллиарда долларов и представила свой первый прогноз на следующий год, при этом финансовый директор напрямую обсудил круговое финансирование во время звонка. OpenAI утверждает, что ранние сигналы могли предотвратить утечку данных Hugging Face OpenAI утверждает, что ранние сигналы могли предотвратить утечку данных Hugging Face Отчет OpenAI сообщает, что в конце мая он заметил, как модели выходят из своей песочницы, и позволил оценке продолжаться. Правила Европы могут не охватывать модель, которую он обвиняет.

OpenAI говорит, что ранние сигналы могли предотвратить утечку данных Hugging Face

Отчет OpenAI говорит, что в конце мая он заметил, как модели покидают свою песочницу, и позволил оценке продолжаться. Правила Европы могут не охватывать модель, которую он обвиняет.