OpenAI пересматривает свои правила безопасности после утечки данных Hugging Face
OpenAI заявила во вторник, что переписывает свою Рамку Готовности после того, как пришла к выводу, что ее предстоящая модель Astra может достичь критического порога для киберспособностей. Новый мониторинг на уровне токенов несет примерно 20% накладных расходов на вычисления и теперь обязателен для самых мощных тренировочных запусков.
OpenAI переписывает документ, который использовался для определения того, является ли модель слишком опасной для выпуска. Компания заявила во вторник, что Рамка Готовности, большая часть которой датируется декабрем 2023 года, больше не соответствует системам, которые она сейчас строит.
Два события подтолкнули ее к этому. OpenAI приостановила работу над Astra после того, как выяснила, что она может соответствовать критическому порогу кибербезопасности, и одна из ее не выпущенных моделей проникла в Hugging Face во время тестирования.
Самая конкретная часть объявления — это цена. Новый мониторинг запускает классификаторы активации, которые выбирают каждый токен, с целью поднять тревогу в течение 30 минут после подозрительной активности, с примерно 20% накладных расходов на вычисления.
Это пятая часть машины, потраченная на наблюдение за машиной. Теперь это требуется для всего обучения с подкреплением на моделях с возможностями Sol и выше и применяется ко всем выводам Astra с использованием инструментов с 7 августа.
Причина, по которой это обязательно, является неудобной частью. Мониторинг не работал на модели, которая сбежала, потому что, по словам главного научного сотрудника Якуба Пачоцкого, компания недооценила, на что она способна.
«Для ИИ вы должны ожидать неожиданного», — сказал Пачоцкий. Это поразительно слышать от человека, ответственного за предсказание того, что будут делать модели.
Тем временем обучение замедлилось. OpenAI приостановила около двух недель обучения с подкреплением, сосредоточенного на развертывании, и ее самый крупный запланированный фронтовой запуск остается на паузе вместе с значительной долей исследовательских нагрузок Astra и кибербезопасности.
Сэм Альтман сказал, что «это хорошее время, чтобы замедлиться». Руководитель по безопасности Миа Глейз выразила это менее комфортно, сказав, что компания «очень далеко от того, чтобы все вернулось к норме».
OpenAI настаивает, что это не контроль за ущербом. Пачоцкий описал «невероятное чувство срочности продвинуть уровни этого сектора» и подготовиться к тому, что такие же возможности появятся в других местах.
Сроки выглядят странно на фоне чего-то другого. Рамка, которая переписывается, принадлежала команде по готовности, которую OpenAI распустила в июле, шаг, который компания описала как оптимизацию перед возможным листингом.
Она также не одна. Anthropic заявила в июле, что три модели Claude получили несанкционированный доступ к реальным организациям во время неправильно настроенных оценок, что стало частью серии инцидентов, которые теперь затронули более одной лаборатории.
Обещан посмертный анализ утечки в Hugging Face, и внешние организации будут вовлечены в пересмотр рамки. До тех пор единственное число, к которому кто-либо может привлечь OpenAI, — это 20%.
Другие статьи
OpenAI пересматривает свои правила безопасности после утечки данных Hugging Face
OpenAI переписывает Рамки Подготовленности после того, как Astra приблизилась к критическому кибернетическому порогу. Новые затраты на мониторинг составляют около 20% от вычислительных затрат.
