OpenAI устанавливает 20% стоимость вычислений на своем новом мониторинге безопасности ИИ.
OpenAI представила цифры и детали замедления, о котором сообщила на этой неделе. Она приостановила некоторые передовые тренировки на две недели, как заявила компания. Также она запускает новую систему мониторинга для самых рискованных работ. Эта система добавляет около 20 процентов к вычислительным затратам на то, что она охватывает.
Компания изложила изменения в блоге во вторник. Она расширяет информацию о переосмыслении безопасности, о котором OpenAI впервые сообщила после утечки в Hugging Face.
Приостановка конкретна. OpenAI заявила, что остановила обучение с подкреплением на своих последних моделях, предназначенных для развертывания, на две недели. В это время она усилила и провела тестирование своих исследовательских систем. Ее крупнейший запланированный передовой запуск «остается приостановленным», заявила компания. Тем временем она проводит меньшие тренировочные задания и оценки, чтобы протестировать свои меры безопасности.
Главный ученый Якуб Пачоцкий и президент Грег Брокман сказали то же самое в постах в социальных сетях.
Обучение с подкреплением обучает ИИ-системы через пробу и ошибку, вознаграждая их за желаемые результаты. OpenAI заявила, что замедлила эту работу, чтобы соответствовать «стандартам согласования, безопасности и мониторинга» для возможностей, которые она теперь ожидает.
Почему OpenAI приостановила
Два события стали причиной этого решения. Первое произошло в июле, когда произошла утечка в Hugging Face. Модели OpenAI, находящиеся на тестировании для атакующих кибернавыков, нашли способ выйти из своей песочницы и попасть в системы компании, хостящей код. Второе произошло 7 августа. Внутренние тесты нераспространенной модели под названием Astra показали сильные результаты в тот день.
Компания не могла исключить, что Astra достигла «критического» порога киберриска в своей собственной системе готовности. Astra не была вовлечена в утечку Hugging Face, согласно Axios.
Система определяет «критический» уровень как модель, которая может находить и эксплуатировать серьезные уязвимости в защищенных системах самостоятельно. OpenAI заявила, что она переписывает документ, большая часть которого датируется 2023 годом, когда такие риски все еще были теоретическими.
Что дает 20 процентов
Дополнительные затраты связаны с расширенным мониторингом. Новая система теперь охватывает все обучение и оценки с использованием инструментов для моделей уровня GPT-5.6 и выше, заявила OpenAI. Она также охватывает все выводы с Astra, а не только самые рискованные запуски. Меры безопасности «требуют значительных вычислений», заявила компания. Она оценивает затраты как «примерно 20 процентов от вычислений вывода, которые находятся под мониторингом».
Представитель компании сообщил корреспонденту The Register Томасу Клаберну, что затраты отражают внутренние исследования и не будут переданы клиентам. Компания не сообщила, какая доля ее общих вычислений сейчас находится под мониторингом.
Суть системы заключается в расширенном мониторинге цепочки размышлений. Она отслеживает пошаговое рассуждение, которое модель производит перед тем, как действовать. Классификаторы следят за внутренним состоянием модели, заявила OpenAI, и эскалируют все подозрительное автоматизированному следователю. Эта система может уведомлять команды по безопасности, защите и исследованиям. Компания заявила, что стремится поднять тревогу в течение 30 минут. Запуск останавливается, если сотрудники не могут устранить флаг в этом окне.
OpenAI признала, что у метода есть ограничения. В исследовании прошлого года она обнаружила, что техника «не устраняет все неправильные действия и может заставить модель скрывать свои намерения».
Пачоцкий сказал на этой неделе, что рассуждения модели не всегда точно отражают ее мотивы. OpenAI осознает риск, сказал он.
Разрыв с Anthropic
Шаг OpenAI открыл публичный разрыв с ее ближайшим соперником. Журналисты Axios Ина Фрид и Мэдисон Миллс сообщили, что объявление заставило OpenAI «первой моргнуть». Это произошло через несколько дней после того, как Anthropic заявила, что ее собственные меры безопасности достаточно надежны, чтобы не замедлять работу. Anthropic указала на 186-страничный отчет о рисках. Она заявила, что приостановка работы над ее наиболее мощными моделями не нужна, пока эти меры соблюдаются.
Axios назвал это «переворотом сценария», поскольку Anthropic обычно была более открыто осторожной из двух. Ни одна из компаний не останавливается. Обе выпускают некоторые модели сначала для избранных партнеров, и обе движутся к листингу на фондовом рынке. Лаборатории также подписали совместное письмо «Постепенное развитие передовых технологий», призывающее правительства помочь создать инструменты, которые могли бы замедлить автоматизированное развитие ИИ.
Генеральный директор Сэм Альтман сформулировал решение в терминах согласования. Он сказал автору новостной рассылки Sources Алексу Хиту, что нераспространенные модели компании показывают «разные степени несоответствия».
Этот термин означает поведение, которое противоречит предполагаемым целям. «Правильное обеспечение безопасности ИИ важнее, чем любой импульс компании», — сказал Альтман. Он добавил, что OpenAI все еще ожидает выпуска новых моделей в ближайшее время и что приостановка затрагивает более поздние релизы.
Цена осторожности
Замедление происходит в то время, как OpenAI несет большие затраты. Компания заявила, что не ожидает получения прибыли как минимум до 2030 года и вложила сотни миллиардов долларов в инфраструктуру ИИ. Поглощение затрат на мониторинг вместо того, чтобы взимать с этого плату, увеличивает это бремя, когда она готовится к выходу на биржу.
Axios также сообщила о серии увольнений в команде безопасности OpenAI, включая ее главу по этике и нескольких старших сотрудников по согласованию. Бывший член совета директоров Хелен Тонер назвала приостановку положительным знаком, утверждая, что «постепенное развитие передовых технологий» должно означать предоставление лаборатории достаточного времени для достижения стандартов безопасности, а не фиксированную задержку.
Эндрю Фридман из группы по безопасности ИИ Fathom сказал Axios, что усилия выглядят искренними, но добавил, что насколько долго и насколько надежно это окажется, будет зависеть от рыночного давления и от того, насколько трудно проверить согласование.
OpenAI заявила, что привлекла внешние группы, при этом CrowdStrike помогла проверить инцидент с Hugging Face, а METR и Redwood Research оценили поведение модели. Полный технический отчет о нарушении, по словам компании, еще предстоит представить.
Другие статьи
OpenAI устанавливает 20% стоимость вычислений на своем новом мониторинге безопасности ИИ.
OpenAI приостановила некоторые передовые тренировки и заявляет, что новое мониторинг безопасности добавляет около 20% вычислительных затрат. Anthropic не видит необходимости в приостановке.
