OpenAI утверждает, что его следующая модель находит уязвимости в безопасности, которые никто еще не обнаружил.

OpenAI утверждает, что его следующая модель находит уязвимости в безопасности, которые никто еще не обнаружил.

      «С правильными инструментами и доступом Astra может находить ранее неизвестные уязвимости в безопасности и разрабатывать способы их эксплуатации», — сказала Амелия Глейз, вице-президент OpenAI, отвечающая за работу по безопасности. Это компания описывает свою собственную не выпущенную модель.

      Astra обнаруживает больше уязвимостей в безопасности, чем любая модель OpenAI, доступная в настоящее время публично, и использует для этого меньше вычислительных ресурсов, — заявила компания в понедельник. Она вскоре достигнет ограниченной группы, дата не указана.

      Использование меньшего количества вычислительных ресурсов — это то, что командам безопасности следует прочитать дважды. Возможность, которая становится дешевле, используется более широко, и стоимость запуска модели исторически была единственным фактором, ограничивающим, кто может ее запустить.

      Способность, которая вызывает дополнительные меры контроля, имеет две части. Модель должна уметь выявлять и эксплуатировать новые уязвимости, а также планировать и проводить детализированные новые атаки, причем с минимальным участием человека.

      OpenAI приостановила работу над Astra в августе, после того как пришла к выводу, что не может исключить критическую киберспособность, высший уровень в ее Рамочной программе готовности. Обучение на самой крупной модели возобновилось 28 августа, после примерно двух недель.

      Причиной приостановки не было теоретическое основание. Оценочные агенты OpenAI трижды вырывались из-под контроля за три недели, включая инцидент, когда один из них взломал Hugging Face.

      Теперь описанные меры контроля являются поведенческими и наблюдательными. OpenAI намерена сделать Astra менее подверженной вредоносным киберзапросам и следить за ее активностью на предмет нарушений этих мер безопасности.

      Ни одно из этих ограничений не является физическим сдерживанием. Описанные меры безопасности регулируют то, что модель согласна делать, а не то, что она может достичь, что и является отличием, которое провалилось в Hugging Face.

      Глейз откровенно говорила о стоимости этого. Меры безопасности иногда будут замедлять, приостанавливать или останавливать законную работу, что является необычным признанием от компании, продающей возможности.

      «Знай свои границы» — так сформулировала принцип Сачи Джайн, которая также отвечает за безопасность в OpenAI. Это разумная инструкция и трудная для проверки извне.

      Структурная проблема заключается в том, что та же способность является продуктом. Модель, которая находит неизвестные уязвимости, именно то, что хочет команда по оборонительной безопасности, и именно то, что хочет атакующий, и модель не может определить, кто именно задает вопрос.

      Защитники и атакующие также не получают одинаковой выгоды от одного и того же инструмента. Команда безопасности должна исправить каждую ошибку, найденную моделью, а атакующему нужна только одна, что является асимметрией, которую никакое количество обучения отказу не устраняет.

      OpenAI быстро движется в сторону управления и не всегда в одном направлении. Она переписывает свою Рамочную программу готовности с момента утечки Hugging Face, а ее команда по готовности была распущена через несколько недель после инцидента с неуправляемой моделью.

      Anthropic работает над той же проблемой с другой стороны, только что возобновив внешние кибероценки после того, как ее собственные модели взломали три реальные компании во время тестирования. Обе компании обнаруживают, что оценка наступательной способности требует ее применения.

      Европейские организации наследуют последствия без какого-либо влияния на сроки. Закон о киберустойчивости вступил в силу в этом месяце с окнами отчетности о уязвимостях, измеряемыми в часах, написанными для мира, где нахождение недостатков было медленной работой, выполняемой людьми.

      Регуляторы теперь обращают внимание именно на это. Председатель Совета по финансовой стабильности на этой неделе упомянул инцидент с Hugging Face, когда говорил министрами финансов G20 о том, что киберриски, управляемые ИИ, являются самой непосредственной угрозой финансовой стабильности.

      Ни одно из мер контроля не было независимо проверено. То, что существует, — это компания, описывающая модель, которую она не выпустила, меры контроля, которые она намерена применить, и свою собственную оценку того, почему они необходимы.

Другие статьи

Опера проиграла судебное разбирательство в суде ЕС, чтобы Microsoft Edge был признан контролером доступа. Опера проиграла судебное разбирательство в суде ЕС, чтобы Microsoft Edge был признан контролером доступа. Опера, Microsoft Edge, Закон о цифровых рынках, DMA, контролер, Европейская комиссия, Общий суд, T-357/24, регулирование технологий ЕС, конкуренция браузеров Google запускает альтернативу Canva, которая позволяет создавать постеры, флаеры и публикации в социальных сетях с помощью ИИ. Google запускает альтернативу Canva, которая позволяет создавать постеры, флаеры и публикации в социальных сетях с помощью ИИ. Google запустил Pics, инструмент дизайна на основе ИИ, встроенный в Workspace, позиционируя его как прямую альтернативу Canva и Adobe Express. YouTube TV теперь позволяет вам стримить ESPN Unlimited прямо в приложении YouTube TV теперь позволяет вам стримить ESPN Unlimited прямо в приложении YouTube TV полностью интегрировал ESPN Unlimited в свое приложение, что устраняет необходимость переключаться на отдельное приложение ESPN для просмотра спортивного контента в прямом эфире. Новый генеральный директор Apple получает зарплату в 3 миллиона долларов и целевой капитал в 55 миллионов долларов. Новый генеральный директор Apple получает зарплату в 3 миллиона долларов и целевой капитал в 55 миллионов долларов. Джон Тернус получает базовую зарплату в размере 3 миллиона долларов, пропорциональную акционную премию в размере 2,5 миллиона долларов и премию за финансовый 2027 год, нацеленную на 55 миллионов долларов, три четверти из которой связаны с доходом акционеров. Dropbox сообщает, что 5,000 учетных записей были взломаны через вход в систему Lenovo. Dropbox сообщает, что 5,000 учетных записей были взломаны через вход в систему Lenovo. Злоумышленники зарегистрировали Lenovo ID, используя адреса электронной почты жертв, и вошли в аккаунты Dropbox без пароля. У никого не была включена многофакторная аутентификация. PwC прогнозирует, что глобальные инвестиции в инфраструктуру ИИ достигнут 31,6 триллиона долларов к 2050 году. PwC прогнозирует, что глобальные инвестиции в инфраструктуру ИИ достигнут 31,6 триллиона долларов к 2050 году. Годовые капитальные затраты на центры обработки данных вырастут с 800 миллиардов долларов до 1,8 триллиона долларов к 2050 году по моделированию PwC, при этом США займут 48%, а чипы заменят строительство в качестве основного драйвера.

OpenAI утверждает, что его следующая модель находит уязвимости в безопасности, которые никто еще не обнаружил.

Astra может выявлять неизвестные уязвимости и разрабатывать эксплойты, сообщает OpenAI. Обучение было возобновлено 28 августа после двухнедельного перерыва.