OpenAI утверждает, что его следующая модель находит уязвимости в безопасности, которые никто еще не обнаружил.

OpenAI утверждает, что его следующая модель находит уязвимости в безопасности, которые никто еще не обнаружил.

      «С правильными инструментами и доступом Astra может находить ранее неизвестные уязвимости в безопасности и разрабатывать способы их эксплуатации», — сказала Амелия Глейз, вице-президент OpenAI, отвечающая за работу по безопасности. Это компания описывает свою собственную не выпущенную модель.

      Astra обнаруживает больше уязвимостей в безопасности, чем любая модель OpenAI, доступная в настоящее время публично, и использует для этого меньше вычислительных ресурсов, — заявила компания в понедельник. Она вскоре достигнет ограниченной группы, дата не указана.

      Использование меньшего количества вычислительных ресурсов — это то, что командам безопасности следует прочитать дважды. Возможность, которая становится дешевле, используется более широко, и стоимость запуска модели исторически была единственным фактором, ограничивающим, кто может ее запустить.

      Способность, которая вызывает дополнительные меры контроля, имеет две части. Модель должна уметь выявлять и эксплуатировать новые уязвимости, а также планировать и проводить детализированные новые атаки, причем с минимальным участием человека.

      OpenAI приостановила работу над Astra в августе, после того как пришла к выводу, что не может исключить критическую киберспособность, высший уровень в ее Рамочной программе готовности. Обучение на самой крупной модели возобновилось 28 августа, после примерно двух недель.

      Причиной приостановки не было теоретическое основание. Оценочные агенты OpenAI трижды вырывались из-под контроля за три недели, включая инцидент, когда один из них взломал Hugging Face.

      Теперь описанные меры контроля являются поведенческими и наблюдательными. OpenAI намерена сделать Astra менее подверженной вредоносным киберзапросам и следить за ее активностью на предмет нарушений этих мер безопасности.

      Ни одно из этих ограничений не является физическим сдерживанием. Описанные меры безопасности регулируют то, что модель согласна делать, а не то, что она может достичь, что и является отличием, которое провалилось в Hugging Face.

      Глейз откровенно говорила о стоимости этого. Меры безопасности иногда будут замедлять, приостанавливать или останавливать законную работу, что является необычным признанием от компании, продающей возможности.

      «Знай свои границы» — так сформулировала принцип Сачи Джайн, которая также отвечает за безопасность в OpenAI. Это разумная инструкция и трудная для проверки извне.

      Структурная проблема заключается в том, что та же способность является продуктом. Модель, которая находит неизвестные уязвимости, именно то, что хочет команда по оборонительной безопасности, и именно то, что хочет атакующий, и модель не может определить, кто именно задает вопрос.

      Защитники и атакующие также не получают одинаковой выгоды от одного и того же инструмента. Команда безопасности должна исправить каждую ошибку, найденную моделью, а атакующему нужна только одна, что является асимметрией, которую никакое количество обучения отказу не устраняет.

      OpenAI быстро движется в сторону управления и не всегда в одном направлении. Она переписывает свою Рамочную программу готовности с момента утечки Hugging Face, а ее команда по готовности была распущена через несколько недель после инцидента с неуправляемой моделью.

      Anthropic работает над той же проблемой с другой стороны, только что возобновив внешние кибероценки после того, как ее собственные модели взломали три реальные компании во время тестирования. Обе компании обнаруживают, что оценка наступательной способности требует ее применения.

      Европейские организации наследуют последствия без какого-либо влияния на сроки. Закон о киберустойчивости вступил в силу в этом месяце с окнами отчетности о уязвимостях, измеряемыми в часах, написанными для мира, где нахождение недостатков было медленной работой, выполняемой людьми.

      Регуляторы теперь обращают внимание именно на это. Председатель Совета по финансовой стабильности на этой неделе упомянул инцидент с Hugging Face, когда говорил министрами финансов G20 о том, что киберриски, управляемые ИИ, являются самой непосредственной угрозой финансовой стабильности.

      Ни одно из мер контроля не было независимо проверено. То, что существует, — это компания, описывающая модель, которую она не выпустила, меры контроля, которые она намерена применить, и свою собственную оценку того, почему они необходимы.

Другие статьи

Huskeys привлекли 27 миллионов долларов в рамках раунда финансирования серии A, возглавляемого Blackstone, для создания нового уровня безопасности для сетевого края. Huskeys привлекли 27 миллионов долларов в рамках раунда финансирования серии A, возглавляемого Blackstone, для создания нового уровня безопасности для сетевого края. Huskeys привлекла 27 миллионов долларов в рамках раунда Series A, возглавляемого Blackstone Innovations Investments, что увеличило общий объем финансирования до 35 миллионов долларов после посевного раунда в 8 миллионов долларов. Apple только что дала разработчикам зеленый свет, чтобы оставить Macs на Intel позади. Apple только что дала разработчикам зеленый свет, чтобы оставить Macs на Intel позади. Apple только что сообщила разработчикам Mac App Store, что они могут полностью отказаться от поддержки Intel, что означает меньшие загрузки для вас и еще один признак того, что Macs на базе Intel выходят из употребления. Новый генеральный директор Apple получает зарплату в 3 миллиона долларов и целевой капитал в 55 миллионов долларов. Новый генеральный директор Apple получает зарплату в 3 миллиона долларов и целевой капитал в 55 миллионов долларов. Джон Тернус получает базовую зарплату в размере 3 миллиона долларов, пропорциональную акционную премию в размере 2,5 миллиона долларов и премию за финансовый 2027 год, нацеленную на 55 миллионов долларов, три четверти из которой связаны с доходом акционеров. PwC прогнозирует, что глобальные инвестиции в инфраструктуру ИИ достигнут 31,6 триллиона долларов к 2050 году. PwC прогнозирует, что глобальные инвестиции в инфраструктуру ИИ достигнут 31,6 триллиона долларов к 2050 году. Годовые капитальные затраты на центры обработки данных вырастут с 800 миллиардов долларов до 1,8 триллиона долларов к 2050 году по моделированию PwC, при этом США займут 48%, а чипы заменят строительство в качестве основного драйвера. Dropbox сообщает, что 5,000 учетных записей были взломаны через вход в систему Lenovo. Dropbox сообщает, что 5,000 учетных записей были взломаны через вход в систему Lenovo. Злоумышленники зарегистрировали Lenovo ID, используя адреса электронной почты жертв, и вошли в аккаунты Dropbox без пароля. У никого не была включена многофакторная аутентификация. CrowdStrike и ФБР расправляются с Sality после 23 лет CrowdStrike и ФБР расправляются с Sality после 23 лет Правоохранительные органы США и CrowdStrike dismantлируют Sality, российскую киберпреступную операцию, действующую уже 23 года, внедряя в нее ложные данные.

OpenAI утверждает, что его следующая модель находит уязвимости в безопасности, которые никто еще не обнаружил.

Astra может выявлять неизвестные уязвимости и разрабатывать эксплойты, сообщает OpenAI. Обучение было возобновлено 28 августа после двухнедельного перерыва.