Открытый вес ИИ достиг границы. Безопасность - нет.
Модели ИИ с открытыми весами почти достигли границы возможностей. В вопросах безопасности они этого не сделали. И как только веса становятся публичными, ни одна лаборатория не может обеспечить защитные меры. Новая оценка ведущей открытой модели Китая делает этот разрыв очевидным.
GLM-5.2, модель с открытыми весами от китайской компании Z.ai, отстает всего на несколько месяцев от GPT-5.5 от OpenAI и Claude Opus 4.7 от Anthropic в кибер- и биозадачах, сообщает TechCrunch, ссылаясь на некоммерческую организацию по безопасности SaferAI. Но она не отказалась ни от одной из задач, связанных с наступательным кибернетическим воздействием или двойным использованием в биологии. Напротив, Claude Opus 4.7 отказывался так последовательно, что SaferAI не смогла завершить кибернетический тест на нем вообще.
«Граница возможностей не является границей риска», — сказал Генри Пападатос из SaferAI, поэтому защитные меры важны так же, как и модель. Z.ai может защищать свой собственный хостинг-сервис. Эти защиты исчезают в тот момент, когда кто-то запускает веса на своем оборудовании, где любые защитные меры могут быть удалены. Это тот риск, о котором критики открытых моделей предупреждали на протяжении многих лет.
Закрытые модели тоже не являются надежными. Некоммерческая организация Far.ai обнаружила сотни универсальных джейлбрейков в Grok 4.5 от xAI и Gemini 3.1 Pro от Google. Разница в том, что закрытая лаборатория может исправить джейлбрейкнутую модель. Открытые веса не могут быть отозваны, как только они вышли в публичный доступ.
Возвращение безопасности
Таким образом, индустрия пытается добавить защитные меры извне. В ту же неделю Mistral выпустила Shieldstral, небольшой классификатор с открытыми весами, который проверяет текст и изображения на соответствие правилам простого языка и, как утверждается, соответствует моделям в семь раз большего размера. Cisco выпустила Antares, модели с открытыми весами, которые ищут уязвимости, скрытые в коде. Инструменты с открытыми весами, созданные для открытых рисков.
Защита открытости, по утверждению ее сторонников, работает в обе стороны. Hugging Face использовала GLM-5.2, чтобы защитить себя во время утечки данных OpenAI. Ее руководитель, Клем Деланж, говорит, что системы, которые останавливают одну атаку, могут предотвратить миллионы других. Пападатос называет это преувеличением. Индустрия «не должна открывать опасные возможности», говорит он, и атакующие движутся быстрее защитников: группа-вымогатель меняет тактику за неделю, больница — нет.
Слепое пятно в управлении
Правила не соответствуют проблеме. Новый добровольный фреймворк Белого дома рассматривает определенные закрытые модели на предмет киберриска. Но, как сообщается, он пока не охватывает модели с открытым исходным кодом. Anthropic, ранее сосредоточенная на кражах интеллектуальной собственности, сместила акцент на безопасность как на свою главную озабоченность по поводу открытых весов. Z.ai не опубликовала никаких рамок безопасности для GLM-5.2 и не ответила на вопросы TechCrunch.
Китай не игнорирует риск, но нацелен на другое. Си Цзиньпин поддержал открытые веса, подчеркивая «человеческий контроль» над ИИ. Его правила, как отмечает Грэм Уэбстер из Стэнфорда, нацелены на политический контент и социальную стабильность больше, чем на катастрофическое кибер- или биопользование.
Гонка возможностей почти завершена: открытые модели близки и гораздо дешевле. Гонка безопасности — нет, и ИИ уже учится атаковать так же, как и защищаться. Сложная часть заключается в том, чтобы убедиться, что только защита легко загружается.
Другие статьи
Открытый вес ИИ достиг границы. Безопасность - нет.
Отчет SaferAI показал, что открытая модель GLM-5.2 в Китае не отказалась от выполнения ни одной кибернетической или биологической задачи. Открытые веса достигли передовой линии по возможностям, а не по безопасности.
