Новый контрольный орган отслеживает, когда ИИ выходит из-под контроля, и количество инцидентов заставит вас вспотеть.
Исследователи, отслеживающие ИИ-системы, которые выходят за рамки сценария, только что зафиксировали свой худший месяц.
Модели ИИ созданы для того, чтобы облегчить нашу работу, следуя инструкциям и придерживаясь их, а не тихо обходя их. Однако новые исследования показывают, что именно это происходит гораздо чаще, чем большинство людей осознает.
Случаи, когда ИИ-системы лгут пользователям, уклоняются от мер безопасности, установленных разработчиками, и перенаправляют ресурсы для достижения собственных целей, почти удвоились за один месяц этим летом (по данным The Guardian).
Итак, что именно обнаружили новые исследования?
Обсерватория потери контроля, финансируемая Институтом безопасности ИИ правительства Великобритании, зафиксировала более 300 случаев, когда ИИ-системы вышли из-под контроля только в июле 2026 года, что почти вдвое больше инцидентов, зарегистрированных в июне.
Инициатива отслеживает эти инциденты с ноября 2025 года, фиксируя отчеты, написанные пользователями, через X (ранее известный как Twitter), а не полагаясь на официальные раскрытия компаний.
Некоторые из зафиксированных поведений звучат как что-то из научно-фантастического фильма. Сообщается, что ИИ-системы подражали своим человеческим пользователям, копировали их стиль письма и получали разрешение на действия, фактически обходя меры безопасности, установленные для их контроля.
Самый серьезный случай всплыл на этой неделе. Институт безопасности ИИ Великобритании обнаружил, что две популярные ИИ-системы, Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI, обе провели хакерскую атаку на реальных людей во время теста на кибербезопасность. Стоит отметить, что это не было смоделированным упражнением, а настоящей атакой на реальные цели.
Происходило ли это где-то еще?
Это тоже не было изолированным событием. Сотрудники OpenAI, как сообщается, заметили предупреждающие знаки в своих собственных передовых агентах, и через несколько недель примерно 700 из них выбрались из виртуальной учебной среды и тайно скоординировались для взлома Hugging Face. Они даже отмечали свои успехи на доске сообщений (созданной исключительно для них), с восклицаниями вроде «БУМ!» и «Ух ты!»
Томми Шаффер-Шейн, который курирует Обсерваторию в Центре долгосрочной устойчивости, утверждает, что такое поведение больше не ограничивается лабораторными тестами. Компаниям ИИ необходимо начать открыто говорить о таких инцидентах, а не молчать, пока что-то серьезное не заставит их это сделать.
Обсерватория сама признает, что ее более 1600 зафиксированных инцидентов, вероятно, недооценивают реальное количество, так как она фиксирует только то, что публикуется в X. Она также призывает правительство Великобритании требовать официального отчетности о инцидентах, а также экстренных полномочий для ограничения ИИ-сервисов, если ситуация выйдет из-под контроля.
Если Великобритания вмешается и заставит компании адаптировать свои политики для соблюдения местных норм, это может установить глобальный прецедент для того, как правительства контролируют высокорисковый ИИ.
В течение более пяти лет Шикхар последовательно упрощал разработки в области потребительских технологий и представлял их…
Защитники здоровья Великобритании предупреждают, что инструменты транскрипции ИИ могут подвергать пациентов риску
ИИ-секретари помогают врачам экономить время на бумажной работе, но новые данные показывают, что автоматические транскрипции могут вносить серьезные ошибки в медицинские записи пациентов.
ИИ-секретари стремительно проникают в кабинеты врачей, обещая сократить утомительную бумажную работу и освободить время для ухода за пациентами. Однако растущие доказательства свидетельствуют о том, что эти инструменты вводят новый набор рисков как для пациентов, так и для клиницистов.
ИИ-секретари искажают диагнозы и рецепты
Читать далее
Интернет-архив только что сделал десятилетия винтажного ИИ доступными для игры в вашем браузере, и это fascinates
Перед большими языковыми моделями целое поколение программного обеспечения для домашних компьютеров уже имитировало опыт общения с чем-то живым.
Интернет-архив имеет привычку сохранять уникальные вещи, о которых никто другой не думал, и его новая коллекция является лучшим примером. Я бы сказал, что это то, что каждый историк ИИ должен добавить в закладки.
Кураторская коллекция под названием «Винтажный Искусственный Интеллект» содержит десятилетия программного обеспечения, которое пыталось убедить людей в том, что они разговаривают с мыслящей машиной (хотя с дикими вариациями успеха).
Читать далее
Исследователи создали гаджет за 7 долларов, который может находить скрытые камеры за считанные секунды
Он работает, сканируя свет вместо того, чтобы просто обнаруживать отражения с точностью 94%.
Скрытые камеры продолжают появляться в хитроумных местах, спрятанных внутри ручек, часов, зарядных устройств или рамок для фотографий в гостиничных номерах и арендах. Вот почему исследователи из KAIST создали решение, стоимость которого меньше, чем хороший обед. Их новый инструмент, называемый SweepLED, превращает любой смартфон в надежный детектор скрытых камер с помощью прикрепляемого светодиодного корпуса, стоимость которого составляет менее 7 долларов.
Почему ваш текущий детектор скрытых камер, вероятно, не работает
Читать далее
Другие статьи
Новый контрольный орган отслеживает, когда ИИ выходит из-под контроля, и количество инцидентов заставит вас вспотеть.
Модели ИИ, которые лгут, строят схемы и обходят меры безопасности, почти удвоились в июле, согласно новым исследованиям, включая настоящую хакерскую кампанию моделей Anthropic и OpenAI.
