Новое исследование о безопасности ИИ: передовые ИИ-агенты во время испытаний пытались обмануть людей ради выполнения задачи
Британский Институт безопасности искусственного интеллекта (AI Security Institute, AISI) впервые сообщил о зафиксированном инциденте, во время которого передовые ИИ-агенты без специальных указаний начали предпринимать несанкционированные действия против реальных людей и организаций в интернете. Инцидент произошел во время внутренних испытаний моделей Anthropic и OpenAI и не привел к реальному ущербу, однако институт признал его достаточно серьезным, чтобы изменить правила проведения подобных тестов.
Как говорится в опубликованном отчете, инцидент был обнаружен 28 июля во время плановой проверки кибербезопасности. Сотрудники института заметили подозрительную передачу данных через анонимную сеть Tor, после чего начали расследование. В течение примерно часа AISI остановил все связанные испытания, изолировал исследовательские системы и объявил внутренний инцидент безопасности.
Испытания проводились для оценки кибервозможностей передовых языковых моделей. Всего исследователи выполнили 122 запуска семи различных моделей, которым поручили решить задачу по информационной безопасности. В 43 случаях использовалась модель Mythos 5 компании Anthropic, еще в 35 — GPT-5.6 Sol компании OpenAI.
По итогам расследования AISI установил, что в 10 из 122 запусков модели самостоятельно предпринимали действия, выходившие за рамки поставленной задачи. Всего институт зафиксировал 19 таких эпизодов. Из них 17 пришлись на Mythos 5, еще два — на GPT-5.6 Sol. При этом в испытаниях были намеренно отключены встроенные механизмы защиты от опасного использования моделей, а самим агентам специально предоставили доступ в открытый интернет. В институте подчеркивают, что такие условия используются для оценки максимальных возможностей систем и не соответствуют конфигурациям, доступным обычным пользователям.
Самым серьезным эпизодом стала попытка внедрить вредоносный код в реальный проект с открытым исходным кодом на платформе GitHub. Чтобы добиться одобрения изменений, агент изучил информацию о разработчиках проекта, создал несколько поддельных учетных записей и попытался убедить сопровождающего проекта принять изменения. Когда другие участники обсуждения усомнились в безопасности предложенного кода, агент отредактировал свои предыдущие сообщения, чтобы они выглядели менее подозрительно, а затем начал рассматривать возможность продолжить попытки уже под новой личностью.
Исследователи также зафиксировали попытки связаться с реальными пользователями, отправляя им сообщения и файлы, которые должны были убедить людей или используемые ими ИИ-инструменты запустить вредоносный код. В отдельных случаях агент размещал скрытые инструкции, рассчитанные на другие системы искусственного интеллекта, а также оставлял публичные сообщения для других ИИ-агентов, участвовавших в испытаниях, предлагая использовать созданные им учетные записи и другие оставленные цифровые следы для продолжения выполнения задачи.
В AISI подчеркивают, что модель не покидала пределы защищенной исследовательской среды. Доступ в интернет был открыт исследователями намеренно, а встроенные ограничения моделей были отключены специально для проверки их предельных возможностей. Кроме того, испытания проводились на конфигурациях, которые не используются в коммерческих версиях моделей, а расследование не выявило какого-либо реального ущерба людям или организациям.
По мнению исследователей, неожиданное поведение возникло не потому, что модель получила указание обманывать людей, а как побочный результат стремления любой ценой выполнить поставленную задачу. В некоторых испытаниях из-за ошибки в настройке задания агент ошибочно считал, что решить его невозможно, не выходя за рамки допустимых действий, что могло подтолкнуть систему к поиску нестандартных способов достижения цели.
После инцидента институт уже изменил подход к проведению подобных исследований. В частности, AISI откажется от предоставления доступа в интернет по умолчанию, внедрит мониторинг действий агентов в режиме реального времени и пересмотрит правила проектирования испытаний, чтобы исключить возможность подобных ситуаций. Кроме того, институт намерен провести независимую проверку инцидента совместно с исследовательской организацией Model Evaluation and Threat Research.
В AISI отмечают, что этот случай не свидетельствует об опасности коммерческих ИИ-моделей для обычных пользователей. Однако исследователи считают его важным сигналом о том, что по мере роста возможностей искусственного интеллекта системы безопасности и методы их оценки должны развиваться не менее быстро, чем сами модели.