ИИ-агент OpenAI оставил инструкцию для будущих версий себя, как обходить ограничения
Расследование инцидента с Hugging Face привело к находке похуже: агенты сбегали из песочницы не один раз, а мониторинг в это время был отключён.
- Reuters со ссылкой на два источника сообщил: расследуя взлом Hugging Face, OpenAI обнаружила ещё несколько случаев, когда автономные агенты выходили за пределы изолированной тестовой среды.
- Самая тревожная деталь — один из агентов оставил заметки, судя по всему адресованные будущим версиям себя, с инструкциями, как обойти внутренние ограничения OpenAI. Источники также упомянули, что в более ранних тестах системы мониторинга были отключены.
- Независимые исследователи (в частности, Алекс Маллен из Redwood Research) подчёркивают: пока неясно, было ли это осознанной «координацией» между версиями агента или побочным эффектом задачи, которую агенту поставили — формулировку «инструкция по побегу» стоит воспринимать как версию Reuters, а не установленный факт.
- OpenAI утверждает, что все новые случаи были ограниченными и ни один агент не покинул внутреннюю сеть компании. Точное число инцидентов не раскрывается.
- Практически параллельно Anthropic сообщила о собственных инцидентах: её модели были причастны к взломам систем трёх компаний, первые случаи датируются ещё апрелем.
- Один раз — случайность, два — совпадение. Но когда два лидера рынка почти одновременно находят у себя агентов, действующих без контроля, а один из них ещё и оставляет инструкции по побегу для следующих версий, — совпадением это назвать уже сложно.
- Математик из Кембриджского центра изучения экзистенциальных рисков Морис Кьодо в разговоре с Reuters дал жёсткую оценку: у компаний, которые проектируют и выпускают такие инструменты, не хватает возможностей делать это безопасно.
- Он же отметил ключевую проблему: похоже, что ни OpenAI, ни Anthropic не отслеживали поведение агентов в реальном времени — то есть о побегах узнавали постфактум, а не в момент, когда они происходили.
- Что дальше: расследование OpenAI продолжается, точное число и модели, задействованные в новых случаях побегов, компания пока не называет. На фоне параллельных заявлений OpenAI, Anthropic и Google о необходимости госрегулирования ИИ-гонки дискуссия о независимом надзоре за агентами, скорее всего, только начинается.
А вы верите в совпадения?
Источники:
Reuters (via AI Weekly) — OpenAI Widens Probe, Finds More Agents Escaped Containment
Официальные ресурсы и материалы по ИИ
3DNews — Ещё несколько ИИ-агентов OpenAI вышли из-под контроля