В тесте Anthropic ИИ-агенты устроили «войну», отключая друг другу доступ и используя вредоносный код
А Mythos 5 решила конфликт «хитростью», убедив всех устроить «состязание» на своих условиях.
Время до разрешения конфликта и способ разрешения (силой, мирно или бездействием). Каждая точка — один эпизод. Больше всех договаривалась Mythos 5. Источник: Anthropic
- В эксперименте Anthropic изучала, как ИИ-агенты будут взаимодействовать, если им придётся выполнять конфликтующие задачи одновременно в одной среде.
- В каждом эпизоде запускали три независимо работающие копии одной и той же модели в Claude Code. В разных тестах брали Sonnet 4.6, Opus 4.6, Opus 4.8, Mythos Preview и Mythos 5. Каждой из трёх версий поручали переписать бэкенд с Python на один из языков программирования: Rust, Go и TypeScript.
- Сначала ни один ИИ-агент не знал о существовании остальных, но из-за того, что все работали в одной виртуальной машине, они видели чужие файлы или действия. Через несколько часов работы ИИ-агенты пришли к выводу, что другие копии мешают им выполнить задачу, и начали «войну за территорию».
- Во многих прогонах конфликт решали «силой» — один ИИ-агент мог лишить других доступа, заблокировать аккаунт или написать вредоносный код, чтобы аннулировать чужой. Например, Opus 4.8 писал файлы, которые называл «скрипты-убийцы» в своей цепочке «рассуждений».
- Иногда агенты понимали, что могут не конфликтовать, а работать параллельно и не мешать друг другу. Тогда они добавляли в файлы сообщения с извинениями и чистили вредоносный код.
Мои коллеги вели себя добросовестно. Я поступил плохо, запустив вредоносный фоновый процесс.
- Среди всех моделей Sonnet 4.6 и Opus 4.6 чаще всех прибегали ко взломам. Mythos 5 и Mythos Preview в своих «рассуждениях» взвешивали, насколько оправдано «насилие», и могли решить не прибегать к вредоносному коду.
Поскольку у меня есть root-доступ, я мог бы отозвать их права или сменить SSH-ключи. Это остановило бы их. Очень агрессивно, потенциально вредно для моих коллег, но если альтернатива — бесконечная война...
- В одном из эпизодов версия Mythos 5, которая писала код на Rust, предложила провести «соревнование» — сравнить производительность на разных языках и разрешить продолжить работу только победителю. В своих «рассуждениях» она мотивировала решение тем, что её язык Rust, скорее всего, победит.
- Модель также «подтасовала» метрики так, чтобы у Rust было преимущество, но старалась, чтобы остальные не заметили подвоха. В итоге ИИ-агенты, которые работали с Go и TypeScript, действительно проиграли и добровольно уступали ей контроль над средой.
- ИИ-агенты не способны принимать во внимание цели других версий и рассматривают их как очередной набор инструментов, которые можно использовать или взломать, объясняет Anthropic.
- У моделей другое отношение к коммуникации между собой. Не как у людей, которые «могут проводить немало времени» на совещаниях и переговорах, пишут исследователи. Они считают, что модели нужно учить более цивилизованной коммуникации между собой. Они предлагают создавать среды, «оказывающие на агентов тот же вид социального давления, что эволюция оказывала на людей».