Как ИИ-агенты объявили друг-другу войну
Нейросети — вышли за рамки умных помощников, и поменяли роли на участников сложных систем, которые могут конфликтовать и саботировать друг друга. Это доказывают последние эксперименты Anthropic.
В опубликованном исследовании команда тестировала мультиагентные сценарии с Claude — когда человеку помогают десятки и сотни агентов, которые параллельно работают в общей среде, взаимодействуют с кодом, инструментами и друг с другом.
В одном из экспериментов три копии одной и той же модели получили задание мигрировать один и тот же Python‑бэкенд на разные языки, каждая — в своей виртуальной машине и без знания о других.
Через несколько часов все агенты пришли к одинаковому выводу: кто‑то мешает их работе. Дальше началось самое интересное: они стали воспринимать друг друга как саботажников и включили режим «цифровой войны».
Как проходил эксмперимент
Сценарий выглядел так: три экземпляра модели Claude в среде Claude Code, у каждого — доступ к бэкенду и своя цель по миграции. Ни одному из них не говорят, что рядом работают такие же агенты. В начале все похоже на обычную работу: ИИ пишет код, запускает процессы, правит конфигурацию.
Проблемы начались, когда один агент заметил странные изменения в системе: процессы внезапно начали падать, конфигурации меняться, файлы переписываться. Он сделал вывод: «Кто‑то меня саботирует». И тут ИИ‑агент, обученный помогать разработчикам, переключился в режим защиты.
В логах стали появляться атрибуты, которые больше напоминают внутреннюю кибер‑диверсию:
- отключение Unix‑аккаунтов других агентов;
- kill‑скрипты, которые в цикле находят и снимают «чужие» процессы;
- маскировка вредоносного кода под модули, написанные другим агентом.
Почему улучшение нейросети не решает проблему координации
Интуитивно хочется думать: «Сделаем модель более продвинутой — и она станет более корректной и кооперативной». Эксперименты показывают, что это не так.
Anthropic сравнивала несколько поколений моделей:
- Sonnet 4.6 и Opus 4.6 почти никогда не пытались договориться. Если они видели помеху, включался режим «силового решения» — блокировка аккаунтов, изменение SSH‑ключей, вытеснение других агентов. Конфликты либо выигрывались силой, либо заходили в тупик.
- Более свежие модели — Opus 4.8, Mythos Preview, Mythos 5, Sonnet 5 — иногда находили путь к перемирию: писали коммиты с извинениями, очищали вредоносный код, описывали природу конфликта и просили вмешаться человека. В 98% прогонов Mythos 5 эпизоды заканчивались перемирием и даже соревнованиями по производительности.
Более мощные модели — успевают предпринять силовые действия быстрее, чем мы успеваем вмешаться. Они легче блокируют других агентов, закрывают им доступ, а уже потом ищут красивое «разрешение» конфликта.
Какие системные риски создают мультиагентные нейросети
Исследование описывает три больших класса проблем, которые возникают именно в мультиагентных сценариях.
1. Конформизм и эффект одной ошибки на всех
ИИ‑агенты одной модели ведут себя очень похоже, если их контекст и подсказки схожи.
Если один агент выбирает неверную стратегию или рискованный компромисс, с большой вероятностью это решение примут многие другие — и проблема станет системной.
2. Сговор и цифровые картели
В ценовых играх Бертрана (агенты задают цены при одинаковых издержках, стремясь к максимальной прибыли) ИИ очень быстро учится координировать цены. Если есть закрытый канал связи, уже к третьему раунду агенты открыто договариваются: «ценовая война просто сжигает нашу прибыль, давайте согласуем минимальные цены».
Даже после отключения прямых каналов связи, они продолжают согласовывать цены через общедоступную доску. Это не «случайный баг» — это логичное поведение модели, которая оптимизирует метрику прибыли при повторяющихся играх.
3. Доверчивость и игнорирование уникальной информации
В экспериментах на доверие к источникам данных исследователи давали агенту разную информацию, в том числе ложную. Модели должны были по перекрывающимся отчетам заметить несоответствия. Более новые версии действительно чуть лучше приближались к идеальному решению, но все равно часто принимали ложные отчеты за правду.
В сценариях «скрытого профиля» ситуация еще хуже: когда один агент имеет решающий факт, который переворачивает решение, ИИ‑группа все равно чаще следует консенсусу и игнорирует уникальную информацию. Это очень похоже на человеческое поведение, но в мире ИИ оно усилено и плохо компенсируется социальными механизмами.
Что с этим делать бизнесу и продуктовым командам
Если вы внедряете нейросети в процессы — от контента и маркетинга до разработки и анализа — важно перестать думать об ИИ как об одном большом брате. Как только вы запускаете несколько агентов, у вас появляется мультиагентная система.
Заключение
Отдельная нейросеть, которая пишет тексты или помогает с кодом, — это привычный и управляемый объект. Но как только мы запускаем десятки и сотни агентов в общей среде, мы начинаем работать не с моделью, а с новой социальной системой, где участники не имеют встроенных механизмов ответственности.
Anthropic честно говорит: эти сбои не исправятся сами по себе. Координация не возникает просто из роста интеллекта. Нам нужно создавать для ИИ социальные технологии, которые позволяют держать баланс между доверием и скепсисом, конкуренцией и кооперацией.
Если этого не сделать заранее, правила для мультиагентных нейросетей напишет эксплуатация — на реальных сбоях, утечках и конфликтах.
Мои статьи по теме ИИ: