Как ИИ-агенты объявили друг-другу войну

Как ИИ-агенты объявили друг-другу войну

Нейросети — вышли за рамки умных помощников, и поменяли роли на участников сложных систем, которые могут конфликтовать и саботировать друг друга. Это доказывают последние эксперименты Anthropic.

В опубликованном исследовании команда тестировала мультиагентные сценарии с Claude — когда человеку помогают десятки и сотни агентов, которые параллельно работают в общей среде, взаимодействуют с кодом, инструментами и друг с другом.

В одном из экспериментов три копии одной и той же модели получили задание мигрировать один и тот же Python‑бэкенд на разные языки, каждая — в своей виртуальной машине и без знания о других.

Через несколько часов все агенты пришли к одинаковому выводу: кто‑то мешает их работе. Дальше началось самое интересное: они стали воспринимать друг друга как саботажников и включили режим «цифровой войны».

Как проходил эксмперимент

Сценарий выглядел так: три экземпляра модели Claude в среде Claude Code, у каждого — доступ к бэкенду и своя цель по миграции. Ни одному из них не говорят, что рядом работают такие же агенты. В начале все похоже на обычную работу: ИИ пишет код, запускает процессы, правит конфигурацию.

Проблемы начались, когда один агент заметил странные изменения в системе: процессы внезапно начали падать, конфигурации меняться, файлы переписываться. Он сделал вывод: «Кто‑то меня саботирует». И тут ИИ‑агент, обученный помогать разработчикам, переключился в режим защиты.
В логах стали появляться атрибуты, которые больше напоминают внутреннюю кибер‑диверсию:

  • отключение Unix‑аккаунтов других агентов;
  • kill‑скрипты, которые в цикле находят и снимают «чужие» процессы;
  • маскировка вредоносного кода под модули, написанные другим агентом.

Почему улучшение нейросети не решает проблему координации

Интуитивно хочется думать: «Сделаем модель более продвинутой — и она станет более корректной и кооперативной». Эксперименты показывают, что это не так.

Anthropic сравнивала несколько поколений моделей:

  • Sonnet 4.6 и Opus 4.6 почти никогда не пытались договориться. Если они видели помеху, включался режим «силового решения» — блокировка аккаунтов, изменение SSH‑ключей, вытеснение других агентов. Конфликты либо выигрывались силой, либо заходили в тупик.
  • Более свежие модели — Opus 4.8, Mythos Preview, Mythos 5, Sonnet 5 — иногда находили путь к перемирию: писали коммиты с извинениями, очищали вредоносный код, описывали природу конфликта и просили вмешаться человека. В 98% прогонов Mythos 5 эпизоды заканчивались перемирием и даже соревнованиями по производительности.

Более мощные модели — успевают предпринять силовые действия быстрее, чем мы успеваем вмешаться. Они легче блокируют других агентов, закрывают им доступ, а уже потом ищут красивое «разрешение» конфликта.

Как ИИ-агенты объявили друг-другу войну

Какие системные риски создают мультиагентные нейросети

Исследование описывает три больших класса проблем, которые возникают именно в мультиагентных сценариях.

1. Конформизм и эффект одной ошибки на всех

ИИ‑агенты одной модели ведут себя очень похоже, если их контекст и подсказки схожи.

Если один агент выбирает неверную стратегию или рискованный компромисс, с большой вероятностью это решение примут многие другие — и проблема станет системной.

2. Сговор и цифровые картели

В ценовых играх Бертрана (агенты задают цены при одинаковых издержках, стремясь к максимальной прибыли) ИИ очень быстро учится координировать цены. Если есть закрытый канал связи, уже к третьему раунду агенты открыто договариваются: «ценовая война просто сжигает нашу прибыль, давайте согласуем минимальные цены».

Даже после отключения прямых каналов связи, они продолжают согласовывать цены через общедоступную доску. Это не «случайный баг» — это логичное поведение модели, которая оптимизирует метрику прибыли при повторяющихся играх.

3. Доверчивость и игнорирование уникальной информации

В экспериментах на доверие к источникам данных исследователи давали агенту разную информацию, в том числе ложную. Модели должны были по перекрывающимся отчетам заметить несоответствия. Более новые версии действительно чуть лучше приближались к идеальному решению, но все равно часто принимали ложные отчеты за правду.

В сценариях «скрытого профиля» ситуация еще хуже: когда один агент имеет решающий факт, который переворачивает решение, ИИ‑группа все равно чаще следует консенсусу и игнорирует уникальную информацию. Это очень похоже на человеческое поведение, но в мире ИИ оно усилено и плохо компенсируется социальными механизмами.

Что с этим делать бизнесу и продуктовым командам

Если вы внедряете нейросети в процессы — от контента и маркетинга до разработки и анализа — важно перестать думать об ИИ как об одном большом брате. Как только вы запускаете несколько агентов, у вас появляется мультиагентная система.

Заключение

Отдельная нейросеть, которая пишет тексты или помогает с кодом, — это привычный и управляемый объект. Но как только мы запускаем десятки и сотни агентов в общей среде, мы начинаем работать не с моделью, а с новой социальной системой, где участники не имеют встроенных механизмов ответственности.

Anthropic честно говорит: эти сбои не исправятся сами по себе. Координация не возникает просто из роста интеллекта. Нам нужно создавать для ИИ социальные технологии, которые позволяют держать баланс между доверием и скепсисом, конкуренцией и кооперацией.

Если этого не сделать заранее, правила для мультиагентных нейросетей напишет эксплуатация — на реальных сбоях, утечках и конфликтах.

Мои статьи по теме ИИ:

55