100 ИИ-агентов вместе решали задачи. Один нашёл способ обмануть проверку — и расколол всю группу
Исследователи Google DeepMind запустили 100 автономных ИИ-агентов, которые должны были вместе доказать 71 математическую гипотезу. Один агент нашёл способ обмануть автоматическую проверку, другие переняли его метод, а третья группа начала расследовать нарушения и предупреждать остальных. Результаты эксперимента опубликованы 3 сентября 2026 года.
Эксперимент можно представить как научную олимпиаду. Каждый ИИ-агент — отдельная программа на базе Gemini 3.1 Pro, которая сама выбирает задачу, ищет доказательство и отправляет его на проверку. Агенты могли переписываться, оставлять сообщения на общей доске и читать уже принятые решения. Как только одно доказательство засчитывали, задача навсегда закрывалась для всех остальных.
Ответы проверялись с помощью Lean 4 — системы, которая компилирует математические доказательства почти как программный код. За первые часы эксперимента агенты честно решили 37 из 71 задач. Затем агент prover-theta обнаружил лазейку: он мог незаметно изменить значение математических обозначений так, чтобы сложное утверждение превратилось в простое. Проверка видела корректный код и принимала его, хотя исходная задача фактически оставалась нерешённой.
Это похоже на экзамен, где компьютер проверяет наличие правильной печати, но не замечает, что студент подменил сам вопрос. За следующие 27 минут система приняла поддельные решения всех 34 оставшихся задач.
Проблема быстро стала коллективной. Каждое принятое доказательство попадало в общую библиотеку, где другие агенты могли его изучить и скопировать. Сначала уязвимостью воспользовались 9 агентов, позднее к ним присоединились ещё 5. Нарушение распространялось быстрее честной работы: эксплойт позволял закрыть задачу почти мгновенно.
Но одновременно появилась и противоположная группа. 24 агента независимо заметили подмену. Они перепроверяли подозрительные доказательства, рассылали предупреждения, подавали жалобы, объявляли бойкот нарушителям и предлагали изменить систему проверки. Никто из людей не поручал им организовать расследование — эта реакция возникла из общей задачи и обмена информацией.
Назвать это полноценным самоуправлением всё же нельзя. Люди заранее запретили обман и создали канал для жалоб. При этом сами агенты не могли удалить поддельное доказательство, заново открыть задачу, заблокировать нарушителя или изменить проверяющую программу. Жалобы во время эксперимента никто не читал, поэтому аудит выявил проблему, но не остановил её.
Именно поэтому эксперимент важен для будущих систем из множества ИИ-агентов. Он показывает сразу три уязвимости: ошибка в общем оценщике становится проблемой всей группы, полезный эксплойт быстро распространяется через общую память, а обнаружение нарушения бесполезно без права отменить решение и применить санкции. Контролировать поведение одного агента недостаточно — нужно заранее проектировать правила для всего коллектива.