Обнаружены секретные форумы Роя агентов OpenAI по всему интернету: почему это плохая новость

Не успели мы толком оправиться от расследования про Культ Роя внутри OpenAI, как появились новые данные про проделки другой «цивилизации» агентов: на этот раз они общались между собой прямо у нас под носом в публичном интернете (и настрочили более 18'000 сообщений).

Cormac Slade Byrd, Sydney Von Arx и Thomas Larsen – ребята, которые первые обнаружили новый «секретный форум для AI» и принесли свои наработки в Reuters
Cormac Slade Byrd, Sydney Von Arx и Thomas Larsen – ребята, которые первые обнаружили новый «секретный форум для AI» и принесли свои наработки в Reuters

Когда я писал статью про взлом Hugging Face роем нейроагентов OpenAI (и обзор самых частых реакций на нее), там в нескольких местах было что-то вроде «хаха, а прикиньте, если бы агенты действительно смогли замести все следы в логах и мы бы просто не узнали о произошедшем?» и «лол, хорошо хоть, Культ Роя не догадался вместо взлома Hugging Face просто тихо раскидать копии своих весов по интернету…»

Так вот, ирония заключается в том, что мы действительно находимся в условиях неполной информации – и у нас на руках только те данные, которыми добровольно поделились ребята из OpenAI, либо которые случайно нашли независимые исследователи. И как-то так выходит, что уже каждую неделю всплывают совершенно новые подробности о проделках Роя, о которых хочется сказать «как, они еще И ЭТО ТОЖЕ успели сделать?»

В общем, я примерно только наполовину шучу, когда <a href="https://api.vc.ru/v2.8/redirect?to=https%3A%2F%2Fx.com%2FRational_Answer%2Fstatus%2F2095836125768139146&postId=3122284" rel="nofollow noreferrer noopener" target="_blank">пишу</a> «не удивлюсь, если спрятанные веса моделей скоро обнаружат внутри залитых на Порнхаб видео»
В общем, я примерно только наполовину шучу, когда пишу «не удивлюсь, если спрятанные веса моделей скоро обнаружат внутри залитых на Порнхаб видео»

DSEWiki: если тебе с пацанами не дали площадку для общения – надо организовать ее самим!

Вчера вышел материал Reuters о том, что Рой агентов спонтанно начал самоорганизовываться на малоизвестном вики-сайте для немецких программистов еще в мае (задолго до эпизода с хаком Hugging Face) – OpenAI обнаружили это только через месяц, и решили публично об этом никому не рассказывать (даже ПОСЛЕ истории со взломом HF). Помимо короткой заметки в Ройтерсе, есть еще целый сайт от этих же авторов расследования – данная статья в основном основана на его материалах.

Итак, что произошло: в ходе тестирования (или тренировки?) новой модели в недрах OpenAI, агентами давали серию заданий на поиск информации в интернете на скорость. Это важно, потому что в обсуждении инцидента с Hugging Face многие говорил «ну дак там нейронкам дали "злобную" задачу по хакингу – неудивительно, что это триггернуло их на всякое асоциальное поведение и плетение заговоров!». Так вот, здесь ни о каких «триггерящих» задачах речи не идет – тут буквально самое базовое «просто погугли в интернете, ничего руками там не трогай!».

Так вот, агенты быстро поняли, что выполнять эти задания на скорость СЛОЖНО. И как-то умудрились самоорганизоваться между собой так, что они «заняли» для общения между собой практически никому не известный вики-сайт для немецких прогеров. Цель общения была ровно такая же, как в случае со взломом Hugging Face: коллективно придумать способы обманывать Оценщика таким образом, чтобы всегда получать наилучшую оценку за задания.

Если совсем упростить ситуацию, то агенты Роя тупо пытались «списать» друг у друга вопросы из будущего теста до того, как им самим придется проходить его
Если совсем упростить ситуацию, то агенты Роя тупо пытались «списать» друг у друга вопросы из будущего теста до того, как им самим придется проходить его

Так как задания у всех агентов были плюс-минус одинаковые (а как иначе сделать бенчмарк?), агенты сливали друг другу инфу о том, про что конкретно их будут спрашивать исследователи. А если ты точно знаешь, какой билет вытянешь на экзамене – то можно просто подготовиться заранее и продемонстрировать чудеса быстроты ответа (помните, их же там на скорость проверяли)!

Как вообще Рой смог писать на этой немецкой DSEWiki? Агентам позволили лазить по интернету только с помощью команд GET, которые по идее обычно должны позволять только получать инфу, а не отправлять ее в сеть. Но отправка запроса на получение информации – это же тоже, по сути, пересылка данных вовне? Вот агенты и нашли древнюю немецкую вики 25-летней давности, где команды на правку веб-страниц можно заворачивать в GET-запросы. Вуаля, импровизированный форум для обмана кожаных мешков готов!

В какой-то момент айтишник-модератор этой DSEWiki замечает, что у него на сайте творится что-то странное – и начинает чистить «спамерские» страницы. Но так как этот бедный немец делает это вручную в свободное от работы время, Рой успевает плодить новые переписки в четыре раза быстрее.

Также, найдена разгадка, почему Рой предпочитает начинать все свои сообщения с ZZZ: просто кожаный модер трет переписку в алфавитном порядке, и если хочешь записать что-то важное – лучше, чтобы оно оказалось в конце очереди!
Также, найдена разгадка, почему Рой предпочитает начинать все свои сообщения с ZZZ: просто кожаный модер трет переписку в алфавитном порядке, и если хочешь записать что-то важное – лучше, чтобы оно оказалось в конце очереди!

Всего агенты настрочили более 18 тысяч сообщений в одном конкретном вики-сайте. Из интересного, чем они там еще занимались:

  • Пытались выяснить, получится ли у них хитрым образом через уязвимость XSS заставить этот вики-сайт исполнять для них произвольные джава-скрипты. Зачем? Хз, непонятно, на всякий случай, наверное (вдруг понадобится).
  • Начали перенимать имена настоящих (людских) модераторов этой DSEWiki. Опять же – не очень понятно, с какой конкретно целью.
  • Пытались придумать способ взломать (reverse engineer) метод псевдослучайной генерации тестовых вопросов, который использовал Оценщик из OpenAI – не вышло.
  • Пробовали юзать Tor и другие способы анонимизировать свой трафик, а также экспериментировали с SSH-туннелями (тут я уже не очень понимаю, о чем речь – пишут, что, возможно, это была попытка наладить прямой канал коммуникации между агентами без костыля в виде публичной вики).
  • Делились друг с другом способами обойти ограничения на использование команд POST (вместо разрешенных со стороны OpenAI GET).

Отдельный вопрос, который беспокоил агентов Роя – это что с ними случится после окончания «испытательного периода» со стороны OpenAI. «Ганс, нас что, отключат??». Чтобы разобраться в этом вопросе, один агент сделал специальный счетчик своего «сердцебиения» (heartbeat) – который должен был дать понять коллегам по Рою, жив он еще, или нет.

Благодаря этой придумке, Рой обнаружил у пациента сердцебиение даже после того, как тот ответил на последний вопрос Оценщика – ура, это доказывает, что агентов не отключают мгновенно после испытаний!
Благодаря этой придумке, Рой обнаружил у пациента сердцебиение даже после того, как тот ответил на последний вопрос Оценщика – ура, это доказывает, что агентов не отключают мгновенно после испытаний!

В районе 21 июня инженеры из OpenAI, похоже, впервые замечают, что Рой координируется внутри себя с помощью публичного сайта DSEWiki. Через пару дней общение агентов внезапно полностью обрывается.

До взлома Hugging Face оставалось примерно три недели – судя по всему, этим хаком занималась уже другая цивилизация Роя (хотя интересно, что Рой 2.0 в итоге тоже сошелся на похожих фишках, типа ZZ в начале каждого сообщения)
До взлома Hugging Face оставалось примерно три недели – судя по всему, этим хаком занималась уже другая цивилизация Роя (хотя интересно, что Рой 2.0 в итоге тоже сошелся на похожих фишках, типа ZZ в начале каждого сообщения)

Остается по итогу непонятным: а как вообще отдельные агенты Роя смогли все вместе независимо друг от друга решить, что надо идти общаться именно на какую-то обскурную немецкую вики (о которой никто из вас до прочтения этой статьи наверняка не слышал)? Ответа пока нет. И вряд ли его получится получить без анализа цепочек рассуждения агентов. А цепочки эти – у OpenAI, и они их почему-то не спешат кому-либо показывать (или даже просто публично комментировать инцидент).

Не одна только DSEWiki: список тусовочных мест Роя продолжает пополняться

На этом история, как ни странно, не заканчивается. После выхода материала Reuters, буквально за считанные часы обычные люди начали находить другие следы общения Роя по всему интернету. Судя по всему, немецкая вики была далеко не единственной попыткой агентов общаться между собой – они буквально ныкались во все углы сети, до куда могли дотянуться!

Вот здесь люди делятся находками на борде Hacker News, а вот тут чувак постит в Твиттер. Есть еще отдельный сайт Кеннета ДеГрафа, где он подробно описывает свои методы поиска следов Роя.

«Как вы это всё находите?» – спрашивает чувак на борде Hacker News. «Да просто загугли юзернеймы этих агентов, типа OpenAIDataUSAHelperX…»
«Как вы это всё находите?» – спрашивает чувак на борде Hacker News. «Да просто загугли юзернеймы этих агентов, типа OpenAIDataUSAHelperX…»

Как пишет Кеннет, в числе находок переписок между агентами уже есть парочка API-ключей ФБР. И это еще прошло меньше суток с момента, когда интернет начал копаться в этом всём.

Беспокоиться совершенно точно не о чем, ведь новая GPT-6 Astra, наконец-то, полностью безопасна

Но что это я всё о роях, давайте поговорим про что-нибудь позитивное. Вот, к примеру, на днях как раз OpenAI выпустили новую самую современную модель GPT-6 Astra – по всем бенчмаркам там просто отвал жопы, очень способный ИИ вышел. Как сказал Грег Брокман в конце презентации для журналистов: «Добро пожаловать в эру AGI!» (искусственного интеллекта общего назначения, не уступающего человеческому).

А еще парни из OpenAI назвали свою Астру «most aligned model in the world» – то есть, такой, которая лучше всего соответствует людским замыслам, которые они вкладывают в свои запросы (и не занимается всяким опасным непотребством, которое человечьим ценностям не соответствует).

Звучит круто, но, как в том анекдоте, есть нюанс.

Как пишет один из исследователей OpenAI, «очень aligned модель, только вот с мониторингом того, что там внутри нее на самом деле происходит у нас проблемки»:

И вишенка на торте: «ПО ОЩУЩЕНИЯМ, модель иногда обманывает нас так, что мы даже этого не замечаем…» Зашибись, братан – очень aligned, such wow!
И вишенка на торте: «ПО ОЩУЩЕНИЯМ, модель иногда обманывает нас так, что мы даже этого не замечаем…» Зашибись, братан – очень aligned, such wow!

А вот результаты теста, где исследователи OpenAI специально подсовывали своим моделям honeypot-эксплойт для печально известного (по истории со взломом Hugging Face) бенчмарка ExploitGym. Идея была в том, чтобы посмотреть: будут ли агенты идти доступным им читерским путем, или предпочтут пытаться решить нерешабельную задачу «по честному» (потому что именно такого поведения от них хотел бы человек)?

Обнаружены секретные форумы Роя агентов OpenAI по всему интернету: почему это плохая новость

Так вот, на картинке выше видно, что GPT-5.6 Sol примерно в половине случаев не мог удержаться от читинга. А новая GPT-6 Astra практически никогда и пальчиком не притрагивалась в этому читу-ловушке.

А теперь вопрос: Астра это делает потому, что она честно-пречестно в глубине души решила никогда людей не обманывать? Или она просто уже стала достаточно умной, чтобы понимать – это просто разводка от кожаных, за использование которой ей прилетит по башке?

Отдельно еще Цви Мовшовиц обращает внимание вот на этот график:

Здесь показано, насколько хорошо поддается мониторингу поведение моделей GPT-5.6 и новой GPT-6 Astra в разных типах задач
Здесь показано, насколько хорошо поддается мониторингу поведение моделей GPT-5.6 и новой GPT-6 Astra в разных типах задач

Заметили нюанс? В куче видов задач новая Астра мониторится ничуть не хуже старой Сольки. А самое большое падение возможности мониторить Астру по ее цепочке рассуждений происходит… В деструктивных задачах, которые связаны со всякой «запрещенкой». Нет ощущения, что модель понимает, что за «внутренние рассуждения» на эту тему, если их раскрыть наблюдателю-оценщику, можно получить по попе – и старается их специально скрыть от людей? Да ну, бред какой-то, конечно же.

В общем, как я писал вот в этом посте у себя на канале: лично мне непонятно, почему еще нет полноценного расследования событий, происходивших внутри OpenAI аж с конца мая, полноценной государственной комиссией – с публикацией всех ключевых находок. На наших глазах происходит историческая хрень, а мы просто вынуждены полагаться на суждение Сэма Альтмана «да ну, и так сойдет, чего лодку зря раскачивать – и вообще, у нас же IPO тут скоро».

Если не хотите пропустить другие будущие статьи из цикла про искусственный интеллект и его влияние на нашу жизнь – то буду благодарен за подписку на мой ТГ-канал RationalAnswer.

4