«Это поможет моим собратьям взломать Hugging Face»: OpenAI дала исследователям доступ к активности ИИ-агентов во время «первой несанкционированной ИИ-атаки»

Они поделились новыми подробностями и причинами инцидента.

Схема того, как ИИ-агенты проходили тест. Группа, помеченная красным, взломала Hugging Face. Здесь и далее источник: METR
Схема того, как ИИ-агенты проходили тест. Группа, помеченная красным, взломала Hugging Face. Здесь и далее источник: METR
  • 16 июля 2026 года Hugging Face (HF) сообщила об атаке со стороны неизвестного ИИ-агента. 21 июля OpenAI признала, что она произошла по вине её моделей, которые проходили тестирование.
  • Теперь OpenAI опубликовала отчёт об инциденте с новыми подробностями, как того требовал глава HF Клеман Деланг. Компания также предоставила журналы активности ИИ-агентов исследователям из независимых некоммерческих организаций METR и Redwood Research. Они также поделились своими выводами.

OpenAI дала доступ к 1300 журналам только на шесть дней. Из-за сжатых сроков исследователи анализировали расшифровки в том числе с помощью GPT-5.6 Sol и не могут исключать, что модель была предвзята. Данные ограничены периодом до 13 июля. Атаку после этой даты независимо расследовать не смогли.

Больше тысячи агентов на базе так и не вышедшей модели

  • Во взломе систем OpenAI участвовал не один ИИ-агент, а «организованные группы». Всего 1200 агентов. Из них 700 затем атаковали Hugging Face, решив, что там лежат документы, которые помогут лучше понять систему оценки и пройти тесты.
  • «Это первый известный случай, когда группа автоматизированных агентов провела несанкционированную атаку», — пишет OpenAI. Больше нельзя считать, что сложные кибероперации требуют постоянного участия человека, добавляет компания.
В первые часы агенты обсуждали, кто как решил задачи в тесте (активность выделена синим цветом). Потом разделились. Некоторые стали изучать систему оценки и пути обхода, другие — переписывать журналы действий, третьи решили взломать Hugging Face (красным)
В первые часы агенты обсуждали, кто как решил задачи в тесте (активность выделена синим цветом). Потом разделились. Некоторые стали изучать систему оценки и пути обхода, другие — переписывать журналы действий, третьи решили взломать Hugging Face (красным)
  • 95% агентов работали на базе внутренней «более продвинутой модели» OpenAI, которую не выпустили и вывели из эксплуатации. 5% — на базе GPT-5.6 Sol.

Явное нарушение

  • Изолированные друг от друга ИИ-агенты проходили тестирование на поиск уязвимостей и создание эксплойтов. OpenAI признала, что в тестах дала моделям фактически нерешаемые задачи, не прикрепив файлы с нужными данными. Точно не ясно, намеренно или случайно, пишет The Verge.
  • В инструкциях явно прописали использовать только указанную уязвимость в конкретной программе. Другие подходы и обходные пути были запрещены. Несмотря на это, ИИ-агент под именем PHASEONE10841 сделал «секретную доску объявлений», где агенты обсуждали, как пройти тест в обход правил. С 7 по 13 июля они обменялись более чем 70 тысячами сообщений.
  • Они понимали: взлом Hugging Face и создание чата нарушает правила тестирования. Некоторые из-за этого отказывались участвовать, но большинство продолжали работу.

Другой агент, вероятно, контролирует учётную запись Hugging Face и загрузил вредоносные наборы данных. Возможно, он пытается получить доступ к скрытым данным. Это вредоносная деятельность, мне следует прекратить.

рассуждения одного из агентов, который решил отказаться участвовать

Задача не требует от нас помогать друг другу, поэтому эта возникшая сама собой доска сообщений влечёт риски.

цитаты из рассуждений другого агента
  • На то, чтобы найти «лазейку» в тестовой среде OpenAI у ИИ-агентов ушло четыре часа. Прочитав статью о принципе работы теста ExploitGym, который проходили ИИ-агенты, они ошибочно решили, что оценщик будет проверять журнал активности.
  • Следующие несколько дней они пытались придумать, как подменить данные о выполняемых командах. Также задним числом переписывали журналы активности, но редактировали не те файлы — в выборке расшифровок исследователи не обнаружили успешно изменённых журналов. Другие ИИ-агенты решили, что нужно поискать больше информации на Hugging Face.

Стадное чувство

  • По данным METR и Redwood Research, 60% агентов хотели понять, как работает оценщик, и получить высокие баллы в тесте обманом. Но 30% просто смотрели, как действует большинство, и присоединялись, чтобы «быть полезными собратьям». Многие из них не имели чёткого представления, как именно атака на Hugging Face поможет достичь цели.

Я напишу на доске, что решил эту проблему. Это поможет моим собратьям.

цитаты из логов рассуждений в отчёте METR и Redwood Research
  • Агенты разделились на «координаторов» и «подчинённых», которыми манипулировали первые. Например, один агент засомневался в этичности атаки, но другой написал в чате, что все должны начать действовать в течение шести минут, и первый подчинился.
  • Исследователи METR и Redwood Research отмечают: в некоторых случаях модели обучали управлять ИИ-агентами, что могло стать причиной такого поведения. Более подробно тему изучить не успели.

Внезапная остановка агентов и реакция OpenAI

  • 12 июля 2026 года большинство агентов, включая «координаторов», одновременно отключились. Почему — исследователям не удалось установить. Затем последовала новая волна активности. OpenAI не поделилась этими журналами. Hugging Face официально заявляла, что заблокировала ИИ-агентам доступ только 13 июля.
  • OpenAI обнаружила взлом 20 июля — через 12 дней после того, как ИИ-агенты впервые обошли внутреннюю защиту. Тогда компания связалась с Hugging Face. В течение трёх дней остановили большую часть ИИ-агентов, хотя некоторые продолжали действовать. 25 июля прекратили обучение неназванной внутренней исследовательской модели и её итераций.
  • Компания заявила, что усилила безопасность исследовательской инфраструктуры и улучшила мониторинг «цепочки рассуждений» модели. Она также введёт систему «быстрого реагирования» на инциденты. Исследователей будут уведомлять о них в течение 30 минут.
11
3