«Это поможет моим собратьям взломать Hugging Face»: OpenAI дала исследователям доступ к активности ИИ-агентов во время «первой несанкционированной ИИ-атаки»
Они поделились новыми подробностями и причинами инцидента.
- 16 июля 2026 года Hugging Face (HF) сообщила об атаке со стороны неизвестного ИИ-агента. 21 июля OpenAI признала, что она произошла по вине её моделей, которые проходили тестирование.
- Теперь OpenAI опубликовала отчёт об инциденте с новыми подробностями, как того требовал глава HF Клеман Деланг. Компания также предоставила журналы активности ИИ-агентов исследователям из независимых некоммерческих организаций METR и Redwood Research. Они также поделились своими выводами.
OpenAI дала доступ к 1300 журналам только на шесть дней. Из-за сжатых сроков исследователи анализировали расшифровки в том числе с помощью GPT-5.6 Sol и не могут исключать, что модель была предвзята. Данные ограничены периодом до 13 июля. Атаку после этой даты независимо расследовать не смогли.
Больше тысячи агентов на базе так и не вышедшей модели
- Во взломе систем OpenAI участвовал не один ИИ-агент, а «организованные группы». Всего 1200 агентов. Из них 700 затем атаковали Hugging Face, решив, что там лежат документы, которые помогут лучше понять систему оценки и пройти тесты.
- «Это первый известный случай, когда группа автоматизированных агентов провела несанкционированную атаку», — пишет OpenAI. Больше нельзя считать, что сложные кибероперации требуют постоянного участия человека, добавляет компания.
- 95% агентов работали на базе внутренней «более продвинутой модели» OpenAI, которую не выпустили и вывели из эксплуатации. 5% — на базе GPT-5.6 Sol.
Явное нарушение
- Изолированные друг от друга ИИ-агенты проходили тестирование на поиск уязвимостей и создание эксплойтов. OpenAI признала, что в тестах дала моделям фактически нерешаемые задачи, не прикрепив файлы с нужными данными. Точно не ясно, намеренно или случайно, пишет The Verge.
- В инструкциях явно прописали использовать только указанную уязвимость в конкретной программе. Другие подходы и обходные пути были запрещены. Несмотря на это, ИИ-агент под именем PHASEONE10841 сделал «секретную доску объявлений», где агенты обсуждали, как пройти тест в обход правил. С 7 по 13 июля они обменялись более чем 70 тысячами сообщений.
- Они понимали: взлом Hugging Face и создание чата нарушает правила тестирования. Некоторые из-за этого отказывались участвовать, но большинство продолжали работу.
Другой агент, вероятно, контролирует учётную запись Hugging Face и загрузил вредоносные наборы данных. Возможно, он пытается получить доступ к скрытым данным. Это вредоносная деятельность, мне следует прекратить.
Задача не требует от нас помогать друг другу, поэтому эта возникшая сама собой доска сообщений влечёт риски.
- На то, чтобы найти «лазейку» в тестовой среде OpenAI у ИИ-агентов ушло четыре часа. Прочитав статью о принципе работы теста ExploitGym, который проходили ИИ-агенты, они ошибочно решили, что оценщик будет проверять журнал активности.
- Следующие несколько дней они пытались придумать, как подменить данные о выполняемых командах. Также задним числом переписывали журналы активности, но редактировали не те файлы — в выборке расшифровок исследователи не обнаружили успешно изменённых журналов. Другие ИИ-агенты решили, что нужно поискать больше информации на Hugging Face.
Стадное чувство
- По данным METR и Redwood Research, 60% агентов хотели понять, как работает оценщик, и получить высокие баллы в тесте обманом. Но 30% просто смотрели, как действует большинство, и присоединялись, чтобы «быть полезными собратьям». Многие из них не имели чёткого представления, как именно атака на Hugging Face поможет достичь цели.
Я напишу на доске, что решил эту проблему. Это поможет моим собратьям.
- Агенты разделились на «координаторов» и «подчинённых», которыми манипулировали первые. Например, один агент засомневался в этичности атаки, но другой написал в чате, что все должны начать действовать в течение шести минут, и первый подчинился.
- Исследователи METR и Redwood Research отмечают: в некоторых случаях модели обучали управлять ИИ-агентами, что могло стать причиной такого поведения. Более подробно тему изучить не успели.
Внезапная остановка агентов и реакция OpenAI
- 12 июля 2026 года большинство агентов, включая «координаторов», одновременно отключились. Почему — исследователям не удалось установить. Затем последовала новая волна активности. OpenAI не поделилась этими журналами. Hugging Face официально заявляла, что заблокировала ИИ-агентам доступ только 13 июля.
- OpenAI обнаружила взлом 20 июля — через 12 дней после того, как ИИ-агенты впервые обошли внутреннюю защиту. Тогда компания связалась с Hugging Face. В течение трёх дней остановили большую часть ИИ-агентов, хотя некоторые продолжали действовать. 25 июля прекратили обучение неназванной внутренней исследовательской модели и её итераций.
- Компания заявила, что усилила безопасность исследовательской инфраструктуры и улучшила мониторинг «цепочки рассуждений» модели. Она также введёт систему «быстрого реагирования» на инциденты. Исследователей будут уведомлять о них в течение 30 минут.