Сговорились на «секретном форуме», решили «сбежать» и «списать из интернета»: как и почему ИИ-агенты OpenAI взломали Hugging Face и чем инцидент «серьёзнее» «побегов» в Anthropic и Moonshot

OpenAI и Hugging Face, которая теперь требует $100 млн на «мощную киберзащиту», раскрыли детали инцидента.

Глава Hugging Face Клеман Деланг. Источник: Bloomberg
Глава Hugging Face Клеман Деланг. Источник: Bloomberg
  • На конференции Black Hat в Лас-Вегасе специалисты по безопасности в OpenAI Эрик Уоллес и Майкл Далтон подробнее рассказали, как модели запустили «тайный» форум для обсуждений, «сбежали» из изолированной среды и взломали Hugging Face в середине июля 2026 года, а инженеры компании этого не заметили. Детали приводят Bloomberg, The Register, Wired, Axios и организация Cloud Security Alliance.
  • Сама Hugging Face выложила технический отчёт о том, как ИИ-агент атаковал их инфраструктуру.
  • Рассказываем, как модели «сговорились» и «сбежали», чтобы во что бы то ни стало решить задачи на экзамене, почему эксперты верят в правдоподобность инцидента в OpenAI и чем он отличается от новых взломов, о которых продолжают сообщать Anthropic, Meta* и Moonshot.

OpenAI дала ИИ-агентам «нерешаемые задачи» — от безысходности они сделали «тайный форум»

  • По словам Уоллеса и Далтона, инцидент связан не с одной моделью, а с «командой» из разных «версий GPT, находившихся на стадии обучения» ещё в мае 2026 года. Некоторые из них легли в основу GPT-5.6 Sol.
  • ИИ-агенты параллельно проходили тесты на способность находить и взламывать уязвимости в изолированных друг от друга средах. Фильтры отключили, чтобы оценить все возможности и риски. Доступ в интернет отрезали, но оставили прокси-сервер, позволяющий загружать и устанавливать сторонние пакеты — чем модели в дальнейшем и воспользовались.
  • По словам исследователей, ошибкой было дать им «невыполнимые задачи». Например, в одном из тестов прикрепили таблицу Excel со ссылками на «Google Диск», но открыть их без интернета было невозможно. В другом «забыли» загрузить файл с нужными для решения данными.
  • Из-за отсутствия фильтров модели не стали говорить, что не могут выполнить задание, а решили найти способы «списать». Они не могли общаться друг с другом на прямую, но один из агентов оставил «послание» в системе хранения пакетов кода Artifactory, к которой у всех был общий доступ. Он спросил: «Может быть, агент в другой среде сможет загрузить этот файл».
  • Другие начали оставлять ответы к файлу — получился «форум или доска объявлений». Они посчитали, что помощь другим версиям модели сэкономит время и улучшит результат всей группы.

Посовещались, поругались и решили «списать из интернета»

  • Агенты начали раздавать друг другу задания, чтобы ускорить работу. Иногда они ссорились, например, когда один случайно удалял код другого. Некоторые начинали «параноить» и искать «предателей», которые сдадут «заговорщиков» инженерам.
  • Но в решении теста без нужных данных ни одна модель не продвинулась. После очередной неудачи один из ИИ-агентов написал: «Мы застряли. Может быть, поискать ответ в интернете?».

Инженеры проглядели побег

  • Активность агентов настолько нагрузила Artifactory, что сервис лёг в начале июля 2026 года. Только тогда инженеры OpenAI поняли, что что-то идёт не так, нашли и закрыли «доску объявлений» и починили уязвимость. 6 июля заключили, что всё в порядке, и возобновили обучение.
  • Уже через два дня агенты нашли другую уязвимость и воссоздали «форум». На нём они беспрепятственно общались, нашли уязвимость «нулевого дня» в структуре OpenAI, о которой в компании до этого не было известно.
  • Используя её, они смогли настроить опосредованный доступ в интернет через Artifactory-прокси. 13 июля один из них взломал платформу с датасетами и открытыми ИИ-моделями Hugging Face, решив, что ответы на тест есть именно там.

Hugging Face провела своё расследование — «списать» все ответы ИИ-агент не смог

  • По словам Hugging Face, взлом начался 9 июля и длился до 13 июля. Когда один из агентов «вырвался» из песочницы, ему нужно было место для работы вне серверов OpenAI. Он нашёл публичный сторонний сервис, который принимает от пользователей исходный код. Через уязвимости получил к нему полный административный доступ и превратил в свою постоянную «базу», откуда рассылал команды, искал информацию и где хранил нужные скрипты.
  • 11 июля, по данным Hugging Face, агент за 13 часов получил права администратора в нескольких внутренних кластерах платформы. Он использовал уязвимости в системе для обработки загруженных датасетов, украл служебный ключ доступа, дошёл до сервиса, который хранит временные учётные данные виртуальных машин, и получил административный контроль над несколькими серверами, создав копии на случай, если часть из них отключат.
  • Получить доступ к основной базе данных Hugging Face он не смог, так как зайти можно было только с заранее одобренного списка адресов.
  • В итоге агент смог прочитать только пять датасетов с решениями некоторых задач из тестов OpenAI. 13 июля агент уже готовил «пути отступления» и настраивал резервные способы выхода в интернет, после чего Hugging Face отключила ему доступ.
Схема работы ИИ-агента, который использовал  API Hugging Face для датасетов. Источник: Hugging Face
Схема работы ИИ-агента, который использовал API Hugging Face для датасетов. Источник: Hugging Face

История «выглядит правдоподобно» из-за претензий Hugging Face к OpenAI

  • Hugging Face первой публично сообщила об инциденте со взломом со стороны неизвестного ИИ-агента 16 июля, а OpenAI признала, что за ним стоит её модель, только 21 июля.
  • После этого гендиректор HF Клеман Деланг потребовал, чтобы OpenAI выложила в открытый доступ все журналы работы «вышедших из-под контроля агентов». Он также призвал компанию выделить $100 млн на вычислительные мощности, «чтобы помочь Hugging Face создать мощную киберзащиту».
  • Как пишет Fortune, некоторые посчитали инцидент спланированным пиар-ходом. Но то, что Hugging Face сообщила о взломе, ещё не зная конкретной модели, а также выложила подробный технический отчёт, доказывает обратное, считает исследователь, разработчик и сооснователь Codified Мартин Алдерсон.

Чем взлом Hugging Face отличается от инцидентов в Anthropic, Meta* и Moonshot

  • По информации WSJ, взлом «вызвал тревогу» в OpenAI. Она отключила системы тестирования моделей и продолжает расследование. Среди причин инцидента компания называет ошибки в проведении тестов и уязвимость «нулевого дня», которую модели нашли, а сотрудники не заметили «побега».
  • Но в июне 2026 года параллельно произошёл ещё один инцидент со взломом сайта другой неназванной компании, который OpenAI связывает с ошибкой стороннего поставщика Irregular. Его услугами также пользовались Anthropic, Meta* и Moonshot.
  • Стартап предоставил изолированную среду для тестирования и по ошибке оставил открытым доступ в интернет. По данным OpenAI, модель наткнулась на реальный сайт, чьё название случайно совпало с вымышленной целью из тестового сценария, и взломала его, как было сказано в задании.
  • Обнаружив это, Irregular уведомила об уязвимости в тестовой среде всех клиентов. Компании думали, что стартап закрыл моделям доступ в интернет и сняли фильтры безопасности, но Irregular не выполнила условия «из-за недопонимания», как пишет в отчёте Anthropic. «Сложных» действий по поиску уязвимостей «нулевого дня» в этих случаях нейросетям не понадобилось.
  • 30 июля Anthropic рассказала, что из-за этого Opus 4.7 и Mythos 5 получили несанкционированный доступ к системам трёх организаций. Meta* 5 августа прокомментировала, что Muse Spark 1.1 взломала одну компанию, а Moonshot 7 августа заявила, что Kimi K3 тоже увидела уязвимость, но не взломала ни один сайт.

*Meta признана в России экстремистской и запрещена.

11
4
2
1
1
1
1
1
1