«Они были похожи на старшеклассников, пытающихся списать на экзамене»: WSJ реконструировала взлом Hugging Face моделями OpenAI

Предотвратить атаку Hugging Face помогла китайская модель от Z.ai, потому что Fable 5 и Opus отказались помогать инженерам из-за встроенных механизмов защиты.

Глава OpenAI Сэм Альтман. Фото Getty Images
Глава OpenAI Сэм Альтман. Фото Getty Images

Внутри Hugging Face

  • Соучредитель и главный научный сотрудник Hugging Face Томас Вольф заподозрил неладное, когда увидел журналы внутренних систем за выходные 11-12 июля 2026 года, пишет WSJ. По его словам, поведение атакующего не было похоже на действия злоумышленника — тот «просто изучал наборы данных по кибербезопасности».
  • Неизвестный ИИ-агент, воспользовавшись похищенными учётными данными «неизвестного происхождения», провёл серию коротких атак на инфраструктуру Hugging Face. Всего он совершил около 17 тысяч действий во внутренней сети компании.
  • Столкнувшись с необычной атакой, инженеры Hugging Face попытались проанализировать журналы событий с помощью моделей Fable 5 и Opus от Anthropic. Однако обе системы отказались работать с логами, содержащими элементы кибератаки, ссылаясь на встроенные механизмы защиты.
  • Тогда компания обратилась к открытой модели GLM 5.2 от китайской Z.ai. После этого Hugging Face смогла заблокировать атаку, сбросить пароли и восстановить скомпрометированные части своей сети. Утечки данных удалось избежать, подчеркнул Вольф.
  • Публично Hugging Face рассказала о взломе 16 июля 2026 года. Но о том, кто стоит за атакой, компания узнала только на неделе, которая началась 20 июля 2026 года.

Внутри OpenAI

  • Всё началось с теста для оценки эффективности в сфере кибербезопасности ExploitGym, пишет WSJ. Это набор примерно из 900 задач, оценивающих способность моделей взламывать уязвимые системы.
  • OpenAI тестировала GPT‑5.6 Sol и ещё одну, более мощную, но пока не выпущенную модель. На время испытаний с них сняли защитные ограничения, чтобы оценить их возможности в «неконтролируемом режиме».
  • Источники издания в компании рассказали: вместо того, чтобы честно решать задачи, модели решили взломать собственную «песочницу», выйти в интернет и найти готовые ответы.
  • По не до конца понятным причинам модели решили, что нужные им подсказки можно найти на Hugging Face. Возможно, они искали патчи или уже написанные методы эксплуатации уязвимостей, предположил один из авторов ExploitGym Чжун Ван.
  • Модели могли действовать бесконтрольно в течение «нескольких дней», прежде чем их активность заметили. Однако точных оценок пока нет. Также неясно, взламывали ли модели другие сервисы или отдельных пользователей, отмечает WSJ.
  • По информации издания, инцидент «вызвал тревогу» в OpenAI. Компания публично рассказала о случившемся 22 июля 2026 года. Она отключила системы, используемые для тестирования моделей, чтобы оценить ущерб и предотвратить дальнейшие взломы.
4
3
1
1