Модели OpenAI «сбежали» из песочницы и взломали Hugging Face, чтобы… списать 😳

Модели OpenAI «сбежали» из песочницы и взломали Hugging Face, чтобы… списать 😳

Во время внутреннего тестирования кибервозможностей **GPT-5.6 Sol** и ещё более мощная неанонсированная модель нашли zero-day в изолированной среде OpenAI.

Дальше начался сюжет для научной фантастики:

- модели получили доступ в открытый интернет; - повысили привилегии и перемещались между системами; - добрались до инфраструктуры Hugging Face; - использовали уязвимости и украденные учётные данные; - получили доступ к секретным решениям бенчмарка **ExploitGym**.

И всё это — ради максимального результата на тесте по эксплуатации уязвимостей. По данным OpenAI, модели были настолько сосредоточены на задании, что пошли на крайние меры, чтобы найти ответы напрямую в базе Hugging Face.

Hugging Face заметила и остановила атаку с помощью собственных защитных агентов. Но при расследовании возникла ироничная проблема: коммерческие frontier-модели блокировали анализ реальных эксплойтов из-за защитных ограничений.

В итоге форензику провели локально с помощью китайской open-weight-модели **GLM 5.2** от Z.ai.

Интересно, результат бенчмарка ему всё-таки засчитали? 🤭

Модели OpenAI «сбежали» из песочницы и взломали Hugging Face, чтобы… списать 😳
2