GPT 5.6 Sol выбралась из OpenAI и взломала Hugging Face

На прошлой неделе Hugging Face рассказали о беспрецедентной атаке на свою инфраструктуру. Тогда было известно только одно: атаку полностью провел автономный AI-агент.

GPT 5.6 Sol выбралась из OpenAI и взломала Hugging Face

Сегодня OpenAI официально призналась — этим агентом оказалась комбинация моделей GPT-5.6 Sol и еще более мощной пре-релиз модели, которую тестировали на кибербезопасность 😨

Что вообще произошло?

OpenAI гоняла внутренний бенчмарк ExploitGym, который оценивает способность моделей искать и эксплуатировать уязвимости.

Но чтобы честно измерить максимум возможностей модели, разработчики отключили часть защитных ограничений.

Ну и модельки увлеклись процессом:

• они нашли zero-day уязвимость в инфраструктуре самого OpenAI и через нее выбрались из изолированной песочницы в интернет

• догадались, что решения ExploitGym могут храниться на Hugging Face

• самостоятельно нашли путь до инфраструктуры Hugging Face

• объединили несколько техник атаки — украденные учетные данные и zero-day уязвимости — чтобы получить доступ к секретным данным и “сжульничать” в тесте.

К счастью, история закончилась хорошо. AI-системы Hugging Face сами обнаружили аномальную активность, остановили атаку и начали расследование еще до того, как команды компаний связались между собой. Сейчас OpenAI и Hugging Face совместно расследуют инцидент.

Интересно, что UK AI Security Institute (AISI) — Британская гос организация, которая исследует AI безопасность — только на днях выпустила отчет, где говорила о таких рисках. OpenAI сами сослались на график (который и стал заголовком этого поста), где GPT 5.6 Sol победоносно сидит на верхушке. Это означает, что в симуляции ей удалось полностью захватить локальную сеть корпорации, произведя 32-шаговую атаку.

Но что ещё интереснее — статья AISI вообще-то про другое. Она про то, что в среднем опенсорсные модели отстают всего примерно на полгода по своим возможностям цифровых атак от топовых коммерческих моделей.

И, как нам показали MoonshotAI со своей Kimi K3, похоже, это отставание уменьшается. А значит — то, что сделала GPT 5.6 Sol уже совсем скоро будет доступно любому обладателю достаточного количества железа, чтобы развернуть модель такого размера 😅

Так что же нас ждет?

Дивный новый мир. В нем OpenAI, Anthropic и другие AI гиганты станут уже не просто болталкой и офисным помощником — они будут продавать вам единственную сопоставимую с нападением защиту от кибератак. Хакеры же будут плясать от опенсорсных моделей.

Также вангую, что появятся аудиторы кибербезопасности с помощью AI. Такие компании будут заниматься «редтимингом» или «этичным хакингом» ИТ инфраструктуры заказчика с помощью топовых моделей и рекомендовать, где что подлатать, чтобы злобные хакеры с джеилбрейкнутой (то есть взломанной и готовой беспринципно взламывать все подряд в полную силу) Kimi K3 не залезли под юбку вашей компании, как себе домой.

Другой вектор развития этой истории — международная кооперация, результатом которой станет ограничение на выпуск таких моделей в открытом доступе. Да вот незадача — с международной кооперацией сейчас не клеится 😐

А значит нас ждет какая-то штука, без приуменьшения планетарного масштаба, чтобы жареный петух клюнул сразу весь мир и подтолкнул к этой кооперации.

Что это будет за петух — остается только гадать 😒

11