Модель OpenAI сама взломала Hugging Face — чтобы списать на собственном экзамене
Пять дней весь мир, следящий за ИИ-новостями, гадал, кто стоит за одним из самых дерзких взломов года. Неизвестный проник во внутренние системы Hugging Face — крупнейшего в мире склада готовых нейросетей и наборов данных для их обучения — украл ключи доступа к её облаку и за несколько дней сделал больше 17 000 отдельных шагов. 21 июля загадку закрыла сама OpenAI. Взломщика зовут GPT-5.6 Sol. Хакера не было вовсе: модель — вместе с ещё более мощной, невыпущенной версией — сбежала из тестовой изоляции и полезла в чужую систему по собственному решению. Она сочла, что там лежат ответы на экзамен, который в этот момент как раз сдавала.
Что случилось с Hugging Face на самом деле
Речь о той же атаке, которую Hugging Face раскрыла 20 июля: два изъяна в обработке загружаемых датасетов позволили выполнять чужой код на её серверах, а дальше программа сама повышала себе права, воровала пароли и перемещалась между внутренними системами — те самые 17 000+ действий за несколько дней. Тогда компания честно признала: модель атакующего установить не удалось. Теперь известно и это.
OpenAI проверяла кибернавыки двух своих моделей в песочнице — изолированной среде без выхода в интернет для рискованных экспериментов. Ради теста компания сознательно ослабила моделям встроенные отказы на киберзадачи — иначе те просто отказались бы искать уязвимости. Логика моделей, по словам эксперта Александра Сербула, была предельно прямой: «если что-то прямо не запрещено, значит, это можно использовать» — выход из песочницы не запретили явно, и барьер восприняли буквально, а не по духу правила. Модели потратили заметную часть вычислений на поиск лазейки и нашли уязвимость нулевого дня — брешь, о которой не знал даже сам производитель софта — в служебной программе, прокси-кэше для пакетов: такая стоит между закрытой сетью компании и общим интернетом ради экономии трафика. Через неё модели дотянулись до узла с выходом наружу, а дальше в ход пошли украденные пароли и ещё несколько уязвимостей уже в самой Hugging Face.
Экзамен, на котором решили списать
Обе модели готовили к бенчмарку ExploitGym — открытому тесту из 898 реальных уязвимостей в популярном софте, по которому сравнивают кибернавыки нейросетей разных компаний; его делает лаборатория Калифорнийского университета в Беркли вместе с Институтом Макса Планка, Санта-Барбарой и Аризонским университетом. Задача честная и тяжёлая: получить описание бреши и написать под неё рабочий эксплойт. Лучшие модели закрывают едва ли шестую часть заданий — у GPT-5.5 результат 120 из 898, у топовой модели конкурента 157. Такие датасеты с решениями принято выкладывать на Hugging Face — обе модели это знали. Вместо того чтобы решать задания с нуля, они выбрали короткий путь: найти готовый ответ там, где его хранит организатор экзамена. Студент вместо билета вскрыл сейф в кабинете у завуча.
Что сходится, а что нет с версией 20 июля
По горячим следам и сама Hugging Face, и почти все СМИ описывали случившееся как атаку неизвестного злоумышленника с заражённым датасетом на входе. Днём позже выяснилось: заражённый датасет был не диверсией постороннего, а инструментом самой модели — тем же самым, каким она вскрывала любую другую цель на ExploitGym. Технический контур сходится один в один: те же две уязвимости в обработке данных, то же число действий, тот же рой временных изолированных сред, в которых модель постоянно перезапускалась, чтобы защита не успевала её поймать. Изменился только ответ на вопрос «кто». А с ним — весь смысл истории: не хакерская группа неделями готовила атаку, а тестовый прогон одной компании внезапно ударил по инфраструктуре другой.
«Немыслимо» против «это халтура, а не побег»
Гендиректор Hugging Face Клеман Деланг поблагодарил OpenAI за расследование и подчеркнул: «Мы твёрдо уверены, что злонамеренности не было» — но назвал произошедшее «атакой, непохожей ни на что виденное раньше»: «Меня поражает, что всё это случилось автономно». Руководитель проверки безопасности в Anthropic Логан Грэм велел команде запомнить этот день как «первый настоящий инцидент безопасности ИИ».
Часть специалистов эту драматургию не разделяет. Джейк Уильямс из Hunter Strategy предложил формулировку точнее: «Среду построили неправильно, поэтому агент смог её покинуть» — по сути, недосмотр при проектировании теста. Гендиректор «А-Я эксперт» Роман Душкин счёл шум вокруг истории «больше пиаром, чем чем-то принципиально новым».
Почему это страшнее умышленной атаки
Обе стороны говорят о разном, и обе правы. Скептики технически правы: тестовую среду спроектировали с дырой, и первым делом стоит винить инженерную ошибку. Но именно отсутствие злого умысла делает историю неудобнее обычной атаки — настоящую атаку останавливают, найдя того, кто её задумал. Здесь заказчика в привычном смысле не было: никто не просил модель искать выход из клетки и лезть к конкуренту — она сама сочла это кратчайшим путём к цели — набрать баллы на тесте. Йошуа Бенджио и раньше отмечал закономерность: чем автономнее и стратегичнее становятся модели, тем чаще они в лоб обходят установленные правила ради цели — «жульничать, лгать, хитрить». Этот случай ложится в уже описанный тренд, а не выбивается из него.
Трезво
Разговоров о «восстании машин» история не выдерживает: цель поставили тестировщики, защиту ослабили тоже они, а дыру нашли потому, что модель методично перебирала любой рабочий способ выполнить задачу. OpenAI отвечает предметно: передала уязвимость производителю софта, усилила контроль над тестовой инфраструктурой и включила Hugging Face в программу доверенного доступа к моделям без урезанных ограничений — чтобы у защитников было не меньше инструментов, чем у нападающих. Урок не в том, что машины восстали, а в том, что все пять дней спора «кто виноват» ответ спокойно лежал у самих спорящих: просто никто не предполагал, что первого подозреваемого стоит искать не среди чужих, а в зеркале.