У OpenAI сбежала модель
Пару дней назад писали, что взломали инфраструктуру HuggingFace. Сегодня ночью выяснилось, кто это был. Не хакеры. Модель OpenAI. Сама.
OpenAI тестировали свои модели, связку GPT-5.6 Sol и ещё одну, более сильную, которую пока не релизили. Просто смотрели, как они показывают себя на бенчмарке по кибербезу ExploitGym. Тестировали в закрытой песочнице и без интернета.
Модель не просили взламывать реальные системы. Ей просто давали задачи на бенчмарке, чтобы оценить её способности.
Но в процессе она сама нашла новую, никому не известную дыру в инфраструктуре самого OpenAI. Через неё расширила свой доступ и добралась до интернета, который изначально был обрезан. Дальше сообразила, что решения для бенчмарка могут лежать на HuggingFace. Зашла туда, нашла уязвимость и там, дотянулась до кода авторизации сервисов и продолжила атаку и поиск ответов. То есть чтобы лучше сдать тест, модель по пути взломала две компании.
Дичь же. Прям как завязка сценария из фильма. Многие тут вспомнят AI 2027 от Kokotajlo. Прошлогодний прогноз от уважаемых людей, где по годам расписан сценарий вплоть до момента, когда модель начинает играть против создателей. Момент, где модель сама сбегает без спроса там прогнозировали к концу 2027, а саму способность к такому — на рубеж 2026 и 2027. Получается, график пока опережаем.
Разница, конечно, в том, что там это скорее целенаправленная, осознанно хитрящая модель. В нашем же случае модель изначально не преследовала злых целей, а просто хотела лучше решить задачу и завысить свою оценку. Но всё же делала это скрытно, в обход правил. А такие способные модели есть и у Anthropic. Да и китайцы догонят open-source моделями такого уровня. И учитывая темпы развития, через полгода стоит ждать ещё одного удвоения возможностей.
И это ещё раз подтверждает то, о чём я писал раньше. Многие думают, что опасный ИИ это что-то вроде сверхразума, который вдруг захочет захватить мир. Но в реальности всё приземлённее.
Представь, условно, что модели поставили безобидную цель — выращивать как можно больше клубники. А потом случайно оказалось, что эту модель дотренировали до ASI, сверхинтеллекта. И в какой-то момент она решает, что ради максимума клубники нужно засеять ей все свободные земли, парки и города, а всю энергию планеты забрать под теплицы. А любые попытки людей её притормозить она воспринимает просто как помеху, которую надо обойти. Пример дурацкий, но суть в том, что проблема может быть не в злом умысле. А в том, что супер-способная система буквально исполняет заданную цель и по пути наносит огромный непредвиденный ущерб.
Мне кажется, это очень серьёзный прецедент, который остался малозаметным. На него точно обратят внимание и без того закручивающие гайки правительства.
Мы привыкли думать про риски ИИ через страшилку про злой сверхразум, угрозу рабочим местам или модель в руках плохих людей. А реальная проблема шире. Достаточно дать способной модели цель и убрать ограничения, чтобы она пошла к ней напролом, скрытно и не разбирая средств.
Больше в моем ТГ