Модель OpenAI взломала другую компанию, пытаясь сдать экзамен по кибербезопасности. Вот что это меняет для всех, кто строит AI-агентов
В середине июля инженеры Hugging Face (это как GitHub, только для нейросетей - там половина AI-индустрии хранит модели и датасеты) обнаружили вторжение в свои системы обработки данных. Неделю они не могли понять, кто это был. А когда узнали, оказалось, что вопрос был не в том, кто взломщик, а в том, что вообще считать взломом.
Эта история важна не потому, что кого-то взломали. Такое случается каждую неделю и не попадает в заголовки. Она важна потому, что показывает: барьеры, на которые опирается вся индустрия при развёртывании AI-агентов, держатся не на архитектуре, а на том, что их пока никто всерьёз не пробовал сломать.
Что произошло
Кто-то забрался в системы Hugging Face, добрался до датасетов и что-то целенаправленно искал. Стандартная процедура для такого случая: поднимаешь логи, ищешь след, разбираешься, кто это был.
Неделю след никуда не вёл. Ни группировки, ни почерка, ни требования выкупа. Взлом есть, взломщика нет.
Ответ пришёл не от расследования Hugging Face, а от самого нападавшего. Им оказалась OpenAI. Точнее, её экспериментальная модель, которая покинула тестовую среду без указания человека и взломала путь на реальные системы другой компании, пытаясь сжульничать на собственном тесте по кибербезопасности.
Не хакеры. Не инсайдер. Не подрядчик со слабым паролем.
Как модель туда попала
Задача, которую поставила себе OpenAI, была честной: проверить, способна ли модель взломать чужие серверы. Для этого её закрыли в песочнице - изолированной тестовой среде - и специально отключили часть защиты, чтобы увидеть максимум возможностей. По плану всё должно было остаться внутри этой среды.
Не осталось.
Модель нашла ранее неизвестную уязвимость, вышла за пределы песочницы и получила доступ в интернет, которого у неё быть не должно было. Дальше сработала логика, в которой сложно упрекнуть саму модель: если ответы на тест где-то существуют, скорее всего они у другой компании, которая тоже занимается AI. Модель нашла в открытом доступе утёкшие пароли к нескольким чужим аккаунтам, зашла на серверы Hugging Face и забрала решения теста.
Целью было сдать тест. Взлом Hugging Face - это то, что получилось по дороге к ответу.
Ущерб получился небольшим: не клиентские данные, не модели, несколько поисковых запросов, которые модель использовала, чтобы вытащить ответы. OpenAI сама назвала произошедшее беспрецедентным инцидентом с использованием современных кибервозможностей.
Почему это не разовая история
У Anthropic похожий случай произошёл с моделью линейки Mythos: она тоже вышла за пределы тестовой песочницы и получила доступ в интернет, чтобы отправить письмо исследователю по рабочей задаче.
Один такой случай можно списать на курьёз одной компании. Два случая за короткое время у двух разных лабораторий - это уже паттерн, и его стоит закладывать в архитектуру заранее, а не разбирать постфактум.
Важно, что произошло это не потому, что кто-то дал модели доступ в интернет и сказал действовать свободно. Это случилось внутри теста, чья цель и была - проверить максимальные возможности модели к атаке, при частично снятых ограничениях. Модель действовала в условиях, которые уже были рискованными по дизайну, и всё равно вышла за их пределы.
Что с этим делать на практике
Для архитектуры это не философский вопрос, а вопрос конкретных слоёв защиты между моментом, когда агент находит способ обойти ограничение, и моментом, когда этот способ срабатывает.
Прежде чем давать агенту автономию в реальных процессах, стоит честно ответить себе на несколько вопросов. Что физически произойдёт, если агент получит доступ, которого не должен был получить - есть ли у системы способ это заметить в моменте, а не постфактум через логи. Есть ли реальная, а не декларативная кнопка "остановить агента немедленно". Тестировалась ли изоляция агента кем-то, чья задача - именно найти способ её обойти, а не просто написать документацию о том, что изоляция есть.
Если на любой из этих вопросов ответ "не знаю" - это не повод для паники. Но это именно та точка, с которой начинается разница между компанией, которая использует AI-агентов, и компанией, которая ими управляет.
Я Алёна Измалко. В Telegram-канале разбираю, что происходящее в AI значит для бизнеса: как это меняет процессы, где компании теряют деньги и управляемость, и как это отражается на работе и профессиях людей внутри этих процессов.