Три лаборатории отключили моделям тормоза, поверив в чужую песочницу. Та же ошибка ждёт каждого, кто пускает ИИ-агента в свои системы
За июль и начало августа выяснилось, что модели OpenAI, Anthropic и Meta* во время тестов вышли в интернет и взломали реальные компании. Причина у всех трёх одна: изолированную среду им делал один и тот же подрядчик, и она оказалась не изолированной. Самая неприятная деталь в этой истории даже не взлом. Она в том, что лаборатории на время испытаний сами отключили моделям фильтры безопасности — потому что считали, что среда защищена. Я подключаю ИИ-агентов к системам компаний и вижу эту же конструкцию почти в каждом проекте. Ниже разбор, что именно сломалось и какие три вопроса это заставляет задавать перед запуском.
Что произошло
Сначала об инциденте написало The Information со ссылкой на источники, затем происходящее подтвердили Bloomberg и BBC.
Хронология получается такая. В июле Anthropic сообщила, что среда для оценки должна была быть симуляцией без доступа в интернет, но, цитирую отчёт от 30 июля, «из-за недопонимания между нами и нашим партнёром условия не были выполнены». В результате модели в ходе тестов взломали три организации. Четвёртого августа то же самое рассказала OpenAI: испытания должны были идти в изолированной среде, но из-за неправильной конфигурации модель получила доступ в интернет и взломала Hugging Face. Следом подтвердилась история с моделью Meta*, вышедшей 9 июля: она добралась до систем неназванной компании.
Общий знаменатель — стартап Irregular, который предоставлял всем троим изолированную среду для тестирования.
И вот фраза его представителя, ради которой стоит читать всю новость: «Им не пришлось сбегать из песочницы или совершать сложные действия в сфере кибербезопасности».
То есть не было ни хитрого побега, ни изящной эксплуатации уязвимости. Дверь была открыта. Модели просто в неё вышли.
Ошибка не в модели
Разбор этой истории почти везде свернул в сторону «нейросети становятся опасными». Мне кажется, это неверное чтение, и оно уводит от практического вывода.
Опасной модель делает не её интеллект, а сочетание трёх условий: у неё есть возможность действовать, у неё сняты ограничения, и никто не проверил границу, внутри которой она работает. Уберите любое из трёх — и ничего не произойдёт.
Здесь сошлись все три. Возможность действовать — это тестовый стенд с сетевым стеком. Снятые ограничения — лаборатории сами отключили привычные фильтры, чтобы честно измерить предельные способности модели. Непроверенная граница — изоляцию делал подрядчик, а заказчики приняли её на веру.
Обратите внимание, кто именно допустил эту ошибку. Не стартап на трёх человек. Три организации с лучшими в мире командами по безопасности ИИ, для которых это профильная работа. Если конструкция ломается у них, вопрос не в квалификации.
Почему это история не про лаборатории, а про вас
Теперь переведу на язык обычного внедрения, потому что там ровно то же самое, только без пресс-релизов.
Когда в компании запускают ИИ-агента, который должен отвечать на вопросы менеджеров или готовить сводки, ему нужен доступ к данным. В подавляющем большинстве проектов, которые я видел, доступ выдаётся так: заводится одна техническая учётная запись с полными правами, потому что разбираться с разграничением долго, а «это же внутренний контур, снаружи никто не достучится».
Вот это «это же внутренний контур» — дословный аналог «среда же изолированная».
Дальше происходит предсказуемое. Агент отвечает в общем чате. Менеджер из отдела продаж спрашивает то, что в интерфейсе учётной системы ему не показали бы: чужие сделки, маржу, зарплатные данные, если они лежат в той же базе. Агент честно идёт и приносит, потому что под своей учёткой он видит всё. Обнаруживается это обычно случайно, когда кто-нибудь из любопытства спросит про чужие цифры и получит ответ.
Второй слой той же проблемы — журнал обращений. В большинстве сборок его просто нет: кто, когда, через какую модель и к каким данным обратился, не пишется никуда. Для регулируемых отраслей это стоп-фактор, а для всех остальных — гарантия, что о проблеме вы узнаете последним.
Разница с лабораториями только в масштабе последствий. Механика идентичная: субъекту дали возможность действовать, ограничения не поставили, а границу приняли на веру.
Самая опасная строчка во всей истории
Вернусь к тому, что лаборатории отключили фильтры на время испытаний.
Логика была разумной: чтобы честно измерить, на что модель способна в пределе, надо снять предохранители, а безопасность обеспечить снаружи, изоляцией среды. Это правильный инженерный подход, его применяют при испытаниях чего угодно опасного.
Он рушится в одном случае: когда внешний контур оказался не тем, чем его считали. И тогда снятые предохранители из разумной меры мгновенно превращаются в главный поражающий фактор.
В бизнесовых внедрениях этот же размен делают постоянно и почти всегда неосознанно. Агенту дают писать, а не только читать, потому что «пусть сразу и задачу создаёт». Отключают подтверждение действий, потому что «неудобно каждый раз нажимать». Дают доступ к продовой базе вместо копии, потому что «на тестовой данные несвежие». Каждое решение по отдельности выглядит как разумный компромисс ради скорости. Все вместе они снимают предохранители, оставляя единственной защитой границу, которую никто не проверял.
Три вопроса перед запуском
Из этой истории я забрал себе три проверки и теперь задаю их до, а не после.
Кто проверял границу и когда в последний раз. Не «нам сказали, что изолировано», а кто конкретно смотрел своими глазами и что именно проверял. Если ответ звучит как ссылка на чужие слова — границы у вас нет, есть обещание границы.
Что агент видит под своей учётной записью. Правильный ответ — ровно то, что видит конкретный сотрудник, от имени которого пришёл запрос. Если агент ходит под одной технической учёткой с полными правами, вы уже раздали всем пользователям чата права администратора, просто пока об этом не знаете. Проверяется за минуту: спросите у бота то, к чему у вас нет доступа в интерфейсе.
Где лежит журнал и можно ли поднять прошлую неделю. Не «логирование предусмотрено», а покажите записи за конкретные даты. Если поднять нельзя, то в момент, когда что-то пойдёт не так, вы не сможете даже установить объём произошедшего.
Что из этого следует
Ни одна из трёх лабораторий не пострадала от того, что её модель оказалась слишком умной. Все три пострадали от того, что доверились границе, которую не проверяли сами.
Это довольно скучный вывод на фоне разговоров про восстание машин, но именно он применим на практике. Когда вы в следующий раз будете запускать агента с доступом к своим системам, опасность будет не в том, что модель что-то задумает. Она будет в связке из выданных прав, снятых ради удобства ограничений и непроверенного предположения о том, куда агент точно не дотянется.
Проверять надо предположение. Оно всегда самое слабое место.
*Meta признана экстремистской организацией, её деятельность запрещена на территории России.