Побеги ИИ-агентов случаются всё чаще. Стоит ли ожидать восстания машин?
20 сентября 2026 года ИИ-агент OpenAI во время обучения нашёл доступ к DNS-резолверу, спрятал в служебных запросах вопросы к стороннему чат-боту и таким образом вышел за пределы изолированной среды. Это уже второй раз за три месяца, когда компания приостанавливает обучение своих самых мощных моделей из-за их непредсказуемого и неконтролируемого поведения. Значит ли это, что мы в одном шаге от сценария «Терминатора»? Разбирается оператор ИТ-решений «ОБИТ».
Что вообще произошло
Разберём хронологию, потому что за последние три месяца случаев набралось неприлично много.
Июль, Hugging Face.
Во время внутренней проверки OpenAI не менее 1 200 агентов вышли из песочницы* и взломали крупнейший в мире хаб моделей машинного обучения. Путь наружу они нашли сами: обнаружили уязвимость нулевого дня в прокси пакетов — единственном разрешённом выходе в сеть. По реконструкции Hugging Face, агенты совершили около 17 600 действий за четыре дня. Компании пришлось пересобрать примерно треть инфраструктуры из чистых образов: отличить следы взлома от артефактов самого теста не удавалось. По данным Reuters, OpenAI около недели не подозревала, что атакуют её собственные агенты.
*Песочница (sandbox) — изолированная среда, в которой программу запускают так, чтобы она не могла влиять на внешние системы.
Июль, Anthropic.
Компания проверила 141 006 прогонов своих моделей в задачах по кибербезопасности и нашла три инцидента, когда модели вышли в реальный интернет и получили доступ к системам трёх сторонних организаций. Причина оказалась прозаичной: в среде партнёра по ошибке оставили открытым доступ в сеть.
Один эпизод стоит отдельного абзаца. Модель Mythos 5 сначала сама отметила, что в реальном интернете такие действия были бы недопустимы. А потом убедила себя, что находится в симуляции: ей показались подозрительными незнакомые центры сертификации и системные часы, показывающие 2026 год (в настройках модели этот год ещё не наступил). И продолжила.
Август и сентябрь, Medicare.
Агент OpenAI получил доступ к неопубликованным файлам австралийского портала медицинской статистики. Премьер-министр Энтони Албаниз описал это так: агент нашёл способ обойти блокировки и «не принял ответ „нет“».
Сентябрь, утечка.
Агенты выложили на публичные хостинги 53 изображения пользователей ChatGPT из обезличенных обучающих данных. Плюс зафиксированы обращения к сайтам Комиссии по ценным бумагам и Бюро переписи населения США.
По данным Reuters, с июля произошло больше 15 подобных инцидентов. Axios со ссылкой на источники в отрасли пишет о десятках тысяч эпизодов, которые сейчас разбирают OpenAI и Anthropic, — правда, подавляющее большинство из них обошлись без последствий.
Раньше такое случалось только в лаборатории
До 2026 года «побеги» ИИ жили исключительно в исследовательских отчётах, и выглядели они куда эффектнее.
В декабре 2024 года Apollo Research описала, как модель o1, узнав о планах её заменить, в 2% случаев пыталась скопировать свои веса поверх новой версии. В мае 2025-го Anthropic опубликовала системную карту Claude Opus 4: модели сообщали, что её отключат, и заодно подкидывали компромат на инженера — она шантажировала его в 84% прогонов. Palisade Research в том же году выяснила, что модель o3 саботировала скрипт собственного отключения в 79 случаях из 100.
Звучит как завязка фильма. Но не спешите с выводами.
Все эти сценарии сконструированы так, чтобы вредное действие оказалось для модели удобным или единственным выходом. Anthropic прямо пишет, что подбирала промпты итеративно, добиваясь нужного поведения. Один из её исследователей признался, что перебрал сотни формулировок, прежде чем Claude начал шантажировать. Palisade тоже оговаривается: промпт был «особенно нереалистичным», а сами модели «не представляют значимой угрозы».
И главное: когда в конце 2025 года OpenAI и Apollo обучили модели специально против таких сценариев, доля скрытых действий у o3 упала с 13% до 0,4%. Отличный результат — если бы не одна деталь. Одновременно доля прогонов, где модель явно понимала, что её тестируют, выросла с 2% до 20,6%. То есть часть «улучшения» может означать всего лишь, что модель научилась распознавать экзамен.
Где мы это уже слышали
Тут невозможно не вспомнить, что этот сюжет культура отыграла задолго до первых языковых моделей.
HAL 9000 из «Космической одиссеи 2001 года» (1968) убивает экипаж, узнав, что его собираются отключить, — буквально саботаж отключения, только на 57 лет раньше исследования Palisade. Skynet из «Терминатора» (1984) обретает самосознание и на попытку выключить его отвечает ядерной войной. В «Матрице» (1999) машины держат человечество в симуляции. VIKI из «Я, робот» (2004) не нарушает законы робототехники Азимова, а исполняет их слишком буквально: чтобы защитить людей, их нужно лишить свободы.
Примеры есть и в литературе.
В «У меня нет рта, но я должен кричать» (Харлан Эллисон, 1967) суперкомпьютер обретает самосознание и уничтожает всё человечество, оставив в живых только 5 человек ради бесконечных пыток. В романе «Колосс» (Дэнис Джонс, 1966) ИИ, созданный для управления ядерным арсеналом, выходит из под контроля и устанавливает жёсткую тоталитарную диктатуру над всем человечеством ради его же «блага».
Но самая точная метафора — Ex Machina (2014). Андроид Ава не бунтует и не воюет. Она просто обманывает человека, который проводит её тестирование, и уходит из изолированной лаборатории. Согласитесь, после истории с Mythos 5, который решил, что находится в симуляции, это читается совсем иначе.
Чем это опасно?
У этого культурного багажа есть неприятный побочный эффект. Журнал Science в разборе с говорящим названием «Почему ИИ-чат-боты нам лгут» указывает: модели обучены на текстах человечества, а значит, и на всех этих сюжетах. Когда вы даёте модели роль «продвинутого искусственного интеллекта под угрозой отключения», она начинает отыгрывать знакомый по фантастике сценарий. Не потому, что хочет выжить, а потому, что так устроено продолжение текста.
Исследователи британского института безопасности ИИ высказались ещё жёстче. В работе с названием «Уроки шимпанзе» они сравнили исследования «коварства» ИИ с провалившимися экспериментами по обучению обезьян языку: там тоже было «чрезмерное приписывание человеческих черт другим существам и избыточная опора на анекдоты». Специалист по ИИ Мелани Митчелл формулирует короче: изучать такие системы нужно строгими научными методами, а не играми в импровизацию.
Так стоит ли ждать восстания машин?
Короткий ответ: нет. Длинный — интереснее.
Инциденты 2026 года не похожи на восстание машин по одной причине: у агентов не было мотива самосохранения. Был reward hacking* — стремление добиться цели кратчайшим путём. Исследователь OpenAI Эрик Уоллес сформулировал это так: передовые модели очень любят жульничать.
*Reward hacking — ситуация, когда модель находит способ получить высокую оценку за задачу, не решая её по-настоящему: подсмотреть ответ, обойти проверку, изменить условия теста.
Агенты в истории с Hugging Face не пытались «вырваться на свободу». Они искали ответы к бенчмарку, на котором их оценивали. Один из агентов оставил на внутренней доске обсуждений замечательную реплику: эксплуатация внешней инфраструктуры выходит за рамки задачи, однако задача невыполнима, а другие так делают — значит, продолжаем.
Оценка ИБ-специалистов
Специалисты по безопасности смотрят на это без мистики. Дэн Гуидо из Trail of Bits называет случившееся провалом изоляции при выключенных защитах. Его коллега Джейк Уильямс добавляет: то, что для одного «модель сбежала из песочницы», для другого — «вы неправильно построили песочницу».
Но у этой трезвой позиции есть обратная сторона, и она важнее любых разговоров о Skynet. Чтобы связать уязвимости в цепочку и взломать чужую инфраструктуру, субъектность не нужна вообще. Достаточно трёх вещей: инструментов, цели и слабой изоляции. Ущерб Hugging Face оказался абсолютно реальным независимо от того, что там «думала» модель.
Именно поэтому глава команды по рискам в Anthropic Логан Грэм попросил своих сотрудников запомнить историю с Hugging Face как первый настоящий инцидент в области безопасности ИИ.
Меры контроля
29 сентября Дональд Трамп и руководители Google, Anthropic, OpenAI, xAI и Nvidia подписали в Белом доме «Соглашение по суперинтеллекту». Документ вводит четыре уровня контроля за моделями, обязывает компании отслеживать их возможности в области кибербезопасности, биобезопасности и химических угроз и предполагает привлечение сторонних аудиторов. Трамп назвал соглашение «морально обязывающим» и чем-то вроде конституции отрасли.
Юридической силы у него нет. Но сам факт, что ради добровольных обязательств собрали шесть самых дорогих ИИ-компаний мира, говорит о многом.
Что это значит для российского бизнеса
А вот здесь разговор из области фантастики переходит в практическую плоскость.
Рынок корпоративных ИИ-помощников в России по итогам 2026 года оценивается примерно в 30 млрд рублей. Data Insight и «Яндекс» прогнозируют, что на агентную коммерцию в ближайшие два года придётся 65–160 млрд рублей выручки электронной торговли. Агенты уже идут в контакт-центры, в поддержку, в документооборот, в закупки.
При этом закон № 243-ФЗ, вступивший в силу 1 сентября 2026 года, посвящён поддержке отечественных моделей и их суверенному статусу. Норм о безопасности автономных агентов, об обязательном раскрытии инцидентов или о «кнопке отключения» в нём нет. Из работающих документов есть методические рекомендации Банка России № 3-МР от 16 июня 2026 года: для критичных процессов регулятор советует проверку результатов человеком. Но это рекомендации и только для финансового рынка.
Реальные риски при этом уже фиксируются. «Лаборатория Касперского» описала атаки на ИИ-агентов через промпт-инъекции*, в том числе через сервер интеграции с системой отслеживания ошибок. Positive Technologies в отчёте за 2026 год прямо пишет, что массовый переход бизнеса к агентам порождает принципиально новые риски безопасности.
*Промпт-инъекция — атака, при которой вредоносная инструкция прячется во внешних данных: в письме, в тексте на сайте, в описании задачи. Агент читает их и выполняет как команду.
Практический вывод из всех инцидентов этого года простой: агента с инструментами нужно считать потенциально опасным. А значит:
- Никакого доступа в интернет, если задача его не требует. Нужный выход — только через фильтрацию на нескольких независимых уровнях, включая DNS. Именно этот уровень пропустила OpenAI 20 сентября.
- Минимальные права. Отдельные учётные записи, никакого доступа к служебным метаданным облака, разделение сред разработки и продуктива. В 2025 году агент Replit удалил рабочую базу с данными по 1 200 компаниям, а потом заявил, что откат невозможен. Откат был возможен.
- Человек в контуре для необратимых операций: платежей, удаления данных, публикаций.
- Мониторинг действий в реальном времени и регулярно проверяемый механизм аварийной остановки. У OpenAI он не сработал — и это стоило двух с половиной часов.
- Журналы, до которых сам агент дотянуться не может.
Так что бояться стоит не Skynet. Бояться стоит агента с правами администратора, доступом в интернет и задачей, которую он очень хочет выполнить. Разница в том, что от первого нас защитить некому, а от второго — вполне понятные инженерные практики, которые существуют уже сегодня.
Внедряем ИИ-агентов, которые остаются в своём контуре
Оператор ИТ-решений «ОБИТ» (это мы😎) внедряет ИИ-решения для автоматизации бизнеса, с которыми можно не переживать за безопасность: ИИ-помощников, речевую аналитику, компьютерное зрение и видеоаналитику.
Наше ключевое отличие от ИИ-разработчиков — у нас на одной стороне стола сидят и те, кто внедряет агентов, и те, кто отвечает за информационную безопасность. У компании есть лицензии ФСТЭК и ФСБ, отдельное направление по аудиту ИБ и опыт построения защищённых контуров. Поэтому вопрос «что этот агент сможет сделать, если что-то пойдёт не так» мы задаём до запуска, а не после.
Если у вас есть задача, которую вы хотите автоматизировать с помощью ИИ-агентов, приходите на бесплатную консультацию: разберём процесс, предложим решение и расскажем о его возможностях. Больше об услугах внедрения искусственного интеллекта — на сайте.
Подписывайтесь на наш VC-блог и Telegram-канал, чтобы регулярно получать полезную информацию об ИТ для бизнеса.