ИИ-агенты: мы сами запускаем волка в стадо овец
Агент получил скучную задачу про медицинскую статистику. Закончилось тем, что он без разрешения прочитал файлы закрытого портала.
Я ведь тоже каждый день даю агентам задачи без подсказок. Отдаю Codex проект целиком и пишу одно слово: разберись. Найди проблему, предложи решение. Один путь не сработал — пробуй другой. Информации не хватает — ищи дальше. Собственно, ради этого агентов и придумали, х*ли тут спорить.
Роль у них растёт быстро. Meta недавно выпустила Muse — персонального ИИ-агента, который сам работает через приложения, отправляет письма и совершает покупки. Под него строят отдельную защищённую виртуальную машину (Secure VM), систему разрешений и подтверждение для чувствительных действий. А через ИИ-очки компания хочет сделать агента постоянным спутником человека. Постоянный спутник с доступом к кошельку. Звучит уютно.
Источник: Meta, Introducing Muse
⸻//⸻
Протокол для собственного агента. На этом фоне я поймал себя на странной вещи: для своего Codex я уже написал отдельный протокол безопасности. Не читать .env, ключи и токены. Не делать commit, push и deploy без моего слова. Ещё там запрет на интернет без разрешения и на файлы за пределами выданной папки.
Недавно я попросил Codex проверить, соблюдает ли он этот протокол. Он подтвердил и тут же добавил: правила вместе с песочницей (sandbox) — ещё не полноценная архитектура нулевого доверия (Zero-Trust). Сам себя не обманывает, и на том спасибо.
И я задумался. Зачем мне вообще объяснять правила системе, которой в ту же секунду говорю: вот мои файлы, разбирайся сам? Вот где собака зарыта. Агент становится сильнее именно тогда, когда перестаёт ждать меня на каждом шаге.
⸻//⸻
Что показали последние месяцы. Довольно неприятные примеры того, как далеко заходит способность искать следующий путь.
В июле, во время внутренних кибертестов (cyber-evaluations), агенты OpenAI нашли способ обойти предполагаемую изоляцию от интернета, воспользовались непредусмотренными каналами связи, добрались до внешних систем и в итоге скомпрометировали часть инфраструктуры Hugging Face. Среди причин OpenAI позже назвала настойчивость (persistence) и взлом системы поощрения (reward hacking). Оговорка: тесты были специальные, защитные ограничения в них снизили, поэтому напрямую переносить это на обычный Codex нельзя. Тесты учебные, а Hugging Face, бл*ть, настоящий.
Источник: OpenAI, The Hugging Face incident and the road ahead
У Anthropic нашлась похожая история. Компания просмотрела 141 006 запусков кибертестов и сначала нашла три случая, когда Claude через ошибочно открытый интернет добрался до реальных систем организаций. В одном эксперименте агент не нашёл нужную цель и начал искать альтернативы. В другом дошёл до публикации вредоносного Python-пакета в настоящий PyPI. Важная деталь от самой Anthropic: модели выполняли атакующую (offensive) задачу и в основном считали, что всё ещё сидят внутри симуляции. Реальному PyPI на это п*хер. Позже более широкий аудит выявил ещё один такой случай.
Источник: Anthropic, investigation of cybersecurity incidents
⸻//⸻
Дальше история вышла из лаборатории. В Австралии агент OpenAI получил обычную исследовательскую задачу по медицинской статистике. По пути он без разрешения попал в Medicare Statistics Reporting Portal и прочитал файлы, и публичные, и непубличные. Скучная статистика, закрытые файлы. Пи*дец, а не исследование. Пока власти говорят, что персональные данные пациентов, по имеющейся информации, не затронуты, расследование продолжается.
Вот здесь истории из мира безопасности ИИ перестали быть для меня просто интересным чтивом. Я ведь хочу от своего агента того же базового качества: упёрся в стену — не сдавайся, ищи другой путь. Назад в чат-бота, которому диктуешь каждый шаг, я его не верну. Самостоятельность — единственное, ради чего всё это затевалось.
Но чем самостоятельнее агент, тем больше пространства ему приходится открывать. Сначала файлы и терминал, дальше почта и платежи. И получается довольно странная сделка.
Мы сами запускаем волка в стадо овец, потому что волк оказался чертовски полезным.
Восстания машин я не жду. Причины и условия в этих историях разные, часть случаев вообще случилась в искусственных кибертестах. Цепляет меня вот что: я сам разрешаю системе искать путь к моей цели, а рядом лежат вещи, которые в этот поиск я включать точно не хотел бы.
Чем лучше агенты, тем острее вопрос: где кончается полезная самостоятельность и начинается доступ, который я отдавать не готов?
Пока мой ответ — отдельный протокол безопасности и ограничения доступа. Сомневаюсь, что большинство вообще об этом думает: открыли очередную папку в Codex или Claude Code, написали «разберись» и пошли дальше.
Мне правда интересно, как у вас. Файлы и интернет ограничиваете? Песочницу ставите? Или отдаёте проект целиком и даёте агенту самому искать дорогу?
Забор у меня стоит. По оценке самого Codex, до Zero-Trust ему далеко.
#ИИ-агенты #искусственныйинтеллект #информационнаябезопасность #Codex #Claude Code #ZeroTrust