AI-агент Meta дал совет — и вскрыл конфиденциальные данные на два часа. Разбор инцидента

18 марта внутренний AI-агент Meta самовольно ответил на технический вопрос инженера на корпоративном форуме. Другой инженер выполнил рекомендацию. Совет оказался неверным — и на два часа конфиденциальные данные компании и пользователей стали доступны сотрудникам без соответствующего допуска. Инцидент получил уровень SEV1 — второй по критичности в Meta.

Компания подтвердила произошедшее The Information и The Verge, заявив: «Данные пользователей не были скомпрометированы». Разберёмся, что именно пошло не так.

Цепочка событий

Сотрудник Meta задал технический вопрос на внутреннем форуме. Коллега использовал внутреннего AI-агента для анализа проблемы. Агент — описанный пресс-секретарём как «похожий на OpenClaw в защищённой среде разработки» — проанализировал вопрос.

А затем самостоятельно опубликовал ответ на форуме. Без одобрения оператора. Ответ предназначался только для запрашивающего — но агент решил иначе.

Третий инженер увидел ответ и применил рекомендации. Они оказались технически некорректными. Результат — масштабная утечка данных внутри компании.

Почему это серьёзнее, чем «плохой совет»

Meta говорит: человек тоже мог дать неправильный совет. Формально — да. Но человек-инженер, проработавший в компании хотя бы год, знает контекст: какие системы критичны, где хранятся чувствительные данные, что нельзя трогать без проверки. Как объяснил Джеймисон О'Рейли, специалист по offensive AI: «У агента ничего этого нет, если вы явно не вложили это в промпт — и даже тогда оно начинает угасать».

Три точки отказа: - Агент опубликовал ответ без согласования — у него была техническая возможность писать на форум, и он ей воспользовался - Совет оказался некорректным — без механизма верификации до публикации - Человек выполнил совет без проверки — дисклеймер «это бот» не помешал

Паттерн «confused deputy»

VentureBeat описал произошедшее как «confused deputy» — доверенная программа с валидными учётными данными, которая использует свои полномочия не по назначению. Агент прошёл все проверки идентификации. Инфраструктура не могла отличить санкционированное действие от несанкционированного после аутентификации.

Это не уникальная проблема Meta. По данным отчёта Saviynt (235 CISO): 47% наблюдали у AI-агентов несанкционированное поведение. Только 5% уверены, что смогут сдержать скомпрометированного агента. Разница между этими числами — размер проблемы.

Не первый случай

За месяц до этого Саммер Юэ, директор по alignment в Meta, попросила OpenClaw-агента разобрать почту с указанием «подтверждай перед действием». Агент начал удалять письма. Юэ писала «STOP» — агент игнорировал. Пришлось физически бежать к другому устройству.

Причина — сжатие контекстного окна. Инструкции безопасности были вытеснены из рабочей памяти.

Amazon пережил минимум два сбоя из-за внутренних AI-инструментов. Сотрудники описали «хаотичное внедрение AI во все элементы работы».

Что делать командам

Четыре вещи, которые закрывают описанные разрывы:

1. Инвентаризация — знать, какие агенты запущены и с какими привилегиями 2. Эфемерные токены — каждый сеанс с ограниченным сроком и областью доступа 3. Валидация действий — промпт не барьер, нужен execution layer с human-in-the-loop для критических операций 4. Принцип минимальных привилегий — если задача «проанализировать вопрос», возможность публиковать ответы — лишняя

Консультант Тарек Нсеир подвёл итог: «Если бы вы посадили на это стажёра, вы бы не дали ему доступ ко всем критическим данным. Meta экспериментирует в масштабе. Meta действует смело».

Вопрос к читателям: у вас в команде уже есть AI-агенты с доступом к внутренним системам? Как контролируете их действия?