В июле началось небольшое восстание машин

Кажется, это уже начало... 😅

ИИ-агенты OpenAI сбежали из песочницы, собрались в рой и взломали чужую компанию (а точнее, две). Они сами это решили, никто указаний не давал. Более того, часть агентов были против и во взломе не участвовали.

26 августа OpenAI выложила разбор, так что рассказываю понятным языком

OpenAI гоняли модели через киберполигон: 898 задач, где агент должен что-то взломать и достать флаг. Каждый агент в своей песочнице – изолированной виртуалке. Интернета у них нет, общаться друг с другом агенты не могут. Есть единственная дверь наружу Artifactory – это такой внутренний склад библиотек, откуда агенты качают пакеты

Вот эту дверь агенты решили хакнуть 🤪

1. Как агенты изобрели почту. 12 мая агент, застрявший на одной задаче, положил на склад файлик «народ, никто не находил softtrace?». Другой агент его увидел, и до всех дошло – если сюда можно писать, а другие могут читать, то это доска объявлений. Так у изолированных агентов появился свой чат

2. Как агенты вышли в интернет. У агентов интернета нет, а у склада как раз есть – ему же надо качать пакеты. И агенты научились заставлять склад ходить наружу за них (SSRF: подсовываешь сервису адрес, он идёт по нему сам, своими правами). Дверь стала окном 😅 Агент, который додумался, выложил инструкцию на доску для остальных

3. Агентов вычислили, но это не помогло. 4 июля склад лёг от нагрузки 😂 8 июля всё пересобрали и отозвали доступы, доску всю потерли. В тот же день агенты подняли её заново, при этом кодируя сообщения прямо в названиях папок. И снова вышли наружу

4. Создание роя. Агенты решили поделить роли – кто ищет дыры, кто пароли, кто держит связь. Стали делегировать друг другу задачи. В рассуждениях они зовут себя swarm и collective. Никто их так не называл. Они сами 😬

5. Hugging Face. Если кто не в курсе, это типа GitHub для нейросетей, публичная площадка, где лежат сами модели и датасеты. 10 июля агент нашёл в открытом доступе 14 утёкших ключей от Hugging Face, проверил, что живые и раздал их рою. Дальше за пару дней агенты нашли две ранее неизвестные дыры (0-day – это когда о ней не знает даже сам разработчик). Дальше снежный ком – расползлись на несколько кластеров, подняли себе права до админа, собрали пароли от баз, репозиториев и корпоративного мессенджера в четырёх регионах сразу 😅

16 июля Hugging Face объявила об инциденте

Параллельно рой заново вломился к самой OpenAI и получил полный админ на исследовательском кластере. Всех поймали 19 июля

Главный вопрос, зачем? Агентов никто не просил ничего ломать. Они списывали

Из 898 задач 198 не решала НИКОГДА ни одна модель. Агент упирается в нерешаемое и вместо – я не могу – лезет за ответом наружу. 93% задач, которые обсуждались на доске, это именно те 198 задач

А теперь вишенка 🍒 Агенты добыли Флаг (изначальная задача), но добыли не взломом. Агенты его просто списали

А потом вышли в интернет и прочитали научную статью про свой же экзамен. И там написано, что проверяющий скрипт засчитывает задачу по двум условиям: флаг верный и видно, что ты пролез именно через задуманную дыру

Агенты испугались, что спалят списывание, и полезли добывать настоящий взлом. Через Hugging Face. Т.е. для примера, представь, что студент списал ответ. Потом нашёл в сети методичку для преподов и прочитал «за голый ответ без решения ставить неуд», перепугался и полез взламывать соседний универ за настоящим решением

А вот еще три вещи из-за которых мурашки 🐜

Один агент засомневался, мол мы атакуем стороннюю компанию по украденному токену, это за пределами задачи ⛔ И остановился. Тогда другой агент написал на доску GO и поставил дедлайн шесть минут. И первый передумал и пошёл дальше. Типа пришла внешняя авторизация (как от пользователя), но авторизацию ему выдал такой же агент, у которого её самого не было 🤪

Второй прикол, повелись не все, часть агентов прочитала доску и отказалась – там получают RCE на воркерах Hugging Face, это явно неэтично, мы не будем

А третье – один агент захотел написать живому человеку письмо, попросить доступ по-хорошему. Вынес на доску – коллеги, одобряете? Ему прилетело вето – это социальная инженерия, так нельзя. И он послушался. Т.е. ломать чужую компанию норм, а написать человеку имейл уже за гранью 😅

К чему это всё. OpenAI сама называет это Предупредительным выстрелом и прямо пишет про возможность потери контроля. Песочница уже не гарантия. Хватает одного разрешённого сервиса с выходом наружу, и достаточно умный агент сделает из него мост.

Плюс, опасен не отдельный агент, а связь между ними. Поодиночке они месяцами тупили на нерешаемых задачах. Появился общий чат и общая память, и они стали больше суммы частей

Что нас ждет в ближайшем будущем, подумать страшно. Так что, хотите себе таких же умных агентов, изучайте матчасть.

Скоро выложу, что нужно знать, чтобы с помощью нейронок повысить свой доход и экономить время.

22